2021高考数学二轮复习专题练三核心热点突破专题四概率与统计第1讲统计与统计案例含解析

第1讲统计与统计案例高考定位 1.抽样方法、样本的数字特征、统计图表、回归分析与独立性检验主要以选择题、填空题形式命题,难度较小;2.注重知识的交汇渗透,统计与概率、回归分析与概率是近年命题的热点,2018年、2019年和2020年在解答题中均有考查.真题感悟1.(2019·全国Ⅱ卷)演讲比赛共有9位评委分别给出某选手的原始评分,评定该选手的成绩时,从9个原始评分中去掉1个最高分、1个最低分,得到7个有效评分.7个有效评分与9个原始评分相比,不变的数字特征是( )A.中位数B.平均数C.方差D.极差解析中位数是将9个数据从小到大或从大到小排列后,处于中间位置的数据,因而去掉1个最高分和1个最低分,中位数是不变的,平均数、方差、极差均受影响.答案 A2.(2020·全国Ⅲ卷)在一组样本数据中,1,2,3,4出现的频率分别为p1,p2,p3,p4,且∑4i=1 p i=1,则下面四种情形中,对应样本的标准差最大的一组是( )A.p1=p4=0.1,p2=p3=0.4B.p1=p4=0.4,p2=p3=0.1C.p1=p4=0.2,p2=p3=0.3D.p1=p4=0.3,p2=p3=0.2解析X的可能取值为1,2,3,4,四种情形的数学期望E(X)=1×p1+2×p2+3×p3+4×p4都为2.5,方差D(X)=[1-E(X)]2×p1+[2-E(X)]2×p2+[3-E(X)]2×p3+[4-E(X)]2×p4,标准差为D(X).A选项的方差D(X)=0.65;B选项的方差D(X)=1.85;C选项的方差D(X)=1.05;D选项的方差D(X)=1.45.可知选项B的情形对应样本的标准差最大.故选B.答案 B3.(2020·天津卷)从一批零件中抽取80个,测量其直径(单位:mm),将所得数据分为9组:[5.31,5.33),[5.33,5.35),…,[5.45,5.47),[5.47,5.49],并整理得到如下频率分布直方图,则在被抽取的零件中,直径落在区间[5.43,5.47)内的个数为( )A.10B.18C.20D.36解析因为直径落在区间[5.43,5.47)内的频率为0.02×(6.25+5.00)=0.225,所以个数为0.225×80=18.故选B.答案 B4.(2020·全国Ⅱ卷)某沙漠地区经过治理,生态系统得到很大改善,野生动物数量有所增加.为调查该地区某种野生动物的数量,将其分成面积相近的200个地块,从这些地块中用简单随机抽样的方法抽取20个作为样区,调查得到样本数据(x i,y i)(i=1,2,…,20),其中x i和x i=y i分别表示第i个样区的植物覆盖面积(单位:公顷)和这种野生动物的数量,并计算得∑20i=160,∑20i=1y i=1 200,∑20i=1(x i-x-)2=80,∑20i=1(y i-y-)2=9 000,∑20i=1(x i-x-)(y i-y-)=800.(1)求该地区这种野生动物数量的估计值(这种野生动物数量的估计值等于样区这种野生动物数量的平均数乘以地块数);(2)求样本(x i,y i)(i=1,2,…,20)的相关系数(精确到0.01);(3)根据现有统计资料,各地块间植物覆盖面积差异很大.为提高样本的代表性以获得该地区这种野生动物数量更准确的估计,请给出一种你认为更合理的抽样方法,并说明理由.附:相关系数r=∑ni=1(x i-x-)(y i-y-)∑ni=1(x i-x-)2∑ni=1(y i-y-)2,2≈1.414.解(1)由已知得样本平均数y-=120∑20i=1y i=60,从而该地区这种野生动物数量的估计值为60×200=12 000.(2)样本(x i,y i)(i=1,2,…,20)的相关系数r=∑20i=1(x i-x-)(y i-y-)∑20i=1(x i-x-)2∑20i=1(y i-y-)2=80080×9 000=223≈0.94.(3)分层抽样:根据植物覆盖面积的大小对地块分层,再对200个地块进行分层抽样.理由如下:由(2)知各样区的这种野生动物数量与植物覆盖面积有很强的正相关性.由于各地块间植物覆盖面积差异很大,从而各地块间这种野生动物数量差异也很大,采用分层抽样的方法较好地保持了样本结构与总体结构的一致性,提高了样本的代表性,从而可以获得该地区这种野生动物数量更准确的估计.考点整合1.抽样方法抽样方法包括简单随机抽样、分层抽样,两种抽样方法都是等概率抽样,体现了抽样的公平性,但又各有其特点和适用范围.2.统计中的四个数据特征(1)众数:在样本数据中,出现次数最多的那个数据.(2)中位数:在样本数据中,将数据按大小顺序排列,位于最中间的数据.如果数据的个数为偶数,就取中间两个数据的平均数作为中位数.(3)平均数:样本数据的算术平均数,即x -=1n(x 1+x 2+…+x n ).(4)方差与标准差.s 2=1n[(x 1-x -)2+(x 2-x -)2+…+(x n -x -)2], s =1n[(x 1-x -)2+(x 2-x -)2+…+(x n -x -)2].3.直方图的两个结论(1)小长方形的面积=组距×频率组距=频率.(2)各小长方形的面积之和等于1. 4.回归分析与独立性检验(1)回归直线y ^=b ^x +a ^经过样本点的中心(x -,y -),若x 取某一个值代入回归直线方程y ^=b ^x +a ^中,可求出y 的估计值. (2)独立性检验对于取值分别是{x 1,x 2}和{y 1,y 2}的分类变量X 和Y ,其样本频数列联表是:则K2=n(ad-bc)2(a+b)(c+d)(a+c)(b+d)(其中n=a+b+c+d为样本容量).热点一抽样方法【例1】(1)总体由编号为01,02,…,49,50的50个个体组成,利用下面的随机数表选取6个个体,选取方法是从随机数表第6行的第9列和第10列数字开始从左到右依次选取两个数字,则选出的第4个个体的编号为( )附:第6行至第9行的随机数表2748 6198 7164 4148 7086 2888 8519 16207477 0111 1630 2404 2979 7991 9683 51253211 4919 7306 4916 7677 8733 9974 67322635 7900 3370 9160 1620 3882 7757 4950A.3B.19C.38D.20(2)(2020·百校大联考)在新冠肺炎疫情期间,大多数学生都进行网上上课.我校高一、高二、高三共有学生1 800名,为了了解同学们对“钉钉”授课软件的意见,计划采用分层抽样的方法从这1 800名学生中抽取一个容量为72的样本.若从高一、高二、高三抽取的人数恰好是从小到大排列的连续偶数,则我校高三年级的人数为( )A.800B.750C.700D.650解析(1)由题意知,编号为01~50的个体才是需要的个体.由随机数表依次可得41,48,28,19,16,20,……故第4个个体的编号为19.故选B.(2)设从高三年级抽取的学生人数为2x人,则从高二、高一年级抽取的人数分别为2x-2,2x -4.由题意可得2x +(2x -2)+(2x -4)=72,∴x =13. 设我校高三年级的学生人数为N ,且高三抽取26人, 由分层抽样,得N1 800=2672,∴N =650(人).答案 (1)B (2)D探究提高 解决此类题目的关键是深刻理解各种抽样方法的特点和适用范围.但无论哪种抽样方法,每一个个体被抽到的概率都是相等的,都等于样本容量与总体容量的比值.【训练1】 (1)总体由编号为01,02,…,19,20的20个个体组成.利用下面的随机数表选取5个个体,选取方法是从随机数表第1行第6列的数字开始,由左到右依次选取两个数字,则选出来的第5个个体的编号为________. 附:第1行至第2行的随机数表21 16 65 08 90 34 20 76 43 81 26 34 91 64 17 50 71 59 45 06 91 27 35 36 80 72 74 67 21 33 50 25 83 12 02 76 11 87 05 26(2)某工厂生产甲、乙、丙、丁四种不同型号的产品,产量分别为200,400,300,100件,为检验产品的质量,现用分层抽样的方法从以上所有的产品中抽取60件进行检验,则应从丙种型号的产品中抽取________件.解析 (1)从随机数表的第1行第6列的数字开始,按规则得到的编号依次为50,89,03,42,07,64,38,12,63,49,16,41,75,07,15,94,50,……其中编号在01至20之间的依次为03,07,12,16,07,15,……按照编号重复的删除后一个的原则,可知选出来的第5个个体的编号为15.(2)因为样本容量n =60,总体容量N =200+400+300+100=1 000,所以抽取比例为nN=601000=350.因此应从丙种型号的产品中抽取300×350=18(件).答案(1)15 (2)18热点二用样本估计总体角度1 数字特征与统计图表的应用【例2】(1)(2020·衡水检测)甲、乙两名同学高三以来6次数学模拟考试的成绩统计如下图,甲、乙两组数据的平均数分别为x-甲、x-乙,标准差分别为s甲、s乙,则( )A.x-甲<x-乙,s甲<s乙B.x-甲<x-乙,s甲>s乙C.x-甲>x-乙,s甲<s乙D.x-甲>x-乙,s甲>s乙(2)2020年初,我国突发新冠肺炎疫情,疫情期间中小学生“停课不停学”.已知某地区中小学生人数情况如甲图所示,各学段学生在疫情期间“家务劳动”的参与率如乙图所示.为了进一步了解该地区中小学生参与“家务劳动”的情况,现用分层抽样的方法抽取4%的学生进行调查,则抽取的样本容量、抽取的高中生中参与“家务劳动”的人数分别为( )A.2 750,200B.2 750,110C.1 120,110D.1 120,200解析(1)由统计图知,甲同学的总体成绩要好于乙同学的成绩,且乙同学的成绩波动较大,甲同学成绩较稳定.∴x-甲>x-乙,且s甲<s乙.(2)学生总数为15 500+5 000+7 500=28 000人,由于抽取4%的学生进行调查,则抽取的样本容量为28 000×4%=1 120(人).故高中生应抽取的人数为5 000×4%=200(人),而高中生中参与“家务劳动”的比率为0.55,故高中生中参与“家务劳动”的人数为200×0.55=110(人).答案(1)C (2)C角度2 用样本的频率分布估计总体分布【例3】(2019·全国Ⅲ卷)为了解甲、乙两种离子在小鼠体内的残留程度,进行如下试验:将200只小鼠随机分成A,B两组,每组100只,其中A组小鼠给服甲离子溶液,B组小鼠给服乙离子溶液.每只小鼠给服的溶液体积相同、摩尔浓度相同.经过一段时间后用某种科学方法测算出残留在小鼠体内离子的百分比.根据试验数据分别得到如下直方图:记C为事件:“乙离子残留在体内的百分比不低于5.5”,根据直方图得到P(C)的估计值为0.70.(1)求乙离子残留百分比直方图中a,b的值;(2)分别估计甲、乙离子残留百分比的平均值(同一组中的数据用该组区间的中点值为代表).解(1)由已知得0.70=a+0.20+0.15,故a=0.35,b=1-0.05-0.15-0.70=0.10.(2)甲离子残留百分比的平均值的估计值为2×0.15+3×0.20+4×0.30+5×0.20+6×0.10+7×0.05=4.05.乙离子残留百分比的平均值的估计值为3×0.05+4×0.10+5×0.15+6×0.35+7×0.20+8×0.15=6.00.探究提高 1.平均数与方差都是重要的数字特征,是对数据的一种简明描述,它们所反映的情况有着重要的实际意义.平均数、中位数、众数描述数据的集中趋势,方差和标准差描述数据的波动大小.2.在例3中,抓住频率分布直方图各小长方形的面积之和为1,这是求解的关键;本题易混淆频率分布条形图和频率分布直方图,误把频率分布直方图纵轴的几何意义当成频率,导致样本数据的频率求错.【训练2】(1)(2020·新高考海南卷)我国新冠肺炎疫情防控进入常态化,各地有序推进复工复产,下面是某地连续11天复工复产指数折线图,下列说法正确的是( )A.这11天复工指数和复产指数均逐日增加B.这11天期间,复产指数增量大于复工指数的增量C.第3天至第11天复工复产指数均超过80%D.第9天至第11天复产指数增量大于复工指数的增量解析 由图可知,第1天到第2天复工指数减少,第7天到第8天复工指数减少,第10天到第11天复工指数减少,第8天到第9天复产指数减少,故A 错误;由图可知,第一天的复产指数与复工指数的差大于第11天的复产指数与复工指数的差,所以这11天期间,复产指数增量小于复工指数的增量,故B 错误;由图可知,第3天至第11天复工复产指数均超过80%,故C 正确;由图可知,第9天至第11天复产指数增量大于复工指数的增量,故D 正确;故选C 、D. 答案 CD(2)(2019·全国Ⅱ卷)某行业主管部门为了解本行业中小企业的生产情况,随机调查了100个企业,得到这些企业第一季度相对于前一年第一季度产值增长率y 的频数分布表.①分别估计这类企业中产值增长率不低于40%的企业比例、产值负增长的企业比例; ②求这类企业产值增长率的平均数与标准差的估计值(同一组中的数据用该组区间的中点值为代表).(精确到0.01)附:74≈8.602.解 ①根据产值增长率频数分布表得,所调查的100个企业中产值增长率不低于40%的企业频率为14+7100=0.21.产值负增长的企业频率为2100=0.02.所以用样本频率分布估计总体分布得这类企业中产值增长率不低于40%的企业比例为21%,产值负增长的企业比例为2%. ②100个企业的产值增长率平均数为y-=1100×(-0.10×2+0.10×24+0.30×53+0.50×14+0.70×7)=0.30,s2=1100∑5i=1n i(y i-y-)2=1100×[(-0.40)2×2+(-0.20)2×24+02×53+0.202×14+0.402×7]=0.029 6,s=0.029 6=0.02×74≈0.17.所以,这类企业产值增长率的平均数与标准差的估计值分别为0.30,0.17.热点三回归分析在实际问题中的应用【例4】如图是某地区2000年至2016年环境基础设施投资额y(单位:亿元)的折线图.为了预测该地区2018年的环境基础设施投资额,建立了y与时间变量t的两个线性回归模型.根据2000年至2016年的数据(时间变量t的值依次为1,2,…,17)建立模型①:y^=-30.4+13.5t;根据2010年至2016年的数据(时间变量t的值依次为1,2,…,7)建立模型②:y^=99+17.5t.(1)分别利用这两个模型,求该地区2018年的环境基础设施投资额的预测值;(2)你认为用哪个模型得到的预测值更可靠?并说明理由.解(1)利用模型①,该地区2018年的环境基础设施投资额的预测值为y^=-30.4+13.5×19=226.1(亿元).利用模型②,该地区2018年的环境基础设施投资额的预测值为y^=99+17.5×9=256.5(亿元).(2)利用模型②得到的预测值更可靠.理由如下:(ⅰ)从折线图可以看出,2000年至2016年的数据对应的点没有随机散布在直线y=-30.4+13.5t上下,这说明利用2000年至2016年的数据建立的线性模型①不能很好地描述环境基础设施投资额的趋势.2010年相对2009年的环境基础设施投资额有明显增加,2010年至2016年的数据对应的点位于一条直线的附近,这说明从2010年开始环境基础设施投资额的变化规律呈线性增长趋势,利用2010年至2016年的数据建立的线性模型y^=99+17.5t可以较好地描述2010年以后的环境基础设施投资额的变化趋势,因此利用模型②得到的预测值更可靠.(ⅱ)从计算结果看,相对于2016年的环境基础设施投资额220亿元,由模型①得到的预测值226.1亿元的增幅明显偏低,而利用模型②得到的预测值的增幅比较合理,说明利用模型②得到的预测值更可靠.探究提高 1.求回归直线方程的关键及实际应用(1)关键:正确理解b^,a^的计算公式和准确地计算.(2)实际应用:在分析实际中两个变量的相关关系时,可根据样本数据作出散点图来确定两个变量之间是否具有相关关系,若具有线性相关关系,则可通过线性回归方程估计和预测变量的值.2.相关系数(1)当r>0时,表明两个变量正相关;当r<0时,两个变量负相关.(2)当|r|>0.75时,认为两个变量具有较强的线性相关关系.【训练3】(1)(2020·全国Ⅰ卷)某校一个课外学习小组为研究某作物种子的发芽率y和温度x(单位:℃)的关系,在20个不同的温度条件下进行种子发芽实验,由实验数据(x i,y i)(i=1,2,…,20)得到下面的散点图:由此散点图,在10 ℃至40 ℃之间,下面四个回归方程类型中最适宜作为发芽率y和温度x 的回归方程类型的是( )A.y=a+bxB.y=a+bx2C.y=a+b e xD.y=a+b ln x(2)(2020·百强名校领军考试)已知变量x,y的关系可以用模型y=c e kx拟合,设z=ln y,其变换后得到一组数据如下:x 16171819z 50344131由上表可得线性回归方程z^=-4x+a^,则c=( )A.-4B.e-4C.109D.e109解析(1)由散点图可以看出,这些点大致分布在对数型函数的图象附近.故选D.(2)由数据表知x-=17.5,z-=39.∵样本点中心(x-,z-)在回归直线上,∴a^=39+4×17.5=109.又z=ln y=ln(c e kx)=kx+ln c,∴ln c=a^=109,则c=e109.答案(1)D (2)D热点四独立性检验【例5】(2020·新高考山东、海南卷)为加强环境保护,治理空气污染,环境监测部门对某市空气质量进行调研,随机抽查了100天空气中的PM2.5和SO2浓度(单位:μg/m3),得下表:(1)估计事件“该市一天空气中PM2.5浓度不超过75,且SO2浓度不超过150”的概率;(2)根据所给数据,完成下面的2×2列联表:(3)根据(2)中的列联表,判断是否有99%的把握认为该市一天空气中PM2.5浓度与SO2浓度有关?附:K2=n(ad-bc)2(a+b)(c+d)(a+c)(b+d),解(1)根据抽查数据,该市100天的空气中PM2.5浓度不超过75,且SO2浓度不超过150的天数为32+18+6+8=64,因此,该市一天空气中PM2.5浓度不超过75,且SO2浓度不超过150的概率的估计值为64100=0.64.(2)根据抽查数据,可得2×2列联表:(3)根据(2)的列联表得K 2的观测值k =100×(64×10-16×10)280×20×74×26≈7.484.由于7.484>6.635,故有99%的把握认为该市一天空气中PM2.5浓度与SO 2浓度有关. 探究提高 1.独立性检验的一般步骤 (1)根据样本数据列成2×2列联表;(2)根据公式K 2=n (ad -bc )2(a +b )(c +d )(a +c )(b +d ),计算K 2的值;(3)查表比较K 2与临界值的大小关系,作统计判断.2.K 2的观测值k 越大,对应假设事件H 0成立(两类变量相互独立)的概率越小,H 0不成立的概率越大.【训练4】 某商场为提高服务质量,随机调查了50名男顾客和50名女顾客,每位顾客对该商场的服务给出满意或不满意的评价,得到下面列联表:(1)分别估计男、女顾客对该商场服务满意的概率;(2)能否有95%的把握认为男、女顾客对该商场服务的评价有差异?附:K 2=n (ad -bc )2(a +b )(c +d )(a +c )(b +d ).P (K 2≥k 0) 0.050 0.010 0.001 k 03.8416.63510.828解 (1)由调查数据,男顾客中对该商场服务满意的比率为4050=0.8,因此男顾客对该商场服务满意的概率的估计值为0.8.女顾客中对该商场服务满意的比率为3050=0.6,因此女顾客对该商场服务满意的概率的估计值为0.6. (2)K 2的观测值k =100×(40×20-30×10)250×50×70×30≈4.762.由于4.762>3.841,故有95%的把握认为男、女顾客对该商场服务的评价有差异.A 级 巩固提升一、选择题1.《西游记》《三国演义》《水浒传》和《红楼梦》是中国古典文学瑰宝,并称为中国古典小说四大名著.某中学为了解本校学生阅读四大名著的情况,随机调查了100位学生,其中阅读过《西游记》或《红楼梦》的学生共有90位,阅读过《红楼梦》的学生共有80位,阅读过《西游记》且阅读过《红楼梦》的学生共有60位,则该校阅读过《西游记》的学生人数与该校学生总数比值的估计值为( ) A.0.5B.0.6C.0.7D.0.8解析 法一 设调查的100位学生中阅读过《西游记》的学生人数为x ,则x +80-60=90,解得x =70,所以该校阅读过《西游记》的学生人数与该校学生总数比值的估计值为70100=0.7.故选C.法二用Venn图表示阅读过《西游记》和《红楼梦》的人数之间的关系如图:易知调查的100位学生中阅读过《西游记》的学生人数为70,所以该校阅读过《西游记》的学生人数与该校学生总数比值的估计值为70100=0.7.答案 C2.(2020·全国Ⅲ卷)设一组样本数据x1,x2,…,x n的方差为0.01,则数据10x1,10x2,…,10x n的方差为( )A.0.01B.0.1C.1D.10解析10x1,10x2,…,10x n的方差为102×0.01=1.故选C.答案 C3.给出如下列联表患心脏病患其他病总计高血压201030非高血压305080总计5060110P(K2≥10.828)≈0.001,P(K2≥ 6.635)≈0.010,参照公式k=n(ad-bc)2(a+b)(c+d)(a+c)(b+d),得到的正确结论是( )A.有99%以上的把握认为“高血压与患心脏病无关”B.有99%以上的把握认为“高血压与患心脏病有关”C.在犯错误的概率不超过0.1%的前提下,认为“高血压与患心脏病无关”D.在犯错误的概率不超过0.1%的前提下,认为“高血压与患心脏病有关” 解析 由列联表中的数据可得K 2的观测值 k =110×(20×50-10×30)230×80×50×60≈7.486>6.635,根据参考数据P (K 2≥6.635)≈0.01,P (K 2≥10.828)≈0.001,所以有1-0.01=99%的把握认为高血压与患心脏病有关,即有99%以上的把握认为高血压与患心脏病有关. 答案 B4.(多选题)(2020·济南调研)某企业对本企业1 644名职工关于复工的态度进行调查,调查结果如图所示,下列结论成立的是( )疫情防控期间某企业复工职工调查A.x =0.384B.从该企业中任取一名职工,该职工是倾向于在家办公的概率为0.178C.不到80名职工倾向于继续申请休假D.倾向于复工后在家办公或在公司办公的职工超过986名解析 由图表知x %=1-5.1%-17.8%-42.3%,得x =34.8,则A 错.在家办公的人员占17.8%,B 正确.由1 644×5.1%>1644×5%=82.2>80,∴超过80名职工倾向于休假,故C 错误.又1 644×(17.8%+42.3%)≈988,所以超过986名职工倾向于在家办公或在公司办公,D 正确.综上可知,正确的结论为BD. 答案 BD5.(多选题)某校进行了一次创新作文大赛,共有100名同学参赛,经过评判,这100名参赛者的得分都在[40,90]之间,其得分的频率分布直方图如图所示,则下列结论正确的是( )A.得分在[40,60)之间的共有40人B.从这100名参赛者中随机选取1人,其得分在[60,80)的概率为0.5C.估计得分的众数为55D.这100名参赛者得分的中位数为65解析 根据频率和为1,由(a +0.035+0.030+0.020+0.010)×10=1,解得a =0.005, 得分在[40,60)的频率是0.40,估计得分在[40,60)的有100×0.40=40(人),A 正确; 得分在[60,80)的频率为0.5,可得从这100名参赛者中随机选取一人, 得分在[60,80)的概率为0.5,B 正确;根据频率分布直方图知,最高的小矩形对应的底边中点为50+602=55,即估计得分的众数为55,C 正确;由0.05+0.35=0.4<0.5,知中位数位于[60,70)内,所以中位数的估计值为60+0.5-0.40.03≈63.3. 答案 ABC 二、填空题6.(2020·深圳调研)为了响应中央号召,某日深圳环保局随机抽查了本市市区汽车尾气排放污染物x (单位:ppm)与当天私家车路上行驶的时间y (单位:小时)之间的关系,从某主干路随机抽取10辆私家车,根据测量数据的散点图可以看出x 与y 之间具有线性相关关系,其回归直线方程为y ^=0.3x -0.4,若该10辆车中有一辆私家车的尾气排放污染物为6(单位:ppm),据此估计该私家车行驶的时间为________小时.解析 由y ^=0.3x -0.4,取x =6,得y ^=0.3×6-0.4=1.4,∴估计该私家车行驶的时间为1.4小时. 答案 1.47.(2020·济宁联考)由于受到网络电商的冲击,某品牌的洗衣机在线下的销售受到影响,承受了一定的经济损失,现将A 地区200家实体店该品牌洗衣机的月经济损失统计如图所示,估算月经济损失的平均数为m ,中位数为n ,则m -n =________.解析 第一块小矩形的面积S 1=0.3,第二块小矩形的面积S 2=0.4,故n =2 000+0.5-0.30.000 2=3 000;又第四、五块小矩形的面积均为S =0.06,故a =12 000[1-(0.3+0.4+0.06×2)]=0.000 09,所以m =1 000×0.3+3 000×0.4+5 000×0.18+(7 000+9 000)×0.06=3 360,故m -n =360. 答案 3608.(2002·中原名校联考)“关注夕阳、爱老敬老”——某马拉松协会从2013年开始每年向敬老院捐赠物资和现金.下表记录了第x 年(2013年是第一年)与捐赠的现金y (万元)的对应数据,由此表中的数据得到了y 关于x 的线性回归方程y ^=mx +0.35,则预测2021年捐赠的现金大约是________万元.x 3 4 5 6 y2.5344.5解析 由已知,得x -=3+4+5+64=4.5,y -=2.5+3+4+4.54=3.5,所以样本中心点的坐标为(4.5,3.5),代入y ^=mx +0.35中,得3.5=4.5m +0.35,解得m =0.7,所以y ^=0.7x +0.35.取x =9,得y ^=0.7×9+0.35=6.65,故预测2021年捐赠的现金大约是6.65万元. 答案 6.65 三、解答题9.(2020·济南联考)2019年10月1日是中华人民共和国成立70周年纪念日.70年砥砺奋进,70年波澜壮阔,感染、激励着一代又一代华夏儿女,为祖国的繁荣昌盛努力拼搏,奋发图强.为进一步对学生进行爱国教育,某校社会实践活动小组,在老师的指导下,从学校随机抽取四个班级160名同学对这次国庆阅兵受到激励情况进行调查研究,记录的情况如下图:(1)如果从这160人中随机选取1人,此人非常受激励的概率和此人是很受激励的女同学的概率都是14,求a ,b ,c 的值;(2)根据“非常受激励”与“很受激励”两种情况进行研究,判断是否有95%的把握认为受激励程度与性别有关. 附:参考数据解 (1)由题意知20+a 160=c 160=14,且a +b +c =120.解之得a =20,b =60,c =40. (2)由题意可得2×2列联表:∴K 2的观测值k =n (ad -bc )2(a +b )(c +d )(a +c )(b +d )=140×(20×40-20×60)240×100×80×60≈1.17.由于1.17<3.841,∴没有95%的把握认为受激励程度与性别有关.10.某家庭记录了未使用节水龙头50天的日用水量数据(单位:m 3)和使用了节水龙头50天的日用水量数据,得到频数分布表如下:未使用节水龙头50天的日用水量频数分布表使用了节水龙头50天的日用水量频数分布表日用水量 [0,0.1)[0.1,0.2)[0.2,0.3)[0.3,0.4)[0.4,0.5)[0.5,0.6]频数151310165(1)在下图中作出使用了节水龙头50天的日用水量数据的频率分布直方图:(2)估计该家庭使用节水龙头后,日用水量小于0.35 m 3的概率;(3)估计该家庭使用节水龙头后,一年能节省多少水?(一年按365天计算,同一组中的数据以这组数据所在区间中点的值作代表). 解 (1)所求的频率分布直方图如下:(2)由题可知使用节水龙头后50天的用水量在[0.3,0.4)的频数为10,所以可估计在[0.3,0.35)的频数为5,故用水量小于0.35 m 3的频数为1+5+13+5=24,其频率为2450=0.48.因此,估计该家庭使用节水龙头后,日用水量小于0.35 m 3的概率为0.48. (3)该家庭未使用节水龙头50天的日用水量的平均数为x -1=150(0.05×1+0.15×3+0.25×2+0.35×4+0.45×9+0.55×26+0.65×5)=0.48(m 3). 该家庭使用了节水龙头后50天的日用水量的平均数为x -2=150(0.05×1+0.15×5+0.25×13+0.35×10+0.45×16+0.55×5)=0.35(m 3). 估计使用节水龙头后,一年可节省水(0.48-0.35)×365=47.45(m 3).B 级 能力突破11.(多选题)(2020·海南质检)刘女士的网店经营坚果类食品,2019年各月份的收入、支出(单位:百元)情况的统计如图所示,下列说法中正确的是( )A.4至5月份的收入的变化率与11至12月份的收入的变化率相同B.支出最高值与支出最低值的比是5∶1C.第三季度平均收入为5 000元D.利润最高的月份是3月份和10月份解析 对于A ,4至5月份的收入的变化率为30-505-4=-20,11至12月份收入的变化率为50-7012-11=-20,故相同,A 正确.对于B ,支出最高值是2月份60百元,支出最低值是5月份的10百元,故支出最高值与支出最低值的比是6∶1,故B 错误.对于C ,第三季度的7,8,9月每个月的收入分别为40百元,50百元,60百元,故第三季度的平均收入为40+50+603=50(百元),故C 正确.对于D ,利润最高的月份是3月份和10月份都是30百元,故D 正确. 答案 ACD12.(2020·西安模拟)某公司为了预测下月产品销售情况,找出了近7个月的产品销售量y (单位:万件)的统计表:0.55. (1)请用相关系数说明销售量y 与月份代码t 有很强的线性相关关系; (2)求y 关于t 的回归方程(系数精确到0.01); (3)公司经营期间的广告宣传费x i =t i (单位:万元)(i =1,2,…,7),每件产品的销售价为10元,预测第8个月的毛利润能否突破15万元,请说明理由.(毛利润等于销售金额减去广告宣传费)参考公式及数据:7≈2.646,相关系数r =∑n i =1(t i -t -)(y i -y -)∑ni =1(t i -t -)2∑n i =1 (y i -y -)2,当|r |>0.75时认为两个变量有很强的线性相关关系,回归方程y ^=b ^t +a ^中斜率和截距的最小二乘估计公式分别为b ^=∑n i =1 (t i -t -)(y i -y -)∑n i =1 (t i -t -)2,a ^=y --b ^t -. 解 (1)由统计表中的数据和附注中的参考数据得t -=4,∑7i =1 (t i -t -)2=28,∑7i =1(y i -y -)2=0.55, 则∑7i =1 (t i -t -)(y i -y -)=∑7i =1t i y i -t -∑7i =1y i =40.17-4×9.32=2.89,∴r =2.8927×0.55≈ 2.892×2.646×0.55≈0.99, 因为0.99>0.75,所以销售量y 与月份代码t 有很强的线性相关关系.(2)由y -=9.327≈1.331及(1)得b ^=∑7i =1 (t i -t -)(y i -y -)∑7i =1(t i -t -)2=2.8928≈0.103. a ^=y --b ^t -≈1.331-0.103×4≈0.92,所以y 关于t 的回归方程为y ^=0.10t +0.92.(3)当t =8时,代入回归方程得y ^=0.10×8+0.92=1.72(万件), 第8个月的毛利润为z =10×1.72-8≈17.2-2×1.414=14.372(万元).由14.372<15,预测第8个月的毛利润不能突破15万元.。

合集下载

【2021届高考二轮精品资源-数学】专题五 概率与统计(文理)第1讲 统计与统计案例 教师版

【2021届高考二轮精品资源-数学】专题五 概率与统计(文理)第1讲 统计与统计案例  教师版

【2021届高考二轮精品资源-数学】专题五 概率与统计(文理) 第1讲 统计与统计案例 教师版1.抽样方法、样本的数字特征、统计图表、回归分析与独立性检验主要以选择题、填空题形式命题,难度较小;2.注重知识的交汇渗透,统计与概率,回归分析与概率是近年命题的热点.1.抽样方法抽样方法包括简单随机抽样、系统抽样、分层抽样,三种抽样方法都是等概率抽样,体现了抽样的公平性,但又各有其特点和适用范围. 2.统计中的四个数据特征(1)众数:在样本数据中,出现次数最多的那个数据.(2)中位数:样本数据中,将数据按大小排列,位于最中间的数据.如果数据的个数为偶数,就取中间两个数据的平均数作为中位数.(3)平均数:样本数据的算术平均数,即=n 1(x 1+x 2+…+x n ). (4)方差与标准差. s 2=n 1[(x 1-)2+(x 2-)2+…+(x n -)2],s=[(x1- EMBED Equation.DSMT4 )2+(x2- EMBED Equation.DSMT4 )2+…+(xn - EMBED Equation.DSM 1.3.直方图的两个结论(1)小长方形的面积=组距×组距频率=频率. (2)各小长方形的面积之和等于1. 4.回归分析与独立性检验(1)回归直线^y =^b x +^a 经过样本点的中心点(,),若x 取某一个值代入回归直线方程^y=^b x +^a中,可求出y 的估计值. (2)独立性检验对于取值分别是{x 1,x 2}和{y 1,y 2}的分类变量X 和Y ,其样本频数列联表是:则K 2=(a +b )(c +d )(a +c )(b +d )n (ad -bc )2(其中n =a +b +c +d 为样本容量).型更合适,并用此模型预测A 超市广告费支出为8万元时的销售额. 参数数据及公式:=8,=42,7x i y i =2 794,7x i 2=708,(1)解析 ∵k ≈3.918>3.841,且P (K 2≥k 0=3.841)=0.05,根据独立性检验思想“这种血清能起到预防感冒的作用”出错的可能性不超过5%. 答案 B(2)解 ①∵=8,=42,7x i y i =2 794,7x i 2=708.因此^a =-^b=42-1.7×8=28.4.所以,y 关于x 的线性回归方程是^y=1.7x +28.4. ②∵0.75<0.97, ∴对数回归模型更合适.当x =8时,^y=12ln 8+22=36ln 2+22=36×0.7+22=47.2万元.∴广告费支出8万元时,预测A超市销售额为47.2万元.1.(2017·全国Ⅰ卷)为评估一种农作物的种植效果,选了n块地作试验田.这n块地的亩产量(单位:kg)分别为x1,x2,…,x n,下面给出的指标中可以用来评估这种农作物亩产量稳定程度的是()A.x1,x2,…,x n的平均数B.x1,x2,…,x n的标准差C.x1,x2,…,x n的最大值D.x1,x2,…,x n的中位数【解题思路】刻画评估这种农作物亩产量稳定程度的指标是标准差.【答案】B2.(2018·全国I卷)某地区经过一年的新农村建设,农村的经济收入增加了一倍.实现翻番.为更好地了解该地区农村的经济收入变化情况,统计了该地区新农村建设前后农村的经济收入构成比例.得到如下饼图:则下面结论中不正确的是()A.新农村建设后,种植收入减少B.新农村建设后,其他收入增加了一倍以上C.新农村建设后,养殖收入增加了一倍D.新农村建设后,养殖收入与第三产业收入的总和超过了经济收入的一半【解题思路】首先设出新农村建设前的经济收入为M,根据题意,得到新农村建设后的经济收入为2M,之后从图中各项收入所占的比例,得到其对应的收入是多少,从而可以比较其大小,并且得到其相应的关系,从而得出正确的选项.【答案】设新农村建设前的收入为M,而新农村建设后的收入为2M,则新农村建设前种植收入为0.6M,而新农村建设后的种植收入为0.74M,所以种植收入增加了,所以A项不正确;新农村建设前其他收入我0.04M,新农村建设后其他收入为0.1M,故增加了一倍以上,所以B项正确;新农村建设前,养殖收入为0.3M,新农村建设后为0.6M,所以增加了一倍,所以C 项正确;新农村建设后,养殖收入与第三产业收入的综合占经济收入的,所以超过了经济收入的一半,所以D正确;故选A.3.(2018·全国III卷))某公司有大量客户,且不同龄段客户对其服务的评价有较大差异.为了解客户的评价,该公司准备进行抽样调查,可供选择的抽样方法有简单随机抽样、分层抽样和系统抽样,则最合适的抽样方法是________.【解题思路】由题可知满足分层抽样特点【答案】由于从不同龄段客户中抽取,故采用分层抽样,故答案为分层抽样.4.7.(2018·全国II卷)下图是某地区2000年至2016年环境基础设施投资额(单位:亿元)的折线图.为了预测该地区2018年的环境基础设施投资额,建立了与时间变量的两个线性回归模型.根据2000年至2016年的数据(时间变量的值依次为)建立模型①:;根据2010年至2016年的数据(时间变量的值依次为)建立模型②:.(1)分别利用这两个模型,求该地区2018年的环境基础设施投资额的预测值;(2)你认为用哪个模型得到的预测值更可靠?并说明理由.【解题思路】(1)两个回归直线方程中无参数,所以分别求自变量为2018时所对应的函数值,就得结果,(2)根据折线图知2000到2009,与2010到2016是两个有明显区别的直线,且2010到2016的增幅明显高于2000到2009,也高于模型1的增幅,因此所以用模型2更能较好得到2018的预测.【答案】(1)利用模型①,该地区2018年的环境基础设施投资额的预测值为=–30.4+13.5×19=226.1(亿元).利用模型②,该地区2018年的环境基础设施投资额的预测值为=99+17.5×9=256.5(亿元).(2)利用模型②得到的预测值更可靠.理由如下:(i)从折线图可以看出,2000年至2016年的数据对应的点没有随机散布在直线y=–30.4+13.5t上下,这说明利用2000年至2016年的数据建立的线性模型①不能很好地描述环境基础设施投资额的变化趋势.2010年相对2009年的环境基础设施投资额有明显增加,2010年至2016年的数据对应的点位于一条直线的附近,这说明从2010年开始环境基础设施投资额的变化规律呈线性增长趋势,利用2010年至2016年的数据建立的线性模型=99+17.5t可以较好地描述2010年以后的环境基础设施投资额的变化趋势,因此利用模型②得到的预测值更可靠.(ii)从计算结果看,相对于2016年的环境基础设施投资额220亿元,由模型①得到的预测值226.1亿元的增幅明显偏低,而利用模型②得到的预测值的增幅比较合理,说明利用模型②得到的预测值更可靠.以上给出了2种理由,考生答出其中任意一种或其他合理理由均可得分.点睛:若已知回归直线方程,则可以直接将数值代入求得特定要求下的预测值;若回归直线方程有待定参数,则根据回归直线方程恒过点求参数.1.(2018·内江期末)为了了解某社区居民是否准备收看电视台直播的“龙舟大赛”,某记者分别从社区60~70岁,40~50岁,20~30岁的三个年龄段中的128,192,x人中,采用分层抽样的方法共抽出了30人进行调查,若60~70岁这个年龄段中抽查了8人,那么x为()A.64B.96C.144D.160【解题思路】根据60~70岁这个年龄段中128人中抽查了8人,可知分层抽样的抽样比为,因为共抽出30人,所以总人数为人,即可求出20~30岁年龄段的人数.【答案】根据60~70岁这个年龄段中128人中抽查了8人,可知分层抽样的抽样比为,因为共抽出30人,所以总人数为人,所以,20~30岁龄段的人有,故选D.2.(2017·全国Ⅲ卷)某城市为了解游客人数的变化规律,提高旅游服务质量,收集并整理了2014年1月至2016年12月期间月接待游客量(单位:万人)的数据,绘制了下面的折线图.根据该折线图,下列结论错误的是()A.月接待游客量逐月增加B.年接待游客量逐年增加C.各年的月接待游客量高峰期大致在7,8月D.各年1月至6月的月接待游客量相对于7月至12月,波动性更小,变化比较平稳【解题思路】由题图可知,2014年8月到9月的月接待游客量在减少,则A选项错误.【答案】A3.(2017·泉州模拟)某厂在生产甲产品的过程中,产量x(吨)与生产能耗y(吨)的对应数据如表:根据最小二乘法求得回归方程为^=0.65x+^,当产量为80吨时,预计需要生产能耗为________吨.【解题思路】由回归直线方程过样本点中心可得^a.【答案】由题意,=45,=36.25,代入^y=0.65x+^a,可得^a=7,∴当产量为80吨时,预计需要生产能耗为0.65×80+7=59.故填59.4.(2018·全国I卷)某家庭记录了未使用节水龙头50天的日用水量数据(单位:m3)和使用了节水龙头50天的日用水量数据,得到频数分布表如下:未使用节水龙头50天的日用水量频数分布表使用了节水龙头50天的日用水量频数分布表(1)在答题卡上作出使用了节水龙头50天的日用水量数据的频率分布直方图:(2)估计该家庭使用节水龙头后,日用水量小于0.35 m3的概率;(3)估计该家庭使用节水龙头后,一年能节省多少水?(一年按365天计算,同一组中的数据以这组数据所在区间中点的值作代表.)【解题思路】(1)根据题中所给的使用了节水龙头50天的日用水量频数分布表,算出落在相应区间上的频率,借助于直方图中长方形的面积表示的就是落在相应区间上的频率,从而确定出对应矩形的高,从而得到直方图;(2)结合直方图,算出日用水量小于0.35的矩形的面积总和,即为所求的频率;(3)根据组中值乘以相应的频率作和求得50天日用水量的平均值,作差乘以365天得到一年能节约用水多少,从而求得结果.【答案】(1)(2)根据以上数据,该家庭使用节水龙头后50天日用水量小于0.35m3的频率为0.2×0.1+1×0.1+2.6×0.1+2×0.05=0.48,因此该家庭使用节水龙头后日用水量小于0.35m3的概率的估计值为0.48.(3)该家庭未使用节水龙头50天日用水量的平均数为.该家庭使用了节水龙头后50天日用水量的平均数为.估计使用节水龙头后,一年可节省水.1.(2017·汉中模拟)已知两个随机变量x,y之间的相关关系如表所示:根据上述数据得到的回归方程为^y =^b x +^a,则大致可以判断( ) A .^a >0,^b >0B .^a >0,^b <0C .^a <0,^b >0D .^a <0,^b <0【解题思路】作出散点图,画出回归直线直观判定^b >0,^a<0. 【答案】C2.(2018·衡水中学)已知某种商品的广告费支出x (单位:万元)与销售额y (单位:万元)之间有如下对应数据:根据表中的全部数据,用最小二乘法得出y 与x 的线性回归方程为,则表中m 的值为( ) A .45B .50C .55D .70【解题思路】根据回归直线经过样本平均数点,可求得m 的值.【答案】由表可知,,,因为回归直线会经过平均数样本中心点,代入,解得,所以选D .3.为了研究雾霾天气的治理情况,某课题组对部分城市进行空气质量调查,按地域特点把这些城市分成甲、乙、丙三组,已知三组城市的个数分别为4,y ,z ,依次构成等差数列,且4,y ,z +4成等比数列,若用分层抽样抽取6个城市,则乙组中应抽取的城市个数为________.【解题思路】根据等差数列和等比数列的定义列方程组解出y ,z .【答案】由题意可得y2=4(z +4),2y =4+z ,即y2=4z +16,,解得z =12或z =-4(舍去),故y =8. 所以甲、乙、丙三组城市的个数分别为4,8,12. 因为一共要抽取6个城市,所以抽样比为4+8+126=41. 故乙组城市应抽取的个数为8×41=2.故填 2.4.(2017·赤峰二模)微信是腾讯公司推出的一种手机通讯软件,它支持发送语音短信、视频、图片和文字,一经推出便风靡全国,甚至涌现出一批在微信的朋友圈内销售商品的人(被称为微商).为了调查每天微信用户使用微信的时间,某经销化妆品的微商在一广场随机采访男性、女性用户各50名,将男性、女性使用微信的时间分成5组:(0,2],(2,4],(4,6],(6,8],(8,10]分别加以统计,得到如图所示的频率分布直方图.(1)根据女性频率分布直方图估计女性使用微信的平均时间;(2)若每天玩微信超过4小时的用户列为“微信控”,否则称其为“非微信控”,请你根据已知条件完成2×2的列联表,并判断是否有90%的把握认为“微信控”与“性别有关”? 【解题思路】(1)取每组的中间值代表这组,平均数;(2)根据题意列出2×2列联表,并计算K 2.【答案】解 (1)女性平均使用微信的时间为:0.16×1+0.24×3+0.28×5+0.2×7+0.12×9=4.76 (小时).(2)由已知得:2(0.04+a +0.14+2×0.12)=1,解得a =0.08. 由题设条件得列联表∴K 2=(a +b )(c +d )(a +c )(b +d )n (ad =50×50×68×32≈2.941>2.706. 所以有90%的把握认为“微信控”与“性别”有关.。

热点攻关 “概率与统计”大题的常考题型探究(课件)2023年高考数学二轮复习(全国通用)

热点攻关  “概率与统计”大题的常考题型探究(课件)2023年高考数学二轮复习(全国通用)
大题攻略05 有关预测与决策问题
例5 (2022年北京卷)在校运动会上,只有甲、乙、丙三名同学参加铅球比赛,比赛成绩达到 以上(含 )的同学将获得优秀奖.为预测获得优秀奖的人数及冠军得主,收集了甲、乙、丙以往的比赛成绩,并整理得到如下数据(单位: ): 甲: , , , , , , , , , . 乙: , , , , , . 丙: , , , . 假设用频率估计概率,且甲、乙、丙的比赛成绩相互独立.
(3)已知该地区这种疾病的患病率为 ,该地区的年龄位于区间 的人口占该地区总人口的 .从该地区中任选一人,若此人的年龄位于区间 ,求此人患这种疾病的概率.(以样本数据中患者的年龄位于各区间的频率作为患者的年龄位于该区间的概率,精确到 )
[解析] (1)平均年龄 (岁).(2)设 ,则 .(3)设 ,则由条件概率公式,得 .
(1)估计甲在校运动会铅球比赛中获得优秀奖的概率;
(2)设 是甲、乙、丙在校运动会铅球比赛中获得优秀奖的总人数,估计 的数学期望 ;
(3)在校运动会铅球比赛中,甲、乙、丙谁获得冠军的概率估计值最大?(结论不要求证明)
[解析] (1) 由频率估计概率可得,甲获得优秀奖的概率为0.4.(2)设“甲获得优秀奖”为事件 ,“乙获得优秀奖”为事件 ,“丙获得优秀奖”为事件 ,由题意知 ,又 ,则 , ,
树苗高度(单位: )
树苗售价(单位:元/株)
4
6
8
(1)现从120株树苗中,按售价分层抽样抽取8株,再从中任选3株,求售价之和高于20元的概率;
(2)以样本中树苗高度的频率作为育苗基地中树苗高度的概率.若从该育苗基地银杏树树苗中任选4株,记树苗高度超过 的株数为 ,求随机变量 的分布列和期望.
[解析] (1)由题意得, ,令 ,设 关于 的线性回归方程为 ,则有 ,则 ,所以 ,又 ,所以 关于 的回归方程为 .

2021届高考数学二轮复习考点通关·专题突破课件:专题10 统计与概率

2021届高考数学二轮复习考点通关·专题突破课件:专题10 统计与概率

(2)A,B中至少有一个发生:A∪B. ①若A,B互斥:P(A∪B)=P(A)+P(B),否则不成立. ②若A,B相互独立(不互斥),则概率的求法: 方法一:P(A∪B)=P(AB)+P(A B )+P( A B); 方法二:P(A∪B)=P(A)+P(B)-P(AB)=1-P( A )P( B ).
2.选C.由于曲线C为正态分布N(0,1)的正态曲线,则阴 影部分面积为S= 0.682 7 =0.341 35,
2
所以落入阴影部分的点的个数约为 10 000× 0.341 ≈35 3 414.
1
【拓展提升】 利用正态曲线的对称性求概率的方法
合,b开关必须断开,否则短路.设“a闭合”为事件A,
“b闭合”为事件B,“c闭合”为事件C,则甲灯亮应为
事件A B C,且A,B,C之间彼此独立,且P(A)=P(B)=P(C)
=
1 2
,由相互独立事件概率公式知P(A
B C)=
P(A)P(
B
)P(C)=
1 1 1=1. 222 8
答案: 1
C. 2
D. 1
3
5
5
5
【解析】选B.从5只兔子中随机取出3只,总的基本事件
有10种;又因为只有3只测量过某项指标,故恰有2只测
量过该指标的种数为6,则恰有2只测量过该指标的概率
为 6 ,即 3 .
10
5
2.从甲、乙等5名学生中随机选出2人,则甲被选中的概 率为 ( )
A. 1
B. 2
C. 8
5
3.如果3个正整数可作为一个直角三角形三条边的边长, 则称这3个数为一组勾股数.从1,2,3,4,5中任取3个不 同的数,则这3个数构成一组勾股数的概率为 ( )

最新-2021高考数学理科二轮复习课件:第1部分 专题七 概率与统计 第1讲 精品

最新-2021高考数学理科二轮复习课件:第1部分 专题七 概率与统计 第1讲 精品

③求形如(a+b)m(c+d)n(m,n ∈N*)的式子中与特定项相关的量: 根据二项式定理把a+bm与c+dn分别展开,并写出其通项
→
根据特定项的次数,分析特定项可由a+bm与 c+dn的展开式中的哪些项相乘得到
→ 把相乘后的项相加减即可得到特定项 解题 ④求形如(a+b+c)n(n ∈N*)式子中与特定项相关的量: 模板
排列组合求实际 卷·12题);
问题中的计数问
设题
(2016·全国卷甲·5
问
题).
方 式
②求二项式展开
[例](2015·全国卷 Ⅰ·10题);(2015·全
式的指定项、项 国卷Ⅱ·15题);
①计数问题: 分析给出问题的特点 → 确定需要应用的知识点 → 运用对应知识求解 ②求解形如(a+b)n(n ∈N*)的式子中与特定项(如常数项、指定项)相关的量: 解题 模板
备考策 略
• 1.概率的2轮复习需要做好如下六点:
• (1)掌握好有关的概念,如必然事件、不可能 事件、随机事件、互斥事件、对立事件等.
• (2)要注意解决问题的方法,如计算古典概型 时,如何计算基本事件的个数;计算几何概 型时,如何构造基本事件空间等.
• (3)理解事件之间的互斥和对立,并能够运用 事件的互斥和对立计算概率,在弄清楚这个 问题的基础上掌握好古典概型和几何概型的 计算公式,并学会对实际问题的意义进行分
• (6)有关随机变量服从正态分布,求随机变量
• 2.统计部分内容的概念、数据、图表、计算 公式较多,再加之数据计算繁琐,在复习时 要注意以下几点:
• (1)厘清概念,如中位数、众数、样本平均数、 样本方差等,只有明确了这些概念才能在具 体问题中灵活运用;
• (2)搞清楚几个数表的意义,如频率分布表、 独立性检验中的2×2列联表;

2021高考数学二轮复习专题限时集训《统计与统计案例》

2021高考数学二轮复习专题限时集训《统计与统计案例》

专题限时集训(六)统计与统计案例[专题通关练](建议用时:20分钟)1.[新题型:多选题]下列说法中正确的是()A.先把高三年级的2 000名学生编号:1到2 000,再从编号为1到50的50名学生中随机抽取1名学生,其编号为m,然后抽取编号为m+50,m+100,m+150,…的学生,这样的抽样方法是系统抽样法B.线性回归直线y^=b^x+a^不一定过样本中心点(x,y)C.若两个随机变量的线性相关性越强,则相关系数r的值越接近于1D.若一组数据1,a,3的平均数是2,则该组数据的方差是2 3AD[对于A,先把高三年级的2 000名学生编号:1到2 000,再从编号为1到50的50名学生中随机抽取1名学生,其编号为m,然后抽取编号为m+50,m+100,m+150,…的学生,这样的抽样方法是系统抽样,故A项正确;对于B,线性回归直线y^=b^x+a^一定过样本中心点(x,y),故B项错误;对于C,若两个随机变量的线性相关性越强,则相关系数r的绝对值越接近于1,故C项错误;对于D,若一组数据1,a,3的平均数是2,则a=2,则该组数据的方差是1 3×[](1-2)2+(2-2)2+(3-2)2=23,故D项正确,故选AD.]2.[重视题](2019·青岛一模)调查机构对某高科技行业进行调查统计,得到该行业从业者学历分布饼状图、从事该行业岗位分布条形图,如图所示.给出下列三种说法:①该高科技行业从业人员中学历为博士的占一半以上;②该高科技行业中从事技术岗位的人数超过总人数的30%;③该高科技行业中从事运营岗位的人员主要是本科生,其中正确的个数为( )A .0个B .1个C .2个D .3个C [在①中,由该行业从业者学历分布饼状图得到:该高科技行业从业人员中学历为博士的占一半以上,故①正确;在②中,由从事该行业岗位分布条形图得到:该高科技行业中从事技术岗位的人数超过总人数的30%,故②正确;在③中,由该行业从业者学历分布饼状图、从事该行业岗位分布条形图,无法得到该高科技行业中从事运营岗位的人员主要是本科生,故③错误.故选C.]3.(2019·郑州二模)将甲、乙两个篮球队5场比赛的得分数据整理成如图所示的茎叶图,由图可知以下结论正确的是( )A .甲队平均得分高于乙队的平均得分B .甲队得分的中位数大于乙队得分的中位数C .甲队得分的方差大于乙队得分的方差D .甲乙两队得分的极差相等C [对于A ,甲的平均数为15(29+28+26+31+31)=29,乙的平均数为15(28+29+30+31+32)=30,故A 错误.对于B ,甲队得分的中位数是29,乙队得分的中位数是30,故B 错误; 对于C ,甲成绩的方差为:s 2=15×[(26-29)2+(28-29)2+(29-29)2+(31-29)2+(31-29)2]=185.乙成绩的方差为:s 2=15×[(28-30)2+(29-30)2+(30-30)2+(31-30)2+(32-30)2]=2.可得甲队得分的方差大于乙队得分的方差,故C 正确;对于D ,甲的极差是31-26=5,乙的极差是32-28=4,两者不相等,故D 错误.故选C.]4.为了研究某班学生的脚长x (单位:厘米)和身高y (单位:厘米)的关系,从该班随机抽取10名学生,根据测量数据的散点图可以看出y 与x 之间有线性相关关系,设其线性回归方程为y ^=b ^x +a ^.已知∑10i =1x i =225,∑10i =1y i =1 600,b^=4.该班某学生的脚长为24,据此估计其身高为( )A .160B .163C .166D .170C [∵∑10i =1x i =225,∴x =110∑10i =1x i =22.5.∵∑10i =1y i =1 600,∴y =110∑10i =1y i =160. 又b ^=4,∴a ^=y -b ^x =160-4×22.5=70. ∴线性回归方程为y^=4x +70. 将x =24代入上式,得y^=4×24+70=166.故选C.]5.(2019·新余模拟)一支田径队共有运动员98人,其中女运动员42人,用分层抽样的方法抽取一个样本,每名运动员被抽到的概率都是27,则男运动员应抽取 ( )A .18人B .16人C .14人D .12人B [∵田径队共有运动员98人,其中女运动员有42人,∴男运动员有56人,∵每名运动员被抽到的概率都是27,∴男运动员应抽取56×27=16(人),故选B.]6.(2018·聊城市一模)某工厂从生产的一批产品中随机抽出一部分,对这些产品的一项质量指标进行了检测,整理检测结果得到如下频率分布表:144[由题意得这批产品的此项质量指标的平均数为20×0.1+40×0.6+60×0.3=44,故方差为(20-44)2×0.1+(40-44)2×0.6+(60-44)2×0.3=144.][能力提升练](建议用时:15分钟)7.某球迷为了解A,B两支篮球队的攻击能力,从某赛季常规赛中随机调查了20场与这两支篮球队有关的比赛.两队所得分数分别如下.A篮球队:122110105105109101107129115100114 118118104931209610210583B篮球队:11411411010810311793124751069181 10711210710110612010779(1)根据两组数据完成两队所得分数的茎叶图,并通过茎叶图比较两支篮球队所得分数的平均值及分散程度(不要求计算出具体值,得出结论即可);(2)根据篮球队所得分数,将篮球队的攻击能力从低到高分为三个等级,如下表所示.设两支篮球队的攻击能力相互独立,根据所给数据,视事件发生的频率为相应事件发生的概率,求事件C发生的概率.[解](1)两队所得分数的茎叶图如图.通过茎叶图可以看出,A篮球队所得分数的平均值高于B篮球队所得分数的平均值;A篮球队所得分数比较集中,B篮球队所得分数比较分散.(2)记C A1表示事件:“A篮球队的攻击能力等级为较强”.C A2表示事件:“A篮球队的攻击能力等级为很强”.C B1表示事件:“B篮球队的攻击能力等级为较弱”.C B2表示事件:“B篮球队的攻击能力等级为较弱或较强”.则C A1与C B1为相互独立事件,C A2与C B2为相互独立事件,C A1与C A2为互斥事件,C=(C A1C B1)∪(C A2C B2).P(C)=P(C A1C B1)+P(C A2C B2)=P(C A1)P(C B1)+P(C A2)P(C B2).由所给数据得C A1,C A2,C B1,C B2发生的频率分别为710,320,14,910,故P(C A1)=710,P(C A2)=320,P(C B1)=14,P(C B2)=910,P(C)=710×14+320×910=0.31.8.[重视题]某市房管局为了了解该市市民2018年1月至2019年1月期间购买二手房情况,首先随机抽样其中200名购房者,并对其购房面积m(单位:平方米,60≤m≤130)进行了一次调查统计,制成了如图1所示的频率分布直方图,接着调查了该市2018年1月至2019年1月期间当月在售二手房均价y(单位:万元/平方米),制成了如图2所示的散点图(图中月份代码1至13分别对应2018年1月至2019年1月)(1)试估计该市市民的平均购房面积m ;(2)从该市2018年1月至2019年1月期间所有购买二手房的市民中任取3人,用频率估计概率,记这3人购房面积不低于100平方米的人数为X ,求X 的分布列与数学期望;(3)根据散点图选择y ^=a ^+b ^x 和y ^=c ^+d ^ln x 两个模型进行拟合,经过数据处理得到两个回归方程,分别为y ^=0.936 9+0.028 5x 和y ^=0.955 4+0.030 6ln x ,并得到一些统计量的值,如表所示:y^=0.936 9 +0.028 5x y^=0.955 4+ 0.030 6ln x ∑13i =1(y i -y ^i )20.000 5910.000 164∑13i =1(y i -y )2 0.006 050型预测2020年6月份的二手房购房均价(精确到0.001).参考数据:ln 2≈0.69,ln 3≈1.10,ln 10≈2.30,ln 19≈2.94,2≈1.41,3≈1.73,10≈3.16,19≈4.36.参考公式:R 2=1-∑ni =1(y i -y ^i )2∑ni =1(y i -y )2.[解] (1)m =65×0.05+75×0.1+85×0.2+95×0.25+105×0.2+115×0.15+125×0.05=96.(2)每一位市民购房面积不低于100平方米的概率为0.20+0.15+0.05=0.4, ∴X ~B (3,0.4),∴P (X =k )=C k 3×0.4k ×0.63-k ,(k =0,1,2,3), P (X =0)=0.63=0.216,P (X =1)=C 13×0.4×0.62=0.432, P (X =2)=C 23×0.42×0.6=0.288,P (X =3)=0.43=0.064, ∴X 的分布列为:∴E (X )=3×0.4=1.2.(3)设模型y^=0.936 9+0.028 5x 和y ^=0.955 4+0.030 6ln x 的相关指数分别为R 21,R 22,则R 21=1-0.000 5910.006 05,R 22=1-0.000 1640.00 605,∴R 21<R 22,∴模型y^=0.955 4+0.030 6ln x 的拟合效果更好, 2020年6月份对应的x =30,∴y ^=0.955 4+0.030 6ln 30=0.955 4+0.030 6(ln 3+ln 10)≈1.059万元/平方米.内容押题依据独立性检验、离散型随机变量的期望、概率的计算以图表的形式呈现数据,符合高考的命题模式,与期望、概率交汇命题体现了高考命题的特点彰显出中国式创新的强劲活力.某移动支付公司从我市移动支付用户中随机抽取100名进行调查,得到如下数据:每周移动支付次数123456及其以上男10873215女5464630合计1512137845成下列2×2列联表,并判断能否在犯错误的概率不超过0.005的前提下,认为是否为“移动支付活跃用户”与性别有关?非移动支付活跃用户移动支付活跃用户合计男女合计频率为概率,在我市所有“移动支付达人”中随机抽取4名用户.①求抽取的4名用户中,既有男“移动支付达人”,又有女“移动支付达人”的概率;②为了鼓励男性用户使用移动支付,对抽出的男“移动支付达人”每人奖励300元,记奖励总金额为X,求X的分布列及数学期望.附公式及表如下:K2=n(ad-bc)2(a+b)(c+d)(a+c)(b+d).[解] (1)由表格数据可得2×2列联表如下: K 2=n (ad -bc )2(a +b )(c +d )(a +c )(b +d )=100×(25×40-15×20)240×60×55×45=2 450297≈8.249>7.879.所以在犯错误的概率不超过0.005的前提下,能认为是否为“移动支付活跃用户”与性别有关.(2)视频率为概率,在我市“移动支付达人”中随机抽取1名用户,该用户为男“移动支付达人”的概率为13,女“移动支付达人”的概率为23.①抽取的4名用户中,既有男“移动支付达人”,又有女“移动支付达人”的概率为P =1-⎝ ⎛⎭⎪⎫134-⎝ ⎛⎭⎪⎫234=6481.②记抽出的男“移动支付达人”人数为Y ,则X =300Y .由题意得Y ~B ⎝ ⎛⎭⎪⎫4,13,P (Y =0)=C 04⎝ ⎛⎭⎪⎫130⎝ ⎛⎭⎪⎫234=1681; P (Y =1)=C 14⎝ ⎛⎭⎪⎫131⎝ ⎛⎭⎪⎫233=3281;P (Y =2)=C 24⎝ ⎛⎭⎪⎫132⎝ ⎛⎭⎪⎫232=2481; P (Y =3)=C 34⎝⎛⎭⎪⎫133⎝ ⎛⎭⎪⎫231=881; P (Y =4)=C 44⎝ ⎛⎭⎪⎫134⎝ ⎛⎭⎪⎫230=181. 所以Y 的分布列为所以由E (Y )=4×13=43,得X 的数学期望E (X )=300E (Y )=400.。

2021高考数学(文)二轮复习《统计与统计案例》

2021高考数学(文)二轮复习《统计与统计案例》

第2讲 统计与统计案例[做小题——激活思维]s1.采用系统抽样的方法从800人中抽取40人参加某种测试,为此将800人随机编号为1,2,…,800,分组后在第一组采用简单随机抽样的方法抽到的号码为18,在抽到的40人中,编号落入区间[1,200]的人做试卷A ,编号落入区间[201,560]的人做试卷B ,其余的人做试卷C ,则做试卷C 的人数为( )A .10B .12C .18D .28 [答案] B2.某校有高级教师26人,中级教师104人,其他教师若干人,现按分层抽样的方法从该校的所有教师中抽取56人进行某项调查,已知从其他教师中共抽取了16人,则该校共有教师人数为 ( )A .81B .152C .182D .202 [答案] C3.为了参加端午节龙舟赛,某龙舟队进行了6次测试,测得最大速度(单位:m/s)的茎叶图如图所示,则6次测试的最大速度的平均数为________m/s ,方差为________.[答案] 33 4734.一个车间为了规定工时定额,需要确定加工零件所花费的时间,为此进行了10次试验,收集数据,第i 次试验零件个数x i (单位:个)与加工零件所花费时间y i (单位:小时)的数据资料,算得∑10i =1x i =80,∑10i =1y i =20,∑10i =1x i y i =184,∑10i =1x 2i =720,那么加工零件所花费时间y 对零件个数x 的线性回归方程为________.y ^=0.3x -0.4 [由题意知n =10,x =1n ∑n i =1x i =8010=8,y =1n ∑n i =1y i =2010=2,又∑ni =1x 2i -n x 2=720-10×82=80, ∑n i =1x i y i -n x y =184-10×8×2=24,由此得b ^=2480=0.3,a ^=y -b ^x =2-0.3×8=-0.4, 故所求回归方程为y ^=0.3x -0.4.]5.在西非“埃博拉病毒”的传播速度很快,这已经成为全球性的威胁,为了考察某种埃博拉病毒疫苗的效果,现随机抽取100只小鼠进行试验,得到如下列联表:感染与服用疫苗有关”.0.05 [由题意算得,K 2=100×(10×30-20×40)250×50×30×70≈4.762>3.841,参照附表,可得:在犯错误的概率不超过0.05的前提下,认为“小动物是否被感染与服用疫苗有关”.][扣要点——查缺补漏]1.随机抽样简单随机抽样的特点是逐个抽取,适用于总体个数较少的情况;系统抽样也称等距抽样,适用总体个数较多的情况,如T 1;分层抽样一定要注意按比例抽取,总体由差异明显的几部分组成,如T 2.2.统计图表和样本数字特征(1)由频率分布直方图进行相关计算时,需掌握关系式:频数样本容量=频率,此关系式的变形为频数频率=样本容量,样本容量×频率=频数.(2)总体估计的方法:用样本的数字特征估计总体的数字特征.(3)图表判断法:若根据统计图表比较样本数据的大小,可根据数据的分布情况直观分析,大致判断平均数的范围,并利用数据的波动性大小比较方差(标准差)的大小.如T 3.3.统计案例(1)线性回归方程问题的两个要点:样本点的中心在回归直线上;由线性回归方程求出的数值是估计值.如T 4.(2)独立性检验的关键在于准确求出K 2值,然后对比临界值表中的数据,最后下结论.如T 5.抽样方法(5年2考)[高考解读] 全国卷对抽样方法的要求较低,很少单独命题考查. 1.(2018·全国卷Ⅲ)某公司有大量客户,且不同年龄段客户对其服务的评价有较大差异.为了解客户的评价,该公司准备进行抽样调查,可供选择的抽样方法有简单随机抽样、分层抽样和系统抽样,则最合适的抽样方法是________.切入点:不同年龄段客户对其服务的评价有较大差异. 关键点:正确掌握三种抽样方法的特点及适用条件.分层抽样 [因为不同年龄段的客户对公司的服务评价有较大差异,所以需按年龄进行分层抽样,才能了解到不同年龄段的客户对公司服务的客观评价.]2.(2019·全国卷Ⅰ)某学校为了解1 000名新生的身体素质,将这些学生编号为1,2,…,1 000,从这些新生中用系统抽样方法等距抽取100名学生进行体质测验.若46号学生被抽到,则下面4名学生中被抽到的是( )A .8号学生B .200号学生C .616号学生D .815号学生切入点:①系统抽样;②46号学生被抽到. 关键点:正确掌握系统抽样的概念. C [根据题意,系统抽样是等距抽样, 所以抽样间隔为1 000100=10.因为46除以10余6,所以抽到的号码都是除以10余6的数,结合选项知应为616.故选C.]系统抽样和分层抽样中的计算 (1)系统抽样①总体容量为N ,样本容量为n ,则要将总体均分成n 组,每组Nn 个(有零头时要先去掉).②若第一组抽到编号为k 的个体,则以后各组中抽取的个体编号依次为k +N n ,…,k +(n -1)N n .(2)分层抽样按比例抽样,计算的主要依据是:各层抽取的数量之比=总体中各层的数量之比.1.(系统抽样)某班共有52人,现根据学生的学号,用系统抽样的方法抽取一个容量为4的样本,已知3号、29号、42号学生在样本中,那么样本中还有一名学生的学号是()A.10B.11C.12 D.16D[从被抽中的3名学生的学号可以看出学号间距为13,所以样本中还有一名学生的学号是16,故选D.]2.(分层抽样)某商场有四类食品,食品类别和种数见下表:类别粮食类植物油类动物性食品类果蔬类种数40103020抽取样本,则抽取的植物油类与果蔬类食品种数之和为________.6[因为粮食类种数∶植物油类种数∶动物性食品类种数∶果蔬类种数=40∶10∶30∶20=4∶1∶3∶2,所以根据分层抽样的定义可知,抽取的植物油类食品种数为110×20=2,抽取的果蔬类食品种数为210×20=4,所以抽取的植物油类与果蔬类食品种数之和为2+4=6.]3.(简单随机抽样)“双色球”彩票中红色球的号码由编号为01,02,…,33的33个个体组成,一位彩民利用下面的随机数表选取6组数作为6个红色球的编号,选取方法是从随机数表第1行的第6列和第7列数字开始由左到右依次选取两个数字,则选出来的第6个红色球的编号为________.49 54 43 54 82 17 37 93 23 78 87 35 20 96 43 84 26 34 91 6457 24 55 06 88 77 04 74 47 67 21 76 33 50 25 83 92 12 06 7602[从随机数表第1行的第6列和第7列数字开始由左到右依次选取两个数字,则选出的6个红色球的编号依次为21,32,09,16,17,02,故选出的第6个红色球的编号为02.]4.(分层抽样与统计图表的综合)某企业三月中旬生产A、B、C三种产品共3 000件,根据分层抽样的结果,企业统计员制作了如下的统计表格:产品类别 A B C产品数量(件) 1 300样本容量(件)130样本容量比C产品的样本容量多10,根据以上信息,可得C产品的数量是________.800[设样本的总容量为x,则x3 000×1 300=130,∴x=300.∴A产品和C产品在样本中共有300-130=170(件),设C产品的样本容量为y,则y+y+10=170,∴y=80,∴C产品的数量为3 000300×80=800.]用样本估计总体(5年10考)[高考解读]高考对该部分内容的考查常涉及频率分布表、茎叶图、频率分布直方图等,是高考的重点和热点.涉及的样本数字特征主要有平均数、众数、中位数和方差,难度不大,多为基础题.一倍,实现翻番.为更好地了解该地区农村的经济收入变化情况,统计了该地区新农村建设前后农村的经济收入构成比例,得到如下饼图:则下面结论中不正确的是()A.新农村建设后,种植收入减少B.新农村建设后,其他收入增加了一倍以上C.新农村建设后,养殖收入增加了一倍D.新农村建设后,养殖收入与第三产业收入的总和超过了经济收入的一半切入点:①建设前经济收入构成比例;②建设后经济收入构成比例.关键点:从图表中正确提取有用信息.A[设新农村建设前经济收入的总量为x,则新农村建设后经济收入的总量为2x.建设前种植收入为0.6x,建设后种植收入为0.74x,故A不正确;建设前其他收入为0.04x,建设后其他收入为0.1x,故B正确;建设前养殖收入为0.3x,建设后养殖收入为0.6x,故C正确;建设后养殖收入与第三产业收入的总和占建设后经济收入总量的58%,故D 正确.]2.(2017·全国卷Ⅲ)某城市为了解游客人数的变化规律,提高旅游服务质量,收集并整理了2014年1月至2016年12月期间月接待游客量(单位:万人)的数据,绘制了如图所示的折线图.根据该折线图,下列结论错误的是()A.月接待游客量逐月增加B.年接待游客量逐年增加C.各年的月接待游客量高峰期大致在7,8月D.各年1月至6月的月接待游客量相对于7月至12月,波动性更小,变化比较平稳切入点:2014年1月至2016年12月期间月接待游客量的数据.关键点:从折线图中准确提取信息.A[对于选项A,由图易知月接待游客量每年7,8月份明显高于12月份,故A错;对于选项B,观察折线图的变化趋势可知年接待游客量逐年增加,故B正确;对于选项C,D,由图可知显然正确.故选A.]3.(2019·全国卷Ⅱ)某行业主管部门为了解本行业中小企业的生产情况,随机调查了100个企业,得到这些企业第一季度相对于前一年第一季度产值增长率y的频数分布表.y的分组[-0.20,0) [0,0.20) [0.20,0.40)[0.40,0.60)[0.60,0.80)企业数22453147企业比例;(2)求这类企业产值增长率的平均数与标准差的估计值(同一组中的数据用该组区间的中点值为代表).(精确到0.01)附:74≈8.602.切入点:频数分布表.关键点:正确应用平均数与标准差的计算方法.[解] (1)根据产值增长率频数分布表得,所调查的100个企业中产值增长率不低于40%的企业频率为14+7100=0.21.产值负增长的企业频率为2100=0.02.用样本频率分布估计总体分布得这类企业中产值增长率不低于40%的企业比例为21%,产值负增长的企业比例为2%.(2)y =1100×(-0.10×2+0.10×24+0.30×53+0.50×14+0.70×7)=0.30,s 2=1100∑5i =1n i (y i -y )2=1100×[(-0.40)2×2+(-0.20)2×24+02×53+0.202×14+0.402×7] =0.029 6,s =0.029 6=0.02×74≈0.17.所以,这类企业产值增长率的平均数与标准差的估计值分别为0.30,0.17.1.方差的计算与含义(1)计算:计算方差首先要计算平均数,然后再按照方差的计算公式进行计算.(2)含义:方差是描述一个样本和总体的波动大小的特征数,方差大说明波动大.频率频率分布直方图中横轴表示组数,纵轴表示频率组距,频率=组距×频率组距频率比频率分布直方图中各小长方形的面积之和为1,各小长方形高的比也就是频率比众数最高小长方形底边中点的横坐标中位数平分频率分布直方图的面积且垂直于横轴的直线与横轴交点的横坐标平均数频率分布直方图中每个小长方形的面积乘小长方形底边中点的横坐标之和1.(频率分布折线图、众数)某同学将全班某次数学考试成绩整理成频率分布直方图后,并将每个小矩形上方线段的中点连接起来得到频率分布折线图(如图所示).据此估计此次考试成绩的众数是()A.100B.110C.115D.120C[众数是一组数据出现次数最多的数,结合题中频率分布折线图可以看出,数据“115”对应的纵坐标最大,所以相应的频率最大,频数最大,据此估计此次考试成绩的众数是115.]2.(频率分布直方图)某校为了解学生平均每周的上网时间(单位;h),从高一年级1 000名学生中随机抽取100名进行了调查,将所得数据整理后,画出频率分布直方图(如图),其中频率分布直方图从左到右前3个小矩形的面积之比为1∶3∶5,据此估计该校高一年级学生中平均每周上网时间少于4 h的学生人数为()A .200B .240C .400D .480C [设频率分布直方图中从左到右前3个小矩形的面积分别为P ,3P ,5P .由频率分布直方图可知,最后2个小矩形的面积之和为(0.015+0.035)×2=0.1.因为频率分布直方图中各个小矩形的面积之和为1,所以P +3P +5P =0.9,即P =0.1.所以平均每周上网时间少于4 h 的学生所占比例为P +3P =0.4,人数为0.4×1 000=400.]3.(茎叶图、平均数、方差)甲、乙两名学生在5次数学考试中的成绩统计如图所示,若x 甲,x 乙分别表示甲、乙两人的平均成绩,则下列结论正确的是( )A.x 甲>x 乙,乙比甲稳定B.x 甲>x 乙,甲比乙稳定C.x 甲<x 乙,乙比甲稳定D.x 甲<x 乙,甲比乙稳定A [因为x 甲=15×(74+82+88+91+95)=86, x 乙=15×(77+77+78+86+92)=82,所以x 甲>x 乙.因为s 2甲=15×[(-12)2+(-4)2+22+52+92]=54, s 2乙=15×[(-5)2+(-5)2+(-4)2+42+102]=36.4,所以s 2甲>s 2乙,故乙比甲稳定.故选A.]4.(频率分布直方图、均值的应用)为检查某工厂所生产的8万台电风扇的质量,抽查了其中20台的无故障连续使用时限(单位:小时)如下:248 256 232 243 188 268 278 266 289 312274 296 288 302 295 228 287 217 329 283(1)完成下面的频率分布表,并作出频率分布直方图;(2)估计8万台电风扇中有多少台无故障连续使用时限不低于280小时;(3)用组中值(同一组中的数据在该组区间的中点值)估计样本的平均无故障连续使用时限.[解](1)频率分布表及频率分布直方图如下所示:(2)由题意可得8×(0.30+0.10+0.05)=3.6,所以估计8万台电风扇中有3.6万台无故障持续使用时限不低于280小时.(3)由频率分布直方图可知x=190×0.05+210×0.05+230×0.10+250×0.15+270×0.20+290×0.30+310×0.10+330×0.05=269(小时),所以样本的平均无故障连续使用时限为269小时.统计案例(5年6考)[高考解读]应用回归分析与独立性检验思想方法解决简单实际问题的能力是高考考查的重点,试题强调应用性,以实际问题为背景,构建数学模型,突出考查考生的数据处理能力和应用意识.1.(2017·全国卷Ⅰ)为了监控某种零件的一条生产线的生产过程,检验员每隔30 min从该生产线上随机抽取一个零件,并测量其尺寸(单位:cm).下面是检验员在一天内依次抽取的16个零件的尺寸:抽取次序12345678零件尺寸9.9510.129.969.9610.019.929.9810.04抽取次序910111213141516零件尺寸10.269.9110.1310.029.2210.0410.059.95经计算得x=116∑16i=1x i=9.97,s=116∑16i=1(x i-x)2=116⎝⎛⎭⎪⎫∑16i=1x2i-16x2≈0.212,∑16i=1(i-8.5)2≈18.439,i=1(x i-x)(i-8.5)=-2.78,其中x i为抽取的第i个零件的尺寸,i=1,2, (16)(1)求(x i,i)(i=1,2,…,16)的相关系数r,并回答是否可以认为这一天生产的零件尺寸不随生产过程的进行而系统地变大或变小(若|r|<0.25,则可以认为零件的尺寸不随生产过程的进行而系统地变大或变小);(2)一天内抽检零件中,如果出现了尺寸在(x-3s,x+3s)之外的零件,就认为这条生产线在这一天的生产过程可能出现了异常情况,需对当天的生产过程进行检查.(i)从这一天抽检的结果看,是否需对当天的生产过程进行检查?(ⅱ)在(x-3s,x+3s)之外的数据称为离群值,试剔除离群值,估计这条生产线当天生产的零件尺寸的均值与标准差.(精确到0.01)附:样本(x i,y i)(i=1,2,…,n)的相关系数r=∑ni=1(x i-x)(y i-y)∑ni=1(x i-x)2∑ni=1(y i-y)2,0.008≈0.09.切入点:相关系数r和标准差s的计算公式.关键点:题意的理解及数据的准确计算.[解](1)由样本数据得(x i,i)(i=1,2,…,16)的相关系数r=∑16i=1(x i-x)(i-8.5)∑16i=1(x i-x)2∑16i=1(i-8.5)2≈-2.780.212×16×18.439≈-0.18.由于|r|<0.25,因此可以认为这一天生产的零件尺寸不随生产过程的进行而系统地变大或变小.(2)(i)由于x=9.97,s≈0.212,因此由样本数据可以看出抽取的第13个零件的尺寸在(x-3s,x+3s)以外,因此需对当天的生产过程进行检查.(ⅱ)剔除离群值,即第13个数据,剩下数据的平均数为115(16×9.97-9.22)=10.02,这条生产线当天生产的零件尺寸的均值的估计值为10.02.16∑x2i≈16×0.2122+16×9.972≈1 591.134,i=1剔除第13个数据,剩下数据的样本方差为12-15×10.022)≈0.008,15(1 591.134-9.22这条生产线当天生产的零件尺寸的标准差的估计值为0.008≈0.09.角度二:独立性检验的应用2.(2018·全国卷Ⅲ)某工厂为提高生产效率,开展技术创新活动,提出了完成某项生产任务的两种新的生产方式.为比较两种生产方式的效率,选取40名工人,将他们随机分成两组,每组20人.第一组工人用第一种生产方式,第二组工人用第二种生产方式.根据工人完成生产任务的工作时间(单位:min)绘制了如下茎叶图:(1)根据茎叶图判断哪种生产方式的效率更高?并说明理由;(2)求40名工人完成生产任务所需时间的中位数m,并将完成生产任务所需时间超过m和不超过m的工人数填入下面的列联表:超过m 不超过m 第一种生产方式第二种生产方式异?附:K2=n(ad-bc)2(a+b)(c+d)(a+c)(b+d),切入点:茎叶图中的数据.关键点:根据茎叶图中的数据的集中程度作出效率高低的判断;通过茎叶图确定中位数,并完成2×2列联表,将数据代入公式计算.[解](1)第二种生产方式的效率更高.理由如下:(ⅰ)由茎叶图可知:用第一种生产方式的工人中,有75%的工人完成生产任务所需时间至少80分钟,用第二种生产方式的工人中,有75%的工人完成生产任务所需时间至多79分钟.因此第二种生产方式的效率更高.(ⅱ)由茎叶图可知:用第一种生产方式的工人完成生产任务所需时间的中位数为85.5分钟,用第二种生产方式的工人完成生产任务所需时间的中位数为73.5分钟.因此第二种生产方式的效率更高.(ⅲ)由茎叶图可知:用第一种生产方式的工人完成生产任务平均所需时间高于80分钟;用第二种生产方式的工人完成生产任务平均所需时间低于80分钟.因此第二种生产方式的效率更高.(ⅳ)由茎叶图可知:用第一种生产方式的工人完成生产任务所需时间分布在茎8上的最多,关于茎8大致呈对称分布;用第二种生产方式的工人完成生产任务所需时间分布在茎7上的最多,关于茎7大致呈对称分布.又用两种生产方式的工人完成生产任务所需时间分布的区间相同,故可以认为用第二种生产方式完成生产任务所需的时间比用第一种生产方式完成生产任务所需的时间更少.因此第二种生产方式的效率更高.(以上给出了4种理由,答出其中任意一种或其他合理理由均可.)(2)由茎叶图知m=79+812=80.列联表如下:超过m 不超过m第一种生产方式155第二种生产方式515(3)由于K2=40(15×15-5×5)220×20×20×20=10>6.635,所以有99%的把握认为两种生产方式的效率有差异.1.求线性回归方程的步骤(1)计算x,y;(2)计算∑ni=1x i y i,∑ni=1x2i;(3)计算b^=∑ni=1(x i-x)(y i-y)∑ni=1(x i-x)2=∑ni=1x i y i-n x y∑ni=1x2i-n x2,a^=y-b^x;(4)写出线性回归方程y^=b^x+a^.注意:样本点的中心(x,y)必在回归直线上.2.相关系数r当r>0时,表明两个变量正相关;当r<0时,表明两个变量负相关.r的绝对值越接近于1,表明两个变量的线性相关性越强.r 的绝对值越接近于0,表明两个变量之间几乎不存在线性相关关系.通常|r |大于0.75时,认为两个变量有很强的线性相关性.3.独立性检验问题的常见类型及解题策略(1)已知分类变量的数据,判断两个分类变量的相关性,可依据数据及公式计算K 2,然后作出判断;(2)独立性检验与概率统计的综合问题,关键是根据独立性检验的一般步骤,作出判断,再根据概率统计的相关知识求解.1.(线性回归分析)某公司为了准确地把握市场,做好产品生产计划,对过去四年的数据进行整理得到了第x 年与年销售量y (单位:万件)之间的关系如表:x 1 2 3 4 y12284256(2)根据散点图选择合适的回归模型拟合y 与x 的关系(不必说明理由); (3)根据y 关于x 的回归方程,预测第5年的销售量. 参考公式:回归直线的斜率和截距的最小二乘法估计分别为b ^=∑ni =1 (x i -x )(y i -y )∑ni =1(x i -x )2=∑n i =1x i y i -n x y ∑ni =1x 2i -n x2,a ^=y -b ^x .[解] (1)作出的散点图如图:(2)根据散点图观察,可以用线性回归模型拟合y 与x 的关系.观察散点图可知各点大致分布在一条直线附近,列出表格:x y x 2 xy 1 1 12 1 12 2 2 28 4 56 3 3 42 9 126 4 4 56 16 224 ∑1013830418可得x =52,y =692,所以b ^=∑4i =1x i y i -4x y∑4i =1x 2i -4x2=418-4×52×69230-4×⎝ ⎛⎭⎪⎫522=735,a ^=y -b ^x =692-735×52=-2. 故回归直线方程为y ^=735x -2. (3)当x =5时,y ^=735×5-2=71. 故预测第5年的销售量为71万件.2.(直方图与统计案例的综合问题)“黄梅时节家家雨”“梅雨如烟暝村树”“梅雨暂收斜照明”……江南梅雨的点点滴滴都流润着浓烈的诗情.每年六、七月份,我国长江中下游地区进入持续25天左右的梅雨季节,如图是江南Q 镇2009~2018年梅雨季节的降雨量(单位:mm)的频率分布直方图,试用样本频率估计总体概率,解答下列问题:(1)“梅实初黄暮雨深”,请用样本平均数估计Q镇明年梅雨季节的降雨量;(2)“江南梅雨无限愁”,Q镇的杨梅种植户老李也在犯愁,他过去种植的甲品种杨梅,亩产量受降雨量的影响较大(把握超过八成),而乙品种杨梅2009~2018年的亩产量(单位:kg)与降雨量的发生频数(年)如2×2列联表所示(部分数据缺失),请你帮助老李排解忧愁,他来年应该种植哪个品种的杨梅受降雨量影响更小?(完善列联表,并说明理由)降雨量亩产量[200,400)[100,200)∪[400,500]合计<600 2≥600 1合计10附:K2=n(ad-bc)(a+b)(c+d)(a+c)(b+d),其中n=a+b+c+d.P(K2≥k0)0.500.400.250.150.10 k00.4550.708 1.323 2.072 2.706 [解](1)频率分布直方图中第四组的频率为1-100×(0.002+0.004+0.003)=0.1.所以用样本平均数估计Q镇明年梅雨季节的降雨量为150×0.2+250×0.4+350×0.3+450×0.1=30+100+105+45=280(mm).(2)根据频率分布直方图可知,降雨量在[200,400)内的频数为10×100×(0.003+0.004)=7.进而完善列联表如下.降雨量[200,400)[100,200)∪[400,500]合计19K 2=10×(2×1-5×2)27×3×4×6=8063≈1.270<1.323. 故认为乙品种杨梅的亩产量与降雨量有关的把握不足75%.而甲品种杨梅受降雨量影响的把握超过八成,故老李来年应该种植乙品种杨梅受降雨量影响更小.。

2021届高考数学二轮复习题型练5大题专项三统计与概率问题理含解析

题型练5 大题专项(三) 统计与概率问题题型练第66页一、解答题1.为推动乒乓球运动的发展,某乒乓球比赛允许不同协会的运动员组队参加.现有来自甲协会的运动员3名,其中种子选手2名;乙协会的运动员5名,其中种子选手3名.从这8名运动员中随机选择4人参加比赛.(1)设A 为事件“选出的4人中恰有2名种子选手,且这2名种子选手来自同一个协会”,求事件A 发生的概率;(2)设X 为选出的4人中种子选手的人数,求随机变量X 的分布列和数学期望. 解:(1)由已知,有P (A )=C 22C 32+C 32C 32C 84=635.所以,事件A 发生的概率为635.(2)随机变量X 的所有可能取值为1,2,3,4. P (X=k )=C 5k C 34-kC 84(k=1,2,3,4).所以,随机变量X 的分布列为随机变量X 的数学期望E (X )=1×14+2×7+3×7+4×14=2. 2.电影公司随机收集了电影的有关数据,经分类整理得到下表:好评率是指:一类电影中获得好评的部数与该类电影的部数的比值. 假设所有电影是否获得好评相互独立.(1)从电影公司收集的电影中随机选取1部,求这部电影是获得好评的第四类电影的概率; (2)从第四类电影和第五类电影中各随机选取1部,估计恰有1部获得好评的概率;(3)假设每类电影得到人们喜欢的概率与表格中该类电影的好评率相等.用“ξk =1”表示第k 类电影得到人们喜欢,用“ξk =0”表示第k 类电影没有得到人们喜欢(k=1,2,3,4,5,6).写出方差D (ξ1),D (ξ2),D (ξ3),D (ξ4),D (ξ5),D (ξ6)的大小关系.解:(1)设“从电影公司收集的电影中随机选取1部,这部电影是获得好评的第四类电影”为事件A , 第四类电影中获得好评的电影为200×0.25=50(部). P (A )=50140+50+300+200+800+510=502000=0.025.(2)设“从第四类电影和第五类电影中各随机选取1部,恰有1部获得好评”为事件B ,P (B )=0.25×0.8+0.75×0.2=0.35. (3)由题意可知,定义随机变量如下:ξk={0,第k类电影没有得到人们喜欢, 1,第k类电影得到人们喜欢,则ξk显然服从两点分布,则六类电影的分布列及方差计算如下:第一类电影:ξ110P0.40.6D(ξ1)=0.4×0.6=0.24;第二类电影:ξ210P0.20.8D(ξ2)=0.2×0.8=0.16;第三类电影:ξ310P0.150.85D(ξ3)=0.15×0.85=0.1275;第四类电影:ξ410P0.250.75D(ξ4)=0.25×0.75=0.1875;第五类电影:ξ510P0.20.8D(ξ5)=0.2×0.8=0.16;第六类电影:ξ610P0.10.9D(ξ6)=0.1×0.9=0.09.综上所述,D(ξ1)>D(ξ4)>D(ξ2)=D(ξ5)>D(ξ3)>D(ξ6).3.(2020全国Ⅰ,理19)甲、乙、丙三位同学进行羽毛球比赛,约定赛制如下:累计负两场者被淘汰;比赛前抽签决定首先比赛的两人,另一人轮空;每场比赛的胜者与轮空者进行下一场比赛,负者下一场轮空,直至有一人被淘汰;当一人被淘汰后,剩余的两人继续比赛,直至其中一人被淘汰,另一人最终获胜,比赛结束.经抽签,甲、乙首先比赛,丙轮空.设每场比赛双方获胜的概率都为12.(1)求甲连胜四场的概率;(2)求需要进行第五场比赛的概率;(3)求丙最终获胜的概率.解:(1)甲连胜四场的概率为116.(2)根据赛制,至少需要进行四场比赛,至多需要进行五场比赛.比赛四场结束,共有三种情况:甲连胜四场的概率为116;乙连胜四场的概率为116;丙上场后连胜三场的概率为18. 所以需要进行第五场比赛的概率为1-116−116−18=34. (3)丙最终获胜,有两种情况:比赛四场结束且丙最终获胜的概率为18;比赛五场结束且丙最终获胜,则从第二场开始的四场比赛按照丙的胜、负、轮空结果有三种情况:胜胜负胜,胜负空胜,负空胜胜,概率分别为116,18,18. 因此丙最终获胜的概率为18+116+18+18=716.4.(2020全国Ⅱ,理18)某沙漠地区经过治理,生态系统得到很大改善,野生动物数量有所增加,为调查该地区某种野生动物的数量,将其分成面积相近的200个地块,从这些地块中用简单随机抽样的方法抽取20个作为样区,调查得到样本数据(x i ,y i )(i=1,2,…,20),其中x i 和y i 分别表示第i 个样区的植物覆盖面积(单位:公顷)和这种野生动物的数量,并计算得∑i=120x i =60,∑i=120y i =1 200,∑i=120(x i -x )2=80,∑i=120(y i -y )2=9000,∑i=120(x i -x )(y i -y )=800.(1)求该地区这种野生动物数量的估计值(这种野生动物数量的估计值等于样区这种野生动物数量的平均数乘以地块数);(2)求样本(x i ,y i )(i=1,2,…,20)的相关系数(精确到0.01);(3)根据现有统计资料,各地块间植物覆盖面积差异很大.为提高样本的代表性以获得该地区这种野生动物数量更准确的估计,请给出一种你认为更合理的抽样方法.并说明理由. 附:相关系数r=∑i=1n(x i -x )(y i -y )√∑i=1(x i -x )2∑i=1(y i -y )2√2≈1.414.解:(1)由已知得样本平均数y =120∑i=120y i =60,从而该地区这种野生动物数量的估计值为60×200=12000.(2)样本(x i ,y i )(i=1,2,…,20)的相关系数r=∑i=120(x i -x )(y i -y )√∑i=1(x i -x )2∑i=1(y i -y )2=√80×9000=2√23≈0.94.(3)分层抽样:根据植物覆盖面积的大小对地块分层,再对200个地块进行分层抽样.理由如下:由(2)知各样区的这种野生动物数量与植物覆盖面积有很强的正相关.由于各地块间植物覆盖面积差异很大,从而各地块间这种野生动物数量差异也很大,采用分层抽样的方法较好地保持了样本结构与总体结构的一致性,提高了样本的代表性,从而可以获得该地区这种野生动物数量更准确的估计.5.一款击鼓小游戏的规则如下:每盘游戏都需击鼓三次,每次击鼓要么出现一次音乐,要么不出现音乐;每盘游戏击鼓三次后,出现一次音乐获得10分,出现两次音乐获得20分,出现三次音乐获得100分,没有出现音乐则扣除200分(即获得-200分).设每次击鼓出现音乐的概率为12,且各次击鼓出现音乐相互独立.(1)设每盘游戏获得的分数为X ,求X 的分布列; (2)玩三盘游戏,至少有一盘出现音乐的概率是多少?(3)玩过这款游戏的许多人都发现,若干盘游戏后,与最初的分数相比,分数没有增加反而减少了.请运用概率统计的相关知识分析分数减少的原因. 解:(1)X 可能的取值为10,20,100,-200. 根据题意,P (X=10)=C 31×(12)1×(1-12)2=38;P (X=20)=C 32×(12)2×(1-12)1=38; P (X=100)=C 33×(12)3×(1-12)0=18;P (X=-200)=C 30×(12)0×(1-12)3=18.所以X 的分布列为(2)设“第i 盘游戏没有出现音乐”为事件A i (i=1,2,3), 则P (A 1)=P (A 2)=P (A 3)=P (X=-200)=18.所以,“三盘游戏中至少有一盘出现音乐”的概率为 1-P (A 1A 2A 3)=1-(18)3=1-1512=511512.因此,玩三盘游戏至少有一盘出现音乐的概率是511512.(3)X 的数学期望为E (X )=10×38+20×38+100×18-200×18=-54.这表明,获得分数X 的均值为负,因此,多次游戏之后分数减少的可能性更大.6.近年来,移动支付已成为主要支付方式之一.为了解某校学生上个月A,B 两种移动支付方式的使用情况,从全校学生中随机抽取了100人,发现样本中A,B 两种支付方式都不使用的有5人,样本中仅使用A 和仅使用B 的学生的支付金额分布情况如下:(1)从全校学生中随机抽取1人,估计该学生上个月A,B 两种支付方式都使用的概率;(2)从样本仅使用A 和仅使用B 的学生中各随机抽取1人,以X 表示这2人中上个月支付金额大于1 000元的人数,求X 的分布列和数学期望;(3)已知上个月样本学生的支付方式在本月没有变化.现从样本仅使用A 的学生中,随机抽查3人,发现他们本月的支付金额都大于2 000元.根据抽查结果,能否认为样本仅使用A 的学生中本月支付金额大于2 000 元的人数有变化?说明理由.解:(1)由题意知,样本中仅使用A 的学生有18+9+3=30人,仅使用B 的学生有10+14+1=25人,A,B 两种支付方式都不使用的学生有5人.故样本中A,B 两种支付方式都使用的学生有100-30-25-5=40人.所以从全校学生中随机抽取1人,该学生上个月A,B 两种支付方式都使用的概率估计为40100=0.4. (2)X 的所有可能值为0,1,2.记事件C 为“从样本仅使用A 的学生中随机抽取1人,该学生上个月的支付金额大于1000元”,事件D 为“从样本仅使用B 的学生中随机抽取1人,该学生上个月的支付金额大于1000元”. 由题设知,事件C ,D 相互独立, 且P (C )=9+330=0.4,P (D )=14+125=0.6.所以P (X=2)=P (CD )=P (C )P (D )=0.24, P (X=1)=P (C D ∪C D )=P (C )P (D )+P (C )P (D ) =0.4×(1-0.6)+(1-0.4)×0.6=0.52, P (X=0)=P (CD )=P (C )P (D )=0.24. 所以X 的分布列为故X 的数学期望E (X )=0×0.24+1×0.52+2×0.24=1.(3)记事件E 为“从样本仅使用A 的学生中随机抽查3人,他们本月的支付金额都大于2000元”. 假设样本仅使用A 的学生中,本月支付金额大于2000元的人数没有变化,则由上个月的样本数据得P (E )=1C 303=14060.答案示例1:可以认为有变化.理由如下:P (E )比较小,概率比较小的事件一般不容易发生.一旦发生,就有理由认为本月的支付金额大于2000元的人数发生了变化.所以可以认为有变化. 答案示例2:无法确定有没有变化.理由如下:事件E 是随机事件,P (E )比较小,一般不容易发生,但还是有可能发生的,所以无法确定有没有变化.。

名师伴你行届高考理科数学二轮复习专题突破题能专训第讲统计与统计案例公开课一等奖优质课大赛微课获奖课件


y2 b d b+d
总计 a+b c+d a+b+c+d
热点盘点
[二轮备考讲义] 第二部分 专题五 第2讲第11页 第11页
基础记忆
名师伴你行 ·高考二轮复习 ·数学(理)
构造一个随机变量 K2=a+bcn+add-ab+cc2b+d,其中 n=a
+b+c+d.
P(K2≥k) 0.100 0.050 0.025 0.010 0.001
名师伴你行 ·高考二轮复习 ·数学(理)
专项五 概率与统计
[二轮备考讲义] 第二部分 专题五 第2讲第3页 第3页
热点盘点
基础记忆
提能专训
名师伴你行 ·高考二轮复习 ·数学(理)
第二讲 统计与统计案例
[二轮备考讲义] 第二部分 专题五 第2讲第4页 第4页
热点盘点
基础记忆
提能专训
名师伴你行 ·高考二轮复习 ·数学(理)
基础记忆
名师伴你行 ·高考二轮复习 ·数学(理)
分组
频数 频率
(40,45]
n1
f1
(45,50]
n2
f2
(1)确定样本频率分布表中 n1,n2,f1 和 f2 的值;
(2)根据上述频率分布表,画出样本频率分布直方图;
提能专训
热点盘点
[二轮备考讲义] 第二部分 专题五 第2讲第18页 第18页
基础记忆
[二轮备考讲义] 第二部分 专题五 第2讲第10页 第10页
热点盘点
基础记忆
提能专训
名师伴你行 ·高考二轮复习 ·数学(理)
3.独立性检验
假设有两个分类变量 X 和 Y,它们的可能取值分别为{x1, x2}和{y1,y2},其样本频数列联表(称 2×2 列联表)为:
  1. 1、下载文档前请自行甄别文档内容的完整性,平台不提供额外的编辑、内容补充、找答案等附加服务。
  2. 2、"仅部分预览"的文档,不可在线预览部分如存在完整性等问题,可反馈申请退款(可完整预览的文档不适用该条件!)。
  3. 3、如文档侵犯您的权益,请联系客服反馈,我们会尽快为您处理(人工客服工作时间:9:00-18:30)。
相关文档
最新文档