【创新方案】2013年高考数学一轮复习 第十篇 统计、统计案例 第3讲 变量间的相关关系与统计案例教案 理 新

合集下载

【精品课件】新教材一轮复习北师大版第10章第3讲变量间的相关关系、统计案例课件

【精品课件】新教材一轮复习北师大版第10章第3讲变量间的相关关系、统计案例课件

求得回归方程^y=0.67x+54.9.
零件数 x(个) 10 20 30 40 50
加工时间 y(min) 62
75 81 89
现发现表中有一个数据看不清,请你推断出该数据的值为__6_8__.
第十章 统计、统计案例
高考一轮总复习 • 数学(新高考)
[解析] 由-x =30,得-y =0.67×30+54.9=75. 设表中的“模糊数字”为 a, 则 62+a+75+81+89=75×5,∴a=68.
第十章 统计、统计案例
高考一轮总复习 • 数学(新高考)
返回导航
5.(2019·高考全国Ⅰ卷)某商场为提高服务质量,随机调查了 50 名 男顾客和 50 名女顾客,每位顾客对该商场的服务给出满意或不满意的评 价,得到下面列联表:
满意 不满意 男顾客 40 10 女顾客 30 20
第十章 统计、统计案例
高考一轮总复习 • 数学(新高考)
考点一
相关关系的判断——自主练透
(1)(2021·四 川 资 阳 模
拟)在一次对人体脂肪含量和年龄关
系的研究中,研究人员获得了一组样
本数据,并制作成如图所示的人体脂
肪含量与年龄关系的散点图.根据该
图,下列结论中正确的是 ( )
返回导航
第十章 统计、统计案例
高考一轮总复习 • 数学(新高考)
积相近的 200 个地块,从这些地块中用简单随机抽样的方法抽取 20 个作
为样区,调查得到样本数据(xi,yi)(i=1,2,…,20),其中 xi 和 yi 分别表 示第 i 个样区的植物覆盖面积(单位:公顷)和这种野生动物的数量,并计
20
20
20
算得xi=60,yi=1 200,

高考数学一轮复习第十章统计与统计案例10.3变量间的相关关系、统计案例学案理

高考数学一轮复习第十章统计与统计案例10.3变量间的相关关系、统计案例学案理

§10.3 变量间的相关关系、统计案例考纲展示►1.会作两个相关变量的散点图,会利用散点图认识变量之间的相关关系. 2.了解最小二乘法的思想,能根据给出的线性回归系数公式建立线性回归方程. 3.了解独立性检验(只要求2×2列联表)的基本思想、方法及其简单应用. 4.了解回归分析的基本思想、方法及其简单应用.考点1 变量间的相关关系1.常见的两变量之间的关系有两类:一类是函数关系,另一类是________;与函数关系不同,________是一种非确定性关系.答案:相关关系 相关关系2.从散点图上看,点散布在从左下角到右上角的区域内,两个变量的这种相关关系称为________,点散布在左上角到右下角的区域内,两个变量的相关关系为________.答案:正相关 负相关对回归系数的理解:解释变量;预报变量.某工厂工人月工资y (元)依劳动产值x (万元)变化的回归直线方程为y ^=900x +600,下列判断正确的是__________.①劳动产值为10 000元时,工资为500元; ②劳动产值提高10 000元时,工资提高1 500元; ③劳动产值提高10 000元时,工资提高900元; ④劳动产值为10 000元时,工资为900元. 答案:③解析:回归系数b ^的意义为:解释变量每增加1个单位,预报变量平均增加b 个单位.[典题1] (1)下列四个散点图中,变量x 与y 之间具有负的线性相关关系的是( )A BC D[答案] D[解析] 观察散点图可知,只有D 选项的散点图表示的是变量x 与y 之间具有负的线性相关关系.(2)四名同学根据各自的样本数据研究变量x ,y 之间的相关关系,并求得回归直线方程,分别得到以下四个结论:①y 与x 负相关且y ^=2.347x -6.423; ②y 与x 负相关且y ^=-3.476x +5.648; ③y 与x 正相关且y ^=5.437x +8.493; ④y 与x 正相关且y ^=-4.326x -4.578. 其中一定不正确的结论的序号是( ) A .①② B .②③ C .③④ D .①④ [答案] D[解析] 由回归方程y ^=b ^x +a ^知,当b ^>0时,y 与x 正相关,当b ^<0时,y 与x 负相关,∴①④一定错误.[点石成金] 相关关系的直观判断方法就是作出散点图,若散点图呈带状且区域较窄,说明两个变量有一定的线性相关性,若呈曲线型也是有相关性,若呈图形区域且分布较乱则不具备相关性.考点2 线性回归分析1.回归分析对具有________的两个变量进行统计分析的方法叫回归分析.其基本步骤是:(ⅰ)画散点图;(ⅱ)求________;(ⅲ)用回归直线方程作预报.答案:相关关系 回归直线方程 2.回归直线如果散点图中点的分布从整体上看大致在________附近,就称这两个变量之间具有线性相关关系,这条直线叫做回归直线.答案:一条直线3.回归直线方程的求法——最小二乘法设具有线性相关关系的两个变量x ,y 的一组观察值为(x i ,y i )(i =1,2,…,n ),则回归直线方程y ^=b ^x +a ^的系数为:⎩⎪⎨⎪⎧b ^=∑i =1nx i-x y i-y ∑i =1nx i-x2= ,a ^=y -b ^x ,其中x =1n ∑i =1n x i ,y =1n ∑i =1ny i ,(x ,y )称为样本点的________.答案:∑i =1nx i y i -n x y∑i =1nx 2i -n x 2中心4.相关系数当r >0时,表明两个变量________; 当r <0时,表明两个变量________.r 的绝对值越接近于1,表明两个变量的线性相关性________.r 的绝对值越接近于0,表明两个变量之间几乎不存在线性相关关系.通常|r |大于0.75时,认为两个变量有很强的线性相关性.答案:正相关 负相关 越强[教材习题改编]已知回归直线的斜率的估计值为1.23,样本点的中心为(4,5),则回归直线方程为__________.答案:y ^=1.23x +0.08解析:设回归直线方程为y ^=1.23x +a ^, 因为回归直线必过样本点的中心(x ,y ), 将点(4,5)代入回归直线方程得a ^=0.08, 所以所求方程为y ^=1.23x +0.08.变量的相关关系:散点图;回归直线过(x ,y ).某工厂经过技术改造后,生产某种产品的产量x (吨)与相应的生产能耗y (吨标准煤)有如下几组样本数据.x 3 4 5 6 y2.5344.50.7,那么当产量x =10吨时,估计相应的生产能耗为__________吨标准煤.答案:7.35解析:先求得x =4.5,y =3.5,由y ^=0.7x +a ^过点(x ,y ),得a ^=0.35, 所以回归直线方程是y ^=0.7x +0.35.当x =10吨时,y ^=7+0.35=7.35(吨标准煤).[典题2] (1)已知x ,y 的取值如下表,从散点图可以看出y 与x 线性相关,且回归方程为y ^=0.95x +a ^,则a ^=( )x 0 1 3 4 y2.24.34.86.7A.3.25 C .2.2D .0[答案] B[解析] 由已知得x =2,y =4.5, 因为回归方程经过点(x ,y ), 所以a ^=4.5-0.95×2=2.6.(2)由某种设备的使用年限x i (年)与所支出的维修费y i (万元)的数据资料算得如下结果,∑i =15x 2i =90,∑i =15x i y i =112,∑i =15x i =20,∑i =15y i =25.①求所支出的维修费y 对使用年限x 的线性回归方程y ^=b ^x +a ^; ②(ⅰ)判断变量x 与y 之间是正相关还是负相关; (ⅱ)当使用年限为8年时,试估计支出的维修费是多少.附:在线性回归方程y ^=b ^x +a ^中,b ^=∑i =1nx i y i -n x y∑i =1nx 2i -n x 2,a ^=y -b ^x ,其中x ,y 为样本平均值.[解] ①∵∑i =15x i =20,∑i =15y i =25,∴x =15∑i =15x i =4,y =15∑i =15y i =5,∴b ^=∑i =15x i y i -5x y∑i =15x 2i -5x 2=112-5×4×590-5×42=1.2, a ^=y -b ^x =5-1.2×4=0.2.∴线性回归方程为y ^=1.2x +0.2. ②(ⅰ)由①知,b ^=1.2>0, ∴变量x 与y 之间是正相关.(ⅱ)由①知,当x =8时,y ^=9.8,即使用年限为8年时,支出维修费约是9.8万元. [点石成金] 1.正确理解计算b ^,a ^的公式和准确的计算是求线性回归方程的关键.2.回归直线方程y ^=b ^x +a ^必过样本点的中心(x ,y ).3.在分析两个变量的相关关系时,可根据样本数据作出散点图来确定两个变量之间是否具有相关关系,若具有线性相关关系,则可通过线性回归方程来估计和预测.某地最近十年粮食需求量逐年上升,下表是部分统计数据:年份 2006 2008 2010 2012 2014 需求量(万吨)236246257276286(1)利用所给数据求年需求量与年份之间的回归直线方程y ^=b ^x +a ^; (2)利用(1)中所求出的回归直线方程预测该地2016年的粮食需求量.解:(1)由所给数据看出,年需求量与年份之间是近似直线上升,下面来配回归直线方程,为此对数据预处理如下:年份-2 010 -4 -2 0 2 4 需求量-257-21-111929对预处理后的数据,容易算得,x =0,y =3.2,b ^=-4×-21+-2×-11+2×19+4×29-5×0×3.2-42+-22+22+42-5×02=26040=6.5,a ^=y -b ^x =3.2. 由上述计算结果知,所求回归直线方程为 y ^-257=b ^(x -2 010)+a ^=6.5(x -2 010)+3.2, 即y ^=6.5×(x -2 010)+260.2.(2)利用(1)中所求回归直线方程,可预测2016年的粮食需求量为6.5×(2 016-2 010)+260.2=6.5×6+260.2=299.2(万吨).考点3 独立性检验1.分类变量:变量的不同“值”表示个体所属的不同类别,像这类变量称为分类变量.2.列联表:列出两个分类变量的频数表,称为列联表.假设有两个分类变量X和Y,它们的可能取值分别为{x1,x2}和{y1,y2},其样本频数列联表(称为2×2列联表)为2×2列联表:y1y2总计x1 a b a+bx2 c d c+d总计a+c b+d a+b+c+dK2=n ad-bc2a+b a+c b+d c+d(其中n=________为样本容量),则利用独立性检验判断表来判断“X与Y的关系”.答案:a+b+c+d(1)[教材习题改编]为调查中学生的近视情况,测得某校150名男生中有80名近视,140名女生中有70名近视.在检验这些学生眼睛近视是否与性别有关时,最有说服力的方法是________.(填序号)①回归分析;②期望与方差;③独立性检验;④概率.答案:③解析:“近视”与“性别”是两个分类变量,其是否有关,应该用独立性检验来判断.(2)[教材习题改编]在研究吸烟与患肺癌的关系中,通过收集数据、整理分析数据得出“吸烟与患肺癌有关”的结论,并且有99%以上的把握认为这个结论是成立的,有下列四种说法:①100个吸烟者中至少有99人患有肺癌;②1个人吸烟,那么这人有99%的概率患有肺癌;③在100个吸烟者中一定有患肺癌的人;④在100个吸烟者中可能一个患肺癌的人也没有.其中正确说法的序号是________.答案:④对独立性检验的理解:K2的计算;对P(K2≥k0)的解释.[2017·湖南张家界模拟]某高校教“统计初步”课程的教师随机调查了选该课程的一些学生的情况,具体数据如下表:专业性别非统计专业统计专业男1310女720 为了判断主修统计专业是否与性别有关系,根据表中的数据,得到K2的观测值k=50×13×20-10×7223×27×20×30≈4.844.因为k>3.841,所以判定主修统计专业与性别有关系,那么这种判断出错的可能性为________.附表:P(K2≥k0)0.0500.0100.001k0 3.841 6.63510.828 答案:5%解析:∵k>3.841,查临界值表,得P(K2≥3.841)=0.05,故这种判断出错的可能性为5%.[典题3] (1)为了判断高中三年级学生选修文理科是否与性别有关,现随机抽取50名学生,得到2×2列联表:理科文科总计男131023女72027总计203050已知P2P(K2≥5.024)≈0.025.根据表中数据,得到K2=50×13×20-10×7223×27×20×30≈4.844,则认为选修文理科与性别有关系出错的可能性约为________.[答案]5%[解析]由K2≈4.844>3.841.故认为选修文理科与性别有关系出错的可能性约为5%.(2)[2017·江西九江模拟]某校数学课外兴趣小组为研究数学成绩是否与性别有关,先统计本校高三年级每个学生一学期数学成绩平均分(采用百分制),剔除平均分在40分以下的学生后,共有男生300名,女生200名.现采用分层抽样的方法,从中抽取了100名学生,按性别分为两组,并将两组学生的成绩分为6组,得到如下所示的频数分布表.分数段[40,50)[50,60)[60,70)[70,80)[80,90)[90,100] 男39181569女64510132①估计男、女生各自的平均分(同一组数据用该组区间中点值作代表),从计算结果看,数学成绩与性别是否有关;②规定80分以上为优分(含80分),请你根据已知条件作出2×2列联表,并判断是否有90%以上的把握认为“数学成绩与性别有关”.优分 非优分 总计 男生 女生 总计100附表及公式:P (K 2≥k 0)0.100 0.050 0.010 0.001 k 02.7063.841 6.63510.828K 2=n ad -bc 2a +bc +d a +cb +d.[解] ①x 男=45×0.05+55×0.15+65×0.3+75×0.25+85×0.1+95×0.15=71.5,x 女=45×0.15+55×0.1+65×0.125+75×0.25+85×0.325+95×0.05=71.5,从男、女生各自的平均分来看,并不能判断数学成绩与性别有关.②由频数分布表可知,在抽取的100名学生中,“男生组”中的优分有15人,“女生组”中的优分有15人,据此可得2×2列联表如下:优分 非优分 总计 男生 15 45 60 女生 15 25 40 总计3070100可得K 2=100×15×25-15×45260×40×30×70≈1.79,因为1.79<2.706,所以没有90%以上的把握认为“数学成绩与性别有关”. [点石成金] 1.独立性检验的关键是正确列出2×2列联表,并计算出K 2的值. 2.弄清判断两变量有关的把握性与犯错误概率的关系,根据题目要求作出正确的回答.[2017·广西玉林、贵港联考]某市地铁即将于2015年6月开始运营,为此召开了一个价格听证会,拟定价格后又进行了一次调查,随机抽查了50人,他们的收入与态度如下; 月收入 (单位: 百元) [15, 25)[25, 35)[35, 45)[45, 55)[55, 65)[65, 75]赞成定 价者人数 1 2 3 5 3 4认为价 格偏高 者人数4812521“认为价格偏高者”的月平均收入的差距是多少(结果保留2位小数);(2)由以上统计数据填写下面的2×2列联表分析是否有99%的把握认为“月收入以55百元为分界点对地铁定价的态度有差异”.月收入低于 55百元的人数月收入不低于 55百元的人数总计认为价 格偏高者赞成 定价者 总计附:K 2=a +bc +d a +c b +d. P (K 2≥k 0)0.05 0.01 k 03.8416.635解:x 1=20×1+30×2+40×3+50×5+60×3+70×41+2+3+5+3+4≈50.56.“认为价格偏高者”的月平均收入为x 2=20×4+30×8+40×12+50×5+60×2+70×14+8+12+5+2+1=38.75,∴“赞成定价者”与“认为价格偏高者”的月平均收入的差距是x 1-x 2=50.56-38.75=11.81(百元).(2)根据条件可得2×2列联表如下:月收入低于55百元的人数月收入不低于55百元的人数总计认为价格偏高者29332 赞成定价者11718 总计401050 K2=50×7×29-3×11210×40×18×32≈6.27<6.635,∴没有99%的把握认为“月收入以55百元为分界点对地铁定价的态度有差异”.[方法技巧] 1.求回归方程,关键在于正确求出系数a^,b^,由于a^,b^的计算量大,计算时应仔细谨慎,分层进行,避免因计算而产生错误.(注意线性回归方程中一次项系数为b^,常数项为a^,这与一次函数的习惯表示不同.)2.回归分析是处理变量相关关系的一种数学方法.主要解决:(1)确定特定量之间是否有相关关系,如果有就找出它们之间贴近的数学表达式;(2)根据一组观察值,预测变量的取值及判断变量取值的变化趋势;(3)求出线性回归方程.[易错防范] 1.回归分析是对具有相关关系的两个变量进行统计分析的方法,只有在散点图大致呈线性时,求出的线性回归方程才有实际意义,否则,求出的线性回归方程毫无意义.根据回归方程进行预报,仅是一个预报值,而不是真实发生的值.2.独立性检验中统计量K2的观测值k的计算公式很复杂,在解题中易混淆一些数据的意义,代入公式时出错,而导致整个计算结果出错.真题演练集训1.[2015·福建卷]为了解某社区居民的家庭年收入与年支出的关系,随机调查了该社区5户家庭,得到如下统计数据表:收入x(万元)8.28.610.011.311.9支出y(万元) 6.27.58.08.59.8 根据上表可得回归直线方程y=b x+a,其中b=0.76,a=y-b x.据此估计,该社区一户年收入为15万元家庭的年支出为( )A.11.4万元 B.11.8万元C.12.0万元 D.12.2万元答案:B解析:由题意知,x=8.2+8.6+10.0+11.3+11.95=10,y=6.2+7.5+8.0+8.5+9.85=8,∴a^=8-0.76×10=0.4,∴当x=15时,y^=0.76×15+0.4=11.8(万元).2.[2016·新课标全国卷Ⅲ]下图是我国2008年至2014年生活垃圾无害化处理量(单位:亿吨)的折线图.注:年份代码1-7分别对应年份2008-2014.(1)由折线图看出,可用线性回归模型拟合y与t的关系,请用相关系数加以说明;(2)建立y关于t的回归方程(系数精确到0.01),预测2016年我国生活垃圾无害化处理量.附注:参考数据:∑i=17y i=9.32,∑i=17t i y i=40.17,i=17y i-y2=0.55,7≈2.646.参考公式:相关系数r=∑i=1nt i-t y i-y∑i=1nt i-t2∑i=1ny i-y2,回归方程y^=b^t+a^中斜率和截距的最小二乘估计公式分别为b^=∑i=1nt i-t y i-y∑i=1nt i-t2,a^=y-b^t.解:(1)由折线图中数据和附注中参考数据,得t =4,∑i =17(t i -t)2=28,∑i =17y i -y2=0.55,∑i =17 (t i -t)(y i -y )=∑i =17t i y i -t∑i =17y i =40.17-4×9.32=2.89,r ≈ 2.890.55×2×2.646≈0.99.因为y 与t 的相关系数近似为0.99,说明y 与t 的线性相关程度相当高,从而可以用线性回归模型拟合y 与t 的关系.(2)由y =9.327≈1.331及(1),得b ^=∑i =17t i -ty i -y∑i =17t i -t2=2.8928≈0.103, a ^=y -b ^t ≈1.331-0.103×4≈0.92.所以,y 关于t 的回归方程为y ^=0.92+0.10t . 将2016年对应的t =9代入回归方程,得 y ^=0.92+0.10×9=1.82.所以预测2016年我国生活垃圾无害化处理量约为1.82亿吨.3.[2015·新课标全国卷Ⅰ]某公司为确定下一年度投入某种产品的宣传费,需了解年宣传费x (单位:千元)对年销售量y (单位:t)和年利润z (单位:千元)的影响.对近8年的年宣传费x i 和年销售量y i (i =1,2,…,8)数据作了初步处理,得到下面的散点图及一些统计量的值.x y w∑i =18(x i∑i =18(w i∑i =18(x i -∑i =18(w i --x )2-w )2x )(y i -y )w )(y i -y )46.65636.8289.81.61 469108.8表中w i =x i ,w =18∑i =18x i .(1)根据散点图判断,y =a +bx 与y =c +d x 哪一个适宜作为年销售量y 关于年宣传费x 的回归方程类型?(给出判断即可,不必说明理由)(2)根据(1)的判断结果及表中数据,建立y 关于x 的回归方程.(3)已知这种产品的年利润z 与x ,y 的关系为z =0.2y -x .根据(2)的结果回答下列问题: ①年宣传费x =49时,年销售量及年利润的预报值是多少? ②年宣传费x 为何值时,年利润的预报值最大?附:对于一组数据(u 1,v 1),(u 2,v 2),…,(u n ,v n ),其回归直线v =α+β u 的斜率和截距的最小二乘估计分别为β^=∑i =1nu i -uv i -v∑i =1nu i -u2,α^=v -β^u .解:(1)由散点图可以判断,y =c +d x 适宜作为年销售量y 关于年宣传费x 的回归方程类型.(2)令w =x ,先建立y 关于w 的线性回归方程.由于d ^=∑i =18w i -wy i -y∑i =18w i -w2=108.81.6=68, c ^=y -d ^w =563-68×6.8=100.6,所以y 关于w 的线性回归方程为y ^=100.6+68w , 因此y 关于x 的回归方程为y ^=100.6+68x . (3)①由(2)知,当x =49时,年销售量y 的预报值y ^=100.6+6849=576.6,年利润z 的预报值z ^=576.6×0.2-49=66.32.②根据(2)的结果知,年利润z 的预报值 z ^=0.2(100.6+68x )-x =-x +13.6x +20.12.所以当x =13.62=6.8,即x =46.24时,z ^取得最大值.故年宣传费为46.24千元时,年利润的预报值最大.4.[2014·新课标全国卷Ⅱ]某地区2007年至2013年农村居民家庭人均纯收入y (单位:千元)的数据如下表: 年份 2007 2008 2009 2010 2011 2012 2013 年份代号t 1 2 3 4 5 6 7 人均纯收入y2.93.33.64.44.85.25.9(1)求y 关于t 的线性回归方程;(2)利用(1)中的回归方程,分析2007年至2013年该地区农村居民家庭人均纯收入的变化情况,并预测该地区2015年农村居民家庭人均纯收入.附:回归直线的斜率和截距的最小二乘估计公式分别为:b ^=∑i =1nt i -ty i -y∑i =1nt i -t2,a ^=y -b ^t .解:(1)由所给数据计算得t =17×(1+2+3+4+5+6+7)=4,y =17×(2.9+3.3+3.6+4.4+4.8+5.2+5.9)=4.3,∑i =17(t i -t )2=9+4+1+0+1+4+9=28,∑i =17(t i -t)(y i -y )=(-3)×(-1.4)+(-2)×(-1)+(-1)×(-0.7)+0×0.1+1×0.5+2×0.9+3×1.6=14,b ^=∑i =17t i -ty i -y∑i =17t i -t2=1428=0.5, a ^=y -b ^t =4.3-0.5×4=2.3.所求回归方程为y ^=0.5t +2.3.(2)由(1)知,b ^=0.5>0,故2007年至2013年该地区农村居民家庭人均纯收入逐年增加,平均每年增加0.5千元.将2015年的年份代号t =9代入(1)中的回归方程,得 y ^=0.5×9+2.3=6.8,故预测该地区2015年农村居民家庭人均纯收入为6.8千元.课外拓展阅读 统计案例问题的规范答题[典例] [2013·福建卷]某工厂有25周岁以上(含25周岁)工人300名,25周岁以下工人200名.为研究工人的日平均生产量是否与年龄有关,现采用分层抽样的方法,从中抽取了100名工人,先统计了他们某月的日平均生产件数,然后按工人年龄在“25周岁以上(含25周岁)”和“25周岁以下”分为两组,再将两组工人的日平均生产件数分成5组:[50,60),[60,70),[70,80),[80,90),[90,100]分别加以统计,得到如图所示的频率分布直方图.(1)从样本中日平均生产件数不足60件的工人中随机抽取2人,求至少抽到一名“25周岁以下组”工人的概率;(2)规定日平均生产件数不少于80件者为“生产能手”,请你根据已知条件完成2×2列联表,并判断是否有90%的把握认为“生产能手与工人所在的年龄组有关”?P (K 2≥k 0)0.100 0.050 0.010 0.001 k 02.7063.8416.63510.828附:K 2=a +bc +d a +cb +d.[审题视角] 由频率分布直方图列举基本事件,结合古典概型,求概率.利用独立性检验公式计算K 2.[解] (1)由已知得,样本中有25周岁以上组工人60名,25周岁以下组工人40名.所以,样本中日平均生产件数不足60件的工人中,25周岁以上组工人有60×0.05=3(人),记为A 1,A 2,A 3;25周岁以下组工人有40×0.05=2(人),记为B 1,B 2.从中随机抽取2名工人,所有的可能结果共有10种,它们是(A 1,A 2),(A 1,A 3),(A 2,A 3),(A 1,B 1),(A 1,B 2),(A 2,B 1),(A 2,B 2),(A 3,B 1),(A 3,B 2),(B 1,B 2).其中,至少有1名“25周岁以下组”工人的可能结果共有7种,它们是(A 1,B 1),(A 1,B 2),(A 2,B 1),(A 2,B 2),(A 3,B 1),(A 3,B 2),(B 1,B 2).故所求的概率P =710.(2)由频率分布直方图可知,在抽取的100名工人中,“25周岁以上组”中的生产能手有60×0.25=15(人),“25周岁以下组”中的生产能手有40×0.375=15(人),据此可得2×2列联表如下:生产能手 非生产能手总计 25周岁以上组 15 45 60 25周岁以下组15 25 40 总计3070100所以K 2=n ad -bc 2a +bc +d a +cb +d=100×15×25-15×45260×40×30×70=2514≈1.79. 因为1.79<2.706,所以没有90%的把握认为“生产能手与工人所在的年龄组有关”. [答题模板] 第1步:由分层抽样计算两组工人的数目; 第2步:由频率分布直方图计算两组不足60件的人数; 第3步:列举5人抽取2人的基本事件数; 第4步,由古典概型计算概率;第5步:统计生产能手与非生产能手,列2×2列联表; 第6步:由公式计算K 2,确定答案. 归纳总结(1)分层抽样比为100500=15,故25周岁以上有300×15=60(人),25周岁以下的200×15=40(人),然后再根据频率计算“不足60件”的人数,并设定符号.(2)列2×2列联表时,其中的数字应先由频率分布直方图算出后再列表.。

高考数学10.2用样本估计总体与变量间的相关关系

高考数学10.2用样本估计总体与变量间的相关关系

2013版高考数学一轮复习精品学案:第十章统计、统计案例10.2用样本估计总体与变量间的相关关系【高考新动向】一、用样本估计总体(一) 考纲点击1.了解分布的意义和作用,会列频率分布表,会画频率分布直方图、频率折线图、茎叶图,理解它们各自的特点;2.理解样本数据标准差的意义和作用,会计算数据标准差;3.能从样本数据中提取基本的数字特征(如平均数、标准差),并给出合理的解释;4.会用样本的频率分布估计总体分布,会用样本的基本数字特征估计总体的基本数字特征,理解用样本估计总体的思想;5.会用随机抽样的基本方法和样本估计总体的思想解决一些简单的实际问题.(二)热点提示1.频率分布直方图、茎叶图、平均数、方差、标准差是考查的重点,同时考查对样本估计总体的思想的理解;2. 频率分布直方等内容经常与概率等知识相结合出题;3.题型以选择题和填空题为主,属于中低档题。

二、变量间的相关关系(一)考纲点击1.会作两个有关联变量的数据的散点图,会利用散点图认识变量间的相关关系;2.了解最小二乘法的思想,能根据给出的线性回归方程系数公式建立线性回归方程.(二)热点提示1.以考查线性回归系数为主,同时可考查利用散点图判断两个变量间的相关关系;2.以实际生活为背景,重在考查回归方程的求法;3.在高考题中本部分的命题主要是以选择、填空题为主,属于中档题目。

【考纲全景透析】一、用样本估计总体1.作频率分布直方图的步骤(1)求极差(即一组数据中最大值与最小值的差);(2)决定组距与组数;(3)将数据分组;(4)列频率分布表;(5)画频率分布表.2.频率分布折线图和总体密度曲线(1)频率分布折线图:连接频率分布直方图中各小长方形上端的中点,就得频率分布折线图;(2)总体密度曲线:随着样本容量的增加,作图所分的组数增加,组距减小,相应的频率折线图会越来越接近于一条光滑曲线,即总体密度曲线.3.标准差和方差(1)标准差是样本数据到平均数的一种平均距离;(2)x是样本数(3)方差: (n据,n是样本容量,x是样本平均数)注:现实中的总体所包含个体数往往是很多的,如何求得总体的平均数和标准差呢?(通常的做法是用样本的平均数和标准差去估计总体的平均数与标准差,这与有样本的频率分布近似代替总体分布是类似的,只要样本的代表性好,这样做就是合理的,也是可以接受的.)4.利用频率分布直方图估计样本的数字特征(1)中位数:在频率分布直方图中,中位数左边和右边的直方图的面积应该相等,由此可以估计中位数的值;(2)平均数:平均数的估计值等于频率分布直方图中每个小矩形的面积乘以小矩形底边中点的横坐标之和;(3)众数:在频率分布直方图中,众数是最高的矩形的中点的横坐标.二、变量间的相关关系1.两个变量的线性相关(1)正相关在散点图中,点散布在从左下角到右上角的区域.对于两个变量的这种相关关系,我们将它称为正相关.(2)负相关在散点图中,点散布在从左上角到右下角的区域,两个变量的这种相关关系称为负相关. (3)线性相关关系、回归直线如果散点图中点的分布从整体上看大致在一条直线附近,就称这两个变量之间具有线性相关关系,这条直线叫做回归直线.2.回归方程 (1)最小二乘法求回归直线使得样本数据的点到回归直线的距离的平方和最小的方法叫做最小二乘法. (2)回归方程方程ˆybx a =+是两个具有线性相关关系的变量的一组数据1122(,),(,),(,)n n x y x y x y L 的回归方程,期中,a b 是待定参数.1122211()()()nni i i ii i n ni i i i x x y y x y nx yb x x x nx a y bx====⎧---⎪⎪==⎪⎨--⎪⎪=-⎪⎩∑∑∑∑ 注:相关关系与函数关系的异同点(相同点:两者均是指两个变量的关系.不同点:①函数关系是一种确定的关系,相关关系是一种非确定的关系;②函数关系是一种因果关系,而相关关系不一定是因果关系,也可能是伴随关系)【热点难点全析】一、用样本估计总体(一)频率分布直方图在总体估计中的应用 ※相关链接※频率分布直方图反映样本的频率分布(1)频率分布直方图中横坐标表示组距,纵坐标表示频率组距,频率=组距×频率组距. (2)频率分布直方图中各小长方形的面积之和为1,因此在频率分布直方图中组距是一个固定值,所以各小长方形高的比也就是频率比.(3)频率分布表和频率分布直方图是一组数据频率分布的两种形式,前者准确,后者直观.(4)众数为最高矩形中点的横坐标.(5)中位数为平分频率分布直方图面积且垂直于横轴的直线与横轴交点的横坐标.※例题解析※〖例〗为了了解高一学生的体能情况,某校抽取部分学生进行一分钟跳绳次数测试,将所得数据整理后,画出频率分布直方图,图中从左到右各小长方形面积之比为2:4:17:15:9:3,第二小组频数为12.(1)第二小组的频率是多少?样本容量是多少?(2)若次数在110以上(含110次)为达标,试估计该学生全体高一学生的达标率是多少?(3)在这次测试中,学生跳绳次数的中位数落在哪个小组内?请说明理由.思路解析:利用面积求得每组的频率→求样本容量→求频率和→求达标率→分析中位数.解答:(1)由已知可设每组的频率为2x,4x,17x,15x,9x,3x.则2x+4x+17x+15x+9x+3x=1,解得x=0.02.则第二小组的频率为0.02×4=0.08,样本容量为12÷0.08=150.(2)次数在110次以上(含110次)的频率和为17×0.02+15×0.02+9×0.02+3×0.02=0.88,则高一学生的达标率为0.88×100%=88%.(3)在这次测试中,学生跳绳次数的中位数落在第四组.因为中位数为平分频率分布直方图的面积且垂直于横轴的直线与横轴交点的横坐标.注:利用样本的频率分布可近似地估计总体的分布,要比较准确地反映出总体分布的情况,必须准确地作出频率分布表和频率分布直方图,充分利用所给的数据正确地作出估计.(二)用样本的分布估计总体※相关链接※茎叶图刻画数据的优点(1)所有的数据信息都可以从茎叶图中得到.(2)茎叶图便于记录和表示,且能够展示数据的分布情况.注:当数据是两位有效数字时,用茎叶图显得容易、方便.而当样本数据较大和较多时,用茎叶图表示,就显得不太方便.※例题解析※〖例〗在某电脑杂志的一篇目文章中,每个句子的字数如下:10,28,31,17,23,27,18,15,26,24,20,19,36,27,14,25,15,22,11,24,27,17.在某报纸的一篇文章中,每个句子中所含的字数如下:27,39,33,24,28,19,32,41,33,27,35,12,36,41,27,13,22,23,18,46,32,22.(1)将这两组数据用茎叶图表示;(2)将这两组数据进行比较分析,得到什么结论?思路解析:(1)将十位数字作为茎,个位数字作为叶,逐一统计;(2)根据茎叶图分析两组数据,得到结论.解答:(1)如图:(2)电脑杂志上每个句子的字数集中在10~30之间,中位数为22.5;而报纸上每个句子的字数集中在10~40之间,中位数为27.5.可以看出电脑杂志上每个句子的平均字数比报纸上每个句子的平均字数要少.说明电脑杂志作为读物须通俗易懂、简明.(三)用样本的数字特征估计总体的数字特征〖例〗甲乙二人参加某体育项目训练,近期的五次测试成绩得分情况如图.(1)分别求出两人得分的平均数与方差;(2)根据图和上面算得的结果,对两人的训练成绩作出评价.思路解析:(1)先通过图象统计出甲、乙二人的成绩;(2)利用公式求出平均数、方差,再分析两人的成绩,作出评价.解答:(1)由图象可得甲、乙两人五次测试的成绩分别为 甲:10分,13分,12分,14分,16分; 乙:13分,14分,12分,12分,14分.2222222222221013121416==1351314121214==1351=[(1013)(1313)(1213)(1413)(1613)]451[(1313)(1413)(1213)(1213)(1413)]0.85x x s s ++++++++-+-+-+-+-==-+-+-+-+-=甲乙甲乙,(2)由2s 甲>2s 乙可知乙的成绩较稳定.从折线图看,甲的成绩基本呈上升状态,而乙的成绩上下波动,可知甲的成绩在不断提高,而乙的成绩则无明显提高.注:(1)运用方差解决问题时,注意到方差越大,波动越大,越不稳定;方差越小,波动越小,越稳定.(2)平均数与方差都是重要的数字特征,是对总体的一种简单的描述,它们所反映的情况有着重要的实际意义,平均数、中位数、众数描述其集中趋势,方差和标准差描述波动大小.(3)平均数、方差的公式推广①若数据123,,,,n x x x x L 的平均数为x ,那么12,,,n mx a mx a mx a +++L 的平均数是mx a +.②数据123,,,,n x x x x L 的方差为2s . a.22222111[()];n s x x x nx n=+++-L b.数据12,,,n x a x a x a +++L 的方差也为2s ; c.数据12,,,n ax ax ax L 的方差为22a s . 二、变量间的相关关系(一)利用散点图判断两个变量的相关关系 ※相关链接※ 1.散点图在散点图中,如果所有的样本点都落在某一函数的曲线上,就用该函数来描述变量之间的关系,即变量之间具有函数关系.如果所有的样本点都落在某一函数的曲线附近,变量之间就有相关关系.如果所有的样本点都落在某一直线附近,变量之间就有线性相关关系.注:函数关系是一种理想的关系模型,而相关关系是一种更为一般的情况. 2.正相关、负相关从散点图可知,即一个变量的值由小变大时,另一个变量的值也由小变大,这种相关称为正相关.如年龄的值由小变大时,体内脂肪含量也在由小变大.反之,如果一个变量的值由小变大时,另一个变量的值由大变小,这种相关称为负相关. ※例题解析※〖例〗在某地区的12~30岁居民中随机抽取了10个人的身高和体重的统计资料如表:根据上述数据,画出散点图并判断居民的身高和体重之间是否有相关关系。

高考数学一轮复习 第十章 统计、统计案例 第3讲 变量相关关系与统计案例教案 理(含解析)

高考数学一轮复习 第十章 统计、统计案例 第3讲 变量相关关系与统计案例教案 理(含解析)

第3讲变量相关关系与统计案例基础知识整合1.变量间的相关关系(1)常见的两变量之间的关系有两类:一类是函数关系,另一类是相关关系;与函数关系不同,相关关系是一种非□01确定性关系.(2)从散点图上看,点分布在从左下角到右上角的区域内,两个变量的这种相关关系称为□02正相关,点分布在左上角到右下角的区域内,两个变量的相关关系为□03负相关.2.回归方程与回归分析(1)线性相关关系与回归直线如果散点图中点的分布从整体上看大致在□04一条直线附近,就称这两个变量之间具有线性相关关系,这条直线叫做回归直线.(2)回归方程①最小二乘法:求回归直线使得样本数据的点到回归直线的□05距离的平方和最小的方法叫做最小二乘法.②回归方程:方程y^=b^x+a^是两个具有线性相关关系的变量的一组数据(x1,y1),(x2,y2),…,(x n,y n)的回归方程,其中a^,b^是待定数.⎩⎪⎪⎨⎪⎪⎧b ^=∑i =1nx i-x y i-y ∑i =1nx i-x 2=∑i =1nx i y i -n x y∑i =1nx 2i -n x2,a^=y -b ^x .(3)回归分析①定义:对具有□06相关关系的两个变量进行统计分析的一种常用方法.②样本点的中心:在具有线性相关关系的数据(x 1,y 1),(x 2,y 2),…,(x n ,y n )中,x =1n(x 1+…+x n ),y =1n(y 1+…+y n ),a ^=y -b ^x ,(x ,y )称为样本点的中心.③相关系数r =∑i =1nx i -xy i -y∑i =1nx i -x2∑i =1ny i -y2,当r >0时,两变量□07正相关;当r <0时,两变量□08负相关;当|r |≤1且|r |越接近于1,相关程度□09越强;当|r |≤1且|r |越接近于0,相关程度□10越弱. 3.独立性检验(1)独立性检验的有关概念①分类变量可用变量的不同“值”表示个体所属的□11不同类别的变量称为分类变量.②2×2列联表假设有两个分类变量X和Y,它们的取值分别为{x1,x2}和{y1,y2},其样本频数列联表(称为2×2列联表)为(2)独立性检验利用随机变量K2=n ad-bc2a+b c+d a+c b+d(其中n=a+b+c+d为样本容量)来判断“两个变量有关系”的方法称为独立性检验.步骤如下:①计算随机变量K2的观测值k,查表确定临界值k0:②如果k≥k0,就推断“X与Y有关系”,这种推断犯错误的概率不超过P(K2≥k0);否则,就认为在犯错误的概率不超过P(K2≥k0)的前提下不能推断“X与Y有关系”.1.相关关系与函数关系的异同共同点:二者都是指两个变量间的关系;不同点:函数关系是一种确定性关系,体现的是因果关系,而相关关系是一种非确定性关系,体现的不一定是因果关系,也可能是伴随关系.2.从散点图看相关性正相关:样本点分布在从左下角到右上角的区域内;负相关:样本点分布在从左上角到右下角的区域内.3.回归直线y^=b^x+a^必过样本点的中心.1.下面是一个2×2列联表其中a,b处填的值分别为( )A.94 72 B.52 50C.52 74 D.74 52答案C解析由a+21=73,得a=52,a+22=b,得b=74.故选C.2.(2019·湖北模拟)已知相关变量x和y满足关系y=-0.1x +1,相关变量y与z负相关.下列结论中正确的是( ) A.x与y正相关,x与z负相关B.x与y正相关,x与z正相关C.x与y负相关,x与z负相关D.x与y负相关,x与z正相关答案D解析因为y=-0.1x+1的斜率小于0,故x与y负相关.因为y与z负相关,可设z=b^y+a^,b^<0,则z=b^y+a^=-0.1b^x+b^+a^,故x与z正相关.3.(2017·重庆高考)已知变量x与y正相关,且由观测数据算得样本平均数x-=3,y-=3.5,则由该观测数据算得的线性回归方程可能是( )A.y^=0.4x+2.3B.y^=2x-2.4C.y^=-2x+9.5D.y^=-0.3x+4.4答案A解析依题意知,相应的回归直线的斜率应为正,排除C,D.且直线必过点(3,3.5),代入A,B得A正确.4.某校为了研究学生的性别与对待某一活动的态度(支持和不支持两种态度)的关系,运用2×2列联表进行独立性检验,经计算K2=6.669,则所得到的统计学结论是:有________的把握认为“学生性别与是否支持该活动有关系”.附:答案99%解析因为6.669与附表中的6.635最接近,所以得到的统计学结论是:有1-0.010=0.99=99%的把握认为“学生性别与是否支持该活动有关系”.5.(2019·山西模拟)某产品的广告费用x与销售额y的统计数据如下表:根据上表可得回归方程y^=b^x+a^中的b^为9.4,据此模型预报广告费用为6万元时销售额约为________万元.答案 65.5解析 由表可计算x -=4+2+3+54=3.5,y -=49+26+39+544=42,因为点(3.5,42)在回归直线y ^=b ^x +a ^上,且b ^=9.4, 所以42=9.4×72+a ^,解得a ^=9.1.故回归方程为y ^=9.4x +9.1.令x =6,得y ^=65.5.核心考向突破考向一 线性回归分析例1 (2019·河南洛阳模拟)某省电视台为了解该省卫视一档成语类节目的收视情况,抽查东、西部各5个城市,得到观看该节目的人数的统计数据(单位:千人),并画出如下茎叶图,其中一个数字被污损.(1)求东部各城市观看该节目的观众的平均人数超过西部各城市观看该节目的观众的平均人数的概率;(2)该节目的播出极大地激发了观众对成语知识学习积累的热情,现从观看节目的观众中随机统计了4位观众学习成语知识的周均时间(单位:小时)与年龄(单位:岁),并制作了如下对照表:根据表中数据,试求线性回归方程y ^=b ^x +a ^,并预测年龄为50岁的观众周均学习成语知识的时间.参考公式:b ^=∑i =1nx i y i -n x -y -∑i =1nx 2i -n x 2,a ^=y -b ^x .解 (1)设被污损的数字为a ,则a 有10种情况. 由88+89+90+91+92>83+83+87+90+a +99, 得a <8,∴有8种情况使得东部各城市观看该节目的观众的平均人数超过西部各城市观看该节目的观众的平均人数,所求概率为810=45.(2)由表中数据,计算得x =35,y =3.5,b ^=∑i =14x i y i -4x -y -∑i =14x 2i -4x 2=525-4×35×3.55400-4×352=7100, a ^=y -b ^x =3.5-7100×35=2120.∴y ^=7100x +2120. 当x =50时,y ^=4.55.即预测年龄为50岁的观众周均学习成语知识的时间为4.55小时.触类旁通错误!2回归直线方程y ^=b ^x +a ^必过样本点中心x ,y .(3)在分析两个变量的相关关系时,可根据样本数据作出散点图来确定两个变量之间是否具有相关关系,若具有线性相关关系,则可通过线性回归方程来估计和预测.即时训练 1.PM2.5是指空气中直径小于或等于2.5微米的颗粒物(也称可入肺颗粒物).为了探究车流量与PM2.5的浓度是否相关,现采集到某城市周一至周五某一时间段车流量与PM2.5浓度的数据如下表:(1)根据上表数据,用最小二乘法求出y 关于x 的线性回归方程y ^=b ^x +a ^;(2)若周六同一时间段车流量是200万辆,试根据(1)求出的线性回归方程预测,此时PM2.5的浓度为多少?( 参考公式:b ^=∑ni =1 x i -xy i -y∑ni =1x i -x2,a ^=y -b ^x ;参考数据:∑5i =1x i =540,∑5i =1y i=420 ) 解 (1)由条件可知,x =15∑5i =1x i =5405=108,y =15∑5i =1y i =4205=84,∑5i =1(x i -x )(y i -y )=(-8)×(-6)+(-6)×(-4)+0×0+6×4+8×6=144,∑5i =1(x i -x )2=(-8)2+(-6)2+02+62+82=200.b ^=∑5i =1 x i -xy i -y∑5i =1x i -x2=144200=0.72, a ^=y -b ^x =84-0.72×108=6.24,故y 关于x 的线性回归方程为y ^=0.72x +6.24.(2)当x =200时,y ^=0.72×200+6.24=150.24,所以可以预测此时PM2.5的浓度约为150.24微克/立方米.考向二 两个变量的相关性角度1 相关关系的判断例 2 为研究语文成绩和英语成绩之间是否具有线性相关关系,统计某班学生的两科成绩得到如图所示的散点图(x 轴、y 轴的单位长度相同),用回归直线方程y ^=b ^x +a ^近似地刻画其相关关系,根据图形,以下结论最有可能成立的是( )A .线性相关关系较强,b 的值为1.25B .线性相关关系较强,b 的值为0.83C .线性相关关系较强,b 的值为-0.87D .线性相关关系较弱,无研究价值 答案 B解析 由散点图可以看出两个变量所构成的点在一条直线附近,所以线性相关关系较强,且应为正相关,所以回归直线方程的斜率应为正数,且从散点图观察,回归直线方程的斜率应该比y =x 的斜率要小一些,综上可知应选B.角度2 相关系数的意义例3 (2017·全国卷Ⅰ)为了监控某种零件的一条生产线的生产过程,检验员每隔30 min 从该生产线上随机抽取一个零件,并测量其尺寸(单位:cm).下面是检验员在一天内依次抽取的16个零件的尺寸:经计算得x =116∑i =116x i =9.97,s =116∑i =116x i -x 2=116∑i =116x 2i -16x2≈0.212,∑i =116i -8.52≈18.439,∑i =116(x i -x -)(i -8.5)=-2.78,其中x i 为抽取的第i 个零件的尺寸,i =1,2, (16)(1)求(x i ,i )(i =1,2,…,16)的相关系数r ,并回答是否可以认为这一天生产的零件尺寸不随生产过程的进行而系统地变大或变小(若|r |<0.25,则可以认为零件的尺寸不随生产过程的进行而系统地变大或变小);(2)一天内抽检零件中,如果出现了尺寸在(x -3s ,x +3s )之外的零件,就认为这条生产线在这一天的生产过程可能出现了异常情况,需对当天的生产过程进行检查.①从这一天抽检的结果看,是否需对当天的生产过程进行检查?②在(x--3s,x-+3s)之外的数据称为离群值,试剔除离群值,估计这条生产线当天生产的零件尺寸的均值与标准差.(精确到0.01)附:样本(x i,y i)(i=1,2,…,n)的相关系数r=∑i=1nx i-x -y i-y -∑i=1nx i-x2∑i=1ny i-y-2.0.008≈0.09.解(1)由样本数据得(x i,i)(i=1,2,…,16)的相关系数r=∑i=116x i-x-i-8.5∑i=116x i-x-2∑i=116i-8.52≈-2.780.212×16×18.439≈-0.18.由于|r|<0.25,因此可以认为这一天生产的零件尺寸不随生产过程的进行而系统地变大或变小.(2)①由于x-=9.97,s≈0.212,因此由样本数据可以看出抽取的第13个零件的尺寸在(x--3s,x-+3s)以外,因此需对当天的生产过程进行检查.②剔除离群值,即第13个数据,剩下数据的平均数为 115×(16×9.97-9.22)=10.02, 这条生产线当天生产的零件尺寸的均值的估计值为10.02.i =116x 2i ≈16×0.2122+16×9.972≈1591.134,剔除第13个数据,剩下数据的样本方差为 115×(1591.134-9.222-15×10.022)≈0.008, 这条生产线当天生产的零件尺寸的标准差的估计值为0.008≈0.09.触类旁通判断相关关系的两种方法(1)散点图法:如果所有的样本点都落在某一函数的曲线附近,变量之间就有相关关系.如果所有的样本点都落在某一直线附近,变量之间就有线性相关关系.2相关系数法:利用相关系数判定,|r |越趋近于1相关性越强.即时训练 2.(2019·贵阳模拟)对四组数据进行统计,获得如图所示的散点图,关于其相关系数的比较,正确的是( )A .r 2<r 4<0<r 3<r 1B .r 4<r 2<0<r 1<r 3C .r 4<r 2<0<r 3<r 1D .r 2<r 4<0<r 1<r 3答案 A解析 易知题中图①与图③是正相关,图②与图④是负相关,且图①与图②中的样本点集中分布在一条直线附近,则r 2<r 4<0<r 3<r 1.3.如图所示是我国2008年至2014年生活垃圾无害化处理量(单位:亿吨)的折线图.(1)由折线图看出,可用线性回归模型拟合y 与t 的关系,请用相关系数加以说明;(2)建立y 关于t 的回归方程(系数精确到0.01),预测2016年我国生活垃圾无害化处理量.参考数据:∑i =17y i =9.32,∑i =17t i y i =40.17,∑i =17y i -y2=0.55,7≈2.646.参考公式:相关系数r =∑i =1nt i -ty i -y∑i =1nt i -t2∑i =1ny i -y2,回归方程y ^=a +bt 中,斜率和截距的最小二乘估计公式分别为b =∑i =1nt i -ty i -y∑i =1nt i -t2,a =y -b t .解 (1)由折线图中的数据和附注中的参考数据,得t =4,∑i =17(t i -t )2=28,∑i =17y i -y2=0.55,∑i =17 (t i -t )(y i -y )=∑i =17t i y i -t ∑i =17y i =40.17-4×9.32=2.89,r ≈2.890.55×2×2.646≈0.99.由y 与t 的相关系数近似为0.99,说明y 与t 的线性相关程度相当高,从而可以用线性回归模型拟合y 与t 的关系.(2)由y =9.327≈1.331及(1),得b =∑i =17t i -ty i -y∑i =17t i -t2=2.8928≈0.103,a =y -b t ≈1.331-0.103×4≈0.92.所以y 关于t 的回归方程为y ^=0.92+0.10t .将2016对应的t=9代入回归方程,得y^=0.92+0.10×9=1.82.所以预测2016年我国生活垃圾无害化处理量将约为1.82亿吨.考向三独立性检验例4 (2018·全国卷Ⅲ)某工厂为提高生产效率,开展技术创新活动,提出了完成某项生产任务的两种新的生产方式.为比较两种生产方式的效率,选取40名工人,将他们随机分成两组,每组20人,第一组工人用第一种生产方式,第二组工人用第二种生产方式.根据工人完成生产任务的工作时间(单位:min)绘制了如下茎叶图:(1)根据茎叶图判断哪种生产方式的效率更高?并说明理由;(2)求40名工人完成生产任务所需时间的中位数m,并将完成生产任务所需时间超过m和不超过m的工人数填入下面的列联表:(3)根据(2)中的列联表,能否有99%的把握认为两种生产方式的效率有差异?附:K2=n ad-bc2a+b c+d a+c b+d,解(1)第二种生产方式的效率更高.理由如下:(ⅰ)由茎叶图可知:用第一种生产方式的工人中,有75%的工人完成生产任务所需时间至少80分钟,用第二种生产方式的工人中,有75%的工人完成生产任务所需时间至多79分钟.因此第二种生产方式的效率更高.(ⅱ)由茎叶图可知:用第一种生产方式的工人完成生产任务所需时间的中位数为85.5分钟,用第二种生产方式的工人完成生产任务所需时间的中位数为73.5分钟.因此第二种生产方式的效率更高.(ⅲ)由茎叶图可知:用第一种生产方式的工人完成生产任务平均所需时间高于80分钟;用第二种生产方式的工人完成生产任务平均所需时间低于80分钟,因此第二种生产方式的效率更高.(ⅳ)由茎叶图可知:用第一种生产方式的工人完成生产任务所需时间分布在茎8上的最多,关于茎8大致呈对称分布;用第二种生产方式的工人完成生产任务所需时间分布在茎7上的最多,关于茎7大致呈对称分布,又用两种生产方式的工人完成生产任务所需时间分布的区间相同,故可以认为用第二种生产方式完成生产任务所需的时间比用第一种生产方式完成生产任务所需的时间更少,因此第二种生产方式的效率更高.(以上给出了4种理由,考生答出其中任意一种或其他合理理由均可得分.)(2)由茎叶图知m =79+812=80.列联表如下:(3)由于K 2的观测值k =40×15×15-5×5220×20×20×20=10>6.635,所以有99%的把握认为两种生产方式的效率有差异.触类旁通利用统计量K2进行独立性检验的步骤(1)根据数据列出2×2列联表.2根据公式计算K2找观测值k.3比较观测值k与临界值表中相应的检验水平,作出统计推断.即时训练 4.(2017·全国卷Ⅱ)海水养殖场进行某水产品的新、旧网箱养殖方法的产量对比,收获时各随机抽取了100个网箱,测量各箱水产品的产量(单位:kg),其频率分布直方图如下:(1)设两种养殖方法的箱产量相互独立,记A表示事件“旧养殖法的箱产量低于50 kg,新养殖法的箱产量不低于50 kg”,估计A的概率;(2)填写下面列联表,并根据列联表判断是否有99%的把握认为箱产量与养殖方法有关;(3)根据箱产量的频率分布直方图,求新养殖法箱产量的中位数的估计值(精确到0.01).附:K2=n ad-bc2a+b c+d a+c b+d.解(1)记B表示事件“旧养殖法的箱产量低于50 kg”,C表示事件“新养殖法的箱产量不低于50 kg”.由题意知P(A)=P(BC)=P(B)P(C).旧养殖法的箱产量低于50 kg的频率为(0.012+0.014+0.024+0.034+0.040)×5=0.62,故P(B)的估计值为0.62.新养殖法的箱产量不低于50 kg 的频率为 (0.068+0.046+0.010+0.008)×5=0.66, 故P (C )的估计值为0.66.因此,事件A 的概率估计值为0.62×0.66=0.4092. (2)根据箱产量的频率分布直方图得列联表 K 2=200×62×66-34×382100×100×96×104≈15.705.由于15.705>6.635,故有99%的把握认为箱产量与养殖方法有关.(3)因为新养殖法的箱产量频率分布直方图中,箱产量低于50 kg 的直方图面积为(0.004+0.020+0.044)×5=0.34<0.5, 箱产量低于55 kg 的直方图面积为(0.004+0.020+0.044+0.068)×5=0.68>0.5, 故新养殖法产量的中位数的估计值为 50+0.5-0.340.068≈52.35(kg).。

高三数学一轮复习第十篇统计与统计案例第3节变量的相关性与统计案例课件理

高三数学一轮复习第十篇统计与统计案例第3节变量的相关性与统计案例课件理

考点专项突破 在讲练中理解知识
考点一 变量的相关性
【例1】 (1)(2015高考湖北卷)已知变量x和y满足关系y=-0.1x+1,变量y 与z正相关.下列结论中正确的是( ) (A)x与y正相关,x与z负相关 (B)x与y正相关,x与z正相关 (C)x与y负相关,x与z负相关 (D)x与y负相关,x与z正相关
(2)回归方程 ①最小二乘法:使得样本数据的点到回归直线的距离的平方和最小的方 法叫做最小二乘法.
(3)回归分析 ①定义:对具有 相关关系 的两个变量进行统计分析的一种常用方法.
若由资料可知y和x呈相关关系,由表中数据算出线性回归方程 yˆ =bˆx+aˆ
中的bˆ=1.23,据此估计,使用年限为10年时的维修费用是 万元.
0.455
0.40 0.708
0.25 1.323
0.15 2.072
0.10 2.706
0.05 3.841
0.025 5.024
0.010
0.005
越强 6.635
7.879
0.001 10.828
越弱
3.独立性检验 (1)独立性检验的有关概念 ①分类变量 可用变量的不同“值”表示个体所属的 不同类别 的变量称为分类变量.
反思归纳
(1)由于相关系数 r 和回归系数
n
xi yi n x y
bˆ =
i 1 n
xi2

2
nx
,
i 1
分子是相同的,分母都是正数,故 r, bˆ 符号相同,故回归直线的斜率为正时 正相关,为负时负相关,在散点图上就是散点总趋势下降时负相关,总趋势
上升时正相关.
解析:(2)由题图知①③为正相关,①中的点大致集中在一条直线附近,③

2013高考数学(理)一轮复习教案第十篇_统计、统计案例第1讲_随机抽样

2013高考数学(理)一轮复习教案第十篇_统计、统计案例第1讲_随机抽样

第1讲 随机抽样【2013年高考会这样考】1.以选择题或填空题的形式考查随机抽样方法以及有关的计算.特别是对分层抽样的考查,几乎每年都出现在高考试题中.2.在解答题中与概率统计的有关问题相结合进行综合考查. 【复习指导】1.本讲复习时,应准确理解三种抽样方法的定义,搞清它们之间的联系与区别,灵活选择恰当的抽样方法抽取样本.2.新课标高考近几年常将抽样方法与频率分布直方图、概率等相结合进行综合考查,因此,要加强这方面的训练.基础梳理1.简单随机抽样(1)定义:设一个总体含有N 个个体,从中逐个不放回地抽取n 个个体作为样本(n ≤N ),如果每次抽取时总体内的各个个体被抽到的机会都相等,就把这种抽样方法叫做简单随机抽样.(2)最常用的简单随机抽样的方法:抽签法和随机数法. 2.系统抽样的步骤假设要从容量为N 的总体中抽取容量为n 的样本. (1)编号:先将总体的N 个个体编号;(2)分段:确定分段间隔k ,对编号进行分段,当Nn (n 是样本容量)是整数时,取k =N n ;(3)确定首个个体:在第1段用简单随机抽样确定第一个个体编号l (l ≤k );(4)获取样本:按照一定的规则抽取样本,通常是将l加上间隔k得到第2个个体编号(l+k),再加k得到第3个个体编号(l+2k),依次进行下去,直到获取整个样本.3.分层抽样(1)定义:在抽样时,将总体分成互不交叉的层,然后按照一定的比例,从各层独立地抽取一定数量的个体,将各层取出的个体合在一起作为样本,这种抽样方法叫做分层抽样.(2)分层抽样的应用范围:当总体是由差异明显的几个部分组成时,往往选用分层抽样.4.分层抽样的步骤(1)分层:将总体按某种特征分成若干部分;(2)确定比例:计算各层的个体数与总体的个体数的比;(3)确定各层应抽取的样本容量;(4)在每一层进行抽样(各层分别按简单随机抽样或系统抽样的方法抽取),综合每层抽样,组成样本.一条规律三种抽样方法的共同点都是等概率抽样,即抽样过程中每个个体被抽到的概率相等,体现了这三种抽样方法的客观性和公平性.若样本容量为n,总体的个体数为N,则用这三种方法抽样时,每个个体被抽到的概率都是n N.三个特点(1)简单随机抽样的特点:总体中的个体性质相似,无明显层次;总体容量较小,尤其是样本容量较小;用简单随机抽样法抽出的个体带有随机性,个体间无固定间距.(2)系统抽样的特点:适用于元素个数很多且均衡的总体;各个个体被抽到的机会均等;总体分组后,在起始部分抽样时,采用简单随机抽样.(3)分层抽样的特点:适用于总体由差异明显的几部分组成的情况;分层后,在每一层抽样时可采用简单随机抽样或系统抽样.双基自测1.(人教A版教材习题改编)某公司有员工500人,其中不到35岁的有125人,35~49岁的有280人,50岁以上的有95人,为了调查员工的身体健康状况,从中抽取100名员工,则应在这三个年龄段分别抽取人数为().A.33人,34人,33人B.25人,56人,19人C.30人,40人,30人D.30人,50人,20人解析因为125∶280∶95=25∶56∶19,所以抽取人数分别为:25人,56人,19人.答案 B2.(2012·福州质检)为了了解全校240名学生的身高情况,从中抽取40名学生进行测量,下列说法正确的是().A.总体是240 B.个体是每一个学生C.样本是40名学生D.样本容量是40解析总体容量是240,总体是240名学生的身高;个体是每名学生的身高;样本是40名学生的身高;样本容量是40.答案 D3.(2012·昆明调研)下列说法中正确说法的个数是().①总体中的个体数不多时宜用简单随机抽样法;②在总体均分后的每一部分进行抽样时,采用的是简单随机抽样;③百货商场的抓奖活动是抽签法;④整个抽样过程中,每个个体被抽取的概率相等(有剔除时例外).A.1 B.2 C.3 D.4解析①②③显然正确,系统抽样无论有无剔除都是等概率抽样;④不正确.答案 C4.老师在班级50名学生中,依次抽取学号为5,10,15,20,25,30,35,40,45,50的学生进行作业检查,这种抽样方法是().A.随机抽样B.分层抽样C.系统抽样D.以上都不是解析因为所抽取学生的学号成等差数列,即为等距离抽样,属于系统抽样.答案 C5.(2011·天津)一支田径队有男运动员48人,女运动员36人,若用分层抽样的方法从该队的全体运动员中抽取一个容量为21的样本,则抽取男运动员的人数为________.解析抽取的男运动员的人数为2148+36×48=12.答案12考向一简单随机抽样【例1】►某车间工人加工一种轴承100件,为了了解这种轴承的直径,要从中抽取10件轴承在同一条件下测量,如何采用简单随机抽样的方法抽取样本?[审题视点] 考虑到总体中个体数较少,利用抽签法或随机数表法均可容易获取样本.须按这两种抽样方法的操作步骤进行.抽签法应“编号、制签、搅匀、抽取”;随机数表法应“编号、确定起始数、读数、取得样本”.解法一(抽签法)将100件轴承编号为1,2,…,100,并做好大小、形状相同的号签,分别写上这100个数,将这些号签放在一起,进行均匀搅拌,接着连续抽取10个号签,然后测量这10个号签对应的轴的直径.法二(随机数表法)将100件轴承编号为00,01,02,…,99,在随机数表中选定一个起始位置,如取第21行(见随机数表)第1个数开始,选取10个为68,34,30,13,70,55,74,30,77,40,这10件即为所要抽取的样本.(1)一个抽样试验能否用抽签法,关键看两点:一是抽签是否方便;二是号签是否易搅匀,一般地,当总体容量和样本容量都较小时可用抽签法.(2)随机数表中共随机出现0,1,2,…,9十个数字,也就是说,在表中的每个位置上出现各个数字的机会都是相等的.在使用随机数表时,如遇到三位数或四位数时,可从选择的随机数表中的某行某列的数字计起,每三个或每四个作为一个单位,自左向右选取,有超过总体号码或出现重复号码的数字舍去.【训练1】福利彩票的中奖号码是在1~36个号码中,选出7个号码来按规则确定中奖情况,这种从36个号码中选7个号的适宜的抽样方法是________.答案抽签法考向二系统抽样【例2】►用系统抽样法要从160名学生中抽取容量为20的样本,将160名学生从1~160编号,按编号顺序平均分成20组(1~8号,9~16号,…,153~160号),若第16组抽出的号码为123,则第2组中应抽出个体的号码是________.[审题视点] 根据系统抽样的特点,确定组数和每组的样本数,写出每组抽取号码的表达式,确定第一组所抽取的号码数,代入公式即可求得第2组抽取样本的号码.解析由题意可知,系统抽样的组数为20,间隔为8,设第1组抽出的号码为x,则由系统抽样的法则可知,第n组抽出个体的号码应该为x+(n-1)×8,所以第16组应抽出的号码为x+(16-1)×8=123,解得x=3,所以第2组中应抽出个体的号码为3+(2-1)×8=11.答案11(1)系统抽样的特点——机械抽样,又称等距抽样,所以依次抽取的样本对应的号码就是一个等差数列,首项就是第1组所抽取样本的号码,公差为间隔数,根据等差数列的通项公式就可以确定每一组内所要抽取的样本号码.(2)系统抽样时,如果总体中的个数不能被样本容量整除时,可以先用简单随机抽样从总体中剔除几个个体,然后再按系统抽样进行.【训练2】从编号为1~50的50枚最新研制的某种型号的导弹中随机抽取5枚来进行发射实验,若采用每部分选取的号码间隔一样的系统抽样方法,则所选取5枚导弹的编号可能是().A.5,10,15,20,25 B.3,13,23,33,43C.1,2,3,4,5 D.2,4,6,16,32解析间隔距离为10,故可能编号是3,13,23,33,43.答案 B考向三分层抽样【例3】►某市电视台在因特网上征集电视节目的现场参与观众,报名的共有 1 2000人,分别来自4个城区,其中东城区2 400人,西城区4 600人,南城区3 800人,北城区1 200人,从中抽取60人参加现场节目,应当如何抽取?[审题视点] 因为地域有名显的差异,故采用分层抽样.解因为:60∶1 2000=1∶200,所以2 400200=12,4 600200=23,3 800200=19,1 200200=6.故从东城区中抽取12人,从西城中抽23人,从南城中抽19人,从北城区中抽6人.在分层抽样的过程中,为了保证每个个体被抽到的可能性是相同的,这就要求各层所抽取的个体数与该层所包含的个体数之比等于样本容量与总体的个体数之比,即n i∶N i=n∶N.【训练3】(2010·重庆)某单位有职工750人,其中青年职工350人,中年职工250人,老年职工150人,为了了解该单位职工的健康情况,用分层抽样的方法从中抽取样本,若样本中的青年职工为7人,则样本容量为().A.7 B.15C.25 D.35解析由题意知,青年职工人数∶中年职工人数∶老年职工人数=350∶250∶150=7∶5∶3.由样本中青年职工为7人得样本容量为15.答案B难点突破22——高考中抽样方法问题从近两年新课标高考试题可以看出高考主要是以选择题或填空题的形式考查抽样方法,难度并不大.其中重点考查分层抽样,其次是系统抽样.计算时应注意:分层抽样是按比例抽样,系统抽样首先是对总体分段的计算,注意分段时可能要排除一些个体,各段的间距是一样的.【示例1】►(2011·福建)某校选修乒乓球课程的学生中,高一年级有30名,高二年级有40名.现用分层抽样的方法在这70名学生中抽取一个样本,已知在高一年级的学生中抽取了6名,则在高二年级的学生中应抽取的人数为().【示例2】►(2011·山东)某高校甲、乙、丙、丁四个专业分别有150、150、400、300名学生.为了解学生的就业倾向,用分层抽样的方法从该校这四个专业共抽取40名学生进行调查,应在丙专业抽取的学生人数为________.【示例3】►(2010.湖北)将参加夏令营的600名学生编号为:001,002, (600)采用系统抽样方法抽取一个容量为50的样本,且随机抽得的号码为003.这600名学生分住在三个营区,从001到300在第Ⅰ营区,从301到495在第Ⅱ营区,从496到600在第Ⅲ营区,三个营区被抽中的人数依次为().A.26,16,8 B.25,17,8C.25,16,9 D.24,17,9经典作业一、选择题1.(1)某小区有800户家庭,其中高收入家庭200户,中等收入家庭480户,低收入家庭120户,为了了解有关家用轿车购买力的某项指标,要从中抽取一个容量为100户的样本;(2)从10名同学中抽取3名参加座谈会.Ⅰ.简单随机抽样方法;Ⅱ.分层抽样方法. 问题和方法配对正确的是( ) A .(1)Ⅰ(2)Ⅱ B .(1)Ⅱ(2)Ⅰ C .(1)Ⅰ(2)ⅠD .(1)Ⅱ(2)Ⅱ[答案] B[解析] (1)中各类家庭差异明显,故应用分层抽样. (2)中总体容量较小,可采用抽签法,故应用简单随机抽样.2.老师为研究男女同学数学学习的差异情况,对某班50名同学(其中男同学30名,女同学20名)采取分层抽样的方法,抽取一个样本容量为10的样本进行研究,某女同学甲被抽到的概率为( )A.150B.110 C.15D.14[答案] C[解析] 在分层抽样中,任何个体被抽取的概率均相等,所以某女同学甲被抽到的概率P =1050=15.3.(文)为了了解参加一次知识竞赛的1252名学生的成绩,决定采用系统抽样的方法抽取一个容量为50的样本,那么总体中应随机剔除的个体数目是( )A .2B .3C .4D .5[答案] A[解析] 因为1252=50×25+2,所以应随机剔除2个个体,故选A.(理)某班由24名女生和36名男生组成,现要组织20名学生外出参观,若这20名成员按性别分层抽样产生,则参观团的组成方法共有( )A .C 6020种B .A 248C 3612种C .C 2410C 3610种D .C 248C 3612种[答案] D[解析] 由分层抽样的定义可知,要在男生中选出的人数为20×3624+36=12(人).女生选出的人数为20×2424+36=8(人).所以组成方法有C 248C 3612种. 4.(2010·湖北理)将参加夏令营的600名学生编号为:001,002,…,600.采用系统抽样方法抽取一个容量为50的样本,且随机抽得的号码为003,这600名学生分住在三个营区.从001到300在第Ⅰ营区,从301到495在第Ⅱ营区,从496到600在第Ⅲ营区.三个营区被抽中的人数依次为( )A .26,16,8B .25,17,8C .25,16,9D .24,17,9[答案] B[解析] 根据系统抽样的特点可知抽取的号码间隔为60050=12,在第Ⅰ营区恰好有25组,故抽取25人,在第Ⅱ营区共有195人,共有16组多3人,因为抽取的第一个数是3,所以Ⅱ营区共抽取17人,剩余50-25-17=8人需从Ⅲ营区抽取.5.某班有50人,其中男生30名,女生20名,现调查平均身高,已知男、女生身高明显不同,抽取一个容量为10的样本,则抽出的男、女生人数之差为( )A .5B .4C .3D .2[答案] D[解析] 分层抽样,按30 20=3 2分层抽样,男人抽6人,女人抽4人.6.某地区A 、B 、C 三家养鸡场,鸡的数量分别为12000只、8000只、4000只,为了预防禽流感,现用分层抽样的方法从中抽取一个容量为120只的样本检查疫情,则从A 家养鸡场抽取的个体数是( )A .120B .100C .80D .60[答案] D [解析]120×1200012000+8000+4000=60(只),故选D.7.某单位共有老、中、青年职工430人,其中青年职工160人,中年职工人数是老年职工人数的2倍.为了解职工身体状况,现采用分层抽样方法进行调查,在抽取的样本中有青年职工32人,则该样本中的老年职工人数为( )A .9B .18C .7D .36[答案] B[解析] 本小题主要考查分层抽样等基础知识.由题意知青、中、老年职工的人数分别为160、180、90, ∴三者比为16 18 9, ∵样本中青年职工32人, ∴老年职工人数为18,故选B.8.某企业三月中旬生产A 、B 、C 三种产品共3000件,根据分层抽样的结果,企业统计员制作了如下的统计表格:产品类别 A B C 产品数量(件) 1300 样本容量130由于不小心,表格中A 、C 产品的有关数据已被污染得看不清楚,统计员只记得A 产品的样本容量比C 产品的样本容量多10.根据以上信息,可得C 产品的数量是( )A .300件B .800件C .500件D .1000件[答案] B[解析] 设样品的容量为x ,则x 3000×1300=130,所以x =300,所以A 产品和C 产品在样本中共有300-130=170(件). 设C 产品的样本容量为y ,则y +(y +10)=170, 所以y =80,所以C 产品的数量为3000300×80=800(件).二、填空题9.一个总体A 、B 有两层,其个体数之比为4 1,用分层抽样方法从总体中抽取一个容量为10的样本,已知B 层中甲、乙都被抽到的概率为128,则总体中的个体数为________.[答案] 40[解析] 由A 、B 两层个体数之比为4 1及样本容量为10知,B 层抽取2个个体,设B 层有m 个个体,则甲、乙都被抽到的概率为1(m -1)(m -2)+…+2+1=2m (m -1)=128∴m =8,故总体容量为8×(4+1)=40.10.一工厂生产了某种产品16800件,它们来自甲、乙、丙3条生产线.为检查这批产品的质量,决定采用分层抽样的方法进行抽样.已知从甲、乙、丙3条生产线抽取的个体数组成一个等差数列.则乙生产线生产了________件产品.[答案] 5600[解析] 设甲、乙、丙分别生产了a -d 、a 、a +d 件,则a -d +a +a +d =3a =16800,∴a =5600.11.某工厂有甲、乙、丙、丁四类产品的数量成等比数列,共计3000件,现要用分层抽样的方法从中抽取150件进行质量检测,其中乙、丁两类产品抽取的总数为100件,则甲类产品共有________.[答案] 200[解析] 设抽取的150件中甲有a 件,则有a +aq +aq 2+aq 3=150,aq +aq ·q 2=100,①,∴a (1+q 2)=50②,①②,得q =2,∴a =10, ∴甲类产品共有3000×10150=200(件). 三、解答题12.某单位有工程师6人,技术员12人,技工18人,要从这些人中抽取一个容量为n 的样本.如果采用系统抽样和分层抽样方法抽取,不用剔除个体;如果样本容量增加一个,则在采用系统抽样时,需要在总体中先剔除1个个体,求样本容量n .[解析] 总体容量为6+12+18=36(人).当样本容量是n 时,由题意知,系统抽样的间隔为36n ,分层抽样的比例是n 36,抽取工程师人数为n 36×6=n 6人,技术员人数为n 36×12=n 3人,技工人数为n 36×18=n 2人,所以n 应是6的倍数,36的约数,即n =6,12,18.当样本容量为(n +1)时,总体容量是35人,系统抽样的间隔为35n +1,因为35n +1必须是整数,所以n 只能取6.即样本容量为n =6.13.某政府机关有在编人员100人,其中副处级以上干部10人,一般干部70人,工人20人.上级机关为了了解政府机构改革意见,要从中抽取一个容量为20的样本,试确定用何种方法抽取,请具体实施抽取. [分析] (1)机构改革关系到各种人不同的利益;(2)不同层次的人员情况有明显差异,故采用分层抽样.[解析] 用分层抽样方法抽取.具体实施抽取如下:(1)∵20 100=1 5,∴105=2,705=14,205=4, ∴从副处级以上干部中抽取2人,从一般干部中抽取14人,从工人中抽取4人.(2)因副处级以上干部与工人的人数较少,他们分别按1~10编号,1~20编号,然后采用抽签法分别抽取2人,4人;对一般干部70人采用00,01,02,…,69编号,然后用随机数表法抽取14人.(3)将2人,4人,14人的编号对应的人汇合在一起就取得了容量为20的样本.14.某大学为了支援我国西部教育事业,决定从2011年应届毕业生报名的18名志愿者中,选取6人组成志愿小组,请用抽签法和随机数表法设计抽样方案.[解析](1)将18名志愿者编号,编号为1,2,3, (18)(2)将18个号码分别写在18张外形完全相同的纸条上,并揉成团,制成号签.(3)将18个号签放入一个不透明的盒子,充分搅匀.(4)从盒子中逐个抽取6个号签,并记录上面的编号.(5)所得号码对应的志愿者,就是志愿小组的成员.随机数表法(1)将18名志愿者编号,编号为01,02,03, (18)(2)在随机数表中任选一数作为开始,按某一确定的方向读数,例如选出第8行第1列的数7.(3)从数7开始,向右读,每次取两位,凡不在01~18中的数,或已读过的数,都跳过去不作记录,依次可得18,06,15,03,09,01.(4)找出以上号码对应的志愿者就是志愿小组的成员.15.某初级中学共有学生2000名,各年级男、女生人数如下表:初一年级初二年级初三年级女生373x y男生377370z已知在全校学生中随机抽取1名,抽到初二年级女生的概率是0.19.(1)求x的值;(2)现用分层抽样的方法在全校抽取48名学生,问应在初三年级抽取多少名?(3)已知y≥245,z≥245,求初三年级中女生比男生多的概率.[分析]本题考查概率统计及简单随机抽样的基本知识.[解析](1)∵x2000=0.19,∴x=380.(2)初三年级人数为y+z=2000-(373+377+380+370)=500,现用分层抽样的方法在全校抽取48名学生,应在初三年级抽取的人数为:482000×500=12名.(3)设初三年级女生比男生多的事件为A,初三年级女生、男生数记为(y,z)由(2)知y+z=500,且y、z∈N,基本事件空间包含的基本事件有:(245,255)、(246,254)、(247,253),…,(255,245)共11个,事件A包含的基本事件有:(251,249)、(252,248)、(253,247)、(254,246)、(255,245)共5个,5∴P(A)=11.。

高考数学一轮复习第十章统计与统计案例第三节变量间的相关关系、统计案例课件理

高考数学一轮复习第十章统计与统计案例第三节变量间的相关关系、统计案例课件理
第三十二页,共43页。
[典题 3] (2016·九江模拟)某校数学课外兴趣小组为研 究数学成绩是否与性别有关,先统计本校高三年级每个学生 一学期数学成绩平均分(采用百分制),剔除平均分在 40 分以 下的学生后,共有男生 300 名,女生 200 名.现采用分层抽 样的方法,从中抽取了 100 名学生,按性别分为两组,并将 两组学生成绩分为 6 组,得到如下所示频数分布表.
n
xi--x yi--y
n xiyi-n-x -y
i=1

i=1

,^a=-y -^b-x ,其中^b是
n
xi--x 2
n x2i -n-x 2
i=1
i=1
回归方程的 斜率(x,ié^alǜ是) 在 y 轴上的 截距 .
第六页,共43页。
③样本中心:对于一组具有线性相关关系的数据(x1,y1), (x2,y2),…,(xn,yn)中(-x ,-y )称为样本点的中心.
附表及公式 K2=a+bcn+add-ab+cc2b+d
第三十五页,共43页。
[ 听 前 试 做 ] (1) x 男 = 45×0.05 + 55×0.15 + 65×0.3 + 75×0.25+85×0.1+95×0.15=71.5,
第二十页,共43页。
[听前试做] (1)观察散点图可知,只有 D 选项的散点图表 示的是变量 x 与 y 之间具有负的线性相关关系.
(2)由散点图可以看出两个变量所构成的点在一条直线附 近,所以线性相关关系较强,且应为正相关,所以回归直线方 程的斜率应为正数,且从散点图观察,回归直线方程的斜率应 该比 y=x 的斜率要小一些,综上可知应选 B.
(4)样本相关系数
n
xi--x yi--y

2013高考数学(理)一轮复习教案:第十篇_统计、统计案例第2讲_用样本估计总体

2013高考数学(理)一轮复习教案:第十篇_统计、统计案例第2讲_用样本估计总体

第2讲用样本估计总体【2013年高考会这样考】1.考查样本的频率分布(分布表、直方图、茎叶图)中的有关计算,样本特征数(众数、中位数、平均数、标准差)的计算.主要以选择题、填空题为主.2.考查以样本的分布估计总体的分布(以样本的频率估计总体的频率、以样本的特征数估计总体的特征数).【复习指导】1.由于高考对统计考查的覆盖面广,几乎对所有的统计考点都有所涉及,其中频率分布直方图、均值与方差、茎叶图是核心考点,需要好好掌握.复习时,对于统计的任何环节都不能遗漏,最主要的是掌握好统计的基础知识,适度的题量练习.2.高考对频率分布直方图或茎叶图与概率相结合的题目考查日益频繁.因此,复习时要加强这方面的训练,弄清图表中有关量的含义,并从中提炼出有用的信息,为后面的概率计算打好基础.基础梳理1.频率分布直方图(1)通常我们对总体作出的估计一般分成两种:一种是用样本的频率分布估计总体的分布;另一种是用样本的数字特征估计总体的数字特征.(2)作频率分布直方图的步骤①求极差(即一组数据中最大值与最小值的差).②决定组距与组数.③将数据分组.④列频率分布表.⑤画频率分布直方图.(3)在频率分布直方图中,纵轴表示频率组距,数据落在各小组内的频率用各小长方形的面积表示.各小长方形的面积总和等于1.2.频率分布折线图和总体密度曲线(1)频率分布折线图:连接频率分布直方图中各小长方形上端的中点,就得频率分布折线图.(2)总体密度曲线:随着样本容量的增加,作图时所分组数增加,组距减小,相应的频率折线图会越来越接近于一条光滑曲线,即总体密度曲线.3.茎叶图的优点用茎叶图表示数据有两个突出的优点:一是统计图上没有原始数据信息的损失,所有数据信息都可以从茎叶图中得到;二是茎叶图中的数据可以随时记录,随时添加,方便记录与表示.4.样本方差与标准差设样本的元素为x1,x2,…,x n,样本的平均数为x,(1)样本方差:s2=1n[(x1-x)2+(x2-x)2+…+(x n-x)2].(2)样本标准差:s=1n[(x1-x)2+(x2-x)2+…+(x n-x)2].两个异同(1)众数、中位数与平均数的异同①众数、中位数及平均数都是描述一组数据集中趋势的量,平均数是最重要的量.②由于平均数与每一个样本数据有关,所以,任何一个样本数据的改变都会引起平均数的改变,这是中位数、众数都不具有的性质.③众数考查各数据出现的频率,其大小只与这组数据中的部分数据有关.当一组数据中有不少数据多次重复出现时,其众数往往更能反映问题.④某些数据的变动对中位数可能没有影响.中位数可能出现在所给数据中,也可能不在所给数据中.当一组数据中的个别数据变动较大时,可用中位数描述其集中趋势.(2)标准差与方差的异同标准差、方差描述了一组数据围绕平均数波动的大小.标准差、方差越大,数据的离散程度就越大;标准差、方差越小,数据的离散程度则越小,因为方差与原始数据的单位不同,且平方后可能夸大了偏差的程度,所以虽然方差与标准差在刻画样本数据的分散程度上是一样的,但在解决实际问题时,一般多采用标准差.三个特征利用频率分布直方图估计样本的数字特征:(1)中位数:在频率分布直方图中,中位数左边和右边的直方图的面积相等,由此可以估计中位数值.(2)平均数:平均数的估计值等于每个小矩形的面积乘以矩形底边中点横坐标之和.(3)众数:最高的矩形的中点的横坐标.双基自测1.(人教A版教材习题改编)某工厂生产滚珠,从某批产品中随机抽取8粒,量得直径分别为(单位:mm):14.7,14.6,15.1,15.0,14.8,15.1,15.0,14.9,则估计该厂生产的滚珠直径的平均数为( ).A.14.8 mm B.14.9 mmC.15.0 mm D.15.1 mm解析平均数x=18(14.7+14.6+15.1+15.0+14.8+15.1+15.0+14.9)=14.9 (mm).答案 B2.(2012·合肥月考)一个容量为100的样本,其数据的分组与各组的频数如下:A.0.13 B.0.39C.0.52 D.0.64解析由列表可知样本数据落在(10,40]上的频数为52,故其频率为0.52.答案 C3.(人教A版教材习题改编)10名工人某天生产同一零件,生产的件数分别是15,17,14,10,15,19,17,16,14,12,则这一天10名工人生产的零件的中位数是( ).A.14 B.16 C.15 D.17解析将这组数据从小到大排列得10,12,14,14,15,15,16,17,17,19.故中位数为15+152=15.答案 C4.某雷达测速区规定:凡车速大于或等于70 km/h的汽车视为“超速”,并将受到处罚,如图是某路段的一个检测点对200辆汽车的车速进行检测所得结果的频率分布直方图,则从图中可以看出被处罚的汽车大约有( ).A .30辆B .40辆C .60辆D .80辆解析 由题图可知,车速大于或等于70 km/h 的汽车的频率为0.02×10=0.2,则将被处罚的汽车大约有200×0.2=40(辆). 答案 B5.(2011·江苏)某老师从星期一到星期五收到的信件数分别为10,6,8,5,6,则该组数据的方差s 2=________. 解析 平均数x =10+6+8+5+65=7.∴s 2=15[(10-7)2+(6-7)2+(8-7)2+(5-7)2+ (6-7)2]=15×(9+1+1+4+1)=3.2. 答案 3.2考向一 频率分布直方图的绘制与应用 【例1】►某校从参加高一年级期中考试的学生中随机抽出60名学生,将其物理成绩(均为整数)分成六段[40,50),[50,60),…,[90,100]后得到如图所示的频率分布直方图,观察图形的信息,回答下列问题:(1)求分数在[70,80)内的频率,并补全这个频率分布直方图;(2)统计方法中,同一组数据常用该组区间的中点值作为代表,据此估计本次考试中的平均分. [审题视点] 利用各小长方形的面积和等于1求[70,80)内的频率. 解(1)设分数在[70,80)内的频率为x,根据频率分布直方图,有(0.010+0.015×2+0.025+0.005)×10+x=1,可得x=0.3,所以频率分布直方图如图所示.(2)平均分为:x=45×0.1+55×0.15+65×0.15+75×0.3+85×0.25+95×0.05=71(分).频率分布直方图直观形象地表示了样本的频率分布,从这个直方图上可以求出样本数据在各个组的频率分布.根据频率分布直方图估计样本(或者总体)的平均值时,一般是采取组中值乘以各组的频率的方法.【训练1】(2011·湖北)有一个容量为200的样本,其频率分布直方图如图所示.根据样本的频率分布直方图估计,样本数据落在区间[10,12)内的频数为( ).A.18 B.36C.54 D.72解析样本数据落在区间[10,12)内的频率1-(0.19+0.15+0.05+0.02)×2=0.18,所以数据落在此区间的频数为200×0.18=36.答案 B考向二茎叶图的应用【例2】►如图是某青年歌手大奖赛上七位评委为甲、乙两名选手打出的分数的茎叶图(其中m为数字0~9中的一个),去掉一个最高分和一个最低分后,甲、乙两名选手得分的平均数分别为a1、a2,则一定有( ).A.a1>a2B.a2>a1C.a1=a2D.a1,a2的大小与m的值有关[审题视点] 去掉的最低分和最高分就是第一行和第三行的数据,剩下的数我们只要计算其叶上数字之和,即可对问题作出结论.解析去掉一个最高分和一个最低分后,甲选手叶上的数字之和是20,乙选手叶上的数字之和是25,故a2>a1.故选B.答案 B由于茎叶图完全反映了所有的原始数据,解决由茎叶图给出的统计图表试题时,就要充分使用这个图表提供的数据进行相关的计算或者是对某些问题作出判断,这类试题往往伴随着对数据组的平均值或者是方差的计算等.【训练2】在一项大西瓜品种的实验中,共收获甲种大西瓜13个、乙种大西瓜11个,并把这些大西瓜的重量(单位:斤,1斤=500克)制成了茎叶图,如图所示,据此茎叶图写出对甲乙两种大西瓜重量的两条统计结论是:(1)__________________________________________;(2)__________________________________________.解析从这个茎叶图可以看出,甲种大西瓜的重量大致对称,平均重量、众数及中位数都是30多斤;乙种大西瓜的重量除了一个51斤外,也大致对称,平均重量、众数及中位数都是20多斤,但甲种大西瓜的产量比乙种稳定,总体情况比乙好.答案(1)甲种大西瓜的平均重量大于乙种大西瓜(2)甲种大西瓜的产量比乙种大西瓜稳定考向三用样本的数字特征估计总体的数字特征【例3】►甲乙二人参加某体育项目训练,近期的五次测试成绩得分情况如图.(1)分别求出两人得分的平均数与方差;(2)根据图和上面算得的结果,对两人的训练成绩作出评价.[审题视点] (1)先通过图象统计出甲、乙二人的成绩;(2)利用公式求出平均数、方差,再分析两人的成绩,作出评价.解(1)由图象可得甲、乙两人五次测试的成绩分别为甲:10分,13分,12分,14分,16分;乙:13分,14分,12分,12分,14分.x甲=10+13+12+14+165=13,x乙=13+14+12+12+145=13,s2甲=15[(10-13)2+(13-13)2+(12-13)2+(14-13)2+(16-13)2]=4,s2乙=15[(13-13)2+(14-13)2+(12-13)2+(12-13)2+(14-13)2]=0.8.(2)由s2甲>s2乙可知乙的成绩较稳定.从折线图看,甲的成绩基本呈上升状态,而乙的成绩上下波动,可知甲的成绩在不断提高,而乙的成绩则无明显提高.平均数与方差都是重要的数字特征,是对总体的一种简明的描述,它们所反映的情况有着重要的实际意义,平均数、中位数、众数描述其集中趋势,方差和标准差描述其波动大小.【训练3】甲、乙两名射击运动员参加某大型运动会的预选赛,他们分别射击了5次,成绩如下表(单位:环):如果甲、乙两人中只有1人入选,则入选的最佳人选应是________.解析 x 甲=x 乙=9环,s 2甲=15[(9-10)2+(9-8)2+(9-9)2+(9-9)2+(9-9)2]=25,s 2乙=15[(9-10)2+(9-10)2+(9-7)2+(9-9)2+(9-9)2]=65>s 2甲,故甲更稳定,故填甲. 答案 甲规范解答19——怎样解答茎叶图与概率的综合性问题【问题研究】 茎叶图是一个将数据分成主、次两部分,把主要部分当做茎、次要部分当作叶表达数据的一个图,它是一种常用的统计图.因此考题常将茎叶图作为载体来考查平均数、方差以及概率问题.【解决方案】 首先对茎叶图中的数据全面分析,然后再根据茎叶图的数据解决其它问题. 【示例】►(本题满分12分)(2011·北京)以下茎叶图记录了甲、乙两组各四名同学的植树棵数.乙组记录中有一个数据模糊,无法确认,在图中以X 表示.(1)如果X =8,求乙组同学植树棵数的平均数和方差;(2)如果X =9,分别从甲、乙两组中随机选取一名同学,求这两名同学的植树总棵数为19的概率.(注:方差s 2=1n [(x 1-x )2+(x 2-x )2+…+(x n -x )2],其中x 为x 1,x 2,…,x n 的平均数)第(1)问直接套入公式求值;第(2)问利用古典概型的知识解决.[解答示范] (1)当X =8时,由茎叶图可知,乙组同学的植树棵数是:8,8,9,10,所以平均数为 x =8+8+9+104=354.(2分)方差为s 2=14⎣⎢⎡⎦⎥⎤⎝ ⎛⎭⎪⎫8-3542+⎝ ⎛⎭⎪⎫8-3542+⎝ ⎛⎭⎪⎫9-3542+⎝ ⎛⎭⎪⎫10-3542=1116.(5分)(2)记甲组四名同学为A 1,A 2,A 3,A 4,他们植树的棵数依次为9,9,11,11;乙组四名同学为B 1,B 2,B 3,B 4,他们植树的棵数依次为9,8,9,10.分别从甲、乙两组中随机选取一名同学,所有可能的结果有16个,它们是:(A 1,B 1),(A 1,B 2),(A 1,B 3),(A 1,B 4),(A 2,B 1),(A 2,B 2),(A 2,B 3),(A 2,B 4),(A 3,B 1),(A 3,B 2),(A 3,B 3),(A 3,B 4),(A 4,B 1),(A 4,B 2),(A 4,B 3),(A 4,B 4),(9分)用C 表示:“选出的两名同学的植树总棵数为19”这一事件,则C 中的结果有4个,它们是:(A 1,B 4),(A 2,B 4),(A 3,B 2),(A 4,B 2).故所求概率为P (C )=416=14.(12分)茎叶图一般记录两组的数据,它最直观、最清晰,但利用茎叶图解决概率问题时对重复出现的数据要重复记录,不能遗漏.经典作业一、选择题1.(2010·山东文)在某项体育比赛中,七位裁判为一选手打出的分数如下: 90 89 90 95 93 94 93去掉一个最高分和一个最低分后,所剩数据的平均值和方差分别为( ) A .92,2 B .92,2.8 C .93,2D .93,2.8[答案] B[解析] B 本题考查了方差及平均值的概念,数据设置便于运算属基础题,可各减去90,得0,0,3,4,3.3+4+3+0+05=2,∴平均数为92,方差(2-0)2+(2-0)2+(2-3)2+(2-4)2+(2-3)25=2.8,选B.2.在样本的频率分布直方图中,共有11个小长方形,若中间一个小长方形的面积等于其它10个小长方形的面积和的14,且样本容量为160,则中间一组的频数为( )A .32B .20C .40D .25[答案] A[解析] 由条件知,中间一组的频数为样本容量的15,∴频数为160×15=32.3.一个社会调查机构就某地居民的月收入调查了10 000人,并根据所得数据画了样本的频率分布直方图(如图).为了分析居民的收入与年龄、学历、职业等方面的关系,要从这10 000人中再用分层抽样的方法抽出200人作进一步调查,其中低于1 500元的称为低收入者,高于3 000元的称为高收入者,则应在低收入者和高收入者中分别抽取的人数是( )A .1 000,2 000B .40,80C .20,40D .10,20[分析] 根据频率分布直方图,分别计算出低收入者和高收入者的频率即可,这个频率分布直方图可以看作是容量为200的样本的频率分布直方图.[答案] C[解析] 由图可知,低收入者的频率是0.000 2×500=0.1,故应在低收入者中抽取200×0.1=20人;高收入者的频率是(0.000 3+0.000 1)×500=0.2,故应在高收入者中抽取200×0.2=40人.4.甲、乙两名篮球运动员每场比赛得分情况的茎叶图如图,则甲和乙得分的中位数的和是( )A.56分B .57分C .58分D .59分[答案] C[解析] 乙中位数26,甲中位数32,和为58.5.期中考试后,班长算出了全班40名同学的数学成绩的平均分为M .如果把M 当成一个同学的分数,与原来的40个分数加在一起,算出这41个分数的平均值为N ,那么M N 为( )A .40 41B .1 1C .41 40D .2 1[答案] B[解析] 设40个人的成绩依次为a 1,a 2,…,a 40,则 M =a 1+a 2+…+a 4040.当把该平均分M 当成一个人的分数时,41个分数的平均值为 N =a 1+a 2+…+a 40+M 41=40M +M 41=M ,故M N =1 1.6.(2009·福建文3)一个容量为100的样本,其数据的分组与各组的频数如下:A .0.13B .0.39C .0.52D .0.64[答案] C[解析] 本小题主要考查统计等基础知识. 在(10,40]上的频率为13+24+15100=0.52,故选C.7.(2009·上海理17)在发生某公共卫生事件期间,有专业机构认为该事件在一段时间没有发生大规模群体感染的标志为“连续10天,每天新增疑似病例不超过7人”.根据过去10天甲、乙、丙、丁四地新增疑似病例数据,一定符合该标志的是( )A .甲地:总体均值为3,中位数为4B .乙地:总体均值为1,总体方差大于0C .丙地:中位数为2,众数为3D .丁地:总体均值为2,总体方差为3 [答案] D[解析] 本题考查中位数、众数的概念,方差公式以及选择题的特殊解法.排除法:A 中,若连续10天甲地新增疑似病例数据分别为x 1=x 2=x 3=x 4=0,x 5=x 6=x 7=x 8=x 9=4,x 10=10,此时总体均值为3,中位数为4,但第10天新增疑似病例超过7,故A 错;B 中,若x 1=x 2=x 3=x 4=x 5=x 6=x 7=x 8=x 9=0,x 10=10,此时,总体均值为1,方差大于0,但第10天新增疑似病例超过7,故B 错;C 中,若x 1=x 2=x 3=x 4=0,x 5=1,x 6=3,x 7=3,x 8=3,x 9=8,x 10=9,此时,中位数为2,众数为3,但第9天、第10天新增疑似病例超过7,故C 错,故选D.8.某市有15个旅游景点,经计算,黄金周期间各个景点的旅游人数平均为20万,标准差为s ,后来经核实,发现甲、乙两处景点的旅游人数统计有误,甲景点的旅游人数实际为20万,被误统计为15万,乙景点的旅游人数实际为18万,被误统计为23万,更正后重新计算,得到的标准差为s 1,则s 与s 1的大小关系为( )A .s =s 1B .s <s 1C .s >s 1D .不能确定[分析] 利用标准差的计算公式分别表示s 与s 1,再比较s 与s 1的大小. [答案] C[解析] 由已知得,两次统计所得的旅游人数总数没有变,即两次统计的各景点旅游人数的平均数是相同的,设为x ,又设各景点的实际旅游人数为x i (1≤i ≤15,i ∈N *),则s =115[(15-x )2+(23-x )2+(x 3-x )2+…+(x 15-x )2] s 1=115[(20-x )2+(18-x )2+(x 3-x )2+…+(x 15-x )2].若比较s与s1的大小,只需比较(15-x)2+(23-x)2与(20-x)2+(18-x)2的大小即可.而(15-x)2+(23-x)2=754-76x+2x2,(20-x)2+(18-x)2=724-76x+2x2,所以(15-x)2+(23-x)2>(20-x)2+(18-x)2,从而s>s1.二、填空题9.(2010·天津理)甲、乙两人在10天中每天加工零件的个数用茎叶图表示如下图,中间一列的数字表示零件个数的十位数,两边的数字表示零件个数的个位数.则这10天甲、乙两人日加工零件的平均数分别为________和________.[答案]24、23[解析]将零件个数和除以天数,得甲平均数为24,乙平均数为23.10.如图所示,是虹美电视机厂产值统计图,产值最少的是第________季度,产值最多的是第________季度.第四季度比第二季度增产________%.[答案]二;四;150[解析]折线图描述某种现象在时间上的发展趋势.图中折线表示了虹美电视机厂四个季度产值先减少后增多,且第二季度最少,第四季度最多.第四季度比第二季度增产15万元,增产150%.11.(2010·北京理)从某小学随机抽取100名同学,将他们的身高(单位:厘米)数据绘制成频率分布直方图(如图).由图中数据可知a=________.若要从身高在[120,130),[130,140),[140,150]三组内的学生中,用分层抽样的方法选取18人参加一项活动,则从身高在[140,150]内的学生中选取的人数应为________.[答案]0.030 3[解析]由所有小矩形面积为1不难得到a=0.030,而三组身高区间的人数比为3 2 1,由分层抽样的原理不难得到140~150区间内的人数为3人.三、解答题12.(2010·湖北文)为了了解一个小水库中养殖的鱼的有关情况,从这个水库中多个不同位置捕捞出100条鱼,称得每条鱼的质量(单位:千克),并将所得数据分组,画出频率分布直方图(如图所示).(1)在答题卡上的表格中填写相应的频率;(2)估计数据落在[1.15,1.30)中的概率为多少;(3)将上面捕捞的100条鱼分别作一记号后再放回水库,几天后再从水库的多处不同位置捕捞出120条鱼,其中带有记号的鱼有6条,请根据这一情况来估计该水库中鱼的总条数.[解析] 本小题主要考查频率分布直方图,频数,概率等基本概念和总体分布的估计等统计方法. (1)根据频率分布直方图可知,频率=组距×频率组距故可得下表:(2)0.30+0.15+0.02=0.470.47. (3)120×1006=2000,所以水库中鱼的总条数约为2000条.13.在某电脑杂志的一篇文章中,每个句子的字数如下: 10,28,31,17,23,27,18,15,26,24,20,19,36,27,14,25,15,22,11,24,27,17. 在某报纸的一篇文章中,每个句子中所含的字的个数如下:27,39,33,24,28,19,32,41,33,27,35,12,36,41,27,13,22,23,18,46,32,22. (1)将这两组数据用茎叶图表示;(2)将这两组数据进行比较分析,得到什么结论?[分析] 将十位数字作茎,个位数字作叶,进行逐一统计. [解析] (1)茎叶图如图所示:电脑杂志 报纸文章(2)电脑杂志上每个句子的字数集中在10~30之间,中位数为22.5;而报纸上每个句子的字数集中在20~40之间,中位数为27.5.还可以看出电脑杂志上每个句子的平均字数比报纸上每个句子的平均字数要少,说明电脑杂志作为科普读物需要通俗易懂、简明.14.甲、乙两人参加某体育项目训练,近期的五次测试成绩得分情况如图. (1)分别求出两人得分的平均数与方差;(2)根据图和上面算得的结果,对两人的训练成绩作出评价.[分析] 识图→写出甲、乙两人各次的成绩→求平均数→求方差→分析两人的成绩,作出评价 [解析] (1)由图可得甲、乙两人五次测试的成绩分别为甲:10分,13分,12分,14分,16分; 乙:13分,14分,12分,12分,14分. x 甲=10+13+12+14+165=13(分),x 乙=13+14+12+12+145=13(分),s 甲2=15[(10-13)2+(13-13)2+(12-13)2+(14-13)2+(16-13)2]=4,s 乙2=15[(13-13)2+(14-13)2+(12-13)2+(12-13)2+(14-13)2]=0.8.(2)由s甲2>s乙2可知乙的成绩较稳定.从折线图看,甲成绩基本呈上升状态,而乙的成绩上下波动,可知甲的成绩在不断提高,而乙的成绩则无明显提高.[点评] (1)平均数与方差都是重要的数字特征,是对总体的一种简明的描述,它们所反映的情况有着重要的实际意义,平均数、中位数、众数描述其集中趋势,方差和标准差描述波动大小.(2)平均数、方差的公式推广若数据x1,x2,…,x n的平均数为x,方差为s2,那么mx1+a,mx2+a,mx3+a,…,mx n+a的平均数是m x+a,方差为m2s2.。

  1. 1、下载文档前请自行甄别文档内容的完整性,平台不提供额外的编辑、内容补充、找答案等附加服务。
  2. 2、"仅部分预览"的文档,不可在线预览部分如存在完整性等问题,可反馈申请退款(可完整预览的文档不适用该条件!)。
  3. 3、如文档侵犯您的权益,请联系客服反馈,我们会尽快为您处理(人工客服工作时间:9:00-18:30)。

第3讲 变量间的相关关系与统计案例【2013年高考会这样考】以选择题或填空题的形式考查回归分析及独立性检验中的基本思想方法及其简单应用. 【复习指导】高考在该部分的主要命题点就是回归分析和独立性检验的基础知识和简单应用.复习时要掌握好回归分析和独立性检验的基本思想、方法和基本公式.基础梳理1.相关关系的分类从散点图上看,点散布在从左下角到右上角的区域内,对于两个变量的这种相关关系,我们将它称为正相关;点散布在从左上角到右下角的区域内,两个变量的这种相关关系称为负相关. 2.线性相关从散点图上看,如果这些点从整体上看大致分布在一条直线附近,则称这两个变量之间具有线性相关关系,这条直线叫回归直线. 3.回归方程(1)最小二乘法:使得样本数据的点到回归直线的距离平方和最小的方法叫最小二乘法. (2)回归方程:两个具有线性相关关系的变量的一组数据: (x 1,y 1),(x 2,y 2),…,(x n ,y n ),其回归方程为y ^=b ^x +a ^,则⎩⎪⎨⎪⎧b ^=∑i =1n i-xi-y∑i =1ni-x 2=∑i =1nx i y i -n xy∑i =1nx 2i -n x 2,a ^=y -b ^ x .其中,b 是回归方程的斜率,a 是在y 轴上的截距. 4.样本相关系数r=∑i =1ni-xi-y∑i =1ni-x2∑i =1ni-y2,用它来衡量两个变量间的线性相关关系.(1)当r >0时,表明两个变量正相关;(2)当r<0时,表明两个变量负相关;(3)r的绝对值越接近1,表明两个变量的线性相关性越强;r的绝对值越接近于0,表明两个变量之间几乎不存在线性相关关系.通常当|r|>0.75时,认为两个变量有很强的线性相关关系.5.线性回归模型(1)y=bx+a+e中,a、b称为模型的未知参数;e称为随机误差.(2)相关指数用相关指数R2来刻画回归的效果,其计算公式是:R2=,R2的值越大,说明残差平方和越小,也就是说模型的拟合效果越好.在线性回归模型中,R2表示解释变量对预报变量变化的贡献率,R2越接近于1,表示回归效果越好.6.独立性检验(1)用变量的不同“值”表示个体所属的不同类别,这种变量称为分类变量.例如:是否吸烟,宗教信仰,国籍等.(2)列出的两个分类变量的频数表,称为列联表.(3)一般地,假设有两个分类变量X和Y,它们的值域分别为{x1,x2}和{y1,y2},其样本频数列联表(称为2×2列联表)为:2×2列联表y1y2总计x1 a b a+bx2 c d c+d总计a+c b+d a+b+c+dK2=n ad-bc2a +b a+c c+d b+d(其中n=a+b+c+d为样本容量),可利用独立性检验判断表来判断“x与y的关系”.这种利用随机变量K2来确定在多大程度上可以认为“两个分类变量有关系”的方法称为两个分类变量的独立性检验.两个规律(1)函数关系是一种确定的关系,相关关系是一种非确定的关系.事实上,函数关系是两个非随机变量的关系,而相关关系是非随机变量与随机变量的关系.(2)当K2≥3.841时,则有95%的把握说事A与B有关;当K2≥6.635时,则有99%的把握说事件A与B有关;当K2≤2.706时,则认为事件A与B无关.(1)回归分析是对具有相关关系的两个变量进行统计分析的方法,只有在散点图大致呈线性时,求出的回归直线方程才有实际意义,否则,求出的回归直线方程毫无意义.(2)线性回归方程中的截距和斜率都是通过样本数据估计而来的,存在误差,这种误差会导致预报结果的偏差;而且回归方程只适用于我们所研究的样本总体.(3)独立性检验的随机变量K 2=3.841是判断是否有关系的临界值,K 2≤3.841应判断为没有充分证据显示事件A 与B 有关系,而不能作为小于95%的量化值来判断.双基自测1.(人教A 版教材习题改编)下面哪些变量是相关关系( ). A .出租车车费与行驶的里程 B .房屋面积与房屋价格 C .身高与体重D .铁块的大小与质量解析 A ,B ,D 都是函数关系,其中A 一般是分段函数,只有C 是相关关系. 答案 C2.对变量x ,y 有观测数据(x i ,y i )(i =1,2,…,10),得散点图(1);对变量u ,v 有观测数据(u i 、v i )(i =1,2,…,10),得散点图(2).由这两个散点图可以判断( ).A .变量x 与y 正相关,u 与v 正相关B .变量x 与y 正相关,u 与v 负相关C .变量x 与y 负相关,u 与v 正相关D .变量x 与y 负相关,u 与v 负相关解析 由题图(1)可知,各点整体呈递减趋势,x 与y 负相关;由题图(2)可知,各点整体呈递增趋势,u 与v 正相关. 答案 C3.(2012·南昌模拟)某商品销售量y (件)与销售价格x (元/件)负相关,则其回归方程可能是( ).A.y ^=-10x +200 B.y ^=10x +200 C.y ^=-10x -200D.y ^=10x -200解析 因为销量与价格负相关,由函数关系考虑为减函数,又因为x ,y 不能为负数,再排除C ,故选A.4.(2012·枣庄模拟)下面是2×2列联表:y1y2合计x1 a 2173x2222547合计 b 46120则表中a,b的值分别为( ).A.94,72 B.52,50 C.52,74 D.74,52解析∵a+21=73,∴a=52,又a+22=b,∴b=74.答案 C5.在一项打鼾与患心脏病的调查中,共调查了1 671人,经过计算K2的观测值k=27.63,根据这一数据分析,我们有理由认为打鼾与患心脏病是________的(有关,无关).解析由观测值k=27.63与临界值比较,我们有99%的把握说打鼾与患心脏病有关.答案有关考向一相关关系的判断【例1】►山东鲁洁棉业公司的科研人员在7块并排、形状大小相同的试验田上对某棉花新品种进行施化肥量x对产量y影响的试验,得到如下表所示的一组数据(单位:kg):施化肥量x 15202530354045棉花产量y 330345365405445450455(1)画出散点图;(2)判断是否具有相关关系.[审题视点] (1)用x轴表示化肥施用量,y轴表示棉花产量,逐一画点.(2)根据散点图,分析两个变量是否存在相关关系.解(1)散点图如图所示(2)由散点图知,各组数据对应点大致都在一条直线附近,所以施化肥量x与产量y具有线性相关关系.利用散点图判断两个变量是否有相关关系是比较简便的方法.在散点图中如果所有的样本点都落在某一函数的曲线上,就用该函数来描述变量之间的关系.即变量之间具有函数关系.如果所有的样本点落在某一函数的曲线附近,变量之间就有相关关系;如果所有的样本点都落在某一直线附近,变量之间就有线性相关关系.【训练1】根据两个变量x,y之间的观测数据画成散点图如图所示,这两个变量是否具有线性相关关系________(填“是”与“否”).解析从散点图看,散点图的分布成团状,无任何规律,所以两个变量不具有线性相关关系.答案否考向二独立性检验【例2】►(2010·全国新课标)为调查某地区老年人是否需要志愿者提供帮助,用简单随机抽样方法从该地区调查了500位老年人,结果如下:性别是否需要志愿者男女需要4030不需要160270(1)估计该地区老年人中,需要志愿者提供帮助的老年人的比例;(2)能否有99%的把握认为该地区老年人是否需要志愿者提供帮助与性别有关?(3)根据(2)的结论,能否提出更好的调查方法来估计该地区老年人中,需要志愿者提供帮助的老年人的比例?说明理由.附:P(K2≥k )0.0500.0100.001k 3.841 6.63510.828K2=n ad-bc2a+b c+d a+c b+d[审题视点] 第(2)问由a=40,b=30,c=160,d=270,代入公式可求K2,由K2的值与6.635比较断定.第(3)问从抽样方法说明.解(1)调查的500位老年人中有70位需要志愿者提供帮助,因此该地区老年人中,需要志愿者提供帮助的老年人的比例的估计值为70500=14%.(2)K2=-270×430×200×300≈9.967.由于9.967>6.635,所以有99%的把握认为该地区老年人是否需要帮助与性别有关.(3)由(2)的结论知,该地区老年人是否需要帮助与性别有关,并且从样本数据能看出该地区男性老年人与女性老年人中需要帮助的比例有明显差异,因此在调查时,先确定该地区老年人中男、女的比例,再把老年人分成男、女两层,采用分层抽样方法,这要比采用简单随机抽样方法更好.独立性检验的步骤:(1)根据样本数据制成2×2列联表;(2)根据公式K2=n ad-bc 2a+b a+c b+d c+d计算K2的观测值;(3)比较K2与临界值的大小关系作统计推断.【训练2】某企业有两个分厂生产某种零件,按规定内径尺寸(单位:mm)的值落在[29.94,30.06)的零件为优质品.从两个分厂生产的零件中各抽出了500件,量其内径尺寸,得结果如下表:甲厂:分组[29.86,29.90)[29.90,29.94)[29.94,29.98)[29.98,30.02)[30.02,30.06)[30.06,30.10)[30.10,30.14)频数1263861829261 4 乙厂:分组[29.86,29.90)[29.90,29.94)[29.94,29.98)[29.98,30.02)[30.02,30.06)[30.06,30.10)[30.10,30.14)频数297185159766218(1)试分别估计两个分厂生产零件的优质品率;(2)由以上统计数据填下面2×2列联表,并问是否有99%的把握认为“两个分厂生产的零件的质量有差异”.甲厂乙厂合计优质品非优质品合计附K2=n ad-bc2a+b c+d a+c b+d,P(K2≥k)0.050.01k 3.841 6.635解 (1)甲厂抽查的产品中有360件优质品,从而甲厂生产的零件的优质品率估计为360500×100%=72%;乙厂抽查的产品中有320件优质品,从而乙厂生产的零件的优质品率估计为320500×100%=64%.(2)甲 厂 乙 厂 合 计 优质品 360 320 680 非优质品 140 180 320 合 计5005001 000K 2=-320×12500×500×680×320≈7.35>6.635,所以有99%的把握认为“两个分厂生产的零件的质量有差异”.考向三 线性回归方程【例3】►(2012·菏泽模拟)下表提供了某厂节能降耗技术改造后生产甲产品过程中记录的产量x (吨)与相应的生产能耗y (吨标准煤)的几组对照数据.x 3 4 56 y2.5344.5(1)请画出上表数据的散点图;(2)请根据上表提供的数据,用最小二乘法求出y 关于x 的线性回归方程y ^=b ^x +a ^;(3)已知该厂技改前生产100吨甲产品的生产能耗为90吨标准煤.试根据(2)求出的线性回归方程.预测生产100吨甲产品的生产能耗比技改前降低多少吨标准煤? (参考数值:3×2.5+4×3+5×4+6×4.5=66.5)[审题视点] (2)问利用公式求a ^、b ^,即可求出线性回归方程. (3)问将x =100代入回归直线方程即可. 解 (1)由题设所给数据,可得散点图如图所示.(2)由对照数据,计算得: i =14x 2i =86,x =3+4+5+64=4.5(吨),y =2.5+3+4+4.54=3.5(吨). 已知∑i =14x i y i =66.5, 所以,由最小二乘法确定的回归方程的系数为:b ^=∑i =14x i y i -4x ·y∑i =14x 2i -4x 2=66.5-4×4.5×3.586-4×4.52=0.7, a ^=y -b ^x =3.5-0.7×4.5=0.35.因此,所求的线性回归方程为y ^=0.7x +0.35.(3)由(2)的回归方程及技改前生产100吨甲产品的生产能耗,得降低的生产能耗为: 90-(0.7×100+0.35)=19.65(吨标准煤).在解决具体问题时,要先进行相关性检验,通过检验确认两个变量是否具有线性相关关系,若它们之间有线性相关关系,再求回归直线方程.【训练3】 (2011·江西)为了解儿子身高与其父亲身高的关系,随机抽取5对父子的身高数据如下:父亲身高x /cm 174 176 176 176 178 儿子身高y /cm175175176177177则y 对x 的线性回归方程为( ). A.y =x -1 B .y =x +1 C .y =88+12xD .y =176解析 由题意得x =174+176+176+176+1785=176(cm),y =175+175+176+177+1775=176(cm),由于(x ,y )一定满足线性回归方程,经验证知选C. 答案 C阅卷报告15——数据处理不当导致计算错误而失分【问题诊断】 由于大多数省市高考要求不准使用计算器,而线性回归问题和独立性检验问题仍是近几年新课标高考的常考点,并且大多是考查考生的计算能力,就计算方面常有不少考生因计算出错而失分.【防范措施】 平时训练时首先养成勤于动手的习惯,亲自动手计算,再者考场上要保持心态放松,做题时细心认真,最终可减少错误的发生.【示例】►(2011·安徽)某地最近十年粮食需求量逐年上升,下表是部分统计数据:年份 2002 2004 2006 2008 2010 需求量(万吨)236246257276286(1)利用所给数据求年需求量与年份之间的回归直线方程y ^=bx +a ; (2)利用(1)中所求出的直线方程预测该地2012年的粮食需求量. 实录 (1)x =2 006,y =236+246+257+276+2865=260.2.b =-200-+--+---2+-2+-2+-2+-2+--+-20--2+-2+-2+-2+-2=6.2,错因 求b 时计算出错,b 值不准确.a =y -b x =260.2-6.2×2 006=-12 177. ∴y ^=6.2x -12 177.(2)y ^=6.2×2 012-12 177=297.4.正解 (1)由所给数据看出,年需求量与年份之间是近似直线上升,下面来配回归直线方程,为此对数据预处理如下:年份-2006 -4 -2 0 2 4 需求量-257-21-111929对预处理后的数据,容易算得,x =0,y =3.2, b =--+--+2×19+4×29-5×0×3.2-2+-2+22+42-5×02=26040=6.5,a =y -b x =3.2. 由上述计算结果,知所求回归直线方程为y -257=b (x -2 006)+a =6.5(x -2 006)+3.2,即y ^=6.5(x -2 006)+260.2.①(2)利用直线方程①,可预测2012年的粮食需求量为6.5(2 012-2 006)+260.2=6.5×6+260.2=299.2(万吨).。

相关文档
最新文档