人教版高中数学选修2-3《第三章统计案例复习小结》
y2
b d b+d 总计 a+b c+d a+b+c+d
1x x
, 1
x1
x2
总计
a c a+c
2.
n(ad bc) 2 K (a b)(c d )(a c)(b d )
2
3.
P( K 2 k0 ) 0.50
0.40 0.708
0.25 1.323
0.15 2.072
典例剖析
1.收集1993年至2002年每年中国人口总数的数据, 建立人口与年份的关系,预测2003年和2004年的人 口总数,并计算与实际的误差.问题: (1).本题中我们要研究的问题是什么? (2).采用什么方法收集1993年至2002年每年中 国人口总数的数据? (3).得到1993年至2002年每年中国人口总数的 数据后,如何建立人口与年份的关系,(换句话, 如何分析数据呢?) (4). 预测2003年和2004年的人口总数。 (5). 比较预测值与实际数据的误差。(简单分析 产生误差的原因)
4224
3835
3510
3758
3939
1809
2946
359
2480
2413
(1).作销售总额和利润的散点图,根据该图猜想他们之间的关系 应该是什么形式; (2).建立销售总额为解释变量,利润为预报变量的回归模型,并 计算残差; (3).计算 ,你认为这个模型能很好的刻画销售总额和利润 之间的关系吗?请说明理由。 2
2.如果美国10家工业公司提供了以下数据:
公司 通用汽 车 126974 福特 埃克森 IBM 通用电 气 55264 美孚 菲利普. 莫里斯 39069 克莱斯 勒 36156 杜邦 德士古
销售总 额Y(百 万美元) 利润 (百万 美元)
96933
86656
63438
50976
35209
32416
0.10 2.706
0.05 3.841
0.025 5.024
0.010 6.635
0.005 7.879
0.001 10.828
k0
0.455
课堂小结
1.通过本节学习,同学们谈谈你对回归分析基本思想的理 解? 2.对于两个分类变量之间是否有关系,我们采用什么样的 方法检验? 3.统计思维与确定性思维有什差异?
课后作业
1.分别研究数学与物理的成绩关系,你能得到什么结论 ? 2.一只红铃虫的产卵数y与温度x有关,现收集了7组观测 数据列于表3-3中,试建立y关于x的回归方程 。
温度x/摄 氏度 21 23 25 27 29 32 35
产卵数y/ 个
7
11
21
24
66
115
325的关系,得到下面的 数据表,能否在犯错误的概率不超过0.01的前提下认为婴儿性别 与出生时间有关系呢?
晚上 男婴
女婴 合计
白天 31
26 57
合计 55
34 89
24
8 32
1.一般地,假设有两个分类变量X和Y,它们的取值分别是 和 y1, y2 ,其样本频数列联表为
第三章 统计案例 复习参考题
课前回顾
1.《统计案例》这一章我们主要认识了几种案例? 2.在必修课程《数学3》的基础上,我们进一步研究了两 个变量的关系。同学们回忆一下我们是如何研究两个变 量的关系的? 3.在日常生活中,我们常常关心两个分类变量之间是否有 关系。我们是如何研究两个分类变量之间是否有关系的 呢?
人教版数学高二人教A版选修2-3第三章《统计案例》章末小结
知识点一 线性回归方程 求线性回归方程的基本步骤:(1)列出散点图,从直观上分析数据间是否存在线性相关关系.(2)计算(3)代入公式求出y ^=b ^x +a ^中参数b ^,a ^的值. (4)写出线性回归方程并对实际问题作出估计.在我国某地的一个县城,近期发现了好几个癌症村.政府部门十分震惊,马上组成调查组调查病因,经调查发现致癌的罪魁祸首是水源中的金属砷,它们来自附近的几家化工厂,化工厂排出的废水中含有金属砷,废水污染了水源,人食用了这种水就会致癌.下面就是调查组对几个癌症村水源中的砷超标的倍数和患癌症的人数统计的数据:(1)画出表中数据的散点图; (2)求y 对x 的回归方程;(3)若一个村的水源中砷超标的倍数为7,试估计这个村的患癌症的人数.砷超标的倍数x 3 4 5.5 4.2 5.8 6 3.5 患癌症人数y15202824354434解析:(1)散点图如图所示:(2)观察散点图,可知x 、y 成线性相关关系. 计算得=327,=2007,根据求b ^公式代入数据计算得 b ^≈6.065,a ^=2007-6.065×327≈0. 846.所以患癌症人数y 对水源中砷超标的倍数x 的回归直线方程为y ^=6.065x +0.846.(3)根据上面求得的回归直线方程,当水源中砷超标的倍数为7时,y =6.065×7+0.846=43.301. 即该村患癌症的人数约为43人. 知识点二 回归分析回归分析是对具有相关关系的两个变量进行统计分析的一种常用方法,其步骤是先画出两个变量的散点图,然后利用常见的函数模型去拟合样本点,对于用什么类型的函数去拟合该组数据,拟合的效果如何,常用方法有残差分析、求相关指数R 2.一个车间为了规定工时定额,需确定加工零件所花费的时间,为此进行了10次试验,测得的数据如下表:零件数x /个 102030405060708090100加工时间y /min627275818595103108112127且知x 与y 具有线性相关关系,试求出线性回归方程并说明拟合效果的好坏. 解析:设回归模型为y ^=a ^+b ^x ,y ^i 61.833 68.533 75.233 81.933 88.633 y i -y ^i0.1673.467-0.233-0.933-3.633y i-y--30-20-17-11-7y^i95.333102.033108.733115.433122.133y i-y^i-0.3330.967-0.733-3.433 4.867y i-y-311162035知识点三独立性检验独立性检验的基本思想类似于数学中的反证法,要确认“两个分类变量有关系”这一结论成立的可信程度,首先假设该结论不成立,即假设结论“两个分类变量没有关系”成立,在该假设下构造的随机变量K2应该很小,如果由观测数据计算得到的K2的观测值k很大,则在一定程度上说明假设不合理,根据随机变量K2的含义,可以通过概率P(K2≥6.635)≈0.01来评价该假设不合理的程度,由实际计算出的k>6.635,说明该假设不合理的程度约为99%,即“两个分类变量有关系”这一结论成立的可信程度约为99%.现对某市工薪阶层关于“楼市限购令”的态度进行调查,随机抽调了50人,他们月收入的频数分布及对“楼市限购令”赞成人数如下表所示:月收入/百元[15,25)[25,35)[35,45)[45,55)[55,65)[65,75) 频数51015105 5赞成人数481252 1根据以上统计数据填写下面2×2列联表,并问:是否有99%的把握认为以月收入5 500元为分界点对“楼市限购令”的态度有差异?月收入不低于5 500元的人数月收入低于5 500元的人数合计赞成a=c=不赞成b=d=合计解析:2×2列联表如下:月收入不低于5 500元的人数月收入低于5 500元的人数合计赞成a=3c=2932不赞成b=7d=1118合计104050由公式得K2的观测值为k=50×(3×11-7×29)2(3+7)(29+11)(3+29)(7+11)≈6.27<6.635.所以没有99%的把握认为以月收入5 500元为分界点对“楼市限购令”的态度有差异.一、选择题1.下列关系中:①吸烟有害健康;②粮食产量与施肥量;③名师出高徒;④乌鸦叫,没好兆.不具有相关关系的是(D)A.①B.②C.③D.④2.一位母亲记录了儿子3~9岁的身高,由此建立的身高与年龄的回归模型为y^=7.19x+73.93,用这个模型预测这孩子10岁时的身高,则正确的叙述是(D)A.身高一定是145.83 cmB.身高在145.83 cm以上C.身高在145.83 cm以下D.身高在145.83 cm左右3.变量X与Y相对应的一组数据为(10,1)、(11.3,2)、(11.8,3)、(12.5,4)、(13,5);变量U与V 相对应的一组数据为(10,5)、(11.3,4)、(11.8,3)、(12.5,2)、(13,1).r 1表示变量Y 与X 之间的线性相关系数,r 2表示变量V 与U 之间的线性相关系数,则(C )A .r 2<r 1<0B .0<r 2<r 1C .r 2<0<r 1D .r 2=r 1解析:画散点图,由散点图可知X 与Y 是正相关,则相关系数r 1>0,U 与V 是负相关,相关系数r 2<0,故选C.4.(2014·泰安一模)为了调查某地区老年人是否需要志愿者提供帮助,用简单随机抽样的方法从该地区调查了500位老人,其结果如下表:由K 2=n (ad -bc )2(a +b )(c +d )(a +c )(b +d ),得K 2=500×(40×270-30×160)2200×300×70×430≈9.967.附表:P (K 2≥ k )0.050 0.010 0.001 k3.8416.63510.828参照附表,可得到的结论是(C)A .在犯错误的概率不超过0.1%的前提下,认为“需要志愿者提供帮助与性别有关”B .在犯错误的概率不超过0.1%的前提下,认为“需要志愿者提供帮助与性别无关”C .有99%以上的把握认为“需要志愿者提供帮助与性别有关”D .有99%以上的把握认为“需要志愿者提供帮助与性别无关” 解析:由数据知,选项C 正确. 能力提升5.(2014·重庆卷)已知变量x 与y 正相关,且由观测数据算得样本平均数x =3,y =3.5,则由该观测数据算得的线性回归方程可能是(A )A.y ^=0.4x +2.3 B.y ^=2x -2.4 C.y ^=-2x +9.5 D.y ^=-0.3x +4.4解析:因为变量x 与y 正相关,则在线性回归方程中,x 的系数应大于零,排除B ,D ;将x =3,y =3.5分别代入A ,B 中的方程只有A 满足,故选A.6.某考察团对全国10大城市进行职工人均工资水平x (千元)与居民人均消费水平y (千元)统计调查,y 与x 具有相关关系,回归方程为y ^=0.66x +1.562.若某城市居民人均消费水平为7.675千元,估计该城市人均消费额占人均工资收入的百分比约为(A )A .83%B .72%C .67%D .66%解析:将y =7.675代入回归方程,可计算得x ≈9.26,所以该城市人均消费额占人均工资收入的百分比约为7.675÷9.26≈0.83,即约为83%.7.如果K 2的观测值8.654,可以认为“X 与Y 无关”的可信度为(B ) A .99.5% B .0.5% C .99% D .1%解析:∵K 2=8.654≥k =7.879, ∴P (K 2≥7.879)=0.005=0.5%. 8.有下列数据:下列四个函数中,模拟效果最好的为(A) A .y =3·2x -1 B .y =log 2x C .y =3x D .y =x 2解析:分别将x =1,2,3,代入求值,结果最接近y 的函数是y =3·2x -1. 故选A.9.已知一个回归方程为y ^=1.5x +45,x ∈{1,5,7,13,19},则y =________. 解析:=9,∴=1.5× 9+45=58.5.答案:58.510.在对某小学的学生进行吃零食的调查中,得到如下数据:吃零食 不吃零食 合计 男学生 24 31 55 女学生 8 26 34 合计325789根据上述数据分析,我们得出K 2的观测值k =________. 解析:K 2的观测值k =89×(24×26-31×8)255×34×32×57≈3.689.答案:3.68911.下表为收集到的一组数据:x 1 3 5 7 9 y48111720已知变量x 、y 呈线性相关关系,则二者对应的回归直线方程为________________________________________________________________________.12.(2014·韶关一模)设某大学的女生体重y (kg)与身高x (cm)具有线性相关关系,根据一组样本数据(x i ,y i )(i =1,2,…,n ),用最小二乘法建立的线性回归方程为y ^=0.85x -85.71,给出下列结论:①y 与x 具有正的线性相关关系; ②回归直线过样本点的中心(x ,y );③若该大学某女生身高增加1 cm ,则其体重约增加0.85 kg ;④若该大学某女生身高为170 cm ,则可断定其体重必为58.79 kg. 其中,正确结论的序号是________. 解析:利用有关概念可知,①②③正确. 答案:①②③13.已知x 、y 之间的一组数据:(1)分别计算:x -,y -,x 1y 1+x 2y 2+x 3y 3+x 4y 4,x 21+x 22+x 23+x 24; (2)求出回归直线方程y ^=b ^x +a ^. 解析:(1)x -=0+1+2+34=1.5,y -=1+3+5+74=4,x 1y 1+x 2y 2+x 3y 3+x 4y 4=0×1+1×3+2×5+3×7=34,x 21+x 22+x 23+x 24=02+12+22+32=14.(2)b ^=x 1y 1+x 2y 2+x 3y 3+x 4y 4-4x -y -x 21+x 22+x 23+x 24-4x -2=34-4×1.5×414-4×1.52=2;a ^=y --b ^x -=4-2×1.5=1, 所以回归方程为y ^=2x +1.14.在调查学生数学成绩与物理成绩之间的关系时,得到如下数据(人数):试判断数学成绩与物理成绩之间是否相关,判断出错误的概率有多大. 解析:由公式得K 2的观测值为 k =135×(62×22-28×23)290×45×85×50≈4.066.因为4.066>3.841,所以有95%的把握认为数学成绩与物理成绩相关,判断出错的概率只有5%. 15.为了比较注射A ,B 两种药物后产生的皮肤疱疹的面积,选200只家兔做试验,将这200只家兔随机地分成两组,每组100只,其中一组注射药物A ,另一组注射药物B .下表1和表2分别是注射药物A 和药物B 后的试验结果(疱疹面积单位:mm 2).表1 注射药物A 后皮肤疱疹面积的频数分布表表2 注射药物B 后皮肤疱疹面积的频数分布表完成下面2×2列联表,并回答能否有99.9%的把握认为“注射药物A 后的疱疹面积与注射药物B 后的疱疹面积有差异”.表3解析:70 mm 2于70 mm 2 注射药物A a =70 b =30 100 注射药物B c =35 d =65 100 总计10595n =200由列联表中的数据,得K 2的观测值为 k =200×(70×65-35×30)2100×100×105×95≈24.561>10.828.因此,有99.9%的把握认为“注射药物A 后的疱疹面积与注射药物B 后的疱疹面积有差异”. 16.(2014·沈阳市质检)为了研究“教学方式” 对教学质量的影响,某高中老师分别用两种不同的教学方式对入学数学平均分数和优秀率都相同的甲、乙两个高一新班进行教学(勤奋程度和自觉性都一样).以下茎叶图为甲、乙两班(每班均为20人)学生的数学期末考试成绩.(1)现从甲班数学成绩不低于80分的同学中随机抽取两名同学,求成绩为87分的同学至少有一名被抽中的概率;(2)学校规定:成绩不低于75分的为优秀.请填写下面的2× 2列联表,并判断有多大把握认为“成绩优秀与教学方式有关” .甲班 乙班 合计 优秀 不优秀 合计下面临界值表供参考:打印版高中数学⎝⎛⎭⎪⎫参考公式:K 2=n (ad -bc )2(a +b )(c +d )(a +c )(b +d ) 解析:(1)甲班成绩为87分的同学有2个,其他不低于80分的同学有3个“从甲班数学成绩不低于80分的同学中随机抽取两名同学” 的一切可能结果组成的基本事件有C 25=10个,“抽到至少有一个87分的同学” 所组成的基本事件有C 13C 12+C 22=7个,所以P =710. (2)K 2=40×(6×6-14×14)220×20×20×20=6.4>5.024, 因此,我们有97.5%的把握认为成绩优秀与教学方式有关.。
最新人教版高中数学选修2-3《统计案例复习》示范教案
最新人教版高中数学选修2-3《统计案例复习》示范教案本章复习本章知识脉络基础知识聚焦1.回归分析是对具有相关关系的两个变量进行统计分析的一种方法,而联系这两个变量之间的关系的方程称为回归方程,下列叙述正确的是( )A .回归方程一定是直线方程B .回归方程一定不是直线方程C .回归方程是变量之间关系的严格刻画D .回归方程是变量之间关系的一种近似刻画 2.在两个变量Y 与X 的回归模型中,选择了4个不同的模型,它们的相关指数R 2如下,其中拟合效果最好的是( )A .R 2=0.98B .R 2=0.80C .R 2=0.50D .R 2=0.25 3.下列关于K 2的说法正确的是( )A .K 2在任何相互独立的问题中都可以用来检验有关还是无关B .K 2的观测值越大,事件相关的可能性就越大C .K 2是用来判断两个分类变量是否有关系的随机变量,只对两个分类变量适合D .当K 2的观测值大于某一数值(比如10.828)时,我们就说两个分类变量X 与Y 一定相关4.当我们建立多个模型拟合某一数据时,为了比较各个模型的拟合效果,我们可通过计算下列哪些量来确定( )①残差平方和;②回归平方和;③相关指数R 2;④相关系数rA .①B .①②C .①②③D .③④5.线性回归方程y ^=b ^x +a ^必经过( )A .(0,0)B .(x ,0)C .(0,y )D .(x ,y ) 学生活动:先用3~5分钟的时间完成上面5个小题,然后再交流答案,相互讨论,并根据题目设计的知识,回顾本章的主要内容.活动结果:1.D 2.A 3.B 4.C 5.D 基础知识回顾:1.回归方程模型及相关检验(1)回归方程中a ^ =y ^ -b ^ x ,b ^=∑i =1n(x i -x )(y i -y )∑i =1n(x i -x )2,其中(x ,y )称为样本点的中心.(2)r 具有如下性质:||r ≤1,并且||r 越接近1,线性相关程度越强,||r 越接近0,线性相关程度越弱.(3)为了衡量预报的精确度,我们要进行残差分析,通常σ2越小,预报精度越高. 2.2×2列联表的独立性检验(1)分类变量:变量的不同“值”表示个体所属的不同类别,这类变量称为分类变量.(2)列联表:两个分类变量的频数表称为列联表.有两个分类变量的样本频数列联表称为2×2列联表.(3)独立性检验独立性检验一般采用列联表的形式,每个因素可以分为两个类别.当列联表是2×2列联表的形式时,独立性检验的随机变量K 2的计算公式如下:K 2=n(ac -bd)2(a +b)(c +d)(a +c)(b +d).这里的字母如下表在给定的出错概率上限下,我们可以通过K 的观测值与已知数据的大小关系,来判断分类变量的关系.设计目的:把某一节复习课要复习的基础知识(概念、公式、法则、公理、定理、方法、思想、技能、技巧等)整理成一组问题的形式,通过解答问题,达到引发学生再现某些基础知识,进而牢记某些基础知识的目的,即这里的主要目的是再现本节课所要复习的知识、技能、方法与思想.典型示例类型一:线性回归模型及回归分析例1下表提供了某厂节能降耗技术改造后生产甲产品过程中记录的产量x(吨)与相应的生产能耗y(吨标准煤)的几组对照数据:(1)请画出上表数据的散点图;(2)请根据上表提供的数据,用最小二乘法求出y 关于x 的线性回归方程y =b ^x +a ^;(3)已知该厂技术改造前100吨甲产品能耗为90吨标准煤;试根据(2)求出的线性回归方程,预测生产100吨甲产品的生产能耗比技术改造前降低多少吨标准煤?思路分析:结合统计知识,正确作图和计算.解:(1)散点图如图所示:(2)由系数公式可知,x =4.5,y =3.5,b ^=66.5-4×4.5×3.586-4×4.52=66.5-635=0.7. a ^=3.5-0.7×92=0.35,所以线性回归方程为y =0.7x +0.35;(3)x =100时,y =0.7x +0.35=70.35,所以预测生产100吨甲产品的生产能耗比技术改造前降低19.65吨标准煤.点评:回归分析是对具有相关关系的两个变量进行统计分析的常用方法.采用回归分析基本思想,解决实际问题的基本步骤如下:①明确对象;②画散点图;③选择模型,即通过观察分析散点图确定回归方程的类型,如果观察到数据呈线性关系,则选用线性回归方程y ^=b ^x +a ^;④估算方程,即按一定的规则估计回归方程的参数,如最小二乘法原理;⑤线性相关程度的判定,即通过样本相关系数的大小作出判断:|r|≤1;|r|越接近于1,线性相关程度越强;|r|越接近于0,线性相关程度越弱.变式练习:一个车间为了规定工时定额,需要确定加工零件所花费的时间,为此进行了(1)y 与x 是否具有线性相关关系?(2)如果y 与x 具有线性相关关系,求回归直线方程;(3)根据求出的回归直线方程,预测加工200个零件所用的时间为多少?x =55,y =91.7,∑i =110x 2i =38 500,∑i =110y 2i =87 777,∑i =110x i y i =55 950,因此 r =∑i =110x i y i -10x y(∑i =110x 2i -10x 2)(∑i =110y 2i -10y 2)=55 950-10×55×91.7(38 500-10×552)×(87 777-10×91.72)≈0.999 8,由于r =0.999 8>0.75,因此x 与y 之间有很强的线性相关关系,因而可求回归直线方程. (2)设所求的回归直线方程为y ^=b ^x +a ^,则有b ^=∑i =110x i y i -10x y ∑i =110x 2i -10x2≈0.668,a ^ =y -b ^ x ≈54.96,因此,所求线性回归方程为y ^=0.668x +54.96.(3)这个回归直线方程的意义是当x 每增大1时,y 的值约增加0.668,而54.96是y 不随x 增加而变化的部分,因此,当x =200时,y 的估计值为y ^=0.668×200+54.96=188.56≈189,因此,加工200个零件所用的工时约为189分.类型二:非线性回归模型及回归分析例2在试验中得到变量y 与x 的数据如下:由经验知,y 与1x 之间具有线性相关关系,试求y 与x 之间的回归曲线方程;当x 0=0.038时,预测y 0的值.分析:通过换元转化为线性回归问题.解:令u =1x,由题目所给数据可得下表所示的数据:计算得b ^=0.29,a ^=34.24,∴y ^=34.24+0.29u.故所求回归曲线方程为y ^=34.24+0.29x ,当x 0=0.038时,y ^=34.24+0.290.038≈41.87.点评:非线性回归问题有时并不给出经验公式,此时我们可以由已知的数据画出散点图,并把散点图与已经学习过的各种函数,如幂函数、指数函数、对数函数、二次函数等作比较,挑选出跟这些散点拟合得最好的函数,然后再采用变量的变换,把问题转化为线性回归问题,使问题得以解决.变式练习:某地大气中氰化物浓度测定结果如下:(2)求相关指数.(3)作出残差图,并求残差平方和.解:(1)选取污染源距离为自变量x ,氰化物浓度为因变量y ,作散点图.从表中所给的数据可以看出,氰化物浓度与距离有负的相关关系,用非线性回归方程来拟合,建立y 关于x 的指数回归方程:y ^=0.929 3e-0.009 4x.(2)相关指数R 2=1-∑n i =1(y i -y ^i )2∑ni =1(y i -y )2≈0.991 5.残差平方和∑ni =1 (y i -y ^i )2=0.011 8. 类型三:独立性检验思想例3某些行为在运动员的比赛之间往往被赋予很强的神秘色彩,如有一种说法认为,在进入某乒乓球场比赛前先迈入左脚的运动员就会赢得比赛的胜利.某记者为此追踪了某著名负有关?思路分析:根据列联表,求出K 2的观测值,再进行判断.。
人教版高中数学选修2-3《第三章统计案例小结》
2 2 2 2 2 ∑y2 = 12 + 10 + 7 + 5 + 3 =327, i i=1
研一研·题型解法、解题更高效
5
∑xiyi=14×12+16×10+18×7+20×5+22×3=620,
模型的拟合精度越高,回归方程的预报精度越高.
二是确认样本点在采集中是否有人为的错误.
研一研·题型解法、解题更高效
题型一
回归分析思想的应用
回归分析是对抽取的样本进行分析,确定两个变量的相关 关系,并用一个变量的变化去推测另一个变量的变化.如 果两个变量非线性相关,我们可以通过对变量进行变换, 转化为线性相关问题.
i=1
5
∑xiyi-5 x y 620-5×18×7.4 -46 i=1 ∴b = 5 = = 40 =-1.15. 1 660-5×182 2 2 ∑xi -5 x
^ i=1
∴a =7.4+1.15×18=28.1,
∴线性回归方程为y =-1.15x+28.1.
列出残差表为: yiቤተ መጻሕፍቲ ባይዱy yi- y
所以可以制订 189 min 加工 200 个零件的规定.
^
研一研·题型解法、解题更高效
小结
回归分析是对具有相关关系的两个变量进行统计分析
的一种常用方法,其步骤是先画出散点图,并对样本点进行 相关性检验,在此基础上选择适合的函数模型去拟合样本数 据,从而建立较好的回归方程,并用该方程对变量值进行分 析; 有时回归模型可能会有多种选择(如非线性回归模型), 此 时可通过残差分析或利用相关指数 R2 来检验模型的拟合效 果,从而得到最佳模型.
高中数学 第三章 统计案例章末归纳总结 新人教A版选修2-3
月收入 [15,25)
频数
5
赞成人数 4
[25,35) 10 8
[35,45) 15 8
[45,55) 10 5
[55,65) 5 2
[65,75) 5 1
将月收入不低于55的人群称为“高收入族”,月收入低于 55的人群称为“非高收人族”.
(1)根据已知条件完成下面的 2×2 列联表,有多大的把握 认为赞不赞成楼市限购令与收入高低有关?
(3)若学生王明亮入学成绩为 80 分,代入上面线性回归直 线方程^y=22.41+0.76556x,可求得^y≈84(分).
答:王明亮同学高一期末数学成绩预测值为 84 分.
[点评] 本题为求回归直线方程中的最常见问题,应注意 作图要准确.
独立性检验
1.判断两个分类变量之间是否有关系可以通过等高条形 图作粗略判断,需要确知所作判断犯错误的概率情况下,可进 行独立性检验,独立性检验可以得到较为可靠的结论.
[解析] 将问题中的数据写成2×2列联表如下表:
使用 不使用 总计
患病 5 18 23
不患病 100 400 500
总计 105 418 523
将上述数据代入公式 K2=a+bcn+add-ab+cc2b+d中,计 算可得 k≈0.04145,而 0.04145<2.706,所以没有充分的证据表 明该药品对防治 A 疾病有效.
∑i=1
yi-^y2 , yi- y 2
R2 的值越大,模型的拟合效果越好.
2.建立回归模型的一般步骤 (1)确定研究对象,明确哪个变量是解释变量,哪个变量是 预报变量. (2)画出确定好的解释变量和预报变量的散点图,观察它们 之间的关系(如是否存在线性关系). (3)由经验确定回归方程的类型(如我们观察到数据呈线性 关系.则选用线性回归方程^y=b^ x+a^).
数学人教A版选修2-3本章解说:第三章统计案例 含解析
第三章统计案例
本章解说
知识概要
在现实生活中,我们经常会遇到类似下面的问题:肺癌是严重威胁人类生命的一种疾病,吸烟与患肺癌有关系吗?
肥胖是影响人类健康的一个重要因素,身高与体重之间是否存在线性相关关系?等等. 为了回答这些问题,必须明确问题涉及的对象(总体)是什么,用怎样的量来描述要解决的问题,并确定获取变量值(数据)的方法.然后用恰当的方法分析数据,以得到最可靠的结论.
在必修模块中,我们学习过关于抽样,用样本估计总体,线性回归等基础知识.本章中,我们将在此基础上,通过对典型案例的讨论,进一步讨论线性回归分析方法及其应用,并初步了解独立性检验的基本思想,认识统计方法在决策中的作用.
1.本章的主要内容有随机误差、残差、残差分析、列联表及独立性检验等概念.
2.用残差分析、判断线性回归模型的拟合效果.
3.建立回归模型的基本步骤.
4.通过对典型案例的研究,了解回归的基本思想、方法及初步应用.
5.通过对典型案例的研究,了解独立性检验的基本思想、方法及初步应用.
6.根据题目所给的列联表判断结论的可能性.
学法指导
1.在实际问题中,经常会面临需要推断的问题.比如研制出一种新药,需要推断此药是否有效?有人怀疑吸烟的人更易患肺癌,那么吸烟是否与患肺癌有关呢?等等.在对类似的问题作出推断时,我们不能仅凭主观意愿作出结论,需要通过试验来收集数据,并依据独立性检验的原理作出合理的推断.
2.统计方法是可能犯错误的:不管是回归分析还是独立性检验,得出的结论都可能犯错误,好的统计方法就是要尽量降低犯错误的概率,比如在推断吸烟与患肺癌是否有关时,通过收集数据、整理分析数据得到“吸烟与患肺癌有关”的结论,而且这个结论出错的概率在0.01以下.实际上,这是统计思维与确定性思维差异的反应.。
人教A版高中数学选修2-3统计案例知识点归纳
统计案例1. 随机变量 在一次实验中随着实验结果改变而改变的变量。
举例:扔硬币的实验结果用 1 表示正面 向上,用 0表示背面向上,则实验得到 1还是 0是随着扔硬币的结果决定的,这就是一个随机变量。
2. 离散型随机变量 结果是可一一列出的(不论数量有限还是无限,教材中只有限)的随机变量称为 离散型随机变量。
比如一个人的寿命是有无限种可能值的, 所以寿命不是离散型随机变量, 但是如果 定义随机变量“寿命大于等于 50岁时Y=1,寿命不足 50岁时Y=0”,则 Y 是一个离散型随机变量。
3. 离散型随机变量的概率分布列 列举出{X=x i }所有取值及取值时对应概率 P(X=x i )=p i 的表称为离散型 随机变量的概率分布列( i=1、2、3、4、 5⋯⋯)。
举例:著名古典概型掷骰子,定义随机变量 X 为掷骰子的点数,根据古典概型,所有结果的概率都是 X 1 2 3 4 5 6 P1/6 1/6 1/6 1/6 1/6 1/6则可得出当 X=x 1=1时 P(x=1)=p 1=1/6 X=x 3=1时P(x=3)=p 3=1/6等。
而如果要求点数不小于 3,则 3≤X ≤6,P(3≤X ≤6)=p 3+p 4+p 5+p 6=2/3。
有时为了简单起见,也可只用 P(X=x i )=p i 来表示 X 的分布列。
离散型随机变量的概率分布列具有如下两个性质: 1.任一分布列的所有的 p i 大于等于 0。
即任何分布 列里的任一概率大于等于 0。
2.同一分布列的所有 p i 总和为 1。
即概率和为 1。
4. 两点分布 离散型随机变量中 X 只有两种取值(也就是只有两种结果)的情况,通常是 0 和 1,例 X 0 1 P 1-p p像这样的分布列,可判定 ”X 服从两点分布 ”。
5. 超几何分布 这种概率分布列的文字表述通常是如下类型的字眼:在含有 M 个有特性(比如残次 品)的总共 N 个个体中 不放回地 (不放回这个特征要跟二项分布区分 )抽取 n 个个体 ,其中恰有 X 个有特性的物品,则通过组合方式(抽取结果跟顺序无关所以用组合 C 不用排列 A )计算可以得到 {X=k}其中C M k 代表在 M 个有特性个体中抽到 k 件的办法数C N n k M 代表在 N-M 个没有特性的个体中抽到 n-k 件的办法数 C N n 代表在 N 个个体中抽 n 件的办法数则分布列结果如下( m=min{M,n} 即 M 和 n 二者中较小的一个值, n ≤N,M ≤N 且 n,M,N ∈ N +)X 0 1mPC 0 C n 0 C M CN M C 1 Cn 1 C M CN MC m C n m C M CN M C N nC N n C N n 这样的分布列,可判定 ”X 服从超几何分布 ”。
201x-201x学年高中数学 第三章 统计案例章末优化总结 新人教A版选修2-3
4
4
[解析] (1) x =12.5, y =8.25, xiyi=438, x2i =660.
1.某商场经营一批进价是 30 元/件的小商品,在市场试验中发现,此商品的销售单 价 x(x 取整数)元与日销售量 y 件之间有如下关系
x 35 40 45 50 y 56 41 28 11 (1)y 与 x 是否具有线性相关关系?如果具有线性相关关系,求出回归直线方程;(方 程的斜率保留一个有效数字) (2)设经营此商品的日销售利润为 P 元,根据(1)写出 P 关于 x 的函数关系式,并预测 当销售单价 x 为多少元时,才能获得最大日销售利润.
(2)依题意有 P=(-3x+161.5)(x-30) =-3x2+251.5x-4 845 =-3x-2561.52+25112.52-4 845. ∴当 x=2561.5≈42 时,P 有最大值,约为 426. 即预测当销售单价为 42 元时,才能获得最大日销售利润.
2.下表提供了某厂节能降耗技术改造后生产甲产品过程中记录的产量 x(吨)与相应的 生产能耗 y(吨标准煤)的几组对照数据.
x 3 45 6 y 2.5 3 4 4.5 (1)请画出表中数据的散点图; (2)请根据表中提供的数据,用最小二乘法求出 y 关于 x 的线性回归方程^y=^bx+^a; (3)已知该厂技改前 100 吨甲产品的生产能耗为 90 吨标准煤.试根据(2)求出的线性回 归方程,预测生产 100 吨甲产品的生产能耗比技改前降低多少吨标准煤? (参考数值:3×2.5+4×3+5×4+6×4.5=66.5)
人教版A版高中数学选修2-3:第三章 统计案例 复习课件
4
xi2 14,
4
xi zi 0 2 8 15 25,
4
i 1
zi2 46,
2
4x 9,
i 1
i 1
4
2
4z 36,
b
i 1 4
xi zi 4x z
xi 2
2
4x
25 18 7 14 9 5
i 1
a z bx 3 7 1.5 9 , z 7 x 9
a
y
i 1
bx.
i 1
例1(安徽卷)某地最近十年粮食需求量逐年上升,下 表是部分统计数据:
年份
2002 2004 2006 2008 2010
需求量(万吨) 236 246 257 276 286
(1)利用所给数据求年需求量与年份之间的回归直线
方程 yˆ=bx a ;(2)利用(1)中所求出的直线方程预测该
yi--y
0
1
3 -4
4
(y y)2
R2
1
i 1 4
(y y)2
i 1
0.1923
1
(1.5)2 02
0.52 12
3.52 (2.5) 32 (4)2
2
回归直线方程是y x 5
R2 0.1923
2
相关指数越大,越 接近于1,模拟的拟 合效果越好;相关 指数越小,拟合的 效果越差!
x 0123 y 2 4 16 32
(1)画出散点图;(2)试建立y与x之间的回归方程.
解:(1)作出散点图如右图所示: 32
y 2c2xc1 ,
高中数学 第三章 统计案例复习本章诊疗 新人教A版选修2-3(2021年最新整理)
2016-2017学年高中数学第三章统计案例复习本章诊疗新人教A版选修2-3编辑整理:尊敬的读者朋友们:这里是精品文档编辑中心,本文档内容是由我和我的同事精心编辑整理后发布的,发布之前我们对文中内容进行仔细校对,但是难免会有疏漏的地方,但是任然希望(2016-2017学年高中数学第三章统计案例复习本章诊疗新人教A版选修2-3)的内容能够给您的工作和学习带来便利。
同时也真诚的希望收到您的建议和反馈,这将是我们进步的源泉,前进的动力。
本文可编辑可修改,如果觉得对您有帮助请收藏以便随时查阅,最后祝您生活愉快业绩进步,以下为2016-2017学年高中数学第三章统计案例复习本章诊疗新人教A版选修2-3的全部内容。
第三章 统计案例本章诊疗一、离散型随机变量及其分布列的均值与方差 1. 精要总结(1)一组线性相关的数据其线性回归方程为:ˆˆˆybx a =+。
其中ˆb = 1221ni ii nii x y nxyxnx ==--∑∑,ˆa=ˆy bx -,x =11n i i x n =∑,y =11ni i y n =∑.(2)利用相关系数 r =112222221111()()()()nniii ii i n nnniiiii i i i x x y y x y nxyx x y y xnx yny ======---=----∑∑∑∑∑∑来衡量两个变量之间线性相关关系。
|r |≤1,且|r |越接近于1,相关程度越大;|r |越接近于0 ,相关程度越小. 通常,当r 大于0。
75时,我们认为两个变量存在着很强的线性相关关系.当r>0时,表明两个变量正相关.当r 〈0时。
表明两个变量负相关。
常见的r 的取值对应的散点图如下:(3)利用残差分析可以对回归效果进行评价,一般方法有以下两种:①作残差图,纵坐标为残差,横坐标可以选为样本编号,或有关数据,这样作出的图形称为残差图.如果残差点比较均匀的落在水平带状区域中,说明选用的模型比较合适,这样的带状区域的宽度越窄,说明模型的拟合精度越高.回归方程的预报精度也越高,如果残差点分布不均匀,应首先确认采集的样本点是否有误,如果有误,就予以纠正,然后再重新利用线性回归模型来拟合数据,如果数据的采集没有错误,则需要寻找其他的原因。
最新人教版高中数学选修2-3《统计案例》本章小结
整合提升知识网络典例精讲第二、三章内容是概率统计的基础,重点,知识与知识板块联系紧密,在学习过程中,要注意知识的前后沟通与相互应用,使整个概率统计部分成为一个有机整体.此外,在处理数据时,计算量较大且繁琐,注意用科学的方法与计算器来处理,使之简单化.【例1】一袋中装有6个同样大小的黑球,编号为1,2,3,4,5,6,现从中随机取出3个球,以ξ表示取出球的最大号码,求ξ的分布列.分析:随机取出3个球的最大号码ξ所有可能取值为3,4,5,6.“ξ=3”对应事件“取出的3个球,编号为1,2,3”;“ξ=4”对应事件“取出的3个球中”恰取到4号球和1,2,3号球中的2个;“ξ=5”对应事件“取出的3个球中”恰取到5号球和1,2,3,4号球中的2个;“ξ=6”对应事件“取出的3个球中”恰取到6号球及1,2,3,4,5号球中的2个,而要求其概率则要利用等可能事件的概率公式和排列组合知识来求解,从而获得ξ的分布列.解析:随机变量ξ的取值为3,4,5,6.从袋中随机地取3个球,包含的基本事件总数为36C ,事件“ξ=3”包含的基本事件总数为33C ,事件“ξ=4”包含的基本事件总为11C 23C ;事件“ξ=5”包含的基本事件总数为11C 24C ;事件“ξ=6”包含的基本事件总数为11C 25C ;从而有 p(ξ=3)=2013633=C Cp(ξ=4)=203362311=C C C ;p(ξ=5)=103362411=C C C ; p(ξ=6)=21362511=C C C .【例2】在一袋中有一只红球和九只白球,每次从袋中取出一球记下颜色后放回,求取得红 球次数ξ的分布列.解析:取得红球次数ξ的值为0、1、3、……、n ,由于每次取球相互独立且“环境”相同,所以可以看成是n 次独立重复试验,故服从二项分布ξ—B(n,0.1).∴P(ξ=k)= kn C (0.1)k ×0.9n -k,故ξ的分布列为:【例3】坛子里放着5个相同大小,相同形状的咸鸭蛋,其中有3个是绿皮的,2个是白皮的.如果不放回地依次拿出2个鸭蛋,求: (1)第1次拿出绿皮鸭蛋的概率;(2)第1次和第2次都拿到绿皮鸭蛋的概率;(3)在第1次拿出绿皮鸭蛋的条件下,第2次拿出绿皮鸭蛋的概率.解析:设第1次拿出绿皮鸭蛋为事件A ,第2次拿出绿皮鸭蛋为事件B ,则第1次和第2次都拿出绿皮鸭蛋为事件AB.(1)从5个鸭蛋中不放回地依次拿出2个事件数为n(Ω)=25A =20.根据分步乘法计数原理,n(A)=13A ×14A =12.于是P(A)=532012)()(==Ωn A n . (2)因为n(AB)=23A =6,所以P(AB)=206)()(=Ωn AB n =103.(3)解法一 由(1)(2)可得,在第1次拿出绿皮鸭蛋的条件下,第2次拿出绿皮鸭蛋的概率为P(B|A)=53103)()(=A P AB P =21. 解法二 因为n(AB)=6,n(A)=12,所以P(B|A)=126)()(=A n AB n =21. 【例4】一个袋中装有大小相同的球,其中红球5个,黑球3个,现从中随机摸出3个球. (1)求至少摸到一个红球的概率;(2)求摸到黑球个数X 的概率分布和均值. 解析:(1)至少摸到一个红球的概率P=1-5655383305=C C C . (2)设X 表示摸到黑球的个数,P(X=0)= 285383303=C C C , P(X=1)= 2815382513=C C C , P(X=2)=5615381523=C C C , P(X=3)=561380533=C C C . 摸到黑球的个数X 的概率分布为:EX=1·2815+2·5615+3·615=89. 【例5】一袋中有3个白球,3个红球和5个黑球,从袋中随机取3个球,假定取得一个白球得1分,取得一个红球扣1分,取得一个黑球既不得分也不扣分,求所得分数的概率分布及期望值与方差.解析:设ξ为所得分数,则ξ可以取0,±1,±2,±3.ξ=0表示所取3球的分数和为0,即取3个黑球或取一白、一红、一黑,故有P(ξ=0)=1655531115131335=+C C C C C ; ξ=1表示所取3球的分数和为1,即取一白二黑或二白一红,故有P(ξ=1)=551331113232513=+C C C C C ;ξ=2表示所取球的分数和为2,即取二白一黑,故P(ξ=2)=1113111523=C C C ; ξ=3表示所取球的分数和为3,即取三白,故P(ξ=3)=165131133=C C .类似地,我们可求得P(ξ=-1)=13,P(ξ=-2)=1,P(ξ=-3)= 1,故ξ的分布列为:∴Eξ=(-3)×165+(-2)×11+(-1)×55+0×165+1×55+2×11+3×165=0Dξ=(-3)2×1651+(-2)2×111+(-1)2×5513+02×16555+12×5513+22×111+32×1651=165216=1.3.【例6】某厂生产的T 1型的零件的外直径ξ—N(10,0.22),一天从某厂上午、下午生产 的T 1型零件中各随机取出一个,测得其外直径分别为9.92 cm 和9.30 cm.试分析该厂这 一天的生产状况是否正常?思路分析:因为ξ—N(10,0.22),这里μ=10,σ=0.2.正态总体在区间(μ-3σ,μ+3σ)内的概率为99.7%,在此区间外的概率为0.3%,概率值很小.我们只要算出(μ-3σ,μ+3σ).便可通过判定抽得的产品是否落在这一区间来分析生产是否正常. 解:(μ-3σ,μ+3σ)=(9.4,10.6).因为9.92∈(9.4,10.6),可知该厂上午的生产正常.而9.30∉(9.4,10.6),小概率事件发生了.说明该厂下午的生产有异常情况发生.需要立即停机检查,找出原因. 温馨提示若ξ—N(μ,σ2),则正态总体在区间(μ-σ,μ+σ)的概率为68.3%.在区间(μ-2σ,μ+2σ)的概率为95.4%,在区间(μ-3σ,μ+3σ)的概率为99.7%,记住了这些值对解决正态分布问题很方便.“一次试验中,小概率事件几乎不可能发生”是统计中常用的假设检验方法的基本思想.【例7】调查某医院某段时间内婴儿出生的时间与性别的关系,得到下面的数据表,试问能 以多大把握认为婴儿的性别与出生时间有关系.解析:∵K 2=34555732)8312624(892⨯⨯⨯⨯-⨯⨯≈3.69>2.706∴我们有90%的把握认为婴儿的性别与出生时间有关系.。
