列联表检验

合集下载

高考数学一轮复习列联表与独立性检验

高考数学一轮复习列联表与独立性检验

由题意可得, x =2+3+45+5+6=4,
y =2.5+3+45+4.5+6=4,
5
xiyi=2×2.5+3×3+4×4+5×4.5+6×6=88.5,
i=1
5
x2i =22+32+42+52+62=90,
i=1
^^ ^
设 y 关于 x 的经验回归方程为y=bx+a,
5
xiyi-5 x y
^ i=1
知识梳理
2.列联表与独立性检验 (1)关于分类变量X和Y的抽样数据的2×2列联表:
X
X=0 X=1 合计
Y Y=0
a c a+c
Y=1 b d
b+d
合计
a+b c+d n=a+b+c+d
知识梳理
nad-bc2 (2)计算随机变量χ2=a+bc+da+cb+d ,利用χ2的取值推断分类变 量X和Y 是否独立 的方法称为χ2独立性检验. 如表为5个常用的小概率值和相应的临界值.
√C.独立性检验
D.回归分析
由题意可知,“爱玩网游”与“性别”是两类变量,其是否有关,应 用独立性检验判断.
教材改编题
2.如表是2×2列联表,则表中a,b的值分别为
x1 x2 合计
y1
y2
a
8
11
34
b
42
合计 35 45 80
√A.27,38
B.28,38
C.27,37
a=35-8=27,b=a+11=27+11=38.
(3)请根据已知数据完成下列列联表,并根据小概率值α=0.001的独立性 检验,分析“数学成绩达标”是否与“运动达标”相关.
运动达标人数 运动不达标人数
合计
数学成绩达标人数

2023年高考数学一轮复习精讲精练(新高考专用)专题52:列联表独立性检验(讲解版)

2023年高考数学一轮复习精讲精练(新高考专用)专题52:列联表独立性检验(讲解版)

专题52:列联表独立性检验精讲温故知新1. 数值变量与分类变量数值变量:数值变量的取值为实数,其大小和运算都有实际含义.分类变量:这里所说的变量和值不一定是具体的数值,例如:性别变量,其取值为男和女两种,我们经常会使用一种特殊的随机变量,以区别不同的现象或性质,这类随机变量称为分类变量,分类变量的取值可以用实数表示.注意点:分类变量的取值可以用实数来表示,例如男性,女性可以用1,0表示,学生的班级可以用1,2,3来表示.这些数值只作编号使用,并没有大小和运算意义.分类变量是相对于数值变量来说的.变量的不同“值”表示个体所属的不同类别,像这样的变量才是分类变量.2:列联表:列出两个分类变量的频数表,称为列联表.假设有两个分类变量X和Y,它们的可能取值分别为{x1,x2}和{y1,y2},其样本频数列联表(称为2×2列联表)为2×2列联表构造一个随机变量K2=n(ad-bc)(a+b)(a+c)(b+d)(c+d),其中n=a+b+c+d为样本容量.3. 分类变量与列联表的实际应用利用2×2列联表分析两个分类变量间的关系时,首先要根据题中数据获得2×2列联表,然后根据频率特征,即将aa+b与cc+d⎝⎛⎭⎪⎫ba+b与dc+d的值相比,直观地反映出两个分类变量间是否相互影响,但方法较粗劣.4. 独立性检验的理解1.独立性检验:利用χ2的取值推断分类变量X 和Y 是否独立的方法称为χ2独立性检验,读作“卡方独立性检验”,简称独立性检验. 2.χ2=n ad -bc 2a +bc +d a +cb +d,其中n =a +b +c +d .注意点:(1)卡方越小,独立性越强,相关性越弱;卡方越大,独立性越弱,相关性越强.(2)当χ2≥x α时,我们就推断H 0不成立,即认为X 和Y 不独立,该推断犯错误的概率不超过α;当χ2<x α时,我们没有充分证据推断H 0不成立 ,可以认为X 和Y 独立. 根据所给的观测值,与所给的临界值表中的数据进行比较,即可得出结论. 5. 有关“相关的检验” 用χ2进行“相关的检验”步骤 (1)零假设:即先假设两变量间没关系. (2)计算χ2:套用χ2的公式求得χ2值.(3)查临界值:结合所给小概率值α查得相应的临界值x α. (4)下结论:比较χ2与x α的大小,并作出结论. 6. 有关“无关的检验” 运用独立性检验的方法(1)列出2×2列联表,根据公式计算χ2. (2)比较χ2与x α的大小作出结论题型一:列联表例1:假设有两个变量X 和Y ,他们的取值分别为1x ,2x 和1y ,2y ,其列联表为:则表中a ,b 的值分别是( ) A .94,96 B .54,52C .52,50D .52,60【答案】D【详解】根据列联表知,=732152a -=,又8a b +=,所以60b =, 故选:D举一反三下列是关于出生男婴与女婴调查的22⨯列联表那么D __________.【答案】82【详解】解:由题意,4598E +=,35A D +=,45A B +=,35E C +=,180B C +=47A ∴=,92B =,88C =,82D =,53E =故答案为: 82.题型二:等高条形图例2:为了解户籍性别对生育二胎选择倾向的影响,某地从育龄人群中随机抽取了容量为100的调查样本,其中城镇户籍与农村户籍各50人,男性40人,女性60人,绘制不同群体中倾向选择生育二胎与选择不生育二胎的人数比例图(如图所示),其中阴影部分表示倾向选择生育二胎的对应比例,则关于样本下列叙述中正确的是( )A .是否倾向选择生育二胎与户籍无关B .是否倾向选择生育二胎与性别有关C .倾向选择生育二胎的人员中,男性人数与女性人数相同D .倾向选择不生育二胎的人员中,农村户籍人数少于城镇户籍人数 【答案】D【详解】对于A ,城镇户籍中40%选择生育二胎,农村户籍中80%选择生育二胎,相差较大,则是否倾向选择生育二胎与户籍有关,A 错误;对于B ,男性和女性中均有60%选择生育二胎,则是否倾向选择生育二胎与性别无关,B 错误; 对于C ,由于男性和女性中均有60%选择生育二胎,但样本中男性40人,女性60人,则倾向选择生育二胎的人员中,男性人数与女性人数不同,C 错误;对于D ,倾向选择不生育二胎的人员中,农村户籍有5020%10⨯=人,城镇户籍有5060%30⨯=人,农村户籍人数少于城镇户籍人数,D 正确.故选:D.举一反三为了解某高校学生使用手机支付和现金支付的情况,抽取了部分学生作为样本,统计其喜欢的支付方式,并制作出如等高条形图:根据图中的信息,下列结论中不正确的是()A.样本中多数男生喜欢手机支付B.样本中的女生数量少于男生数量C.样本中多数女生喜欢现金支付D.样本中喜欢现金支付的数量少于喜欢手机支付的数量【答案】C【详解】对于A,由右图可知,样本中多数男生喜欢手机支付,A对;对于B,由左图可知,样本中的男生数量多于女生数量,B对;对于C,由右图可知,样本中多数女生喜欢手机支付,C错;对于D,由右图可知,样本中喜欢现金支付的数量少于喜欢手机支付的数量,D对.故选:C.题型三:独立性检验的概念及计算例3:(2022·湖北武汉·模拟预测)通过随机询问某中学110名中学生是否爱好跳绳,得到如下列联表:跳绳性别合计男女爱好40 20 60 不爱好20 30 50已知()()()()()22n ad bcKa b c d a c b d-=++++,则以下结论正确的是()A.根据小概率值0.001α=的独立性检验,爱好跳绳与性别无关B.根据小概率值0.001α=的独立性检验,爱好跳绳与性别无关,这个结论犯错误的概率不超过0.001 C.根据小概率值0.01α=的独立性检验,有99%以上的把握认为“爱好跳绳与性别无关”D.根据小概率值0.01α=的独立性检验,在犯错误的概率不超过1%的前提下,认为“爱好跳绳与性别无关”【答案】A【详解】由题知()()()()()22 2110(40302020)7.82260506050n ad bcKa b c d a c b d-⨯-⨯==≈++++⨯⨯⨯因为7.82210.828<,所以爱好跳绳与性别无关且这个结论犯错误的概率超过0.001,故A正确,B错误,又因为7.822 6.635>,所以有99%以上的把握认为“爱好跳绳与性别有关,或在犯错误的概率不超过1%的前提下,认为“爱好跳绳与性别有关.故C和D错误.故选:A.举一反三1.(2022·江西南昌·一模(理))根据分类变量x与y的观察数据,计算得到2 2.974K=,依据下表给出的2K 独立性检验中的小概率值和相应的临界值,作出下列判断,正确的是()A.有95%的把握认为变量x与y独立B.有95%的把握认为变量x与y不独立C.变量x与y独立,这个结论犯错误的概率不超过10%D.变量x与y不独立,这个结论犯错误的概率不超过10%【答案】D【详解】因为2 2.974 2.706K=>,所以变量x与y不相互独立,这个结论犯错误的概率不超过10%.故选:D 2.(2022·四川雅安·三模(文))为考察一种新药预防疾病的效果,某科研小组进行动物实验,收集整理数据后将所得结果填入相应的22K≈.参照附表,下列结论正确⨯列联表中,由列联表中的数据计算得29.616的是()附表:A.在犯错误的概率不超过0.1%的前提下,认为“药物有效”B.在犯错误的概率不超过0.1%的前提下,认为“药物无效”C.有99%以上的把握认为“药物有效”D.有99%以上的把握认为“药物无效”【答案】C解:因为29.616<<,所以有99%以上的把握认为“药物有效”.K7.87910.828K≈,即2故选:C.题型四:独立性检验的基本思想例4:(2022·江西·二模(文))千百年来,我国劳动人民在生产实践中根据云的形状、走向速度、厚度、颜色等的变化,总结了丰富的“看云识天气”的经验,并将这些经验编成谚语,如“天上钩销云,地上雨淋林”“日落云里走,雨在半夜后”……小明同学为了验证“日落云里走,雨在半夜后”,观察了所在地区A的100天日落和夜晚天气,得到如下22⨯列联表:并计算得到219.05K=,下列小明对地区天气判断正确的是()A.夜晚下雨的概率约为1 5B.未出现“日落云里走”,但夜晚下雨的概率约为12C.出现“日落云里走”,有99.9%的把握认为夜晚会下雨D.有99.9%的把握认为“‘日落云里走’是否出现”与“当晚是否下雨”有关【答案】D【详解】根据表中数据可知,夜晚下雨的概率约为252511002P+==,所以A错.未出现“日落云里走”,但夜晚下雨的概率约为255254514P==+,故B错.219.0510.828K=>,对照临界值表可知,有99.9%的把握认为“‘日落云里走’是否出现”与“当晚是否下雨”有关,但不能说有99.9%的把握认为夜晚会下雨,故C错,D对.故选:D举一反三(2022·安徽省芜湖市教育局模拟预测(理))为了检验某种血清预防感冒的作用,把500名使用血清的人与另外500名未使用血清的人一年中的感冒记录作比较,提出假设0H :“这种血清不能起到预防感冒的作用”,利用22⨯列联表计算的结果,认为0H 成立的可能性不足1%,那么2K 的一个可能取值为( )A .7.879B .6.635C .5.024D .3.841【答案】A【详解】若0H 成立的可能性不足1%,则2 6.635K >,由选项知:27.879K =. 故选:A.题型五:独立性检验解决实际问题例5:(2022·全国·高考真题)一医疗团队为研究某地的一种地方性疾病与当地居民的卫生习惯(卫生习惯分为良好和不够良好两类)的关系,在已患该疾病的病例中随机调查了100例(称为病例组),同时在未患该疾病的人群中随机调查了100人(称为对照组),得到如下数据:(1)能否有99%的把握认为患该疾病群体与未患该疾病群体的卫生习惯有差异?(2)从该地的人群中任选一人,A 表示事件“选到的人卫生习惯不够良好”,B 表示事件“选到的人患有该疾病”.(|)(|)P B A P B A 与(|)(|)P B A P B A 的比值是卫生习惯不够良好对患该疾病风险程度的一项度量指标,记该指标为R .(ⅰ)证明:(|)(|)(|)(|)P A B P A B R P A B P A B =⋅;(ⅱ)利用该调查数据,给出(|),(|)P A B P A B 的估计值,并利用(ⅰ)的结果给出R 的估计值.附22()()()()()n ad bc K a b c d a c b d -=++++,【解析】(1)由已知222()200(40906010)=24()()()()50150100100n ad bc K a b c d a c b d -⨯-⨯==++++⨯⨯⨯, 又2( 6.635)=0.01P K ≥,24 6.635>,所以有99%的把握认为患该疾病群体与未患该疾病群体的卫生习惯有差异. (2)(i)因为(|)(|)()()()()=(|)(|)()()()()P B A P B A P AB P A P AB P A R P B A P B A P A P AB P A P AB =⋅⋅⋅⋅,所以()()()()()()()()P AB P B P AB P B R P B P AB P B P AB =⋅⋅⋅ 所以(|)(|)(|)(|)P A B P A B R P A B P A B =⋅,(ii) 由已知40(|)100P A B =,10(|)100P A B =,又60(|)100P A B =,90(|)100P A B =, 所以(|)(|)=6(|)(|)P A B P A B R P A B P A B =⋅举一反三(2021·全国·高考真题(文))甲、乙两台机床生产同种产品,产品按质量分为一级品和二级品,为了比较两台机床产品的质量,分别用两台机床各生产了200件产品,产品的质量情况统计如下表:(1)甲机床、乙机床生产的产品中一级品的频率分别是多少?(2)能否有99%的把握认为甲机床的产品质量与乙机床的产品质量有差异?附:22()()()()()n ad bcKa b c d a c b d-=++++【详解】(1)甲机床生产的产品中的一级品的频率为15075% 200=,乙机床生产的产品中的一级品的频率为12060% 200=.(2)()22400150801205040010 6.63527013020020039K⨯-⨯==>>⨯⨯⨯,故能有99%的把握认为甲机床的产品与乙机床的产品质量有差异.精练巩固提升一、单选题1.(2022·全国·模拟预测)某初级中学有700名学生,在2021年秋季运动会中,为响应全民健身运动的号召,要求每名学生都必须在“立定跳远”与“坐位体前屈”中选择一项参加比赛.根据报名结果知道,有12的男生选择“立定跳远”,有34的女生选择“坐位体前屈”,且选择“立定跳远”的学生中女生占25,则参照附表,下列结论正确的是()附:()()()()()22n ad bc K a b c d a c b d -=++++,n =a +b +c +d .A .在犯错误的概率不超过2.5%的前提下,认为选择运动项目与性别无关B .在犯错误的概率不超过5%的前提下,认为选择运动项目与性别无关C .有97.5%的把握认为选择运动项目与性别有关D .有95%的把握认为选择运动项目与性别有关【答案】C 【详解】解:由题意得:设该校男生人数为x ,女生人数为y ,则可得如下表格:由题意知12411524y x y =+,即43y x =,又x +y =700,解得300,400,x y =⎧⎨=⎩则()2270015030015010046.67 5.024300400250450K ⨯⨯-⨯=≈>⨯⨯⨯,所以有97.5%的把握认为选择运动项目与性别有关.故选C . 2.(2022·四川成都·三模(理))在某大学一食品超市,随机询问了70名不同性别的大学生在购买食物时是否查看营养说明,得到如下的列联表:附:()()()()()22n ad bcKa b c d a c b d-=++++,其中n a b c d=+++.根据列联表的独立性检验,则下列说法正确的是().A.在犯错误的概率不超过0.05的前提下认为该校大学生在购买食物时要查看营养说明的人数中男生人数更多B.在犯错误的概率不超过0.010的前提下认为该校女大学生在购买食物时要查看营养说明的人数与不查看营养说明的人数比为3 4C.在犯错误的概率不超过0.025的前提下认为性别与是否查看营养说明有关系D.在犯错误的概率不超过0.010的前提下认为性别与是否查看营养说明有关系【答案】C【详解】由题可得2270(15102025)= 5.83 5.02435353040K⨯⨯-⨯≈>⨯⨯⨯,∴在犯错误的概率不超过0.025的前提下认为性别与是否查看营养说明有关系.故选:C.3.(2021·全国·模拟预测(理))为了丰富教职工业余文化生活,某校计划在假期组织70名老师外出旅游,并给出了两种方案(方案一和方案二),每位老师均选择且只选择一种方案,其中有50%的男老师选择方案一,有75%的女老师选择方案二,且选择方案一的老师中女老师占40%,则参照附表,得到的正确结论是( )附:()()()()()22n ad bc K a b c d a c b d -=++++,n a b c d =+++.A .在犯错误的概率不超过2.5%的前提下,认为“选择方案与性别有关”B .在犯错误的概率不超过2.5%的前提下,认为“选择方案与性别无关”C .有95%以上的把握认为“选择方案与性别有关”D .有95%以上的把握认为“选择方案与性别无关”【答案】C【详解】设该校男老师的人数为x ,女老师的人数为y ,则可得如下表格:由题意0.40.50.25x y =+,可得43y x =,可得30x =,40y =, 则()227015301510 4.667 3.84125453040K ⨯-⨯=≈>⨯⨯⨯, 但4.667 5.024<,所以无97.5%以上有95%以上的把握认为“选择方案与性别有关”.故选:C.4.(2021·安徽黄山·二模(理))下列命题:①在线性回归模型中,相关指数2R 表示解释变量x 对于预报变量y 的贡献率,2R 越接近于0,表示回归效果越好;②两个变量相关性越强,则相关系数的绝对值就越接近于1;③两个模型中残差平方和越小的模型拟合的效果越好;④对分类变量X 与Y ,它们的随机变量2K 的观测值k 来说,k 越大,“X 与Y 有关系”的把握程度越大. 其中正确命题的个数是( )A .1个B .2个C .3个D .4个【答案】C解:①在线性回归模型中,相关指数2R 表示解释变量x 对于预报变量y 的贡献率,2R 越接近于0,表示回归效果越不好,①错误;②两个变量相关性越强,则相关系数的绝对值就越接近于1,②正确;③两个模型中残差平方和越小的模型拟合的效果越好,③正确;④对分类变量X 与Y ,它们的随机变量2K 的观测值k 来说,k 越大,“X 与Y 有关系”的把握程度越大,④正确.故选:C .5.(2022·河南·长葛市第一高级中学模拟预测(理))某校计划在课外活动中新增攀岩项目,为了解学生喜欢攀岩和性别是否有关,面向全体学生开展了一次随机调查,其中参加调查的男、女生人数相同,并绘制成等高条形图(如图所示),则下列说法正确的是( ) ()20P K k ≥ 0.05 0.010k 3.841 6.635参考公式:()()()()()22n ad bc K a b c d a c b d -=++++,n a b c d =+++.A .参与调查的学生中喜欢攀岩的女生人数比喜欢攀岩的男生人数多B .参与调查的女生中喜欢攀岩的人数比不喜欢攀岩的人数多C .若参与调查的男、女生人数均为100人,则能在犯错误的概率不超过0.01的前提下认为喜欢攀岩和性别有关D .无论参与调查的男、女生人数为多少,都能在犯错误的概率不超过0.01的前提下认为喜欢攀岩和性别有关【答案】C【详解】对于选项A :因为参加调查的男、女生人数相同,而男生中喜欢攀岩的占80%,女生中喜欢攀岩的占30%,所以参与调查的学生中喜欢攀岩的男生人数比喜欢攀岩的女生人数多,所以选项A 错误;对于选项B :参与调查的女生中喜欢攀岩的人数占30%,不喜欢攀岩的人数占70%,所以参与调查的女生中喜欢攀岩的人数比不喜欢攀岩的人数少,所以选项B 错误;对于选项C :若参与调查的男、女生人数均为100人,根据图表,列出2×2列联表如下:所以()2220080702030500050.505 6.6351109010010099K ⨯⨯-⨯==≈>⨯⨯⨯, 所以在犯错误的概率不超过0.01的前提下认为喜欢攀岩和性别有关,C 正确;对于选项D :如果不确定参与调查的男、女生人数,无法计算2K ,D 错误.故选:C .6.(2022·山东聊城·一模)根据分类变量x 与y 的成对样本数据,计算得到2 6.147χ=.依据0.01α=的独立性检验()0.01 6.635x =,结论为( )A .变量x 与y 不独立B .变量x 与y 不独立,这个结论犯错误的概率不超过0.01C .变量x 与y 独立D .变量x 与y 独立,这个结论犯错误的概率不超过0.01【答案】C【详解】按照独立性检验的知识及比对的参数值,当2 6.147χ=,我们可以下结论变量x 与y 独立.故排除选项A,B;依据0.01α=的独立性检验()0.01 6.635x =,6.147<6.635,所以我们不能得到“变量x 与y 独立,这个结论犯错误的概率不超过0.01”这个结论.故C 正确,D 错误.故选:C7.(2022·天津·模拟预测)下列说法错误的是( )A .线性相关系数0r >时,两变量正相关 B .两个随机变量的线性相关性越强,则相关系数r 的值就越接近于1C .在回归直线方程ˆ0.20.8yx =+中,当解释变量x 每增加1个单位时,预报变量ˆy 平增加0.2个单位 D .对分类变量X 与Y ,随机变量2χ的观测值越大,则判断“X 与Y 有关系”的把握程度越大【答案】B【详解】A :线性相关系数0r >时,变量为正相关,正确;B :两个随机变量的线性相关性越强,则相关系数||r 的值就越接近于1,错误;C :在回归直线方程ˆ0.20.8yx =+中,当1x ∆=时,ˆ0.2y ∆=,正确; D :对分类变量X 与Y ,随机变量2χ的观测值越大,变量间的关系把握程度越大,正确.故选:B8.(2020·河南·模拟预测(文))2020年2月,全国掀起了“停课不停学”的热潮,各地教师通过网络直播、微课推送等多种方式来指导学生线上学习.为了调查学生对网络课程的热爱程度,研究人员随机调查了相同数量的男、女学生,发现有80%的男生喜欢网络课程,有40%的女生不喜欢网络课程,且有99%的把握但没有99.9%的把握认为是否喜欢网络课程与性别有关,则被调查的男、女学生总数量可能为( )附:()()()()()2n ad bc a b c d a c b d -++++,其中n a b c d =+++.A .130B .190C .240D .250【答案】B 【解析】【分析】设男、女学生的人数都为5x ,则男、女学生的总人数为10x ,建立22⨯列联表,由独立性检验算出2K ,结合观测值和选项可得答案.【详解】依题意,设男、女学生的人数都为5x ,则男、女学生的总人数为10x ,建立22⨯列联表如下,故()2222108310553721⋅-==⋅⋅⋅x x x x K x x x x ,由题意可得106.63510.82821x <<, 所以139.33510227.388x <<,结合选项可知,只有B 符合题意.故选:B.二、多选题9.(2021·福建福州·一模)“一粥一饭,当思来之不易”,道理虽简单,但每年我国还是有2000多亿元的餐桌浪费,被倒掉的食物相当于2亿多人一年的口粮.为营造“节约光荣,浪费可耻”的氛围,某市发起了“光盘行动”.某机构为调研民众对“光盘行动”的认可情况,在某大型餐厅中随机调查了90位来店就餐的客人,制成如下所示的列联表,通过计算得到K 2的观测值为已知()2 6.6350.010P K =,()210.8280.001P K =,则下列判断正确的是( )A .在该餐厅用餐的客人中大约有66.7%的客人认可“光盘行动”B .在该餐厅用餐的客人中大约有99%的客人认可“光盘行动”C .有99%的把握认为“光盘行动”的认可情况与年龄有关D .在犯错误的概率不超过0.001的前提下,认为“光盘行动”的认可情况与年龄有关【答案】AC【详解】∵K 2的观测值为9,且P (K 2≥6.635)=0.010,P (K 2≥10.828)=0.001,又∵9>6.635,但9<10.828,∴有99%的把握认为“光盘行动”的认可情况与年龄有关,或者说,在犯错误的概率不超过0.010的前提下,认为“光盘行动”的认可情况与年龄有关,所以选项C 正确,选项D 错误,由表可知认可“光盘行动”的人数为60人,所以在该餐厅用餐的客人中认可“光盘行动”的比例为6010090⨯%≈66.7%, 故选项A 正确,选项B 错误.故选:AC.10.(2022·湖南岳阳·三模)下列说法正确的是( )A .线性回归方程y bx a =+必过(,)x yB .设具有线性相关关系的两个变量x ,y 的相关系数为r ,则r 越接近于0,x 和y 之间的线性相关程度越强C .在一个22⨯列联表中,由计算得2K 的值,则2K 的值越小,判断两个变量有关的把握越大D .若()2~1,X N σ,()20.2P X >=,则()010.3P X <<= 【答案】AD【详解】因为线性回归方程y bx a =+必过样本中心点(,)x y ,所以选项A 正确; 因为r 越接近于0,x 和y 之间的线性相关程度越弱,所以选项B 不正确;因为2K 的值越小,确定两个变量有关的把握的程度越小,所以选项C 不正确;因为()2~1,X N σ,所以()()()1011220.32P X P X P X <<=<<=->=,因此选项D 正确,故选:AD 三、填空题11.(2020·宁夏·固原一中模拟预测(文))在独立性检验中,统计量K 2有两个临界值:3.841和6.635.当K 2>3.841时,有95%的把握说明两个事件有关,当K 2>6.635时,有99%的把握说明两个事件有关,当K 2≤3.841时,认为两个事件无关.在一项打鼾与患心脏病的调查中,共调查了2000人,经计算K 2=20.87.根据这一数据分析,我们有理由认为打鼾与患心脏病之间是________的(有关、无关).【答案】有关【详解】K 2=20.87>6.635时,有99%的把握说明打鼾与患心脏病有关.故答案为:有关12.(2022·全国·模拟预测)某大学为了解喜欢看篮球赛是否与性别有关,随机调查了部分学生,在被调查的学生中,男生人数是女生人数的2倍,男生喜欢看篮球赛的人数占男生人数的56,女生喜欢看篮球赛的人数占女生人数的13.若被调查的男生人数为n ,且有95%的把握认为喜欢看篮球赛与性别有关,则n 的最小值为______.【答案】12【详解】由题意得到如下列联表:所以2235263663822n n n n n n n n n n χ⎛⎫⋅-⋅⎪ ⎭⎝==⋅⋅⋅. 因为有95%的把握认为喜欢看篮球赛与性别有关,所以2 3.841χ≥,即3 3.8418n ≥, 3.841810.243n ⨯≥≈. 又2n ,3n ,6n 为整数,所以n 的最小值为12.故答案为:12 13.(2020·山西·大同一中模拟预测(理))某班主任对全班30名男生进行了作业量多少的调查,数据如下表:该班主任据此推断男生认为作业多与喜欢玩电脑游戏有关系,则这种推断犯错误的概率不超过________. 附表及公式:参考公式:K 2=2()()()()()n ad bc a b c d a c b d -++++. 【答案】0.05【详解】计算得K 2的观测值k =230(12828)14162010⨯⨯-⨯⨯⨯⨯≈4.286>3.841,则推断犯错误的概率不超过0.05.故答案为:0.05.14.(2022·辽宁葫芦岛·二模(理))下列说法:①线性回归方程y bx a =+必过(),x y ;②命题“21,34x x ∀≥+≥”的否定是“21,34x x ∃<+<”③相关系数r 越小,表明两个变量相关性越弱;④在一个22⨯列联表中,由计算得28.079K =,则有99%的把握认为这两个变量间有关系;其中正确..的说法是__________.(把你认为正确的结论都写在横线上) 本题可参考独立性检验临界值表: 【答案】①④详解:线性回归方程ˆˆˆybx a =+必过样本中心点(),x y ,故①正确. 命题“21,34x x ∀≥+≥”的否定是“21,34x x ∃≥+<” 故②错误③相关系数r 绝对值越小,表明两个变量相关性越弱,故不正确;④在一个22⨯列联表中,由计算得28.079K =,则有99%的把握认为这两个变量间有关系,正确.故答案为①④.四、解答题15.(2022·全国·高考真题(文))甲、乙两城之间的长途客车均由A 和B 两家公司运营,为了解这两家公司长途客车的运行情况,随机调查了甲、乙两城之间的500个班次,得到下面列联表:(1)根据上表,分别估计这两家公司甲、乙两城之间的长途客车准点的概率;(2)能否有90%的把握认为甲、乙两城之间的长途客车是否准点与客车所属公司有关?附:22()()()()()n ad bcKa b c d a c b d-=++++,()2P K k0.100 0.050 0.010k 2.706 3.841 6.635【解析】(1)根据表中数据,A共有班次260次,准点班次有240次,设A家公司长途客车准点事件为M,则24012 ()26013==P M;B共有班次240次,准点班次有210次,设B家公司长途客车准点事件为N,则210()27840==P N.A家公司长途客车准点的概率为12 13;B家公司长途客车准点的概率为7 8 .(2)列联表22()()()()()n ad bc K a b c d a c b d -=++++=2500(2403021020) 3.205 2.70626024045050⨯⨯-⨯≈>⨯⨯⨯, 根据临界值表可知,有90%的把握认为甲、乙两城之间的长途客车是否准点与客车所属公司有关. 16.(2020·全国·高考真题(文))某学生兴趣小组随机调查了某市100天中每天的空气质量等级和当天到某公园锻炼的人次,整理数据得到下表(单位:天):(1)分别估计该市一天的空气质量等级为1,2,3,4的概率;(2)求一天中到该公园锻炼的平均人次的估计值(同一组中的数据用该组区间的中点值为代表);(3)若某天的空气质量等级为1或2,则称这天“空气质量好”;若某天的空气质量等级为3或4,则称这天“空气质量不好”.根据所给数据,完成下面的2×2列联表,并根据列联表,判断是否有95%的把握认为一天中到该公园锻炼的人次与该市当天的空气质量有关?附:22()()()()()n ad bcKa b c d a c b d-=++++,【详解】(1)由频数分布表可知,该市一天的空气质量等级为1的概率为216250.43100++=,等级为2的概率为510120.27100++=,等级为3的概率为6780.21100++=,等级为4的概率为7200.09100++=;(2)由频数分布表可知,一天中到该公园锻炼的人次的平均数为100203003550045350100⨯+⨯+⨯=(3)22⨯列联表如下:()221003383722 5.820 3.84155457030K ⨯⨯-⨯=≈>⨯⨯⨯, 因此,有95%的把握认为一天中到该公园锻炼的人次与该市当天的空气质量有关.。

列联表资料的X2检验

列联表资料的X2检验
(3)对于有序的R*C表资料不宜用X2检验
(五)、交叉分类2*2表的关联分析
1、 X2检验 2、列联系数r
(六)、2*2配对资料的关联性分析
1、 X2检验 注意与配对资料的四格表X2 检验(McNemar检验)不一样,是四格表 资料X2检验基本的公式
2、列联系数r
(七总体率(或构成比)
之间有无差别;两种属性的关联性(计
数资料的相关性分析)
• 4、方法:
⑴、专用公式。每一格的T值均>5且n>40;
P104,式(7-1);P105,式(7-4)
⑵、校正公式。有一格的T值<5且n>40;
P106,式(7-5);P106,式(7-6) ⑶、确切概率法。T<1或n<40时不计算X2值
(一)列联表资料的X2检验
列联表是按两种属性分类的一种频 数数据表。(表内数据为实际频数) 分类:交叉分类表
多组分类表
• 交叉分类:是以一个总体抽样后,按两种属性搭配 的类确定其个体数目而得。它需检验的是两种属性 是否独立(即计数资料的相关性或关联性)
• 多组分类:从多个总体(可视为属性X)分别抽样 后,按另一类属性Y的类确定其个体数目而得。它 需检验的是各总体按同一属性Y的类的分布概率是 否相同。
1、 X2检验 2、列联系数r
(八) 多个样本率比较的X2分割法
1、用途:当多个样本率比较的行*列表X2检验, 推论结论为拒绝,接受时,只能认为各总体之 间总的来说有差别,需要对每两个总体率之间 有无差别作出判断。其分析方法之一就是X2分 割法。
2、基本思想:
将2*k表(X2)分割成多个独立的四格表(X2) (其原理是X2分布 的可加性),并进行两两比 较。要求必须重新规定检验水准,其目的是为 保证检验假设中的第一类错误α 的概率不变

列联表的独立性检验

列联表的独立性检验

拒绝域形式Q2 c.
因为ˆi
ni n
,ˆ j
n j n
.
r
Q2
s
nij
nin j n
2
r
s
2
nnij nin j
i1 j1
nin j
i1 j1
nnin j
如果H0成立,Qn2渐近服从自由度为(r -1() s -1)
的 2分布.
例1 随机抽取某校男生35名,女生31,进行
体育达标考核,结果如下表 问体育达标水平是
2.5 列联表的独立检验
一、二维r 列s联表
设A, B为两个定性变量,A有r个不同水平(A1,A2 , Ar ),
B有s个不同水平(B1,B2 , Bs ).观测n次, 各水平组合(Ai ,Bj )
出现频数为nij. 列表如下: 二维 r s 列联表
s
令:ni nij j 1
A
B B1,
B2 ,
著的差异.
即有 n11 n21
n1 n2+
如果p1 p2, 表示有属性A的个体中有属性B的比例高
即
n11 n1
n21 n2+
如果p1 p2,表示有属性A的个体中有属性B的比例低
即
n11 n21
n1 n2+
四表格的检验问题, 即属性A和B的独立性检验问题有
(1) H0 : p1=p2, H1 : p1 p2 (2) H0 : p1=p2, H1 : p1 p2 (3) H0 : p1=p2, H1 : p1 p2
X-squared = 0.0057, df = 1, p-value = 0.9397 因此在0.05显著性水平下,接受原假设.

卡方检验和列联表的关系

卡方检验和列联表的关系

卡方检验和列联表的关系
卡方检验和列联表是统计学中常用的两种分析方法,它们之间有着密切的关系。

在列联表中,我们将两个或多个变量的分布情况通过表格的形式展示出来,从而得到它们之间的关系。

而卡方检验则是用来检验这些关系是否显著的方法。

卡方检验的基本思想是比较实际观察值和理论期望值之间的差异,从而判断它们之间是否有显著的关系。

而在列联表中,我们可以通过计算每个单元格的理论期望值来进行卡方检验。

具体地,我们可以根据列联表中的边际分布情况和总体比例来计算每个单元格的理论期望值。

然后,我们可以通过将每个单元格的实际观察值和理论期望值之间的差异进行平方,并将其除以理论期望值来得到卡方值。

最后,我们可以利用卡方分布表来确定卡方值的显著性水平,从而判断两个变量之间的关系是否显著。

总之,卡方检验和列联表是密切相关的两种方法,它们可以互相支持和补充。

通过利用列联表来展示变量之间的关系,我们可以进一步使用卡方检验来判断这些关系是否显著,从而更加深入地分析数据。

- 1 -。

列联表与独立性检验-高考数学复习

列联表与独立性检验-高考数学复习
=28.
目录
高中总复习·数学
5. (2024·南通模拟)已知变量 X , Y ,由它们的样本数据计算得到
χ2≈4.328,χ2的部分临界值表如下:
α
0.10
0.05
0.025
0.010
0.005
xα
2.706
3.841
5.024
6.635
7.879
则最大有
95% 的把握说变量 X , Y 有关系(填百分数).
工作,会务组选聘了50名记者担任对外翻译工作,下表为“性别与
会俄语”的2×2列联表,则 a - b + d =
性别
28 .
是否会俄语
会俄语
不会俄语
男
a
b
女
6
d
合计
18
⁠
合计
20
50
目录
高中总复习·数学
解析:由2×2列联表得 a +6=18,所以 a =12,因为 a + b =20,所
以 b =8,因为6+ d =30,所以 d =24,所以 a - b + d =12-8+24
饮用水
是否得病
合计
得病
不得病
干净水
52
466
518
不干净水
94
218
312
合计
146
684
830
目录
高中总复习·数学
(1)这种传染病是否与饮用水的卫生程度有关?请说明理由;
解:零假设为 H 0:这种传染病与饮用水的卫生程度无关.
2
830×
(
52×218−466×94
)
12 =
≈54.21>10.828= x 0.001,

4x4列联表卡方检验步骤 概述及解释说明

4x4列联表卡方检验步骤概述及解释说明1. 引言1.1 概述本篇文章旨在介绍和解释4x4列联表卡方检验步骤。

通过对列联表和卡方检验原理的简要概述,我们将详细探讨如何进行4x4列联表卡方检验,并解释各个步骤的含义与目的。

1.2 文章结构本文将按照以下顺序来展开对4x4列联表卡方检验步骤的概述及解释说明:- 引言部分将提供整篇文章的概览,并阐明本文的目的。

- 第2部分将介绍列联表的基本概念,使读者了解什么是列联表及其在数据分析中的应用。

- 接下来,第3部分将对卡方检验原理进行简要介绍,帮助读者理解该统计方法背后的原理及意义。

- 第4部分将详细解释进行4x4列联表卡方检验所需的步骤,包括计算和推导过程。

- 在随后的三个部分(第5部分、第6部分和第7部分),我们将重点介绍该主题下涉及到的三个重要要点,并给出相关子要点以支持我们对这些要点的深入讨论。

- 最后,在结论部分,我们将对前文进行总结,并提供对于4x4列联表卡方检验步骤的应用价值以及未来研究方向的一些观点和建议。

1.3 目的本文的目的是介绍和解释4x4列联表卡方检验步骤。

通过对该统计方法背后的原理、计算过程以及相关要点和子要点的详细阐述,读者将能够全面了解并掌握如何进行4x4列联表卡方检验。

此外,本文还旨在提供给读者一个应用场景下实施该统计方法的指南,并挖掘其在实际数据分析中可能存在的局限性。

希望本文能为读者提供有益而全面的知识,并促进对于该领域的深入研究与讨论。

2. 4x4列联表卡方检验步骤概述及解释说明:2.1 列联表介绍:列联表是一种用于比较两个变量之间关系的交叉分析方法。

它将两个分类变量交叉组合形成一个二维表格,并显示出各个分类变量之间的关系。

在4x4列联表中,有四行和四列,每个单元格表示了两个分类变量之间的交叉频数。

2.2 卡方检验原理简介:卡方检验是一种统计方法,用于确定观察到的频数与期望频数之间是否存在显著差异。

通过比较实际观察到的频数和预期的频数,来判断两个分类变量是否存在相关性。

列联表卡方检验的统计检验力表

列联表卡方检验的统计检验力表1. 介绍列联表卡方检验(chi-square test)是一种用于检验两个或多个分类变量之间是否存在关联的统计方法。

通过比较观察到的频数与预期频数之间的差异,来判断两个变量之间是否存在显著关联。

统计检验力表则是用来帮助我们解释和解读卡方检验结果的工具,它显示了不同样本量和效应大小下,卡方检验的统计检验力。

2. 统计检验力的意义统计检验力(statistical power)是指在给定的显著性水平下,能够正确地拒绝原假设的能力。

它通常取值为0到1之间,值越接近1,说明检验的能力越强。

检验力取决于样本量的大小、效应大小以及显著性水平的选择。

统计检验力表提供了在不同条件下检验力的数值,可以帮助我们了解和评估统计检验的可靠性和稳定性。

3. 检验力表的结构统计检验力表通常由一个二维表格组成,纵轴表示样本量的大小,横轴表示效应大小。

表格中的每个单元格都标示了在给定样本量和效应大小情况下的统计检验力数值。

通常,表格中的数值越大,表示检验的能力越强。

4. 不同样本量下的统计检验力4.1 小样本量在小样本量下进行卡方检验时,统计检验力通常较低。

这是因为小样本量对于检测出显著差异的能力较弱,易产生虚假的负向结果(即未能拒绝原假设)。

因此,在设计研究时需要尽量选择足够大的样本量,以增加检验的可靠性。

4.2 中等样本量在中等样本量下进行卡方检验时,统计检验力通常较高。

这意味着检验的能力较强,能够较好地检测出真实存在的差异。

中等样本量在实际研究中较为常见,因此在使用卡方检验时,如果能够控制好样本量的选择,将能够获得较为可靠和准确的结果。

4.3 大样本量在大样本量下进行卡方检验时,统计检验力通常接近1。

这意味着我们可以非常确信对于样本所代表的总体来说,所观察到的差异是真实存在的。

大样本量的优势在于能够更好地检测到小的效应和低频事件,同时可以降低虚假阳性的产生。

5. 不同效应大小下的统计检验力5.1 小效应大小在小效应大小下,即两个变量之间的关联较弱时,统计检验力可能较低。

第10章 列联表检验

第10章列联表检验•2x2 列联表•Fisher精确检验•r x s 列联表•Ridit检验Is the proportion of girls in Peking University significantly larger than that of Tsinghua?N B N GN B N GTests of two proportionsProtocol0101Let Populatoin and Population in a contingency have Bernoulli () and Bernoulli () distributions, respectively.We like to test(1): versus :;(2): versus :X Y X Y X Y X Y X Y X Y p p H p p H p p H p p H p p =>=<01;(3): versus :.X Y X Y H p p H p p =¹Tests of two proportions Contingency table统计量构造•设总体1中属于类别1的个数为x1, 总体2中, 按照二项分布有属于类别1的个数为x2•在零假设下,由于x1和x2独立,则联合分布为统计量构造•在H0下统计量构造•大样本近似•故构造统计量固定时,一个格Fisher精确检验•在H0下,x的分布由超几何分布给出,•这个分布可以由二项分布的条件概率给出Fisher精确检验•表格出现的联合概率•列总和也服从二项分布•于是固定列和下的条件概率为大样本计算•对超几何分布计算均值和方差•于是可以定义统计量Conditional on a sufficientstatisticConditional on a sufficient statistic to define a p-value1Let () be a test statistic such that values of give evidence that is true. Let () be a sufficient statistic for the parameter . For each sample point , define()(W W H S p P q =X large X under the null model x x ()()|()).Then, () is a valid -value.W W S S p p ³=X x x XFisher’s exact test11Since is a sufficient statistic for and is a sufficient statistic for , we can make the decision with the use of only and .Obviously, has a binomial (, ) distrib XXn n X i X Y ii i Y X Y X X X S X p S Y p S S S n p ====åå()()ution and has a binomial (, ) distribution. When (),the joint pmf of (,) is(,|,,)(1),which suggests X Y X Y X Y Y Y Y X Y X Y s s n n s s X Y X Y X Y X Y S n p p p p S S n n f s s n n p p p s s ++-+==æöæö÷÷çç÷÷=-çç÷÷çç÷÷ççèøèøthe null is true that is a sufficient statistic for under the null hypothesis.X Y S S S p =+rxs列联表齐次性检验•检验问题:不同总体内各类的比例是否一致,即所谓的齐次性问题•统计量构造:如果各总体没有差异,则每个类比例的估计为, 于是对于格子ij,期望频数rxs列联表齐次性检验•由拟合优度检验统计量构造,我们可以构造如下Pearson 卡方统计量•可以证明,在大样本情形下有rxs列联表独立性检验•如果把列联表看成是两个随机变量不同取值的样本量•检验问题rxs列联表独立性检验•在H0下,每个格子的期望值•同样可以构造Pearson 卡方统计量Ridit检验•Ridit是Relative to identified distribution的缩写,中文翻译成“参照单位分析法”•在上面的列联表中,列变量B为顺序尺度变量(比如评价药物治疗效果可以有:无效,基本有效, 有效,效果非常好), A为不同的总体。

教学设计1:§8.3 列联表与独立性检验

§8.3列联表与独立性检验教学目标1.通过实例,理解2×2列联表的统计意义.2.通过实例,了解2×2列联表独立性检验及其应用.教学知识梳理知识点一分类变量为了表述方便,我们经常会使用一种特殊的随机变量,以区别不同的现象或性质,这类随机变量称为分类变量.分类变量的取值可以用实数表示.知识点二2×2列联表1.2×2列联表给出了成对分类变量数据的交叉分类频数.2.定义一对分类变量X和Y,我们整理数据如下表所示:知识点三独立性检验1.定义:利用χ2的取值推断分类变量X和Y是否独立的方法称为χ2独立性检验,读作“卡方独立性检验”.简称独立性检验.2.χ2=n(ad-bc)2(a+b)(c+d)(a+c)(b+d),其中n=a+b+c+d.3.独立性检验解决实际问题的主要环节(1)提出零假设H0:X和Y相互独立,并给出在问题中的解释.(2)根据抽样数据整理出2×2列联表,计算χ2的值,并与临界值xα比较.(3)根据检验规则得出推断结论.(4)在X和Y不独立的情况下,根据需要,通过比较相应的频率,分析X和Y间的影响规律.思考独立性检验与反证法的思想类似,那么独立性检验是反证法吗?答案不是.因为反证法不会出错,而独立性检验依据的是小概率事件几乎不发生.教学案例案例一等高堆积条形图的应用例1.某学校对高三学生作了一项调查发现:在平时的模拟考试中,性格内向的学生426人中有332人在考前心情紧张,性格外向的学生594人中有213人在考前心情紧张,作出等高条形图,利用图形判断考前心情紧张与性格类型是否有关系.解:作列联表如下:性格内向 性格外向 总计 考前心情紧张 332 213 545 考前心情不紧张94 381 475 总计4265941020相应的等高条形图如图所示:图中阴影部分表示考前心情紧张与考前心情不紧张中性格内向的人数的比例,从图中可以看出考前心情紧张的样本中性格内向的人数占的比例比考前心情不紧张样本中性格内向的人数占的比例高,可以认为考前紧张与性格类型有关. 反思感悟 等高堆积条形图的优劣点(1)优点:较直观地展示了a a +b 与c c +d的差异性.(2)劣点:不能给出推断“两个分类变量有关系”犯错误的概率.跟踪训练1.为考察某种药物预防疾病的效果进行动物试验,得到如下列联表:药物效果试验列联表患病 未患病 总计 服用药 10 45 55 未服用药 20 30 50 总计3075105解:根据列联表所给的数据可得出服用药患病的频率为1055≈0.18,未服用药患病的频率为2050=0.4,两者的差距是|0.18-0.4|=0.22,两者相差很大,作出等高条形图如图所示,因此服用药与患病之间有关系的程度很大.案例二由χ2进行独立性检验命题角度1有关“相关的检验”例2.海水养殖场进行某水产品的新、旧网箱养殖方法的产量对比,收获时各随机抽取了100 个网箱,测量各箱水产品的产量(单位:kg),其频率分布直方图如下:(1)设两种养殖方法的箱产量相互独立,记A表示事件“旧养殖法的箱产量低于50 kg, 新养殖法的箱产量不低于50 kg”,估计A的概率;(2)填写下面列联表,并根据列联表判断是否有99%的把握认为箱产量与养殖方法有关:箱产量<50 kg箱产量≥50 kg 旧养殖法新养殖法P(χ2≥x0)0.0500.0100.001 x0 3.841 6.63510.828χ2=.(a+b)(c+d)(a+c)(b+d)解:(1)记B表示事件“旧养殖法的箱产量低于50 kg”,C表示事件“新养殖法的箱产量不低于50 kg”.由题意知P(A)=P(BC)=P(B)P(C).旧养殖法的箱产量低于50 kg的频率为(0.012+0.014+0.024+0.034+0.040)×5=0.62,故P(B)的估计值为0.62.新养殖法的箱产量不低于50 kg的频率为(0.068+0.046+0.010+0.008)×5=0.66,故P(C)的估计值为0.66.因此,事件A的概率估计值为0.62×0.66=0.409 2.(2)根据箱产量的频率分布直方图得列联表箱产量<50 kg箱产量≥50 kg旧养殖法 62 38 新养殖法3466χ2=200×(62×66-34×38)2100×100×96×104≈15.705.由于15.705>6.635,故有99%的把握认为箱产量与养殖方法有关. 反思感悟 用χ2进行“相关的检验”步骤 (1)零假设:即先假设两变量间没关系. (2)计算χ2:套用χ2的公式求得χ2值.(3)查临界值:结合所给小概率值α查得相应的临界值x α. (4)下结论:比较χ2与x α的大小,并作出结论.跟踪训练2.吃零食是在中学生中普遍存在的现象,吃零食对中学生的身体发育有诸多不利影响,并影响他们的健康成长.下表是性别与喜欢吃零食的列联表:男 女 合计 喜欢吃零食 5 12 17 不喜欢吃零食40 28 68 合计454085试用等高条形图分析性别与吃零食是否有关系.解:根据列联表所给的数据,可得出男生中喜欢吃零食的频率为545≈0.11,女生中喜欢吃零食的频率为1240=0.3,两者差距是|0.3-0.11|=0.19.两者相差较大,作出等高条形图如图所示,比较图中两个深色的条形可以发现,女生中喜欢吃零食的频率明显高于男生中喜欢吃零食的频率,因此可以认为性别与喜欢吃零食有关系.命题角度2 有关“无关的检验”例3.为了研究学生选报文、理科是否与对外语的兴趣有关,某同学调查了361名高一在校生,调查结果如下:理科对外语有兴趣的有138人,无兴趣的有98人,文科对外语有兴趣的有73人,无兴趣的有52人.试分析学生选报文、理科与对外语的兴趣是否有关? 解:问题是判断学生选报文、理科是否与对外语的兴趣有关.列出2×2列联表如下:由公式得χ2=361×(138×52-73×98)236×125×211×150≈1.871×10-4.因为1.871×10-4<2.706,故可以认为学生选报文、理科与对外语的兴趣无关. 反思感悟 独立性检验解决实际问题的主要环节(1)提出零假设H 0:X 和Y 相互独立,并给出在问题中的解释.(2)根据抽样数据整理出2×2列联表,计算χ2的值,并与临界值x α比较. (3)根据检验规则得出推断结论.(4)在X 和Y 不独立的情况下,根据需要,通过比较相应的频率,分析X 和Y 间的影响规律. 跟踪训练3.下表是某届某校本科志愿报名时,对其中304名学生进入高校时是否知道想学专业的调查表:根据表中数据,则下列说法正确的是________.(填序号) ①性别与知道想学专业有关; ②性别与知道想学专业无关; ③女生比男生更易知道所学专业. 【答案】② 【解析】χ2=304×(63×82-42×117)2180×124×105×199≈0.041≤2.706=x 0.1,所以性别与知道想学专业无关.课堂小结 1.知识清单: (1)分类变量. (2)2×2列联表. (3)等高堆积条形图. (4)独立性检验,χ2公式. 2.方法归纳:数形结合.3.常见误区:对独立性检验的原理不理解,导致不会用χ2分析问题. 随堂检测1.在独立性检验中,假设H 0:变量x 与变量y 没有关系,则在H 0成立的情况下, P (K 2≥6.635)≈0.01表示 ( ) A .变量x 与变量y 有关系的概率是1% B .变量x 与变量y 有关系的概率是99% C .变量x 与变量y 没有关系的概率是0.1% D .变量x 与变量y 没有关系的概率是99.9% 【答案】B【解析】因为P (K 2≥6.635)≈0.01,所以两个变量有关系的可信度是99%,即两个变量有关系的概率是99%.故选B.2.某工厂为了调查工人文化程度与月收入的关系,随机抽取了部分工人,得到如下列联表:文化程度与月收入列联表(单位:人)由上表中数据计算得K 2的观测值k =105×(10×30-20×45)255×50×30×75≈6.109,请估计有多大把握认为“文化程度与月收入有关系”( )A .1%B .99%C .2.5%D .97.5%【答案】D【解析】由于6.109>5.024,故在犯错误的概率不超过0.025的前提下,即有97.5%的把握认为“文化程度与月收入有关系”.3.如图是某地区男女中学生是否喜欢理科的等高条形图,从图中可以看出 ( )A .是否喜欢理科与性别无关B .女生中喜欢理科的百分比约为80%C .男生比女生喜欢理科的可能性大D .男生中不喜欢理科的百分比约为60% 【答案】C【解析】由等高条形图,可知女生中喜欢理科的百分比约为1-0.8=0.2=20%,男生中喜欢理科的百分比约为1-0.4=0.6=60%,因此男生比女生喜欢理科的可能性大.故选C. 4.为了解某班学生喜爱打篮球是否与性别有关,对该班50名学生进行了问卷调查,得到了如下的2×2列联表:则在犯错误的概率不超过________的前提下认为喜爱打篮球与性别有关(请用百分数表示). 【答案】0.5% 【解析】K 2=n (ad -bc )2(a +b )(c +d )(a +c )(b +d )=50×(20×15-5×10)225×25×30×20≈8.333>7.879,所以在犯错误的概率不超过0.005的前提下认为喜爱打篮球与性别有关.5.某校在两个班进行教学方式对比试验,两个月后进行了一次检测,试验班与对照班成绩统计如下表所示(单位:人):(1)求m ,n ;(2)根据表中数据能得到什么结论? 解:(1)m =45-15=30,n =50+50=100. (2)由表中的数据,得χ2=100×(35×30-15×20)250×50×55×45≈9.091.因为9.091>6.635,所以有99%的把握说“教学方式与成绩有关系”.6.某企业有两个分厂生产某种零件,按规定内径尺寸(单位:mm)的值落在[29.94,30.06)的零件为优质品.从两个分厂生产的零件中各抽出了500件,量其内径尺寸,得结果如下表: 甲厂:(1)(2)由以上统计数据填下面2×2列联表,并问是否有99%的把握认为“两个分厂生产的零件的质量有差异”?附χ2=n (n 11n 22-n 12n 21)2n 1+n 2+n +1n +2,解:(1)甲厂抽查的产品中有360件优质品,从而甲厂生产的零件的优质品率估计为360500=72%;乙厂抽查的产品中有320件优质品,从而乙厂生产的零件的优质品率估计为320500=64%.(2)χ2=1 000×(360×180-500×500×680×320≈7.35>6.635,所以有99%的把握认为“两个分厂生产的零件的质量有差异”.。

  1. 1、下载文档前请自行甄别文档内容的完整性,平台不提供额外的编辑、内容补充、找答案等附加服务。
  2. 2、"仅部分预览"的文档,不可在线预览部分如存在完整性等问题,可反馈申请退款(可完整预览的文档不适用该条件!)。
  3. 3、如文档侵犯您的权益,请联系客服反馈,我们会尽快为您处理(人工客服工作时间:9:00-18:30)。
相关文档
最新文档