高考数学总复习专题系列——统计.板块六.回归分析.学生
一.随机抽样
1.随机抽样:满足每个个体被抽到的机会是均等的抽样,共有三种经常采用的随机抽样方法:
⑴简单随机抽样:从元素个数为N 的总体中不放回地抽取容量为n 的样本,如果每一次抽取时总体中的各个个体有相同的可能性被抽到,这种抽样方法叫做简单随机抽样. 抽出办法:①抽签法:用纸片或小球分别标号后抽签的方法.
②随机数表法:随机数表是使用计算器或计算机的应用程序生成随机数的功能生成的一张数表.表中每一位置出现各个数字的可能性相同. 随机数表法是对样本进行编号后,按照一定的规律从随机数表中读数,并取出相应的样本的方法.
简单随机抽样是最简单、最基本的抽样方法.
⑵系统抽样:将总体分成均衡的若干部分,然后按照预先制定的规则,从每一部分抽取一个个体,得到所需要的样本的抽样方法.
抽出办法:从元素个数为N 的总体中抽取容量为n 的样本,如果总体容量能被样本容量整
除,设N
k n
=,先对总体进行编号,号码从1到N ,再从数字1到k 中随机抽取一个数s 作
为起始数,然后顺次抽取第2(1)s k s k s n k +++-L ,,,个数,这样就得到容量为n 的样本.如果总体容量不能被样本容量整除,可随机地从总体中剔除余数,然后再按系统抽样方法进行抽样.
系统抽样适用于大规模的抽样调查,由于抽样间隔相等,又被称为等距抽样.
⑶分层抽样:当总体有明显差别的几部分组成时,要反映总体情况,常采用分层抽样,使总体中各个个体按某种特征分成若干个互不重叠的几部分,每一部分叫做层,在各层中按层在总体中所占比例进行简单随机抽样,这种抽样方法叫做分层抽样.
分层抽样的样本具有较强的代表性,而且各层抽样时,可灵活选用不同的抽样方法,应用广泛.
2.简单随机抽样必须具备下列特点:
⑴简单随机抽样要求被抽取的样本的总体个数N 是有限的. ⑵简单随机样本数n 小于等于样本总体的个数N . ⑶简单随机样本是从总体中逐个抽取的. ⑷简单随机抽样是一种不放回的抽样.
⑸简单随机抽样的每个个体入样的可能性均为n
N
.
3.系统抽样时,当总体个数N 恰好是样本容量n 的整数倍时,取N
k n
=;
若N
n
不是整数时,先从总体中随机地剔除几个个体,使得总体中剩余的个体数能被样本容量n 整除.因为每个个体被剔除的机会相等,因而整个抽样过程中每个个体被抽取的机会仍
知识内容
板块六.回归分析
然相等,为N n
.
二.频率直方图
列出样本数据的频率分布表和频率分布直方图的步骤:
①计算极差:找出数据的最大值与最小值,计算它们的差;
②决定组距与组数:取组距,用极差
组距
决定组数;
③决定分点:决定起点,进行分组;
④列频率分布直方图:对落入各小组的数据累计,算出各小数的频数,除以样本容量,得到各小组的频率.
⑤绘制频率分布直方图:以数据的值为横坐标,以频率
组距
的值为纵坐标绘制直方图,
知小长方形的面积=组距×频率
组距
=频率.
频率分布折线图:将频率分布直方图各个长方形上边的中点用线段连接起来,就得到频率分布折线图,一般把折线图画成与横轴相连,所以横轴左右两端点没有实际意义.
总体密度曲线:样本容量不断增大时,所分组数不断增加,分组的组距不断缩小,频率分布直方图可以用一条光滑曲线()y f x =来描绘,这条光滑曲线就叫做总体密度曲线.总体密度曲线精确地反映了一个总体在各个区域内取值的规律.
三.茎叶图
制作茎叶图的步骤:
①将数据分为“茎”、“叶”两部分;
②将最大茎与最小茎之间的数字按大小顺序排成一列,并画上竖线作为分隔线; ③将各个数据的“叶”在分界线的一侧对应茎处同行列出.
四.统计数据的数字特征
用样本平均数估计总体平均数;用样本标准差估计总体标准差. 数据的离散程序可以用极差、方差或标准差来描述.
极差又叫全距,是一组数据的最大值和最小值之差,反映一组数据的变动幅度; 样本方差描述了一组数据平均数波动的大小,样本的标准差是方差的算术平方根. 一般地,设样本的元素为12n x x x L ,,,样本的平均数为x , 定义样本方差为2222
12()()()n x x x x x x s n
-+-++-=L ,
样本标准差s =简化公式:2222
2121[()]n s x x x nx n
=+++-L .
五.独立性检验
1.两个变量之间的关系;
常见的有两类:一类是确定性的函数关系;另一类是变量间存在关系,但又不具备函数关系所要求的确定性,它们的关系是带有一定随机性的.当一个变量取值一定时,另一个变量的取值带有一定随机性的两个变量之间的关系叫做相关关系.
2.散点图:将样本中的n 个数据点()(12)i i x y i n =L ,
,,,描在平面直角坐标系中,就得到了散点图.
散点图形象地反映了各个数据的密切程度,根据散点图的分布趋势可以直观地判断分析两个
变量的关系.
3.如果当一个变量的值变大时,另一个变量的值也在变大,则这种相关称为正相关;此时,散点图中的点在从左下角到右上角的区域.
反之,一个变量的值变大时,另一个变量的值由大变小,这种相关称为负相关.此时,散点图中的点在从左上角到右下角的区域.
散点图可以判断两个变量之间有没有相关关系.
4.统计假设:如果事件A 与B 独立,这时应该有()()()P AB P A P B =,用字母0H 表示此式,即0:()()()H P AB P A P B =,称之为统计假设. 5.2χ(读作“卡方”)统计量:
统计学中有一个非常有用的统计量,它的表达式为2
2
112212211212
()n n n n n n n n n χ++++-=,用它的大小可以
用来决定是否拒绝原来的统计假设0H .如果2χ的值较大,就拒绝0H ,即认为A 与B 是有关的.
2χ统计量的两个临界值:3.841、6.635;当2 3.841χ>时,有95%的把握说事件A 与B 有关;当2 6.635χ>时,有99%的把握说事件A 与B 有关;当2 3.841χ≤时,认为事件A 与B 是无关的.
独立性检验的基本思想与反证法类似,由结论不成立时推出有利于结论成立的小概率事件发生,而小概率事件在一次试验中通常是不会发生的,所以认为结论在很大程度上是成立的. 1.独立性检验的步骤:统计假设:0H ;列出22?联表;计算2χ统计量;查对临界值表,作出判断.
2.几个临界值:222()0.10( 3.841)0.05( 6.635)0.01P P P χχχ≈≈≈≥2.706,
≥,≥.
22?联表的独立性检验:
如果对于某个群体有两种状态,对于每种状态又有两个情况,这样排成一张22?的表,如下:
状态B 状态B 合计 状态A 11n 12n 1n + 状态A
21n
22n
2n +
1n + 2n +
n
如果有调查得来的四个数据11122122n n n n ,,,,并希望根据这样的4个数据来检验上述的两种
状态A 与B 是否有关,就称之为22?联表的独立性检验.
六.回归分析
1.回归分析:对于具有相关关系的两个变量进行统计分析的方法叫做回归分析,即回归分析就是寻找相关关系中这种非确定关系的某种确定性. 回归直线:如果散点图中的各点都大致分布在一条直线附近,就称这两个变量之间具有线性相关关系,这条直线叫做回归直线. 2.最小二乘法:
记回归直线方程为:?y a bx =+,称为变量Y 对变量x 的回归直线方程,其中a b ,叫做回归
系数.
?y
是为了区分Y 的实际值y ,当x 取值i x 时,变量Y 的相应观察值为i y ,而直线上对应于i x 的纵坐标是?i i y
a bx =+. 设x Y ,的一组观察值为()i i x y ,,12i n =L ,,,,且回归直线方程为?y
a bx =+, 当x 取值i x 时,Y 的相应观察值为i y ,差?(12)i i y y
i n -=L ,,,刻画了实际观察值i y 与回归
直线上相应点的纵坐标之间的偏离程度,称这些值为离差.
我们希望这n 个离差构成的总离差越小越好,这样才能使所找的直线很贴近已知点. 记21()n
i i i Q y a bx ==--∑,回归直线就是所有直线中Q 取最小值的那条.
这种使“离差平方和为最小”的方法,叫做最小二乘法.
用最小二乘法求回归系数a b ,有如下的公式: 1
2
2
1
?n
i i
i n
i
i x y
nxy b
x
nx ==-=-∑∑,??a y bx =-,其中a b ,上方加“^”,表示是由观察值按最小二乘法求得的
回归系数.
3.线性回归模型:将用于估计y 值的线性函数a bx +作为确定性函数;y 的实际值与估计值之间的误差记为ε,称之为随机误差;将y a bx ε=++称为线性回归模型. 产生随机误差的主要原因有:
①所用的确定性函数不恰当即模型近似引起的误差; ②忽略了某些因素的影响,通常这些影响都比较小; ③由于测量工具等原因,存在观测误差. 4.线性回归系数的最佳估计值:
利用最小二乘法可以得到??a
b ,的计算公式为 1
1
2
22
1
1
()()
()()n
n
i
i i
i
i i n
n
i
i
i i x
x y y x y
nxy
b
x
x x
n x ====---==
--∑∑∑∑$,??a y bx =-,其中11n i i x x n ==∑,1
1n
i
i y y n ==∑ 由此得到的直线??y
a bx =+$就称为回归直线,此直线方程即为线性回归方程.其中?a ,
b $分别为a ,b 的估计值,?a
称为回归截距,b $称为回归系数,?y 称为回归值. 5.相关系数:
()()
n
n
i
i i i
x
x y y x y
nx y
r ---=
=
∑∑
6.相关系数r 的性质:
⑴||1r ≤;
⑵||r 越接近于1,x y ,的线性相关程度越强; ⑶||r 越接近于0,x y ,的线性相关程度越弱.
可见,一条回归直线有多大的预测功能,和变量间的相关系数密切相关. 7.转化思想:
根据专业知识或散点图,对某些特殊的非线性关系,选择适当的变量代换,把非线性方程转化为线性回归方程,从而确定未知参数. 8.一些备案 ①回归(regression )一词的来历:“回归”这个词英国统计学家Francils Galton 提出来的.1889年,他在研究祖先与后代的身高之间的关系时发现,身材较高的父母,他们的孩子也较高,但这些孩子的平均身高并没有他们父母的平均身高高;身材较矮的父母,他们的孩子也较矮,但这些孩子的平均身高却比他们父母的平均身高高.Galton 把这种后代的身高向中间值靠近的趋势称为“回归现象”.后来,人们把由一个变量的变化去推测另一个变量的变化的方法称为回归分析.
②回归系数的推导过程:
22222[()]222i i i i i i i i Q y a bx y a y na b x y ab x b x =--=-+-++∑∑∑∑∑∑ 22222()2i i i i i i na a b x y b x b x y y =+-+-+∑∑∑∑∑,
把上式看成a 的二次函数,2a 的系数0n >,
因此当2()2i i i i
b x y y b x a n n --=-=
∑∑∑∑时取最小值. 同理,把Q 的展开式按b 的降幂排列,看成b 的二次函数,当2i i
i
i
x y a x
b x
-=
∑∑∑时取最小值.
解得:1
2
22
1
()()()
n
i i
i
i i n
i
i
i x y
nxy
x x y y b x x x
nx
==---=
=--∑∑∑∑,a y bx =-, 其中1i y y n =
∑,1
i x x n
=∑是样本平均数. 9. 对相关系数r 进行相关性检验的步骤: ①提出统计假设0H :变量x y ,不具有线性相关关系;
②如果以95%的把握作出推断,那么可以根据10.950.05-=与2n -(n 是样本容量)在相关性检验的临界值表中查出一个r 的临界值0.05r (其中10.950.05-=称为检验水平); ③计算样本相关系数r ;
④作出统计推断:若0.05||r r >,则否定0H ,表明有95%的把握认为变量y 与x 之间具有线性相关关系;若0.05||r r ≤,则没有理由拒绝0H ,即就目前数据而言,没有充分理由认为变量y 与x 之间具有线性相关关系. 说明:
⑴对相关系数r 进行显著性检验,一般取检验水平0.05α=,即可靠程度为95%.
⑵这里的r 指的是线性相关系数,r 的绝对值很小,只是说明线性相关程度低,不一定不相关,可能是非线性相关的某种关系.
⑶这里的r 是对抽样数据而言的.有时即使||1r =,两者也不一定是线性相关的.故在统计分析时,不能就数据论数据,要结合实际情况进行合理解释.
题型一 线性相关及回归
【例1】 已知变量y 与x 之间的相关系数是0.872r =-,查表得到相关系数临界值
0.050.482r =,要使可靠性不低于95%,则变量y 与x 之间( )
A .不具有线性相关关系
B .具有线性相关关系
C .线性相关关系还待进一步确定
D .具有确定性关系
【例2】 当相关系数0r =时,表明( )
A 现象之间完全无关
B 相关程度较小
C 现象之间完全相关
D 无直线相关关系
【例3】 下列结论中,能表示变量,x y 具有线性相关关系的是( )
A .0.05r r ≥
B .0.05r r ≤
C .0.05r r >
D .0.05r r <
典例分析
【例4】 下列现象的相关密切程度最高的是( )
A .某商店的职工人数与商品销售额之间的相关系数0.87
B .流通费用水平与利润率之间的相关关系为0.94-
C .商品销售额与利润率之间的相关系数为0.51
D .商品销售额与流通费用水平的相关系数为0.81-
【例5】 在吸烟与患肺病这两个分类变量的计算中,下列说法正确的是( )
①若2χ的值为6.635,我们有99%的把握认为吸烟与患肺病有关系,那么在100个吸烟的人中必有99人患有肺病;
②从独立性检验可知有99%的把握认为吸烟与患肺病有关系时,我们说某人吸烟,那么他有99%的可能患有肺病;
③若从统计量中求出有95%的把握认为吸烟与患肺病有关系,是指有5%的可能性使得判断出现错误;
④以上三种说法都不正确.
【例6】 设两个变量x 和y 之间具有线性相关关系,它们的相关系数是r ,y 关于x 的回归
直线的斜率是b ,纵截距是a ,那么必有( )
A .b 与r 的符号相同
B .a 与r 的符号相同
C .b 与r 的相反
D .a 与r 的符号相反
【例7】 定义:点()i i x y ,
与直线$y bx a =+的“纵向距离”为()i i y bx a -+.已知(00)(01)(11)A B C -,,,,,三点,存在直线l ,使A B C ,,三点到直线l 的“纵向距
离的平方和”Q 最小.
⑴求直线l 的方程和Q 的最小值;
⑵判断点1
(0)3
D ,与直线l 的位置关系.
【例8】 (2009宁夏海南卷理)
对变量x ,y 有观测数据()11x y ,()1210i =L ,
,,,得散点图1;对变量u ,v 有观测数据()11u v ,
()1210i =L ,,,,得散点图2. 由这两个散点图可以判断.
A .变量x 与y 正相关,u 与v 正相关
B .变量x 与y 正相关,u 与v 负相关
C .变量x 与y 负相关,u 与v 正相关
D .变量x 与y 负相关,u 与v 负相
关
【例9】 为了考查两个变量x 和y 之间的线性关系,甲、乙两位同学各自独立做了10次和15
次的试验,
并且利用线性回归方法求得回归直线分别为12l l ,,已知两人得到的试验数据中,
变量x 和y 的数据的平均值都对应相等,那么下列说法正确的是( ) A .直线1l 和2l 一定有交点 B .直线1l 一定平行于直线2l C .直线1l 一定与2l 重合 D .以上都不对
【例10】 某地高校教育经费()x 与高校学生人数()y 连续6年的统计资料如下:
教育经费(万元)x
316 343 373 393 418 455 在校学生(万人)y 11 16 18 20 22 25 试求回归直线方程,估计教育经费为500万元时的在校学生数.
【例11】 一家庭问题研究机构想知道是否夫妻所受的教育越高越不愿生孩子,现随机抽样了
8对夫妻,计算夫妻所受教育的总年数x 与孩子数y ,得结果如下
x 19 17 21 18 15 12 14 20 y
1 3 1
1 2 3 2 1
试求y 对x 回归直线方程.
【例12】某种产品的广告费支出x与销售额y(单位:百万元)之间有如下对应数据:
x24568
y3040605070
⑴画出散点图;⑵求回归直线方程.
【例13】某五星级大饭店的住屋率(%)()x与每天每间客房的成本(元)()y如下:
x100 75 65 55 50
y2000 2500 2800 3200 4000
⑴试求y对x回归直线;
⑵若y的表示不变,x以小数表示(如75%表为0.75),求新的回归直线.
【例14】某兴趣小组欲研究昼夜温差大小与患感冒人数多少之间的关系,他们分别到气象局与某医院抄录了1至6月份每月10号的昼夜温差情况与因患感冒而就诊的人数,得
到如下资料:
该兴趣小组确定的研究方案是:先从这六组数据中选取2组,用剩下的4组数据求
线性回归方程,再用被选取的2组数据进行检验.
⑴若选取的1月与6月的两组数据,请根据2至5月份的数据,求出y关于x的线
性回归方程;
⑵若由线性回归方程得到的估计数据与所选出的检验数据的误差均不超过2人,则
认为得到的线性回归方程是理想的,试问该小组所得线性回归方程是否理想?
【例15】某种产品的产量与单位在成本的资料如下:
产量(千件)x 2 3 4 3 4 5
单位成本(元/件)y73 72 71 73 69 68
试求:
⑴计算相关系数r;
⑵y对x直线回归方程;
⑶指出产量每增加1000件时,单位成本平均下降了多少元?
【例16】求回归直线方程
以下是收集到的某城市的新房屋销售价格y与房屋的大小x的数据:房屋大小x(2
m)80105110115135销售价格y(万元)18.42221.624.829.2
⑴画出数据的散点图;
⑵用最小二乘法求回归直线方程;
⑶估计该城市一个90平米的房屋销售价格大约为多少?
⑷写一个程序,计算出()
Q,的值,再比较大小.
,和(20.2)
Q a b
【例17】(07广东)下表提供了某厂节能降耗技术改造后生产甲产品过程中记录的产量x (吨)与相应的生产能耗y(吨标准煤)的几组对照数据
x 3 4 5 6
y 2.5 3 4 4.5
⑴请画出上表数据的散点图;
⑵请根据上表提供的数据,用最小二乘法求出y关于x的线性回归方程??
y bx a
=+;
⑶已知该厂技改前100吨甲产品的生产能耗为90吨标准煤.试根据(2)求出的
线性回归方程,预测生产100吨甲产品的生产能耗比技改前降低多少吨标准煤?
(参考数值:3 2.543546 4.566.5
?+?+?+?=)
【例18】测定某肉鸡的生长过程,每两周记录一次鸡的重量,数据如下表:
x(周) 2 4 6 8 10 12 14
y(kg)0.30.86 1.73 2.2 2.47 2.67 2.8
由经验知生长曲线为
2.827
1x
y
Aeλ-
=
+
,试求y对x的回归曲线方程.
【例19】为了研究某种细菌随时间x变化的繁殖个数,收集数据如下:
天数x 1 2 3 4 5 6
繁殖个数y 6 12 25 49 95 190
⑴作出这些数据的散点图;
⑵求出y对x的回归方程.
最全高考数学统计专题解析版【真题】
最全高考数学统计专题解析版【真题】 -CAL-FENGHAI-(2020YEAR-YICAI)_JINGBIAN
第十一章统计、统计案例 第一部分六年高考荟萃 2013年高考题 1 .(2013年高考陕西卷(理))某单位有840名职工, 现采用系统抽样方法, 抽取 42人做问卷调查, 将840人按1, 2, , 840随机编号, 则抽取的42人中, 编号 落入区间[481, 720]的人数为()A.11 B.12 C.13 D.14 2 .(2013年普通高等学校招生统一考试安徽数学(理)试题(纯WORD版))某班级有 50名学生,其中有30名男生和20名女生,随机询问了该班五名男生和五名 女生在某次数学测验中的成绩,五名男生的成绩分别为86,94,88,92,90,五名 女生的成绩分别为88,93,93,88,93.下列说法一定正确的是()A.这种抽样方法是一种分层抽样 B.这种抽样方法是一种系统抽样 C.这五名男生成绩的方差大于这五名女生成绩的方差 D.该班级男生成绩的平均数小于该班女生成绩的平均数 3 .(2013年普通高等学校招生统一考试福建数学(理)试题(纯WORD版))某校从高 一年级学生中随机抽取部分学生,将他们的模块测试成绩分为6组:[40,50), [50,60), [60,70), [70,80), [80,90), [90,100)加以统计,得到如图所示的频率分布 直方图,已知高一年级共有学生600名,据此估计,该模块测试成绩不少于60 分的学生人数为()A.588 B.480 C.450 D.120 4 .(2013年高考江西卷(理))总体有编号为01,02,…,19,20的20个个体组成。利用下 面的随机数表选取5个个体,选取方法是从随机数表第1行的第5列和第6列数字 7816 6572 0802 6314 0702 4369 9728 0198 3204 9234 4935 8200 3623 4869 6938 7481 )A.08 B.07 C.02 D.01 5.(2013年高考上海卷(理))盒子中装有编号为1,2,3,4,5,6,7,8,9的九个球,从中任意取出两个,则这两个球的编号之积为偶数的概率是 ___________(结果用最简分数表示)
全国各地高考数学统计与概率大题专题汇编.doc
1.【2015·新课标II】某公司为了解用户对其产品的满意度,从A,B两地区分别随机调查了20个用户,得到用户对产品的满意度评分如下: A地区:62 73 81 92 95 85 74 64 53 76 78 86 95 66 97 78 88 82 76 89 B地区:73 83 62 51 91 46 53 73 64 82 93 48 65 81 74 56 54 76 65 79 (Ⅰ)根据两组数据完成两地区用户满意度评分的茎叶图,并通过茎叶图比较两地区满意度评分的平均值及分散程度(不要求计算出具体值,得出结论即可); 价结果相互独立.根据所给数据,以事件发生的频率作为相应事件发生的概率,求C的概率. 2.【2015·福建】某银行规定,一张银行卡若在一天内出现3次密码尝试错误,该银行卡将被锁定,小王到银行取钱时,发现自己忘记了银行卡的密码,但是可以确定该银行卡的正确密码是他常用的6个密码之一,小王决定从中不重复地随机选择1个进行尝试.若密码正确,则结束尝试;否则继续尝试,直至该银行卡被锁定. (Ⅰ)求当天小王的该银行卡被锁定的概率; (Ⅱ)设当天小王用该银行卡尝试密码次数为X,求X的分布列和数学期望.
3.【2015·山东】若n是一个三位正整数,且n的个位数字大于十位数字,十位数字大于百位数字,则称n为“三位递增数”(如137,359,567等).在某次数学趣味活动中,每位参加者需从所有的“三位递增数”中随机抽取1个数,且只能抽取一次.得分规则如下:若抽取的“三位递增数”的三个数字之积不能被5整除,参加者得0分;若能被5整除,但不能被10 分;若能被10整除,得1分. 整除,得1 (I)写出所有个位数字是5的“三位递增数” ; (II)若甲参加活动,求甲得分X的分布列和数学期望EX. 4.【2015·安徽】已知2件次品和3件正品放在一起,现需要通过检测将其区分,每次随机检测一件产品,检测后不放回,直到检测出2件次品或者检测出3件正品时检测结束. (Ⅰ)求第一次检测出的是次品且第二次检测出的是正品的概率; (Ⅱ)已知每检测一件产品需要费用100元,设X表示直到检测出2件次品或者检测出3件正品时所 需要的检测费用(单位:元),求X的分布列和均值(数学期望).
(典型题)高考数学二轮复习-知识点总结-统计与统计案例
统计和统计案例 1.该部分常考内容:样本数字特征的计算、各种统计图表、线性回归方程、独立性检验等;有时也会在知识交汇点处命题,如概率和统计交汇等. 2.从考查形式上来看,大部分为选择题、填空题,重在考查基础知识、基本技能,有时在知识交汇点处命题,也会出现解答题,都属于中低档题. 1. 随机抽样 (1)简单随机抽样特点为从总体中逐个抽取,适用范围:总体中的个体较少. (2)系统抽样特点是将总体均分成几部分,按事先确定的规则在各部分中抽取,适用范围:总体中的个体数较多. (3)分层抽样特点是将总体分成几层,分层进行抽取,适用范围:总体由差异明显的几部分组成. 2. 常用的统计图表 (1)频率分布直方图 ①小长方形的面积=组距× 频率 组距 =频率; ②各小长方形的面积之和等于1; ③小长方形的高=频率组距,所有小长方形的高的和为1 组距. (2)茎叶图 在样本数据较少时,用茎叶图表示数据的效果较好. 3. 用样本的数字特征估计总体的数字特征 (1)众数、中位数、平均数 数字特征 样本数据 频率分布直方图 众数 出现次数最多的数据 取最高的小长方形底边中点的横坐标 中位数 将数据按大小依次排列,处在最 中间位置的一个数据(或最中间两个数据的平均数) 把频率分布直方图划分左右两个面积相等的分界线和x 轴交点的横坐标 平均数 样本数据的算术平均数 每个小矩形的面积乘以小矩形底边中点的横坐标之和 (2)方差:s 2=n [(x 1-x )2+(x 2-x )2+…+(x n -x )2 ]. 标准差:
s = 1n [ x 1-x 2 +x 2-x 2 +…+x n -x 2 ]. 4. 变量的相关性和最小二乘法 (1)相关关系的概念、正相关和负相关、相关系数. (2)最小二乘法:对于给定的一组样本数据(x 1,y 1),(x 2,y 2),…,(x n ,y n ),通过求Q = i =1 n (y i -a -bx i )2 最小时,得到线性回归方程y ^ =b ^ x +a ^ 的方法叫做最小二乘法. 5. 独立性检验 对于取值分别是{x 1,x 2}和{y 1,y 2}的分类变量X 和Y ,其样本频数列联表是: y 1 y 2 总计 x 1 a b a +b x 2 c d c +d 总计 a +c b +d n 则K 2 = n ad -bc 2a +b c + d a +c b +d (其中n =a +b +c +d 为样本容量). 考点一 抽样方法 例1 (2012·山东)采用系统抽样方法从960人中抽取32人做问卷调查,为此将他们随机编号为1,2,…,960,分组后在第一组采用简单随机抽样的方法抽到的号码为9.抽到的32人中,编号落入区间[1,450]的人做问卷A ,编号落入区间[451,750]的人做问卷B ,其余的人做问卷C .则抽到的人中,做问卷B 的人数为 ( ) A .7 B .9 C .10 D .15 答案 C 分析 由系统抽样的特点知:抽取号码的间隔为 960 32 =30,抽取的号码依次为9,39,69,…,939.落入区间[451,750]的有459,489,…,729,这些数构成首项为459,公差为30的等差数列,设有n 项,显然有729=459+(n -1)×30,解得n =10.所以做问卷B 的有10人. 在系统抽样的过程中,要注意分段间隔,需要抽取几个个体,样本就需要分 成几个组,则分段间隔即为N n (N 为样本容量),首先确定在第一组中抽取的个体的号码数,再从后面的每组中按规则抽取每个个体.解决此类题目的关键是深刻理解各种抽样
2020高考数学概率统计(大题)
全国一卷真题分析---概率统计 1.(2011年)根据以往统计资料,某地车主购买甲种保险的概率为0.5,购买乙种保险但不购买甲种保险的 概率为0.3,设各车主购买保险相互独立. (Ⅰ)求该地1位车主至少购买甲、乙两种保险中的l种的概率; (Ⅱ)X表示该地的l00位车主中,甲、乙两种保险都不购买的车主数.求X的期望. 2.(2012年)某花店每天以每枝5元的价格从农场购进若干枝玫瑰花,然后以每枝10元的价格出售.如果 当天卖不完,剩下的玫瑰花作垃圾处理.(Ⅰ)若花店一天购进16朵玫瑰花,求当天的利润y(单位:元)关于当天需求量n(单位:枝,N n )的函数解析式;(Ⅱ)花店记录了100天玫瑰花的日需求量(单位:枝),整理得下表: 以100天记录的各需求量的频率作为 各需求量发生的概率. (ⅰ)若花店一天购进16枝玫瑰花,X表示当天的利润(单位:元),求X的分布列、数学期望及方差; (ⅱ)若花店计划一天购进16枝或17枝玫瑰花,你认为应购进16枝还是17枝?请说明理由. 3.(2013年)一批产品需要进行质量检验,检验方案是:先从这批产品中任取4件作检验,这4件产品中 优质品的件数记为n.如果n=3,再从这批产品中任取4件作检验,若都为优质品,则这批产品通过检验;如果n=4,再从这批产品中任取1件作检验,若为优质品,则这批产品通过检验;其他情况下, 这批产品都不能通过检验.假设这批产品的优质品率为50%,即取出的产品是优质品的概率都为1 2, 且各件产品是否为优质品相互独立. (1)求这批产品通过检验的概率; (2)已知每件产品检验费用为100元,凡抽取的每件产品都需要检验,对这批产品作质量检验所需的费用记为X(单位:元),求X的分布列及数学期望. 1
高考数学统计及统计案例
§10.2统计及统计案例 考纲解读 分析解读
从近几年的高考试题来看,本部分在高考中的考查点如下:1.主要考查分层抽样的定义,频率分布直方图,平均数、方差的计算,识图能力及借助概率知识分析、解决问题的能力;2.在频率分布直方图中,注意小矩形的高=频率/组距,小矩形的面积为频率,所有小矩形的面积之和为1;3.分析两个变量间的相关关系,通过独立性检验判断两个变量是否相关.本节内容在高考中分值为17分左右,属中档题.
(1)根据频率分布直方图可知,样本中分数不小于70的频率为(0.02+0.04)×10=0.6, 所以样本中分数小于70的频率为1-0.6=0.4. 所以从总体的400名学生中随机抽取一人,其分数小于70的概率估计为0.4. (2)根据题意,样本中分数不小于50的频率为(0.01+0.02+0.04+0.02)×10=0.9, 分数在区间[40,50)内的人数为100-100×0.9-5=5. 所以总体中分数在区间[40,50)内的人数估计为400× =20. (3)由题意可知,样本中分数不小于70的学生人数为(0.02+0.04)×10×100=60, 所以样本中分数不小于70的男生人数为60× =30. 所以样本中的男生人数为30×2=60,女生人数为100-60=40,男生和女生人数的比例为60∶40=3∶2. 所以根据分层抽样原理,总体中男生和女生人数的比例估计为3∶2. 五年高考 考点一 抽样方法 1.(2015北京,4,5分)某校老年、中年和青年教师的人数见下表.采用分层抽样的方法调查教师的身体状况,在抽取的样本中,青年教师有320人,则该样本中的老年教师人数为( )
概率与数理统计典型例题
《概率与数理统计》 第一章 随机事件与概率 典型例题 一、利用概率的性质、事件间的关系和运算律进行求解 1.设,,A B C 为三个事件,且()0.9,()0.97P A B P A B C ==U U U ,则()________.P AB C -= 2.设,A B 为两个任意事件,证明:1|()()()|.4 P AB P A P B -≤ 二、古典概型与几何概型的概率计算 1.袋中有a 个红球,b 个白球,现从袋中每次任取一球,取后不放回,试求第k 次 取到红球的概率.(a a b +) 2.从数字1,2,,9L 中可重复地任取n 次,试求所取的n 个数的乘积能被10整除的 概率.(58419n n n n +--) 3.50只铆钉随机地取来用在10个部件上,其中有3个铆钉强度太弱,每个部件用3只铆钉,若将3只强度太弱的铆钉都装在一个部件上,则这个部件强度就太 弱,从而成为不合格品,试求10个部件都是合格品的概率.(19591960 ) 4.掷n 颗骰子,求出现最大的点数为5的概率. 5.(配对问题)某人写了n 封信给不同的n 个人,并在n 个信封上写好了各人的地址,现在每个信封里随意地塞进一封信,试求至少有一封信放对了信封的概率. (01(1)! n k k k =-∑)
6.在线段AD上任取两点,B C,在,B C处折断而得三条线段,求“这三条线段能构成三角形”的概率.(0.25) 7.从(0,1)中任取两个数,试求这两个数之和小于1,且其积小于 3 16 的概率. (13 ln3 416 +) 三、事件独立性 1.设事件A与B独立,且两个事件仅发生一个的概率都是 3 16 ,试求() P A. 2.甲、乙两人轮流投篮,甲先投,且甲每轮只投一次,而乙每轮可投两次,先投 中者为胜.已知甲、乙每次投篮的命中率分别为p和1 3 .(1)求甲取胜的概率; (2)p求何值时,甲、乙两人的胜负概率相同?( 95 ; 5414 p p p = + ) 四、条件概率与积事件概率的计算 1.已知10件产品中有2件次品,现从中取产品两次,每次取一件,去后不放回,求下列事件的概率:(1)两次均取到正品;(2)在第一次取到正品的条件下第二次取到正品;(3)第二次取到正品;(4)两次中恰有一次取到正品;(5)两次中 至少有一次取到正品.(28741644 ;;;; 45954545 ) 2.某人忘记了电话号码的最后一个数字,因而他随意地拨号,假设拨过了的数字不再重复,试求下列事件的概率:(1)拨号不超过3次而接通电话;(2)第3次拨号才接通电话.(0.3;0.1) 五、全概率公式和贝叶斯公式概型 1.假设有两箱同种零件:第一箱内装50件,其中10件为一等品;第二箱内装30件,其中18件为一等品,现从两箱中随意挑选出一箱,然后从该箱中先后随机取出两个零件(取出的零件均不放回),试求:(1)先取出的零件是一等品的概率;(2)在先取出的零件是一等品的条件下,第二次取出的零件仍然是一等品 的概率.(2690 ; 51421 ) 2.有100个零件,其中90个一等品,10个二等品,随机地取2个,安装在一台设备上,若2个零件中有i个(0,1,2 i=)二等品,则该设备的使用寿命服从参
高考数学概率与统计专题复习
高考复习专题之:概率与统计 一、概率:随机事件A 的概率是频率的稳定值,反之,频率是概率的近似值. 1.随机事件A 的概率0()1P A ≤≤,其中当()1P A =时称为必然事件;当()0P A =时称为不可能事件P(A)=0; 注:求随机概率的三种方法: (一)枚举法 例1如图1所示,有一电路AB 是由图示的开关控制,闭合a ,b ,c , d , e 五个开关中的任意两个开关,使电路形成通路.则使电路形成通 路的概率是 . 分析:要计算使电路形成通路的概率,列举出闭合五个开关中的任意 两个可能出现的结果总数,从中找出能使电路形成通路的结果数,根据概率的意义计算即可。 解:闭合五个开关中的两个,可能出现的结果数有10种,分别是a b 、a c 、a d 、a e 、bc 、bd 、be 、cd 、ce 、de ,其中能形成通路的有6种,所以p(通路)= 106=5 3 评注:枚举法是求概率的一种重要方法,这种方法一般应用于可能出现的结果比较少的事件的概率计算. (二)树形图法 例2小刚和小明两位同学玩一种游戏.游戏规则为:两人各执“象、虎、鼠”三张牌,同时各出一张牌定胜负,其中象胜虎、虎胜鼠、鼠胜象,若两人所出牌相同,则为平局.例如,小刚出象牌,小明出虎牌,则小刚胜;又如, 两人同时出象牌,则两人平局.如果用A 、B 、C 分别表示小刚的象、虎、鼠三张牌,用A 1、B 1、C 1分别表示小明 的象、虎、鼠三张牌,那么一次出牌小刚胜小明的概率是多少? 分析:为了清楚地看出小亮胜小刚的概率,可用树状图列出所有可能出现的结果,并从中找出小刚胜小明可能出现的结果数。 解:画树状图如图树状图。由树状图(树形图)或列表可知,可能出现的结果有9种,而且每种结果出现的可能性相同,其中小刚胜小明的结果有3种.所以P (一次出牌小刚胜小明)= 31 点评:当一事件要涉及两个或更多的因素时,为了不重不漏地列出所有可能的结果,通过画树形图的方法来计算概率 (三)列表法 例3将图中的三张扑克牌背面朝上放在桌面上,从中随机摸出两张,并用这两张扑克牌上的数字组成一个两位数.请你用画树形(状)图或列表的方法求:(1)组成的两位数是偶数的概率;(2)组成的两位数是6的倍数的概率. 分析:本题可通过列表的方法,列出所有可能组成的两位数的可能情况,然后再找出组成的两位数是偶数的可能情况和组成两位数
概率统计大题题型总结(理)学生版
统计概率大题题型总结 题型一 频率分布直方图与茎叶图 例1.(2013广东理17)某车间共有12名工人,随机抽取6名,他们某日加工零件个数的茎叶图如 图所示,其中茎为十位数,叶为个位数. (Ⅰ) 根据茎叶图计算样本均值; (Ⅱ) 日加工零件个数大于样本均值的工人为优秀工人,根据茎叶图推断该车间12名工人中有几名优秀工人; (Ⅲ) 从该车间12名工人中,任取2人,求恰有名优秀工人的概率. 例2.(2013新课标Ⅱ理)经销商经销某种农产品,在一个销售季度内,每售出t 该产品获利润500 元,未售出的产品,每t 亏损300元.根据历史资料,得到销售季度内市场需求量的频率分布直方图,如图所示.经销商为下一个销售季度购进了130t 该农产品,以X (单位:t,150100≤≤X )表示下一个销售季度内的市场需求量,T (单位:元)表示下一个销售季度内销商该农产品的利润. (Ⅰ)将T 表示为X 的函数; (Ⅱ)根据直方图估计利润T 不少于57000元的概率; 1 7 9 2 0 1 5 3 0 第17题图
(Ⅲ)在直方图的需求量分组中,以各组的区间中点值代表该组的各个值,需求量落入该区间的频率作为需求量取该区间中点值的概率(例如:若[100,110)X ∈,则取105X =,且105X =的概率等于需求量落入[100,110)的概率),求利润T 的数学期望. 变式1. 【2015高考重庆,理3】重庆市2013年各月的平均气温(o C )数据的茎叶图如下: 08912 58 200338312 则这组数据的中位数是( ) A 、19 B 、20 C 、21.5 D 、23 /频率组距0.010 0.0150.0200.0250.030100110120130140150需求量/x t
数理统计复习题第五章
第五章 大数定律与中心极限定理 一、 典型题解 例1设随机变量X 的数学期望()(){}2,3E X u D X X u σσ==-≥方差,求P 的大小区间。 解 令3εσ=,则有切比雪夫不等式有: ()() ()22 221 ,339D X P X E X P X E X σεσεσ????-≥≤ -≥≤=????有 例2在n 次独立试验中,设事件A 在第i 次试验中发生的概率为()1,2,....i p i n = 试证明:A 发生的频率稳定于概率的平均值。 证 设X 表示n 次试验中A 发生的次数,引入新的随机变量0i A X A ?=??1,发生? ,不发生 ()12,...i n =, ,则X 服从()01-分布,故 ()()(),1i i i i i i i E X p D X p p p q ==-=, 又因为 () ()2 2 4140i i i i i i i i p q p q p q p q -=+-=-≥, 所以 ()()1 1,2, (4) i i i D X p q i n =≤ = 由切比雪夫大数定理,对,o ε?>有()11lim 1n i i n i p X E X n ε→∞ =?? -<=???????? ∑ 即 11lim 1n i n i X p p n n ε→∞ =?? -<=???? ∑ 例 3 对于一个学生而言,来参加家长会的家长人数是一个随机变量,设一个学 生无家长,1名家长、2名家长来参加会议的概率分别为。若学校共有400名学生,设各学生参加会议的家长数相互独立,且服从同一分布。(1)求参加会议的家长数X 超过450的概率;(2)求有1名家长来参加会议的学生数不多于340的概率。 解(1)以()400,,2,1 =k X k 记第k 个学生来参加会议的家长数,则k X 的分布律为 k X 0 1 2 k P 0.05 0.8 0.15
2019年高考数学一轮复习专题10.2统计与统计案例测
专题10.2 统计与统计案例 一、填空题:请把答案直接填写在答题卡相应的位置........ 上(共10题,每小题6分,共计60分). 1.交通部门对某路段公路上行驶的汽车速度实施监控,从速度在 的汽车中抽取150辆进行分析,得到数据的频率分布直方图如图所示,则速度在 以下的汽车有辆. ) 【答案】75 2.某校高一年级有学生人,高二年级有学生人,现采用分层抽样的方法从全校学生中抽出人,其中从高一年级学生中抽出人,则从高三年级学生中抽取的人数为 ▲ . 【答案】17 【解析】高一高二人数之比为10:9,因此高二抽出的人数为18人,高三抽出的人数为55-20-18=17人 3.若一组样本数据9,8,x ,10,11的平均数为10,则该组样本数据的方差为▲. 【答案】2 【解析】由题意得,因此方差为 4.某校共有教师200人,男学生800人,女学生600人,现用分层抽样的方法从所有师生中抽取一个容量为的样本,已知从男学生中抽取的人数为100人,那么 ▲ . 【答案】200 【解析】男学生占全校总人数,那么 5.从某校高三年级随机抽取一个班,对该班50名学生的高校招生体检表中的视力情况进行统计,其频率分布直方图如图所示。若某高校A 专业对视力的要求在0.9以上,则该班学生中能报A 专业的人数为.
【答案】20 【解析】根据频率分布直方图,得视力在0.9以上的频率为(1.00+0.75+0.25)×0.2=0.4, ∴该班学生中能报A专业的人数为50×0.4=20. 6.某单位200名职工的年龄分布情况如图,现要从中抽取40名职工作样本.用系统抽样法,将全体职工随机按1~200编号,并按编号顺序平均分为40组(1~5号,6~10号,…,196~200号).若第5组抽出的号码为22,则第8组抽出的号码应是________.若用分层抽样方法,则40岁以下年龄段应抽取________人. 【答案】37,20 7.下图是2014年在怀化市举行的演讲比赛,七位评委为第一位演讲者打出的分数的茎叶统计图,去掉一个最高分和一个最低分后,所剩数据的平均数与方差分别为. 【答案】, 【解析】去掉一个最高分和一个最低分之后,剩余的五个数据依次是、、、、,平均数为
高考数学统计与统计案例.doc
高考数学统计与统计案例1.小吴一星期的总开支分布如图 1 所示,一星期的食品开支如图 2 所示,则小吴一星期的鸡蛋开支占总开支的百分比为() A.1%B.2%C.3%D.5% C[ 由图 1 所示,食品开支占总开支的 30%,由图 2 所示,鸡蛋开支占食 品开支的30 = 1 , 30+40+100+80+ 50 10 1 ∴鸡蛋开支占总开支的百分比为30%×10=3%.故选 C.] 2.(2019 德·州模拟 )某人到甲、乙两市各7 个小区调查空置房情况,调查得到的小区空置房的套数绘成了如图所示的茎叶图,则调查中甲市空置房套数的中位数与乙市空置房套数的中位数之差为() A.4B. 3C.2D.1 B[ 由茎叶图可以看出甲、乙两市的空置房的套数的中位数分别是79,76,因此其差是 79- 76=3,故选 B.] 3.某工厂对一批新产品的长度(单位: mm)进行检测,如图是检测结果的频