《社会统计学》卢淑华(第四版)课程练习题答案
《社会统计学》卢淑华(第四版)课程练习题答案收集整理by kiss 阿黄Ps:1)本答案仅供社三需要看课本习题的同学参考使用2)本答案只包括6--13章,重点章节3)本答案来自网络,若有不全,请谅解4)共享光荣~~~~~~“社会统计学”第六章习题答案一、设X 1,X 2,X 3为简单随机抽样的3个观测值。
如果采用如下不等权的平均值:'123221555X X X X =++作为总体均值的点估计值,试说明它将比采用等权的平均值:123111333X X X X =++作为总体均值的点估计值要差。
解答:根据方差的性质'12322212321232221232221()()()()555221()()()()()()555441()()()252525925111()()()()333111()()()()()()333111()()()99913D X D X D X D X D X D X D X D X D X D X D X D X D X D X D X D X D X D X D X D X σσ=++=++=++==++=++=++=因为'()()D X D X ,所以采用等权的平均值X 作为总体均值的点估计值比采用不等权的平均值'X 作为总体均值的点估计值更有效。
二、解答:75.0=x 20.0=S 05.095.01=-=α 96.12=αt 代入式(6.22)置信区间为:[]7892.0,7108.010020.096.175.0,10020.096.175.0=⎥⎦⎤⎢⎣⎡⨯+⨯-四、解答:5.4=x 5=S 05.095.01=-=α 96.12=αt代入式(6.22)置信区间为:[]48.5,52.3100596.15.4,100596.15.4=⎥⎦⎤⎢⎣⎡⨯+⨯-五、解答:60.0ˆ=p 40.0ˆ1ˆ=-=p q 10.090.01=-=α 65.12=αt代入式(6.33)置信区间为:[]6572.0,5428.020040.060.065.160.0,20040.060.065.160.0=⎥⎦⎤⎢⎣⎡⨯⨯+⨯⨯-第八章 单总体假设检验一、解答:H 0:u=2.5 H 1:u<2.564.311.04.011.05.21.21001.15.2-=-=-=-=x z65.1-=-αzz =-3.64<-1.65,故拒绝原假设。
二、解答:H 0:p=0.6 H 1:p>0.6408.00024.002.01004.06.06.062.0==⨯-=z65.1=αzz =0.408<1.65,故不能拒绝原假设。
三、解答:(1)H 0:u=75% H 1:u ≠75%5.21000.20.75-0.8z ==96.12/=αzz =2.5>1.96,故应拒绝原假设。
(2) 如果拒绝了食品费用占总收入的比例为75%的说法,则可能犯错误的概率为α,即0.05。
四、解答:H 0:u=55000 H 1:u ≠55000n=6 67.60466=x∑=362800i x ∑=022*********i x71.461056362800022043600001)(222=-=--=∑∑n n x x S i i90.2671.46105500067.60466=-=-=n S u x t 57.2)5(025.0=t 0690.2=t >57.2)5(2=αt 06,故应拒绝原假设。
第九章 二总体假设检验一、解答:H 0:0=-B A u u H 1:B A u u ->0 27.1805.64503.495.672.69=+-=z65.1=αz27.1=z <1.65,故不能拒绝原假设。
二、解答:H 0:0=-B A P P H 1:B A P P -≠0 54.01001006345ˆ=++=++=B A BA n n m m P55.2004968.018.0100246.054.063.045.0-=-=⎪⎭⎫ ⎝⎛⨯⨯-=z96.12-=-αz 55.2-=z <-1.96,故应拒绝原假设。
四、解答:H 0:0=-B A u u H 1:B A u u ->0 53.1212129.0)112(5.1)112(222=-+⨯-+⨯-=S7171.1)22(05.0=t97.2121121237.13.58.611=+-=+-=B A B A n n S X X t97.2=t >1.7171,故应拒绝原假设。
五、解答:H 0:0=-B A u u H 1:B A u u ->0 67.26062145≈+++-+==∑n d d i8048.28667.78667.75616821)(2222===-=--=∑∑d i i d s n n d d s3319.2145.167.268048.267.2===tt 0.05(5)=2.0150t=2.3319>t 0.05(5)=2.0150,所以拒绝原假设,即可以认为新教学法优于原教学法。
第十章 列联表一、 解答:⎪⎪⎭⎫⎝⎛-⨯=∑∑==c i r j j i ij n n n n x 11**221 =)1954322105432195652610565399592471059245(200222222-⨯+⨯+⨯+⨯+⨯+⨯⨯=()11185.00977.01095.02229.02527.02096.0200-+++++⨯ =2.18991.5)13)(12(205.0=--x18.22=x <5.991,故不能拒绝原假设。
237.153.1==S二、解答:(1)⎪⎪⎭⎫⎝⎛-⨯+⨯+⨯+⨯+⨯+⨯⨯=1304020304010204010304010304020204010802222222x =6.664991.5)2(205.0=x664.62=x >5.991,故拒绝原假设。
(2)∑∑∑∑====--=r j jc i r j r j j i ijn n n n n n n 12*1112**211τ3040204010401040104020401022222112*2=+++++=∑∑==c i r j i ij n n()5.27303020801112222*=++⨯=∑=rj j n n048.05.27805.2730=--=τ三、解答:(1)⎪⎪⎭⎫ ⎝⎛-⨯+⨯+⨯+⨯⨯=124241726247242672626195022222x=()15017.00785.025340.050-+⨯+⨯=9.635841.3)1(205.0=x635.92=x >3.841,故拒绝原假设。
(2)44.050635.9==Φ五、解答:(1)5044.1711006.117413551.01315.00689.01308.00415.03728.017418088502888186688208086302886106686461742222222=-⨯=-+++++⨯=⎪⎪⎭⎫⎝⎛-⨯+⨯+⨯+⨯+⨯+⨯⨯=)()(x 991.5)2(205.0=x5.172=x >5.991,故拒绝原假设。
(2)17.080174805046=--+=λ第十二章 回归与相关一、解答:(2)根据最小二乘法作回归线。
(3) 33.21228x ==83.1512190==y289.36667.126667.41281217819028121485)(11222==⨯-⨯⨯-=--==∑∑∑∑∑i i ii i i xxxyx n x y x n y x L L b156.833.2289.383.15=⨯-=-=x b y a(4) 3.289x 8.156y ˆ+=21.31243.2898.156y ˆ4x 18.02333.2898.156y ˆ3x 14.73423.2898.156y ˆ2x 11.4453.2898.156y ˆ1=⨯⨯===⨯+===⨯+===+==时,时,时,时,x(5)67.1471901213156)(1222=⨯-=-==∑∑i i yy y n y L TSS04.137667.41289.3=⨯=⨯=xy L b RSSR 63.1004.13767.147=-=-=RSSR TSS RSS(6)928.067.14704.137r 2===TSS RSSR r 2=0.928表明可以用x 解释掉y 的9.28%的误差。
(7)r=0.963576.0)10(05.0=rr=0.963>0.576,故r 具有推论意义。
二、解答:(1)6530x == 6.6533==y 6.0402430512203330512222==⨯-⨯⨯-=b 366.06.6=⨯-=-=x b y ax y6.03ˆ+= (2)2.1733512352=⨯-=yy L 915.02.174024=⨯==yyxx xyL L L r 8372.022==yy xx xyL L L r判定系数r 2=0.8372说明用自变量父代受教育年限去预测因变量子代受教育年限,可以改善预测程度的83.72%,或可以用自变量x 解释掉因变量y83.72%的误差。
(3)878.0)3(05.0=r915.0=r >0.878,故具有推论意义。
三、解答:(1)125.5841x == 75.4838==y 875.0875.6825.6041812793841812552==⨯-⨯⨯-=b 266.0125.5875.075.4=⨯-=-=x b y ax y875.0266.0ˆ+= (2)5.8338812642=⨯-=yy L 794.05.83875.6825.60=⨯==yy xx xyL L L r 6312.02=r判定系数r 2=0.6312说明用自变量生活期望值去预测因变量个人成就,可以改善预测程度的63.12%,或可以用自变量x 解释掉因变量y63.12%的误差。
(3)707.0)6(05.0=r794.0=r >0.707,故具有推论意义。
四、解答:(1)165058250x == 1710005855000==y 86.11014500001607500008250511506250085500082505115715000002==⨯-⨯⨯-=b 11919165086.110171000-=⨯-=-=x b y ax y86.11011919ˆ+-= (2)01805400000855000510016425900002=⨯-=yy L 9935.0018054000001450000160750000=⨯==yy xx xy L L L r9871.02=r判定系数r 2=0.9871说明用广告费用去预测因变量销售额,可以改善预测程度的98.71%,或可以用自变量x 解释掉因变量y98.71%的误差。
统计学答案统计学第四版
P111单样本 T: C1平均值 95% 置信区变量 N 平均值标准差标准误间C1 16 9.37 4.11 1.03 (7.18, 11.57) p243双比率检验和置信区间样本 X N 样本 p1 43 205 0.2097562 13 134 0.097015差值 = p (1) - p (2)差值估计: 0.112741差值的 95% 置信下限: 0.0498412差值 = 0(与 > 0) 的检验: Z = 2.95 P 值 = 0.002 Fisher 精确检验: P 值 = 0.004p243双样本 T 检验和置信区间平均值样本 N 平均值标准差标准误1 25 82.00 7.48 1.52 16 78.00 7.00 1.8差值 = mu (1) - mu (2)差值估计: 4.00差值的 98% 置信下限: -0.92差值 = 0 (与 >) 的 T 检验: T 值 = 1.74 P 值 = 0.046 自由度 = 33p261卡方检验: C1, C2, C3, C4在观测计数下方给出的是期望计数在期望计数下方给出的是卡方贡献C1 C2 C3 C4 合计1 6 13 14 79 11225.44 30.06 13.88 42.6214.855 9.686 0.001 31.0552 12 16 8 31 6715.22 17.99 8.30 25.500.681 0.219 0.011 1.1883 38 40 11 6 9521.58 25.50 11.77 36.1512.498 8.243 0.050 25.1464 21 22 9 13 6514.76 17.45 8.05 24.732.634 1.187 0.111 5.567合计 77 91 42 129 339卡方 = 113.133, DF = 9, P 值 = 0.000P294单因子方差分析: C1, C2, C3来源自由度 SS MS F P因子 2 615.6 307.8 17.07 0.000误差 12 216.4 18.0合计 14 832.0S = 4.247 R-Sq = 73.99% R-Sq(调整) = 69.66%平均值(基于合并标准差)的单组 95% 置信区间水平 N 平均值标准差 -------+---------+---------+---------+-- C1 5 44.400 5.320 (------*------)C2 5 30.000 3.162 (------*------)C3 5 42.600 3.975 (------*------)-------+---------+---------+---------+-- 30.0 36.0 42.0 48.0合并标准差 = 4.247P296 10.11双因子方差分析: C1 与 C2, C3来源自由度 SS MS F P C2 2 1736.22 868.111 34.31 0.000 C3 3 1078.33 359.444 14.20 0.000 交互作用 6 503.33 83.889 3.32 0.016 误差 24 607.33 25.306合计 35 3925.22S = 5.030 R-Sq = 84.53% R-Sq(调整) = 77.44%p360回归分析: C1 与 C2, C3, C4回归方程为C1 = 149 + 0.815 C2 + 0.821 C3 + 0.135 C4自变量系数系数标准误 T P常量 148.7 574.4 0.26 0.799C2 0.8147 0.5120 1.59 0.131C3 0.8210 0.2112 3.89 0.001C4 0.13504 0.06586 2.05 0.057S = 791.682 R-Sq = 89.7% R-Sq(调整) = 87.8% 方差分析来源自由度 SS MS F P 回归 3 87803505 29267835 46.70 0.000 残差误差 16 10028175 626761合计 19 97831680来源自由度 Seq SSC2 1 61022241C3 1 24146474C4 1 2634791异常观测值拟合值标准化观测值 C2 C1 拟合值标准误残差残差11 730 4050 5496 335 -1446 -2.02R 17 400 5600 4002 340 1598 2.23RR 表示此观测值含有大的标准化残差P400数据 C2长度 20缺失数据数 0拟合趋势方程Yt = -364 + 129*t准确度度量平均百分误差 (MAPE) 45.3 平均绝对误差 (MAD) 221.8 平均偏差平方和 68658.3。
社会统计学(卢淑华)_第六章
第一节 统计推论
一、统计推论:根据局部资料对总体特征进行推断 特点: 1、局部资料的特性在某种程度上能反映总体的特征 2、抽样结果不能恰好等于总体的结果
二、理论基础:概率论 三、内容:
1、通过样本对总体的未知参数进行估计(参数估计) 2、通过样本对总体的某种假设进行检验(假设检验)
第二节 名词解释
二、评价估计值的标准
1、无偏性:x 的均值等于待估参数μ
如果 Qˆ 是总体参数Q的估计值,且Qˆ 分布的均值有 E Qˆ 称 Qˆ 是Q的无偏估计。
Q,则
2、有效性:
1)方法:如果两个估计值Qˆ1 x1 x2 xn 及 Qˆ 2 x1 x2 xn ,它
都满足无偏性,那么当 Qˆ1 的方差比 Qˆ 2 的方差小时,则Q1 较 Q 2 更
有效。
2)增加样本容量可以有效的增加一次抽样接近待估参数的概率。
x 样本均值
2
的方差:Dx n
样本方差
S 2 的方差
:D2 S
4
n 2 1
3、一致性: 一个数的估计值要求随样本容量n的增大而以较
大的概率去接近被估计参数的值。
把样本容量为n时的估计值记作 Qˆ n ,如果 n
第五节 正态总体的区间估计
一、置信度、置信区间
如果用Qˆ x1 x2 xn 作为未知参数Q的估计值,那么区间
包含参数Q之概率为1
的关系表达式为
Q Q,
——置信区间(反映估计的准确性)
1
置信度(置信概率)(置信区间估计的可靠性)
显著性水平(置信区间不可靠的概率)
置信区间与置信度的关系:
《统计学》(袁卫 第四版)课后答案.pptx
答:总体参数是固定的,未知的,置信区间是一个随机区间。置信水平为95%的置信区间的含义是指,在相同 条件下多次抽样下,在所有构造的置信区间里大约有95%包含总体参数的真值。
.简述样本容量与置信水平、总体方差、允许误差的关系
答:以估计总体均值时样本容量的确定公式为例:〃=卜“『
(3)个人对股票的选择,与其风险偏好等因素有关。
第四章
1.总体分布指某个变量在总体中各个个体上的取值所形成的分布,它是未知的,是统计推断的对象。从总体中随 机抽取容量为n的样本。,λ2,∙,王),它的分布称为样本分布。由样本的某个函数所形成的统计量/(3,λ2,,天),它的分布 称为抽样分布(如样本均值、样本方差的分布)
5对比率数据的平均,为什么采用几何平均?
答:比率数据往往表现出连乘积为总比率的特征,不同于一般数据的和为总量的性质,由此需采用几何平均。
6.简述众数、中位数和均值的特点和应用场合。
答:众数、中位数和均值是分布集中趋势的三个主要测度,众数和中位数是从数据分布形状及位置角度来考虑 的,而均值是对所有数据计算后得到的。众数容易计算,但不是总是存在,应用场合较少;中位数直观,不受极端 数据的影响,但数据信息利用不够充分;均值数据提取的信息最充分,但受极端数据的影响。
.简要说明统计数据的来源
答:统计数据来源于两个方面:直接的数据:源于直接组织的调查、观察和科学实验,在社会经济管理领域, 主要通过统计调查方式来获得,如普查和抽样调查。间接的数据:从报纸、图书杂志、统计年鉴、网络等渠道获得 。
.简要说明抽样误差和非抽样误差
答:统计调查误差可分为非抽样误差和抽样误差。非抽样误差是由于调查过程中各环节工作失误造成的,从理 论上看,这类误差是可以避免的。抽样误差是利用样本推断总体时所产生的误差,它是不可避免的,但可以控制的 。
卢淑华 《社会统计学》讲义 整理翔实
3、四分互差 Q 是定序以上变量度量分散程度的方法。其优点是可以克服极值对分散度量的
干扰。把一组数据按序排列,然后分成四个数据数目相等的段落,各段分界点上的数叫做四
分位数,即第一个四分位数 Q1 以下包括了 25%的数据,Q2 是中位数,第三个四分位数 Q3
以下包括了总数据中的 75%的数据。四分互差就是第三个四分位数与第一个四分位数的差,
(1)三者设计的目的相同,都是希望通过比较一个数值来描述整体特征,以便简化资料,
都反映了变量的集中趋势。众值适用于定类、定序和定距变量;中位值适用于定序和定距变
量;均值适用于定距变量。
(2)众值的资料使用不完全;中位值考虑了变量的顺序和居中位置,和总体频次分布有关,
但因为只考虑了居中位置,故其它变量值比中位值大多少或小多少不影响中位值;均值考虑
量,众数可直接从变量的频率分布中观察到;对于定距变量,如果变量是在第 i 组具有最高的
频率密度,则用第 i 组的组中值表示变量的众数。
2、中位数 就是数据序列之中央位置的变量值。
(1)未分组数据:①根据原始资料:观察总数 N 为奇数时 =
+
;观察总数 N 为偶数时
中位值取居中位置左右两数的平均值为中位值。
规模的影响,因而可以用来比较不同的样本。一般频率分布使用比率的形式表示的。
2、统计表就是以表格形式来表示变量的分布。在制作统计表时,若有未回答或回答不合要
求的情况有两种处理方法:(A)仍以调查总数为基础计算频率,这时应加入一类:未详。(B)
以有效回答为基数计算频率,这时应在表的下面、紧接着表的地方注明:未详****户。
是它可能取某一区间内所有的值。
(完整word版)卢淑华 《社会统计学》讲义
社会统计学讲义第一章导论一、社会统计学1、社会统计学是运用统计的一般原理,对社会各种静态结构与动态趋势进行定量描述或推断的一种专门方法和技术。
研究对象:概括而言是指社会现象的数量方面。
2、选择统计分析方法的原则是根据研究目的和资料本身的特点选择。
3、统计分析的作用:(1)可对资料进行简化和描述;(2)可对变量间的关系进行描述和深入地分析(统计分析通过事后解释使得探讨变量间复杂的因果联系成为可能);(3)可通过样本资料推断总体(通过参数估计和假设检验,将样本推论到总体并指出这种推论的误差及做出这种推论的把握有多大)。
4、社会统计的基本程序(1)制定计划;(2)统计调查;(3)统计整理;(4)统计分析;(5)统计报告。
5、几个基本概念(1)总体与单位总体又称母体,是作为统计研究对象的、由许多具有共性的单位构成的整体。
构成总体的每一个个体称为总体单位,简称单位或个体。
3个基本特征:大量性、同质性和变异性。
(2)标志与变量总体的每个单位都具有许多属性和特性,说明总体单位属性或数量特征的名称在统计上称为标志,分为数量标志和品质标志。
可变的品质标志无法用数值表示,我们称之为变项;可变的数量标志能够用数值表示,我们称之为变量。
(3)指标与指标体系统计指标是反映总体(或样本总体)的数量特征的概念或范畴。
一个完整的统计指标由两部分构成:指标名称和指标数值。
在社会统计中,如要全面把握对象总体情况,就不能单凭一个指标,而要靠一组相互联系的并与之相适应的指标来完整地反映对象总体。
指标体系就是一系列有内在联系的统计指标的集合体。
二、社会调查研究的程序社会学研究之阶段与步骤(1)确定课题:来源与社会学理论、当前社会现实和要解决的实际问题;具有强烈的时代感、为国家现代化服务;(2)了解情况:查阅文献和向有经验、有知识的人了解,运用个案调查、典型调查进行探索性研究;(3)提出一定的想法和建立假设:差异式、函数式;(4)建立概念和测量方法:采用适当的术语和概念;操作化定义;概念的表现形式往往具有多值性;(5)设计问卷:内容包括事实、态度与看法、行为趋向、理由;方式有固定答题式和自由答题式;(6)试填问卷:发现不周或遗漏之处在试填阶段予以纠正;(7)调查实施(抽样调查):从局部推论到全体(8)校核与登录(9)统计分析与命题的检验:检验最初研究阶段的命题或假设是否得到证实或部分证实,在此基础上对研究内容提出建议和确定进一步的研究方案。
统计学课后习题答案_(第四版)_贾俊平
《统计学》第四版 第四章练习题答案4.1 (1)众数:M 0=10; 中位数:中位数位置=n+1/2=5.5,M e =10;平均数:6.91096===∑nxx i(2)Q L 位置=n/4=2.5, Q L =4+7/2=5.5;Q U 位置=3n/4=7.5,Q U =12 (3)2.494.1561)(2==-=∑-n i s x x (4)由于平均数小于中位数和众数,所以汽车销售量为左偏分布。
4.2 (1)从表中数据可以看出,年龄出现频数最多的是19和23,故有个众数,即M 0=19和M 0=23。
将原始数据排序后,计算中位数的位置为:中位数位置= n+1/2=13,第13个位置上的数值为23,所以中位数为M e =23(2)Q L 位置=n/4=6.25, Q L ==19;Q U 位置=3n/4=18.75,Q U =26.5(3)平均数==∑nx x i600/25=24,标准差65.612510621)(2=-=-=∑-n i s x x(4)偏态系数SK=1.08,峰态系数K=0.77(5)分析:从众数、中位数和平均数来看,网民年龄在23-24岁的人数占多数。
由于标准差较大,说明网民年龄之间有较大差异。
从偏态系数来看,年龄分布为右偏,由于偏态系数大于1,所以,偏斜程度很大。
由于峰态系数为正值,所以为尖峰分布。
4.3 (1(2)==∑nxx i63/9=7,714.0808.41)(2==-=∑-n i s x x (3)由于两种排队方式的平均数不同,所以用离散系数进行比较。
第一种排队方式:v 1=1.97/7.2=0.274;v 2=0.714/7=0.102.由于v 1>v 2,表明第一种排队方式的离散程度大于第二种排队方式。
(4)选方法二,因为第二种排队方式的平均等待时间较短,且离散程度小于第一种排队方式。
4.4 (1)==∑nx x i8223/30=274.1中位数位置=n+1/2=15.5,M e =272+273/2=272.5(2)Q L 位置=n/4=7.5, Q L ==(258+261)/2=259.5;Q U 位置=3n/4=22.5,Q U =(284+291)/2=287.5(3) 17.211307.130021)(2=-=-=∑-n i s x x4.5 (1)甲企业的平均成本=总成本/总产量=41.193406600301500203000152100150030002100==++++乙企业的平均成本=总成本/总产量=29.183426255301500201500153255150015003255==++++原因:尽管两个企业的单位成本相同,但单位成本较低的产品在乙企业的产量中所占比重较大,因此拉低了总平均成本。
统计学第四版课后答案
统计课后思考题答案第一章思考题1.1什么是统计学统计学是关于数据的一门学科,它收集,处理,分析,解释来自各个领域的数据并从中得出结论。
1.2解释描述统计和推断统计描述统计;它研究的是数据收集,处理,汇总,图表描述,概括与分析等统计方法。
推断统计;它是研究如何利用样本数据来推断总体特征的统计方法。
1.3统计学的类型和不同类型的特点统计数据;按所采用的计量尺度不同分;(定性数据)分类数据:只能归于某一类别的非数字型数据,它是对事物进行分类的结果,数据表现为类别,用文字来表述;(定性数据)顺序数据:只能归于某一有序类别的非数字型数据。
它也是有类别的,但这些类别是有序的。
(定量数据)数值型数据:按数字尺度测量的观察值,其结果表现为具体的数值。
统计数据;按统计数据都收集方法分;观测数据:是通过调查或观测而收集到的数据,这类数据是在没有对事物人为控制的条件下得到的。
实验数据:在实验中控制实验对象而收集到的数据。
统计数据;按被描述的现象与实践的关系分;截面数据:在相同或相似的时间点收集到的数据,也叫静态数据。
时间序列数据:按时间顺序收集到的,用于描述现象随时间变化的情况,也叫动态数据。
1.4解释分类数据,顺序数据和数值型数据答案同1.31.5举例说明总体,样本,参数,统计量,变量这几个概念对一千灯泡进行寿命测试,那么这千个灯泡就是总体,从中抽取一百个进行检测,这一百个灯泡的集合就是样本,这一千个灯泡的寿命的平均值和标准差还有合格率等描述特征的数值就是参数,这一百个灯泡的寿命的平均值和标准差还有合格率等描述特征的数值就是统计量,变量就是说明现象某种特征的概念,比如说灯泡的寿命。
1.6变量的分类变量可以分为分类变量,顺序变量,数值型变量。
变量也可以分为随机变量和非随机变量。
经验变量和理论变量。
1.7举例说明离散型变量和连续性变量离散型变量,只能取有限个值,取值以整数位断开,比如“企业数”连续型变量,取之连续不断,不能一一列举,比如“温度”。
社会统计学(卢淑华),第一章资料
一、社会统计学的发展
统计学的两大流派:数理统计学派和社 会统计学派
数理统计学派的原创始人是比利时的A ·凯特靳, 其最大的贡献就是将法国的古典概率引入统计 学,用纯数学的方法对社会现象进行研究; 社会统计学派的首倡者是德国的K·克尼斯,他 认为统计研究的对象是社会现象,研究方法为 大量观察法。
例:中学升学率调查
课题确定:升学率差异较大;学生择校
初探:收集文献,前人研究;咨询相关人员; 典型个案观察(好坏各2-3所中学)
假设:构思影响因素:1、师资专业水平,2、 学生入学水平,3、父母教育水平;
师资水平高
升学率高
入学成绩好
升学率高
父母教育水平高
升学率高
续例
操作化定义:如,师资:学历、职称、 获奖等;学生水平:考分、地域、性别 等;父母水平:学历、职业、教育子女的 时间等(注意:每一个定义就是一个变量, 要注意变量的各种可能取值)
1、混淆统计联系与因果关系 根据观测数据得到的统计联系(如相关 关系)只是因果关系存在的必要条件, 而不是充分条件。
2、事后解释错误 将探测性研究或描述性研究得到的理论 假设反过来作为假设检验来看待。
统计分析中常见的错误
3、生态学错误 混淆宏观模式与微观模式。 如:教育、经济水平越高的地区生育水平 越低,不能引申为个人教育水平与生育 水平的关系。 4、还原论错误 根据较低层次研究单位的分析结果推断较 高层次单位的运行规律。
联合国有关组织规定: 若低于0.2表示收入绝对平均; 0.2-0.3表示比较平均; 0.3-0.4表示相对合理; 0.4-0.5表示收入差距较大; 0.6以上表示收入差距悬殊。
二、社会学不社会统计学
1、社会学研究的重要环节 ▲课题---了解课题---假设---术语---问卷---调查---校核---统计
社会统计学(卢淑华),第十一章
系数。
d yx
ns nd ns nd n y
d
xy
ns nd ns nd nx
d yx :仅考虑在y方向的同分对 d xy :仅考虑在x方向的同分对
.
三、s值检验
H0: s 0
H1: s 0
统计量:
S
z —N(0,1)
Se
s ns nd
Y\x
10
1
12
4
32
2
22
4
23
4
32
2
12
1
12
5
.
4、 Gamma系数的PRE性质:
PRE ns nd ns nd 与G系数相同
5、当定序变量只有两种等级 G
n1 n4 n3 n2
不计符号时(方向)与Q系数相同
.
三、 Gamma系数的检验
H0: r0
H1: r0
统计量:
z G 1 G2
ns nd n
.
例:在某地选取409名已婚男人,研究他们对 母亲的感情会否影响他们对婚姻的适应,并问 是否有总体推论价值。
婚姻适应
丈夫对母亲的感情
平淡 不错 良好 很好
差
32 41 26 28 127
一般
28 47 41 22 138
很好
15 69 61 59 204
75 157 128 109 409
.
每对父子(女)作为一个观测单元,将其等 级写成一个集合:如(1,2)
将等级差平方后求和 其极值会是怎样?
.
r 1、相关系数 s
以等级差的平方和为基础来讨论等级相关。
社会统计学,卢淑华(第4版),第7,8章.pptx
假设检验的基本步骤
第1步:提出原假设和备择假设。 支持的命题为:备择假设 备择假设的对立面则为原假设 第2步:选择适当的检验统计量(test statistic) ,并 根据样本信息计算检验统计量的值
估计量-假设(H 0 )值 标准化检验统计量= 标准误差
第3步:选择显著性水平,确定临界值
总体参数的区间估计
用样本信息检验总体信息
第七章 假设检验 Hypothesis testing
一、假设检验的基本内容
(一)假设检验的基本思想 假设检验(hypothesis testing)是除参数估计之 外的另一类重要的统计推断问题。它的基本思想可以 用小概率原理来解释。所谓小概率原理,就是认为小 概率事件在一次试验中是几乎不可能发生的。也就是 说,如果对于总体的某个假设是真实的,那么不利于 或不可能支持这一假设的小概率事件A在一次试验中 几乎是不可能发生的,要是一次试验中事件A竟然发 生了,我们就有理由怀疑这一假设的真实性,拒绝这 一假设。
原假设 H0 原假设(null hypothesis)通常是研究 者想收集证据予以反对的假设,也称为 零假设,用表示。一般来说,原假设建 立的依据都是已有的、具有稳定性的, 从经验看,没有发生条件的变化,是不 会被轻易否定的。换句话讲,进行假设 检验的基本目的,就在于作出决策:接 受原假设还是拒绝原假设。
临界值计算 比较判断
由于 z 2.77 z 1.645
故不能拒绝原假设。
例6(P251) H0:μ≤20
右侧检验 H1:μ>20 假设设定
分析:正态总体,方差未知,小样本
统计量选择
统计量计算
23.5 20 t 3.5 s/ n 3/ 9
x 0
