非参数假设检验及其运用

非参数假设检验法及其运用
摘要:在国际金融危机下•以中国股市数据为依据,运用S-plus 统汁分析软件和Excel , 对中国股市正态分布假设进行了 Kolmogorv 拟合优度检验,运用方差平方秩检验方法,比 较分析了上证指数和深证综指的波动性。

关键字:股市:Kolmogorov 拟合优度检验:秩检验。

引言:对中国股市分布的研究,国内各学者对中国股市进行了非参数检验0王金玉、李霞、 潘德惠(2005)通过引入一种新的估计方法“非参数假设检脸方法”,以达到对证券投资咨询 机构,对证券市场大盘定势预测准确度的估计。

周明磊(2004)运用非参数非线性协整检验• 对上证指数与深成指间协整关系进行了研究,结论是:上证指数□深圳成指之间确实存在非 线性的协整关系。

方国斌(2007)从分析中国股市收益率序列的特征入手,寻找描述中国股市 波动性特征的合适的统计模型。

在研究相关文献的基础上,将非参检验应用于中国股市统计特征的研究。

运用 Kolmogorov 拟合优度检验,对中国般市进行了正态分布假设检验;运用方差平方秩检验方 法,比较分析了上海指数和深圳综指的波动性。

正文:
一、Kolmogorov 拟合优度检脸以及方差的平方秩检验方法。

(―)Kolmogorov 拟合优度检验
1・原假设和备择假设
原假设H 。

:样本来自于正态分布总体。

备择假设H(:样本不是来自于正态分布总体。

2・检验统i|•量
令S (X)是样本X 「X2、…X“、的经验分布函数,Fhx)是完全已知的假设分布函数.
则检验统il •量T 为S(x)片F*(x)的最大垂宜距离,即:T = supl F*(x)-S(x)L
3. P 值计算
近似P 值可以通过在表A13中插值得到,或者利用2倍的单边检验的P 值。

(-)方差的平方秩检验
1. 原假设和备择假设
(1) 双边检验 原假设Ho :除了它们的均值可能不同外,X 和Y 同分布。

2 // Z •、/T
I «丿
单边P 值二》
7=1 W 人
且是小于等于nU-t)的最大整数。

当给迫的显著性水平a 大于或等于P 值时,拒绝原 假设°
在本文中,该检验是运用S-plus 统il •分析软件实现的。

这里I 的是检验统il •量的观测值,(n(M)l
备择假设H(:Var(X) HVar(Y)。

(2)左边检验
原假设Ho:除了它们的均值可能不同外,X和y同分布。

备择假设 Hj: var(x)<var(Y)o
2.检验统计量
记Xt、X2、…X为来自总体1、样本容量为n的随机样本,
Y「丫2、…Y Q为来自总体2、容量为m的随机样本•
将Xj和Yj转换为它到均值的绝对离差5和Vj。

U产IX厂Ujl, V .=IY--u^b U|和
u,是总体1和2的均值,若未知,可用样本均值来代替。

以通常方式将秩1到n + m 賦给U和V的合并样本。

如果U的值与V的值没有结,则赋给总体1的秩的平方和可
以用作检验统计量。

其中,T=£k(Uj]2。

1-1
当样本容量大于 10 时T 的近似分位数
wy(N + 0(2N + l)+ 严何 + 0(2心的 +可(「其中,S 为
180
标准正态分布分位数。

3.拒绝域
对于双边检验,在显著性水平a下,求出拒绝域:T(T,)<T^2或T(T|)>T"2 °对
于左边检验,拒绝域:T(「)vTa。

4-作出判断
对于双边检验•根据样本观测值计算T,若T(T,)<T^2或T(T,)>T I_^,O
拒绝原假设。

对于单边检验,根据样本观测值讣算T(T,),若T(TJvTa,则拒绝
原假设.
在本文中,该检验是借助于Exce 1完成的。

二、实证研究
(-)数据的选取及预处理
由于2008年的国际金融危机,改变了世界经济的运行状态,所以选取2009年]月5日
2
到20H年6月30日上海指数和深圳指数收盘价为样本,分析同际金融危机,后中国股市的统讣特征。

将收盘价化为以2009年1月5日为基期的收益率序列,其中,il算收益率采用的是对
数收益率7, /= 警& )、(Pr为第t期的收盘价)。

采用对数收益率的主要原
因,是 log 件 J
对数收益率具有可加性和连续复利收益率的优点。

(二)Kolmogorov拟合优度检验
通过S-plus软件,对上海指数和深圳指数进行Kolmogorov拟合优度检验,检验结果如表1所示Q
(三)方差的平方秩检验
方差的平方秩检验是基于Excel >根据方差的平方秩检验步骤,计算上海指数和指深圳数日收益率序列的均值,将上海指数日收益率序列X和深圳日收益率序列Y转化为序列U和V.
然后将U和V合并,从小到大排序并赋秩,正好U和V都没有结,将总体1的秩的平方和作为检验统计量,运用Excel ,计算出检验统汁量T = 272423095。

由于X和Y的样本容量为604,远大于10,所以检验讣量的分位数计算通过公式(1 )得到0
对于双边检验,在5 %的显著性水平下,T的I拧分位数为3阿嗣9 , T的号分
位数为 279326825 拒绝域为 (Tv 279326825 )|J ( T> 308999979 ), 由于 T =
272423095V279326825.所以,在5 %的显著性水平下,拒绝原假设,即上海指数和深圳指数收益率序列的方差不柑等。

对于左边检验,在5 %的显著性水平下,T的a分位数281712032,拒绝域为T< 281712032 ,由于T= 272423095 < 281712032 ,所以拒绝原假设,接受备择假设,即:Var(X)<Var (Y),也就是说,上海指数日收益率序列的波动性小于深圳指数日收益率序列的波动性0
三、结论
3
(-)国际金融危机后,中国股市收益率序列不服从正态分布。

(二)国际金融危机后,上海指数收益率的波动性和深圳指数收益率的波动性不同,上海
指数日收益率的波动性小于深圳指数日收益率序列的波动性。

即:在上海证券交易所上市的股票整体波动性,小于在深圳证券交易所上市的股票的波动性。

小节:
1.注意kolmogorov拟合优度检验的具体做法:比较实际频数与理论频数的积累率间的差距,
找出最大距离,根据这个值来判断实际频数分布是否服从理论频数分布。

在小样本中,根据渐进分布计算P值的误差会增大,应该通过相应的设定要求软件输出精确检验的P值,像例子中那样带入软件中。

2.方差的平方秩检验可以按照同样的思想对正太分布或者任何想象的其他分布进行检验,但
主要用于对立性变量的检验,且可以用于对两个总体分布的比较。

3.运用Kolmogorov拟合优度检验,进行了正态分布假设检验:运用方差平方秩检验方法, 比
较分析。

在其他问题上都是非常好的检脸方法。

参考文献:
(1)艾克凤.股票收益率的非正态性检验与分布拟合.
商业时代,2006 , ( 31) : 57 — 58 .
(2)王建华、王玉玲、柯开明.中国股票收益率的稳左分布拟合与检验.
武汉理工大学学报,2003. ( 10) : 99 — 102 .
(3)王宁、劳兰珊.中国股票市场风险和收益风格效应的非参数检脸.
上海管理科学,2007, (02) :12 — 14 .
(4)王金玉、李霞、潘徳惠.非参数假设检验在证券投资分析中的应用.
数学的实践与认识,2005 , ( 12) :57 — 61 .
(5)周明磊.上海指数与深圳指数间协整关系的非参数检验.
统讣与决策,2004. (08 ) : 24 — 25 .
(6)方国斌.中国股市波动性聚类特征参数与非参数分析.
技术经济,2007 , (10 ) : 84 - 88 .
4。

合集下载

非参数统计中的Mann-WhitneyU检验使用教程(十)

非参数统计中的Mann-WhitneyU检验使用教程(十)

非参数统计中的Mann-Whitney U检验使用教程统计是一门用来研究数据的学科,而非参数统计是一种不依赖于数据分布的统计方法。

在非参数统计中,Mann-Whitney U检验是一种用于比较两组独立样本的假设检验方法。

它可以用于确定两组样本之间是否存在显著差异。

本文将介绍Mann-Whitney U检验的原理和使用方法,以及如何在实际应用中进行数据分析。

Mann-Whitney U检验的原理Mann-Whitney U检验又称为Wilcoxon秩和检验,它是一种非参数检验方法,适用于两组独立样本的假设检验。

在进行Mann-Whitney U检验时,首先将两组样本的数据合并,并按照从小到大的顺序排列。

然后,对每个样本进行秩次排序,计算出每个样本的秩和。

接下来,计算出较小的秩和作为检验统计量U。

Mann-Whitney U检验的零假设是两组样本的分布相同,备择假设是两组样本的分布不同。

根据检验统计量U的大小,可以计算出P值,用来判断样本之间的差异是否显著。

如果P值小于显著性水平,则拒绝零假设,认为两组样本的分布不同;如果P值大于显著性水平,则接受零假设,认为两组样本的分布相同。

Mann-Whitney U检验的使用方法Mann-Whitney U检验的使用方法相对简单,首先需要准备两组独立样本的数据。

然后,将这两组样本的数据合并,并按照顺序排列。

接下来,对每个样本进行秩次排序,并计算出每个样本的秩和。

最后,根据计算出的检验统计量U和P值,判断两组样本之间是否存在显著差异。

在实际应用中,Mann-Whitney U检验可以用于比较两组样本的中位数是否相等。

例如,可以将一组样本视为实验组,另一组样本视为对照组,然后使用Mann-Whitney U检验来比较两组样本之间的差异。

另外,Mann-Whitney U检验也可以用于比较两组不同处理条件下的实验数据,以确定处理条件是否对实验结果产生显著影响。

Mann-Whitney U检验的实际应用在实际应用中,Mann-Whitney U检验经常用于生物医学研究、社会科学调查和工程实验等领域。

§3-3 非参数假设检验方法

§3-3 非参数假设检验方法

A6 :149.5 x 154.5 9 0.1336
A7 :154 .5 x
3 0.0375
npˆ i
ni2 / npˆ i
0.73 5.09
4.91
4.36
14.72
6.79
26.21
41.55
23.61
24.40
11.22 14.37 3.15
10.02 =87.67
上页 下页 返回
142 149 142 137 134 144 146 147 140 142 140 137 152 145
解 所求问题为检验假设
H0 : X 的概率密度 f ( x)
1
e
(
x )2 2 2
,
x
.

上页 下页 返回
由于在 H0 中参数 , 2 未具体给出, 故先估计, 2. 由最大似然估计法得 ˆ 143.8, ˆ 2 6.02,
在 H0 为真的前提下, X 的概率密度的估计为
fˆ ( x)
1
e
(
x
143.8 262
)2
,
x
.
2π 6
将 X 可能取值区间(,) 分为7个小区间,
A1 : x 129.5
A2 :129.5 x 134.5
A3 :134.5 x 139.5 A4 :139.5 x 144.5
A5 :144.5 x 149.5 A6 :149.5 x 154.5
由于6.52 > 5.991 故有理由拒绝H0 认为顾客对此三种品牌的商品喜好确实存在着显著的差异.
上页 下页 返回
例2 64只某种杂交的几内亚猪的后代,其中34只红色,10只 黑色,20只白色,根据遗传模型,它们之间的比例应为 9:3:4,问以上数据在0.05的水平下体现的与遗传模型是否 吻合。 认为基本吻合

非参数检验-SPSS

非参数检验-SPSS

非参数检验-SPSS什么是非参数检验?非参数检验是一种统计假设检验方法,它不依赖于总体的任何假设条件,如总体分布的正态性、方差的同一性等。

与参数检验相比,非参数检验更加灵活,能够适应更多的数据情况。

为什么需要非参数检验?当我们的数据不满足正态分布等假设条件时,就需要使用非参数检验。

此外,非参数检验还有以下优点:1.不需要知道总体分布的具体形态,从而更加适用于实际情况2.对于离群值和极端值并不敏感3.数据缺失并不会影响检验结果SPSS中的非参数检验现在我们来介绍SPSS中的非参数检验。

1. Wilcoxon符号秩检验Wilcoxon符号秩检验旨在检验两组配对样本的中位数差异是否为零。

它的原假设是两组样本中位数相同。

首先,我们需要打开SPSS,导入数据集,然后点击菜单栏中的“数据”-“配对样本T检验”-“Wilcoxon符号秩检验”。

接下来,我们需要在弹出的对话框中选择配对变量,然后点击“OK”即可得到检验结果。

2. Mann-Whitney U检验Mann-Whitney U检验是一种非参数检验方法,用于检验两组独立样本的中位数是否相同。

它的原假设是两组样本中位数相同。

要进行Mann-Whitney U检验,我们需要打开SPSS,导入数据集,然后点击菜单栏中的“分析”-“非参数检验”-“2独立样本”。

接着,在弹出的对话框中选择两组样本的变量,并设置分析的方法为“Mann-Whitney U检验”。

最后点击“OK”即可得到检验结果。

3. Kruskal-Wallis检验Kruskal-Wallis检验是一种非参数检验方法,用于检验多个独立样本的中位数是否相同。

它的原假设是多组样本中位数相同。

要进行Kruskal-Wallis检验,我们需要打开SPSS,导入数据集,然后点击菜单栏中的“分析”-“非参数检验”-“Kruskal-Wallis检验”。

接着,在弹出的对话框中选择多组样本的变量,并点击“OK”即可得到检验结果。

非参数假设检验

非参数假设检验

§ 7.4 非参数假设检验在§7.2中讨论了母体分布类型为已知时的参数假设检验问题.一般在进行参数假设检验之前,需要对母体的分布进行推断.本节将讨论母体分布的假设检验问题.因为所用的方法适用于任何分布或者仅有微弱假定分布,实质上是不依赖于分布的.在数理统计学中不依赖于分布的统计方法统称为非参数统计方法.这里所讨论的问题就是非参数假设检验问题.这里所研究的检验是如何用子样去似全母体分布,所以又称为分布拟合扰度检验,一般有两种:一是拟合母体的分布函数;另一是拟合母体分布的概率函数.这里我们只介绍三种检验方法:概率图纸法. 2χ-拟合优度检验和柯尔莫哥洛夫斯米尔诺夫检验.一, 概率图纸法这是一种比较直观和简便的检验方法.它适合于在现场使用.目前常见的概率图纸有正态,对数正态,二项分布,指数分布和威布尔分布概率图纸等.这里我们只介绍正态概率图纸,关于其它分布的概率图纸的构造原理和使用方法都是类似的1. 正态概率图纸的构造原理设母体ξ有分布函数F(x),{N(μ,2σ)}表示正态分布族.需要检验假设)},({)(:20σμN x F H ∈这里μ和2σ均为未知常数.在原假设0H 为真时,通过中心化变换)(2121)(22)(222σμπσπσμμσμ-Φ===⎰⎰-∞--∞---x du edt e x F x xt即σμξξμ-=)(服从正态N(0,1).函数u(x)是x 的线性函数.σμξξμ-=)( (7.13)在(x,u(x))直角坐标平面上是一条直线.这条直线过(μ,0),且斜率为σ1.2. 检验步骤.事实上,我们知道的不是母体ξ取出的一组子样观察值n x x ,,1 由格里汶科定理知道子样的经验分布函数)(x F n 依概率收剑于母体分布函数F(x).所以在检验母分体布函数F(x)是否属于正态分布族时,我们以大子样的经验分布函数)(x F n 作为母体分布的近似.若0H :F(x)∈{N(μ,2σ)}为真,那末点,,,1)),(,(n i x F x i i =在正态概率图纸上应该在一条直线上.所以根据上述经验分布函数)(x F n 是母体分布函数F(x)很好的近似,点,,,1)),(,(n i x F x i i =在正态概率图纸上也应该近似地在一条直线附近.倘若点列)),(,(i i x F x 不是近似地在一条直线附近,那末只能说明F(x)不属于正态分布族.根据上述想法,用正态概率图纸去检验假设0H 的具体步骤如下.(1) 整理数据(2) 描点(3) 目测这些点的位置, 3. 未知参数μ与2σ的估计.若通过概率图纸检验已经知道母体服从正态分布,我们就凭目测在概率图纸上画出最靠近各点,,,1)),(,()()(n i x F x i n i =的一条直线l,因为σμξξμ-=)(服从正态N(0,1),所以当0)(=-=σμξμx ,即x=μ时对应的概率F=0.5.因此,只要在概率图纸上面一条F=0.5的水平直线.这条直线与直线l 的交点的横坐标5.0x 就可以作为参数为μ的估计.又由μ(x)=1时所对应的概率F=0.8413的水平直线,这条直线与直线l 的交点的横坐标为8413.0x .这个8413.0x 显然满足18413.08413.0=-=σμμx 即μσ-=8413.0x 因此可以用差5.08413.0x x -估计σ.例 7.8 (略)见P 338 二, 2χ的似体检验法前面介绍了直观而简便的概率图纸法,它不需要很多计算就能对母体分布族作出一个统计推断,并且还能对分布所含的参数作出估计.但是这种方法因人而异,且精度不高,又不能控制犯错误的概率.这里介绍2χ-拟合检验法,它能够像各种显著性检验一样控制犯第一类错误的概率.设母体ξ的分布函数为具有明确表达式的F(x),.我们把随机变量ξ的值域R 分成k 个互不相容的区间[][][]k k k a a A a a A a a A ,,,,,,1212101-=== 这些区间不一定有相同的长度.设n x x ,,1 是容量为n 的子样的一组观测值.i n 为子样观测值n x x ,,1 中落入i A 的频数.n n ni i =∑=1在这n 次事件i A 出现的频率为nn i .我们现在检验原假设)()(:00x F x F H =.设在原假设0H 成立下,母体ξ落入区间i A 的概率为i P ,即k i a F a F A P P i i i i ,1),()()(100=-==- (7.14)此时n 个观察值中,恰有1n 个值落入1A 内,2n 的观察值落入2A 内,k n 个观察值落入k A 内的概率为k nn n n k P P P n n n n 212121!!!!这是一个多项分布.按大数定理,在0H 为真时,频率nn i 与概率i P 的差异不应太大.根据这个思想构造一个统计量2χ=∑=-ki ii i nP nP n 12)( (7.15)称做2χ-统计量.往后可以看到,用2χ表示这一统计量不是没有原因的.因为它的极限分布就是自由度为k-1的2χ-分布.为了能够把2χ-统计量用来作检验的统计量,我们必须知道它的抽样分布.我们先k=2的简单情形.在0H 成立下,221)(,)(P A P P A P i ==其中121=+P P这时,频数n n n =+21我们考察222212112)()(nP nP n nP nP n -+-=χ(7.16)令222111,nP n Y nP n Y -=-= (7.17)显然0)(212121=+-+=+P P n n n Y Y (7.18)由此可见1Y 与2Y 不是线性独立,且21Y Y -=.于是21212221212P nP Y nP Y nP Y =+=χ21111)1(⎥⎥⎦⎤⎢⎢⎣⎡--P nP nP n (7.19) 根据德莫弗-拉普拉斯极限定理,当n 充分大时,随机变量)1(1111P nP nP n --的分布是接近于正态的,从而推得k=2情形的分布,当n 充分大时,是接近于自由度为1的2χ-分布.对于一般情形有如下的定理.定理 7.1 当0H 为真时,即k P P ,,1 为母体的真实概率时,由(7.15)式所定义的统计量2χ的渐近分布是自由度为k-1的2χ-分布,即密度函数为⎪⎪⎩⎪⎪⎨⎧⎪⎭⎫ ⎝⎛-Γ=---,0,2121)(22321xk k e x k x f (7.20) 证 因为在n 个观测值中恰有1n 个观测值落入1A 内, 2n 的观察值落入2A 内,k n 个观察值落入k A 内的概率为k nn nnk P P P n n n n 212121!!!!这里n n n n k =+++ 21.其特征函数nk j it j k je P t t ⎪⎪⎭⎫⎝⎛=∑=112),,( ϕ (7.21) 令k j nP nP n Y jjj j ,2,1, =-=(7.22)于是有∑∑===-=kj jkj jj j YnP nP n 12122)(χ(7.23)和∑=kj j jP Y1=0 (7.24)由此式看出,诸随机变量j Y 不是线性独立的.(k Y Y ,,1 )的联合分布的特征函数具有形状2111exp exp ),,(⎥⎥⎦⎤⎢⎢⎣⎡⎪⎪⎭⎫⎝⎛∙⎪⎪⎭⎫ ⎝⎛-=∑∑==kj j j j kj j jk nP it P nP itt t ϕ (7.25) 两边取对数得⎥⎥⎦⎤⎢⎢⎣⎡⎪⎪⎭⎫⎝⎛+-=∑∑==k j j j j kj j jn nP it P n P t n i t t 111exp ln ),,(ln ϕ (7.26) 利用指数数函和对数函在0=j t 处的泰勒展开:⎪⎭⎫ ⎝⎛+-=-⎥⎥⎦⎤⎢⎢⎣⎡n nP t nP itnp itj jjjjj121exp 2ο 和)(2)1ln(22x xx x ο+-=+于是)1(21211211ln ),,(ln 11212111211οοϕ+⎥⎥⎦⎤⎢⎢⎣⎡⎪⎪⎭⎫⎝⎛--+-=⎪⎪⎭⎫⎝⎛⎪⎭⎫ ⎝⎛+-++-=∑∑∑∑∑∑∑=======kj kj kj j jjj jkj j j kj kj jj jkj j jk P tnit n P tn i n P t n i n t n P tn i n P t n i t t当∞→n 时⎥⎥⎦⎤⎢⎢⎣⎡⎪⎪⎭⎫ ⎝⎛--→∑∑==k j kj j jj k P t t t t 1212121),,(ln ϕ 即⎪⎭⎪⎬⎫⎪⎩⎪⎨⎧⎥⎥⎦⎤⎢⎢⎣⎡⎪⎪⎭⎫⎝⎛--=∑∑==∞→kj k j j jj k n P t t t t 1212121exp ),,(limϕ (7.26) 作一正交变换:⎪⎪⎩⎪⎪⎨⎧=-==∑∑==kj j k j kj lj l Y P Z k l Y a Z 111,,1, (7.27) 其中lj a 应该满足1,,1,,0,11-=⎩⎨⎧≠==⋅∑=k r l r l r l a a kj rj lj 和1,,1,01-==∑=k l P akj j lj由⎪⎪⎩⎪⎪⎨⎧=-==∑∑==kj j j k kj y ij l t P u k l t a u 111,1, (7.28) 得到∑∑∑-====⎪⎪⎭⎫⎝⎛-1122112k j jkj i kj jj uP t t (7.29)由(7.26)知,当∞→n 时,(k Z Z ,,1 )的特征函数⎭⎬⎫⎩⎨⎧-=∑-=∞→112121exp ),,(limk j j k n u u u ϕ.这意味着11,,-k Z Z 的分布弱收剑于相互独立的正态N(0,1)分布,而k Z 依概率收剑于0.因此∑∑====kj jkj jZY12122χ的渐近分布是自由度为k-1的2χ-分布.如果原假设0H 只确定母体分布类型,而分布中还含有未知参数m θθ,,1 则我们还不能用定理7.1来作为检验的理论依据.费歇证明了如下定理.从而解决了含未知参数情形的分布检验问题.定理 7.2 设F(x; m θθ,,1 )为母体的真实分布,其中m θθ,,1 为m 个未知参数.在F(x;m θθ,,1 )中用m θθ,,1 的极大似然估计mθθ∧∧,代替m θθ,,1 并且以F(x; m θθ∧∧,)取代(7.4)中的F(x)得到),,1;(),,1;(1m a F m a F i i i P θθθθ∧∧-∧∧∧-= (7.30)则将(7.30)代入(7.15)所得的统计量∑=∧∧-=kj i ini nn p p 122()χ(7.31)当∞→n 时有自由度为k-m-1的2χ-分布.例 7.9 (略)见P 345由例子来总结一下利用2χ-检验分布假设的步骤:(1)把母体ξ的值域划分为k 个互不相交的区间[,,,1),,1k i a a i i =+其中k a a ,1可以分别取∞∞-,;(2) 在0H 成立下,用极大似然估计法估计分布所含的未知参数; (3)在0H 成立下,计算理论概率)()(010i i i a F a F p -=+并且算出理论频数i nP ; (4)按照子样观察值n x x x ,,,21 落在区间),[1+i i a a 中的个数,即实际频数,,,1,k i n i =和(3)中算出的理论频数i nP ,计算ii i nP nP n )(2-=χ的值;(5)按照所给出的显著性水平α,查自由度k-m-1的2χ-分布表得)1(21---m k αχ,其中m 是未知参数的个数; (6)若2χ21αχ-≥,则拒绝原假设0H ,若212αχχ-<,则认为原假设0H 成立.三 柯尔莫哥洛夫似合检验------n D 检验2χ-似合检验是比较子样频率与母体的概率的.尽管它对于离散型和连续型母体分布都适用.但它是依赖于区间的划分的.因为即使原假设)()(:00x F x F H =不成立,在某种划分下还是可能有k i P a F a F a F a F i i i i i ,,1,)()()()(1001 ==-=---从而不影响(7.5)中2χ的值,也就是有可能把不真的原假设0H 接受过来.由此看到,用2χ-检验实际上只是检验了,,,1,)()(100k i P a F a F i i i ==--是否为真,而并未真正地检验母体分布F(x)是否为)(0x F .柯尔莫哥洛夫对连续母体的分布提出了一种方法.一般称做柯尔莫哥洛夫检验或n D -检验.这个检验比较子样经验分布函数)(x F n 和母体分布函数F(x)的.它不是在划分的区间上考虑)(x F n 与原假设的分布函数之间的偏差.而是在每一点上考虑它们之间的偏差.这就克服了2χ-检验的依赖于区间划分的缺点.但母体分布必须假定为连续.根据格里汶科定理,我们可以把子样经验分布函数看作实际母体分布函的缩影.如果原假设成立,它与F(x)的差距一般不应太大.由此柯尔莫哥洛夫提出一个统计量|)()(|supx F x F D n xn -=(7.32)并且得到这统计量n D 的精确分布和极限分布K(λ).它们都不依赖于母体的分布.这里我们不加证明地引入柯尔莫哥洛夫定理.定理 7.3 设母体ξ有连续分布函数F(x),从中抽取容量为n 的字样,并设经验分布函数为)(x F n ,则|)()(|supx F x F D n xn -=的分布函数⎪⎭⎫ ⎝⎛+<n D P n 21λ =n n n n dy y y f n nn n nn n n n 2120212,1,),,(0,021********22121-<≤⎪⎪⎪⎩⎪⎪⎪⎨⎧-≥<⎰⎰⎰+-+-+---λλλλλλλλλ 当 (7.33)其中⎩⎨⎧<<<=其它当,010!),(11n n y y n y y f在∞→时有极限分布函⎪⎩⎪⎨⎧≤>--=→<∑-∞=0,00),2exp()1()()(22λλλλλ当当n j j n j K D n P (7.34) 在应用柯尔莫哥洛夫检验时,应该注意的是,原假设的分布的参数值原则上应是已知的.但在参数为未知时,近年来有人对某些母体分布如正态分布和指数分布用下列两种方法估计.()可用另一个大容量子样来估计未知参数,(2)如果原来子样容量很大,也可用来估计未知参数.不过此n D -检验是近似的.在检验时以取.较大的显著性水平为宜,一般取α=0.10-0.12.n D -检验检验母体有连续分布函数F(x)这个假设的步骤如下:(1) 从母体抽取容量为n 的子样,并把子样观察值按由小到大的次序排列;(2) 算出经验分布函⎪⎪⎩⎪⎪⎨⎧≤=<≤<=+x n j x x x nx n x x x F k j j jn 当当当,1,,1,,)(,0)()1()()1((3) 在原假设0H 下,计算观测值处的理论分布函数F(x)的值; (4) 对每一个i x 算出经验分布函数与理论分布函数的差的绝对值||)()(||)()()()1()()(i i n i i n x F x F x F x F --+与(5) 由(4)算出统计量的值(6) 给出显著性水平α,由柯尔莫哥洛夫检验的临界值表查出α=≥)(,n n D D P的临界值α,n D ;当n>100时,可通过n D n /1,ααλ-≈查n D 的极限分布函数数值表得αλ-1从而求出α,n D 的近似值.(7) 若由(5)算出的α,n n D D ≥则拒绝原假设0H ;若α,n n D D <则接受假设,并认为原假设的理论分布函数与子样数据是似合得好的. 例 7.10 略) 见P 351定理 7.4 当样本容量21n n 和分别趋身于∞时,统计量|)()(|212121,supx F x F D n n xn n -=有极限分布函数)(212121λλK D n n n n P n n →⎪⎭⎪⎬⎫⎪⎩⎪⎨⎧<+⎪⎩⎪⎨⎧≤>--=∑∞-∞=0,00),2exp()1(22λλλ当当j j j (7.35) 例 7.11 (略)见P 353。

统计学中的非参数检验方法

统计学中的非参数检验方法

统计学中的非参数检验方法统计学是一门应用广泛的科学领域,它的应用范围涉及到社会、经济、医学、科学等各个领域。

非参数检验方法是统计学中的一种基于数据分布情况的假设检验方法,它不仅可以应用于各个领域的研究中,也是数据分析领域中不可或缺的一部分。

什么是非参数检验非参数检验是一种基于统计数据分布情况做出判断的方法,在对特定类别的数据进行假设检验的时候,不依赖于数据分布的形状,而且它可以处理许多小样本或者没有熟知的总体参数的数据。

非参数检验方法的应用范围广泛,可以用于数据汇总、逻辑推理、实验设计以及其他数据分析中的问题。

非参数检验的优势传统的统计假设检验方法是基于大样本数据的总体参数进行推断的,其可以直接获得总体参数值,但是对于小样本数据而言,则需要使用比较多的假设、术语和统计量、偏差的值来判断出研究问题的可行性,而非参数检验则可以用较少的假设来完成数据分析,避免了数据误判,降低了数据分析的难度。

非参数检验的应用非参数检验方法在实际生活中的应用,主要表现在以下几个方面:1. 样本分布非正态:如果样本数据分布不满足正态分布,这时是可以应用非参数检验方法的。

2. 样本数据较少:如果样本数据较少,传统假设检验方法会有较高的错误率,可以使用非参数检验方法来避免这种情况。

3. 样本数据有异常值:若样本数据存在严重的异常值,应用传统的假设检验方法可能会导致数据误判,此时可以应用非参数检验方法进行数据分析。

常见的非参数检验方法常见的非参数检验方法有:1. Wilcoxon符号秩检验:适合偏差没达到正态分布的样本。

2. Mann-Whitney U检验:主要用于2组样本数据非独立的情况。

3. Kruskal-Wallis检验:用于3组及以上的样本比较,判断样本总体是否有差别。

4. Friedman秩和检验:主要用于分析多组数据的内部联系。

5. Kolmogorov-Smirnov拟合检验:用于检验给定的样本是否符合特定分布。

经典非参数假设检验方法全

经典非参数假设检验方法全

此是 m = 3, n1 = 34, n2= 10, n3 = 20,n=64
例3 验证一枚骰子是否均匀。 电话号码的数字出现的概率等等问题。 采用分组离散化方法 若X的分布函数F(x)的具有明确表达式F0(x),不含未知参数。 根据样本信息推断X的分布函数是否为F0(x).
第一步:
第二步:计算
第三步:记数
非参数假设检验方法
一、2拟合优度检验 二、柯尔莫哥洛夫 三、斯米尔诺夫检验 四、独立性检验
一、2拟合优度检验
适用范围广:一个离散、连续、正态总体都适用。
1、多项分布的2检法
离散总体
对一次抽样来说,
现在对总体X进行假设,即对X的分布律进行假设
由于频率是概率的近似表现,
那么当容量 n 较大时,
例1 某商场为了研究顾客对一类商品的某三种品牌商品的喜 好比例,以便为下次进货提供较科学的依据。现随机观 察购买此商品的150名顾客,并记录下其所买的品牌,统 计人数如下:
品 牌



所购买的人数
61
53
36
依据这些数据,是否可以断定顾客对此三种品牌的商品喜好 确实存在着显著的差异?( = 0.05 )
为什么用非参数方法?
• 非参数检验是针对参数检验而言的。从检验步 骤上讲,二者是一致的:它们都是对总体的某 种数量特征建立相应的原假设和备择假设,都 是在给定的显著性水平下,根据实际统计量来 判断对原假设的取舍。 • 二者的不同之处在于:参数检验需要对总体分 布作限制性的假定。这种假定实际就是要求总 体的分布类型已知,所不知道的只是其中的某 个参数,如均值或方差。而非参数检验并不要 求已知总体的分布信息,而是根据数据本身来 推断总体参数。

数理统计实验三非参数假设检验

西北农林科技大学实验报告学院名称:理学院专业年级:姓名:学号:课程:数理统计学报告日期:实验三非参数假设检验一.实验目的1. 验证某产品的合格率是否是否低于0.9.2. 检验某地区儿童身高是否符合正态分布。

3. 为研究心脏病猝死人数与日期的关系,收集到168个观测数据,利用这批样本数据推断猝死人数与日期的关系是否为2.8:1:1:1:1:1:1.4. 某工厂用甲乙两种工艺生产同一种产品,利用样本数据检验两种工艺下产品使用寿命是否存在显著差异。

二.实验要求用spss实现非参数假设检验,包括二项式检验,单样本正态分布检验,两个独立样本检验,卡方检验。

三.实验内容(一)验证某产品的合格率是否是否低于0.9.打开文件“非参数检验(产品合格率)”,点击分析->非参数检验->旧对话框->二项式,把数据“是否合格”添加到检验变量列表,把检验比例默认的0.5该为题目要求的0.9(如图所示)。

点击确定得到结论(如图所示)。

结论:由上表知,SPSS的悖假设检验案例比例小于0.9的,并且在精确显著(单侧)值sig=0.193>0.05,即接受原假设检验,即二项式检验的案例比例是大于0.9的。

(二)检验某地区儿童身高是否符合正态分布。

打开文件“非参数检验(单样本KS-儿童身高)”,点击分析->非参数检验->旧对话框->1样本,把数据“周岁儿童的身高(sg)”添加到检验变量列表,检验分布默认为常规,即正态(如图所示)。

点击确定得到结论(如图所示)。

结论:由上述的结果可以看出,周岁儿童的身高是满足正态分布其中均值为71.8571,标准差为3.97851,可知某地区的儿身高满足正态分布。

除此之外,由上面的结果中的检验值sig=0.344>0.05也可以得出原假设检验是成立的,即接受身高满足正态分布的假设。

(三)为研究心脏病猝死人数与日期的关系,收集到168个观测数据,利用这批样本数据推断猝死人数与日期的关系是否为2.8:1:1:1:1:1:1.打开文件,在变量视图窗口中,点击数据->加权个案,对话框右边选项点击加权个案,把“死亡日期”添加到频率变量中,(如图所示),点击确定。

非参数统计中的秩和检验方法详解(九)

非参数统计中的秩和检验方法详解统计学是一门研究数据收集、分析、解释和呈现的学科,非参数统计是其中的一个重要分支。

在非参数统计中,秩和检验方法是一种常用的假设检验方法,它不依赖于总体分布的具体形式,适用于各种类型的数据。

本文将对秩和检验方法进行详细介绍,包括其原理、应用场景和计算步骤。

1. 原理秩和检验方法是基于数据的秩次而进行的假设检验方法。

在正态分布检验中,我们通常使用t检验或者方差分析,这是基于总体分布的参数进行的假设检验。

而在非参数统计中,我们无法事先确定总体分布的形式,因此需要使用秩和检验方法。

秩和检验方法的原理是将样本数据按照大小进行排序,然后用它们的秩次代替原始数值进行统计分析。

这样的做法可以减小数据的离群值对分析结果的影响,使得分析更加稳健。

同时,秩和检验方法也不受数据的分布形式的限制,适用范围更广。

2. 应用场景秩和检验方法适用于各种类型的数据,特别是对于偏态分布或者具有离群值的数据,秩和检验方法更具优势。

例如,在医学研究中,我们经常需要比较两组病人的治疗效果,由于病人的个体差异很大,数据的分布可能并不符合正态分布假设,这时使用秩和检验方法会更加合适。

此外,在实验设计中,如果数据的方差不齐或者数据不符合正态分布,也可以考虑使用秩和检验方法。

总之,秩和检验方法适用于各种类型的数据,尤其是当数据的分布形式不确定时,是一种非常有力的假设检验方法。

3. 计算步骤使用秩和检验方法进行假设检验,主要分为以下几个步骤:(1)计算秩次:首先将样本数据按照大小进行排序,然后给每个数值赋予一个秩次。

对于相同的数值,可以取它们的平均秩次。

(2)计算秩和:分别计算两组样本数据的秩和,作为检验统计量。

(3)计算临界值:根据显著性水平和自由度,查找秩和检验的临界值。

(4)假设检验:比较计算得到的检验统计量和临界值,进行假设检验。

4. 实例分析为了更好地理解秩和检验方法的应用,我们举一个简单的例子进行分析。

假设有两组样本数据,分别为:组1:5, 8, 10, 12, 15组2:6, 7, 9, 11, 14我们希望比较这两组数据的中位数是否相等。

非参数检验表达

非参数检验表达非参数检验表达是指一种用于检验统计中假设的方法,不需要假设数据满足一定的概率分布。

相对于参数检验,非参数检验的优势在于对数据概率分布的限制较少,更加灵活。

下面我们将结合实例,分步骤阐述非参数检验表达的过程。

第一步:确定零假设和备择假设在进行非参数检验之前,需要先明确零假设和备择假设。

零假设是指对实验中某个参数的陈述,常常假设该参数值为特定的常数或者两组数据之间没有显著性差异。

备择假设通常是指与零假设相反的某种假设。

例如,我们研究一批学生的英语成绩是否存在差异。

那么零假设可以设定为“两组学生的英语成绩相等”,备择假设可以设定为“两组学生的英语成绩不相等”。

第二步:选择用于检验的非参数检验方法根据实验设计和数据类型的不同,可选择多种非参数检验方法,如Wilcoxon-Mann-Whitney检验、Kruskal-Wallis检验、Friedman检验、秩相关检验等等。

例如,对于两组样本的情况,我们可以选择Wilcoxon-Mann-Whitney检验来判断它们是否具有显著性差异。

如果有三组或以上的样本需要比较,则可以选择Kruskal-Wallis检验。

第三步:计算统计量和p值在进行非参数检验时,需要计算统计量和p值,确定是否拒绝零假设。

统计量通常是样本的秩之和或秩平均数等,而p值是指得到检验统计量比该值更极端的概率。

例如,进行Wilcoxon-Mann-Whitney检验时,可以计算出样本的秩和,然后根据秩和计算出一个检验统计量。

接着,可以将该统计量与对应的临界值比较,计算出p值,并根据p值的大小判断是否拒绝零假设。

第四步:做出结论最后,在检验完成后,需要根据结果做出结论,确定是否拒绝零假设。

如果p值小于预先设定的显著性水平(通常为0.05),则拒绝零假设,即两组数据具有显著性差异;否则不能拒绝零假设。

例如,如果通过Wilcoxon-Mann-Whitney检验发现p值小于0.05,则可以得出结论,两组学生的英语成绩存在显著性差异。

3.3非正态总体参数的假设检验和非参数检验


若样本容量充分大,且总体方差未 X 0 知时,可取统计量 U ,当 S/ n n充分大(一般要求 n 100 )时, U近似服从标准正态分布,故问题也 归结为u检验。
例1. 今从总体抽得样本容量为150的 2 样本,算得 x 0 .4 ,s 1 6 , 试在水 平0.05下检验假设 H : 0 ; H : 0 . 0 1 例2.(伯努利分布总体的参数检验) 某 厂产品的不合格率通常为5%。厂方希 望知道原料产地的影响是否会对产品的 质量产生显著影响,今随机地从一批产 品中抽取100个,发现7个不合格品,试 问厂方可以得出什么结论?(α=0.05)
* n
i i 1 D m a x m a x { | F ( x ) | , | F ( x ) | } n 0 ( i ) 0 ( i ) 1 in n n
对于给定的显著性水平,可以通 过查表确定拒绝域. Kolmogorov检验法要求F 0 ( x ) 完全 确定,即不含任何待估参数。
~ ( r 1 )
2 2
由上述定理,当样本容量较大时, 2 统计量 近似服从自由度为r-1的卡 方分布。
p pi 1 , 2 , , r 从而对假设H0: 的检 i i, 验转化为卡方检验。对给定的显著 2 2 r 1 ) 性水平α ,则拒绝域为 1 (
0
通过把样本值代入上述统计量,最 终判断接受或拒绝原假设H0。
与皮尔逊检验法相比,K检验更 精确,但适用范围较小。
服从多项分布。
由大数定律知,当n充分大时,频 数ni与理论频数npi越来越小。故ni 与npi之间的差异可以反映出概率分 ,p , ,p 布 (p 是否为总体的真实分 1 2 r) 布。令
(ni npi ) npi i 1
  1. 1、下载文档前请自行甄别文档内容的完整性,平台不提供额外的编辑、内容补充、找答案等附加服务。
  2. 2、"仅部分预览"的文档,不可在线预览部分如存在完整性等问题,可反馈申请退款(可完整预览的文档不适用该条件!)。
  3. 3、如文档侵犯您的权益,请联系客服反馈,我们会尽快为您处理(人工客服工作时间:9:00-18:30)。
相关文档
最新文档