分类变量资料的假设检验
定性资料常用的统计学方法
定性资料常用的统计学方法一、χ2检验χ2检验(chi-square test)是一种主要用于分析分类变量数据的假设检验方法,该方法主要目的是推断两个或多个总体率或构成比之间有无差别。
(一)四格表资料的χ2检验例17:为了解吲达帕胺片治疗原发性高血压的疗效,将70名高血压患者随机分为两组,试验组用吲达帕胺片加辅助治疗,对照组用安慰剂加辅助治疗,观察结果见表4 -5-1,试分析吲达帕胺片治疗原发性高血压的有效性。
表4 -5-1 两种疗法治疗原发性高血压的疗效1.四格表χ2检验的原理:对于四格表资料,χ2检验的基本公式为:式中,A为实际频数(actual frequency),T为理论频数(theoreticalfrequency)。
理论频数T根据检验假设H0:π1=π2确定,其中π1和π2分别为两组的总体率。
计算理论频数T的公式为:式中Tij 为第i行第j列的理论频数,ni+和n+j分别为相应行与列的周边合计数,n为总例数。
现以例17为例说明χ2检验的步骤:(1)建立检验假设并确定检验水准。
H0:π1=π2,即试验组与对照组的总体有效率相等H1:π1≠π2,即试验组与对照组的总体有效率不等α=0.05(2)计算检验统计量。
按式(4 -5-2)计算T11,然后利用四格表的各行列的合计数计算T12、T21和T22,即T11=(44×41)/70=25.77,T12=44-25.77=18.23T21=41-25.77=15.23,T22=26-15.23=10.77按式(4 -5-3)计算χ2值(3)确定P值,作出推断结论。
以ν=1查χ2分布界值表,得P<0.005。
按α=0.05水准,拒绝H,接受H1,可以认为两组治疗原发性高血压的总体有效率不等,即可以认为吲达帕胺片治疗原发性高血压优于对照组。
2.四格表资料χ2检验的专用公式:在对两样本率比较时,当总例数n≥40且所有格子的T≥5时,可用χ2检验的通用公式(4 -5-1)。
假设检验的基本步骤
假设检验的基本步骤(三)假设检验的基本步骤统计推断1.建立假设检验,确定检验水准H0和H1假设都是对总体特征的检验假设,相互联系且对立。
H0总是假设样本差别来自抽样误差,无效/零假设H1是来自非抽样误差,有单双侧之分,备择假设。
检验水准,a=0.05检验水准的含义2.选定检验方法,计算检验统计量选择和计算检验统计量要注意资料类型和实验设计类型与样本量的问题,一般计量资料用t检验和u检验;计数资料用χ2检验和u检验。
3.确定P值,作出统计推理P≤a ,拒绝H0,接受H1P> a,按a=0.05水准,不拒绝H0,无统计学意义或显著性差异假设检验结论有概率性,无论使拒绝或不拒绝H0,都有可能发生错误(四)两均数的假设检验(各种假设检验方法的适用条件与假设的特点、计算公式、自由度确定以与确定概率P值并做出推断结论)u检验适用条件t检验适用条件t检验和u检验1.样本均数与总体均数比较2.配对资料的比较/成组设计的两样本均数的比较配对设计的情况:3点3. 两个样本均数的比较(1)两个大样本均数比较的u检验(2)两个小样本均数比较的t检验(五)假设检验的两类错误与注意事项(Ⅰ和Ⅱ类错误)1.两类错误拒绝正确的H0称Ⅰ型错误-弃真,用检验水准α表示,α=0.05,犯I型错误概率为0.05,理论上平均每100次抽样有5次发生此类错误;接受错误的H0称Ⅱ型错误-存伪。
用β表示,(1-β)为检验效能或把握度,意义为两总体有差异,按α水准检出差别的能力,1-β=0.9,若两总体确有差别,理论上平均每100次抽样有90次得出有差别的结论。
两者的关系:α愈大β愈小;反之α愈小β愈大。
2.假设检验中的注意事项(1)随机化:代表性和均衡可比性(2)选用适当的检验方法(3)正确理解统计学意义(4)结论不绝对(5)单侧与双侧检验的选择四.分类变量资料的统计描述(一)相对数常用指标与其意义1.率2.构成比3.相对比(二)相对数应用注意事项1.观察例数要足够多2.不能犯以比代率的错误3.计算加权平均率或合并率4.可比性,消除混杂因素的影响(可采用标准化方法或分层分析方法。
统计学中的假设检验方法
统计学中的假设检验方法统计学中的假设检验方法是一种常见的数据分析技术,用于验证关于总体特征的假设。
通过统计抽样和概率分布的理论基础,可以通过假设检验方法来评估样本数据对于某种假设的支持程度。
本文将介绍假设检验的基本原理、步骤以及一些常见的假设检验方法。
一、假设检验的原理假设检验是基于一个或多个关于总体特征的假设提出的。
一般来说,我们称原假设为零假设(H0),表示研究者对于总体特征没有明确的预期;对立假设(H1或Ha)则用来说明研究者认为存在显著的差异或关联关系。
假设检验的基本原理是通过对抽样分布的计算和统计量进行假设检验,从而得出是否拒绝零假设的结论。
根据样本数据的统计量计算出的P值,可以作为评估假设支持程度的标准。
一般来说,当P值小于显著性水平(一般为0.05)时,我们会拒绝零假设。
二、假设检验的步骤假设检验的步骤一般包括以下几个方面:1. 明确研究问题和假设:首先要明确研究者所关注的问题和假设,以及零假设和对立假设的表述。
2. 选择适当的检验方法:根据样本数据的类型和问题的特征,选择适当的假设检验方法。
常见的假设检验方法包括t检验、卡方检验、方差分析等。
3. 设置显著性水平:根据研究者对错误接受零假设和拒绝真实假设的容忍度,设置显著性水平。
一般来说,0.05是常用的显著性水平。
4. 计算统计量和P值:根据样本数据计算统计量,并通过统计分布计算对应的P值。
P值表示了在零假设成立的情况下,获得观察到的统计量或更极端结果的概率。
5. 做出结论:根据P值和显著性水平的比较,得出是否拒绝零假设的结论。
如果P值小于显著性水平,我们会拒绝零假设,认为样本数据支持对立假设;反之,我们无法拒绝零假设。
三、常见的假设检验方法1. 单样本t检验:单样本t检验用于比较一个样本的平均值是否显著不同于一个已知的总体平均值。
适用于连续型数据,例如身高、体重等。
2. 独立样本t检验:独立样本t检验用于比较两个独立样本的平均值是否显著不同。
第三章--统计案例-3.2-独立性检验的基本思想及其初步应用
解:由列联表中的数据,得 K2 的观测值为 1 633×30×1 355-224×242 k= ≈68.033>10.828. 254×1 379×54×1 579 因此,在犯错误的概率不超过 0.001 的前提下,认为每 一晚都打鼾与患心脏病有关.
为了调查某生产线上,某质量监督员甲对产
品质量好坏有无影响,现统计数据如下:质量监督员在现 场时,990件产品中合格品为 982 件,次品数为 8 件,甲不 在现场时,510件产品中合格品为493件,次品数为17件, 试分别用列联表、等高条形图、假设检验的方法对数据进
的方法来判断色盲与性别是否有关?你所得的结论在什么
范围内有效? 解:根据题目所给的数据作出如下的列联表: 色盲 不色盲 合计
男 女 合计
38 6 44
442 514 956
480 520 1 000
根据列联表作出相应的等高条形图,如图所示:
38 从等高条形图来看在男人中患色盲的比例480比在女人
38 6 6 中患色盲的比例520要大,其差值为480-520 ≈0.068,差
位统一,图形准确,但它不能给我们两个分类变量有关或
无关的精确的判断,若要作出精确的判断,可以进行独立 性检验的有关计算.
本题应首先作出调查数据的列联表,再根据列联表画
出等高条形图,并进行分析,ห้องสมุดไป่ตู้后利用独立性检验作出判 断.
在调查 480 名男士中有 38 名患有色盲, 520名女士中有6名患有色盲,分别利用图形和独立性检验
步
骤
③如果 k≥k0 ,就推断“X与Y有关系”,这种推断
犯错误的概率不超过α;否则,就认为在犯错误的概 率不超过α的前提下不能推断“X与Y有关系”,或者 在样本数据中没有发现足够证据支持结论“X与Y有 关系”.
统计软件spss操作3_常用假设检验与相关分析
例:
二、连续变量的统计推断:t-检验
例: 以张文彤《SPSS统计分析基础教程》261页 案例数据做配对检验。(文件:配对样本t检 验(治疗前后舒张压拘束比较:张文彤261页 案例).sps)
二、连续变量的统计推断:t-检验
结果解读: 输出结果中”均值“”标准差“”标准误“和” 可信区间“等都是针对配对差值的统计量。由 结果可见,差值均值为10,相应的 P=0.027>0.025,故可以认为该药物对血压治 疗有影响。由于治疗前-治疗后的差值均值为 正,故可推断是使得病人血压下降。
例5:在轿车拥有率案例中,控制城市影响条 件下,更准确研究收入与轿车拥有率的关系。
三、无序分类变量的统计推断:卡方检验
五)分层卡方检验 (控制某些分类因素) 操作: “分析”—“描述统计”—“交叉表” (“层”框中选入城市变量S0) (“统计量”选中“风险”、 “Cochran‟s…”)
三、无序分类变量的统计推断:卡方检验
功能:比较两个总体样本的均值是否相等。实际功 能可以理解为判断是一个总体的样本还是两个总体 的样本,又称为成组设计两样本均数比较。(通常 数据中有一个变量显示分组情况) 也有前面说的两种情况,SPSS只做一种。 操作:“分析”—“比较均值”—“独立样本 t 检验”
例:
比较“均值比较”数据中男女生“自信心”的均值 是否有差异。(即,是同属于一个总体还是分属两 个不同总体)
用p-p图检验CCSS的年龄S3是否符合正态分布。
“分析”—“描述统计”—“p-p图”
一、分布类型检验
三)用p-p图直观数据分布形状 例3:
用茎叶图比较index和S3分布形状。
SPSS-分类变量的假设检验
例4 方法二 (SPSS菜单:Nonparametric Tests)推荐
b+c <25,则给 出精确概率 法!
例5 用两种方法检查已确诊的乳腺癌患者120名,甲法 检出率为60%,乙法检出率为50%,两法一致的检出 率为35%,问两法检出率是否有差异?
例5 方法二 (SPSS菜单:Nonparametric Tests)推荐
上已经有行×列表的精确概率法)。
结果解释
当P0.05,拒绝H0时,总的说来各组有差别,但并不意味 着任何两组都有差别:可能是任何两者间都有差别,也可能 其中某两者间有差别,而其它组间无差别。目前尚无公认的 进一步两两比较的方法(可考虑采用Logistic回归)。
SPSS软件操作过程
例6 某省从3个水中氟含量不同的地区随机抽取10~12 岁儿童,进行第一恒齿患病率的调查(见数据文件 p231.sav),问3个地区儿童第一恒齿患病率是否不同?
(一)完全随机设计的两样本率比较
假设检验的目的 推断两个总体率是否相等
例1 某中药在改变剂型前曾在临床观察152例,治愈129例, 未治愈23例。改变剂型后又在临床观察130例,治愈101 例,未治愈29例。能否得出新剂型疗效与旧剂型不同的 结论?
H0:1=2 H1:12
=0.05
(四)等级资料的比较
(数学公式请参见有关SPSS说明书)
2.双向有序等级资料的比较
Kappa检验 Kappa系数是医学中常用的一致性指标,取值在0~1之间。
目的:先根据Kappa检验判断一致性有无统计学意义,若 P<0.05,说明行变量与列变量存在一致性,然后根据Kappa 系数的大小来反映一致性的好坏。Kappa值越大,一致性 越好。
统计理论5_分类变量的假设检验
组 别 有效
无效
合 计 有效率(%)
试验组 99(90.48) a 对照组 75(83.52) c 合 计 174(a+c)
5(13.52) b 21(12.48) d 26(b+d)
104 (a+ b) 96 (c+d) 200 (n)
95.20 78.13 87.00
版权所有:多多医善
四格表χ 检验
组 别 有效
无效
试验组 对照组
99(90.48) a 75(83.52) c
5(13.52) b 21(12.48) d
合 计 174(a+c)
26(b+d)
合 计 有效率(%)
104 (a+ b)
95.20
96 (c+d)
78.13
200 (n)
87.00
T11 104174 / 200 90.48 ,T12 104 90.48 13.52 T21 174 90.48 83.52 ,T22 26 13.52 12.48
u | p 0 | | p 0 |
p
0 (1 0 ) n
版权所有:多多医善
率的u检验
根据以往经验,一般胃溃疡病患者有20%(总体率)发生胃出血症状。现某医生观察65岁以上胃 溃疡病人152例,其中48例发生胃出血,占31.6%(样本率)。问老年胃溃疡病患者是否较一般胃溃 疡病患者易发生胃出血。
对照组的96例颅内压增高症患者中:有效者为96(174/200)=83.52;无效者为96(26/200)=12.48。
版权所有:多多医善
四格表χ 检验
某院欲比较异梨醇口服液(试验组)和氢氯噻嗪+地塞米松(对照组)降低颅内压的疗效。将200例 颅内压增高症患者随机分为两组,结果见下表。问两组降低颅内压的总体有效率有无差别?
x2检验 医学统计学
基本思想
所谓两属性X和Y互相独立,是指属性X的概 率和属性Y的概率分布无关,否则称这两种 属性之间存在关联性。即
ij
ri cj
( nri n
)( ncj n
)
Tij
n ij
nri ncj n
1. 建立假设 H0:两种属性之间相互独立 H1:两种属性之间相互不独立
α=0.05
2. 计算检验统计
表10-1 两种药治疗急性下呼吸道感染有效率比较
处理
有效例数
无效例数
合计
有效率(%)
A药 B药 合计
68(64.818)a 52(55.182)c
120 (a+c)
6(9.182)b
74 (a+b)
11(7.818)d
63 (c+d)
17 (b+d)
137 (n=a+b+c+d)
91.89 82.54 87.59
P=0.01, x2 =6.63 ▪ P=0.05时, v=1, x2 =3.84
v=2, x2 =5.99
四格表χ2检验公式
当n≥40,T≥5时
2
( ARC TRC )2 TRC
2
ad bc2 n
a ca bc db d
1. 建立假设 H0:两药疗效相同 H1:两药疗效不相同
为两组疗效之间的差异有统计学意义。
观察组和对照组疗效比较
组别 显效 有效 无效
观察组 58
44
18
对照组 56
43
35
合计
114
87
53
配对四格表χ2检验
▪ 一般形式
甲属性
乙属性
医学统计学-假设检验概述
二、假设检验应注意的问题
假设检验利用小概率反证法思想,从问题对立面 (H0)出发间接判断要解决的问题(H1)是否成立。在H0 成立的条件下计算检验统计量,获得P值来判断。当P ≤,就是小概率事件。
小概率事件原理:小概率事件在一次抽样中发生 的可能性很小,如果它发生了,则有理由怀疑H0,认 为H1成立,该结论可能犯的错误。
当不拒绝H0时,没有拒绝实际上不成立的H0,这 类错误称为Ⅱ类错误(“存伪”),其概率大小用β 表示。
假设检验中的两类错误
客观实际
拒绝H0
不拒绝H0
H0成立 第Ⅰ类错误(α) 推断正确(1- α)
H0不成立 推断正确(1- β) 第Ⅱ类错误(β)
α与β的关系: 当样本量一定时, α愈小, 则β愈大,反之α愈大,
距法
理论上:
• 总体偏度系数1=0为对称,1>0为正偏态,1<0为负偏态; • 总体峰度系数2=0为正态峰,2>0为尖峭峰,2<0为平阔峰。 • 只有同时满足对称和正态峰两个条件时,才能认为资料服从
假设检验概述
第五章 假设检验概述
第一节 假设检验的分类、论证方法与步骤 一、假设检验的分类 二、假设检验的论证方法 三、假设检验的步骤
第二节 假设检验的两类错误和注意事项 一、Ⅰ型错误和Ⅱ型错误 二、应用假设检验的注意事项
第三节 正态性检验与数据转换 一、正态性检验 二、数据转换
第四节 例题和SPSS电脑实验
P>:不拒绝H0 ,还不能认为差异有统计学意义… P:拒绝H0,接受H1 ,差异有统计学意义…
第二节 假设检验的两类错 误和注意事项
一、Ⅰ型错误和Ⅱ型错误
1. Ⅰ型错误: 当拒绝H0时,可能拒绝了实际上成立的H0,这
电大医学统计学 形考3
形考任务3
(第5章、第7章)
一、名词解释(每题5分,共20分)
1.χ2检验
χ2检验也称为卡方检验,是对分类变量资料进行假设检验的统计学方法,应
用相当广泛。
2.理论频数
理论频数又称验频数,统计学概念,是指用阳性理论率推算各实际频数的估计值。
3.行×列表
对于两个样本率比较的x2检验;基本数据形式是2行2列,称为2X2列联
表或四格表。
当行数或列数大于2时,称为行X列表或RxC表。
行x列表资料的x2检验主要用于多个独立样本率或多个独立构成比之间的比较。
4.统计表
统计表是以表格的形式客观地展示数据、数据分析过程及统计分析结果的重
要工具。
一个有效的统计表由表号、标题、标目、线条和数字或文字几个部分组成,与文字叙述相比,统计表更加直观,可提供更多的原创信息。
5.统计图
统计图是以点、线、面等几何图形客观展示数据的分布、水平、构成及关系
等特征的重要工具。
-个有效的统计图由图号、标题、标目和几何图形几个部分组成。
与统计表相比,统计图更直观。
二、单项选择题(每题2分,共40分)
1. 三个独立样本率比较的χ2检验,若χ2>χ20.05,2,统计结论为(D)
A. 各样本率均不相同
B. 各总体率均不相同
C. 各样本率不同或不全相同
D. 各总体率不同或不全相同
2. 某医生用甲药治疗15例病人,治愈8人;用乙药治疗20例病人,治愈2人。
比较两药疗效时,可选用的最佳方法是(D)
A. χ2检验
B. t检验
C.校正χ2检验
D. Fisher确切概率法
1/ 5。
