SPSS第四章 基本统计分析

合集下载

第4章-SPSS基本统计分析

第4章-SPSS基本统计分析

2016/12/25
21
基本描述统计量
描述离散程度的统计量
离散程度:指一组数据远离“中心值”的程度。 即考查所有数据相对于“中心值”分布的疏密程度。 如果数据都紧密地集中在“中心值”的周围,数 据的离散程度较小,则说明“中心值”对数据的 代表性就好; 如果数据比较松散地分布在“中心值”的周围, 数据的离散程度较大,则 “中心值”说明数据特 征是不具有代表性的。
案例

利用“大学生职业生涯规划数据”进行 以下分析:
1. 计算专业和职业认知得分的基本描述统计
量,并比较男女生的得分差异; 2. 分析是否存在专业和职业认知得分的异常 值。

应用举例
基本描述统计
以“居民储蓄调查数据”为例,对一次存(取)款金 额。有两个分析目标: 目标一:计算存(取)款金额的基本描述统计量,并对 城镇储户和农村储户进行比较 (数据拆分)
SK 0
左(负)偏态
x
M M
152 153 154 155 156 157 158 159 160 161 162 163 164 165 166 167 168 e 169o170 171 172 173 174 175
基本描述统计量

描述陡峭程度的统计量
– 峰度(kurtosis): 描述某变量取值分布形态陡缓程

合 计
频数分析表

频数分析的任务: 编制频数分布表
用宽度相同的条形的高度或长短来表示频数分布变化的图 如果有缺省值,那 – 各组的名称 形。使用于定序和定类变量的分析 么有效百分比能更 – 频数(Frequency) 加准确地反映取值 用圆形及圆内扇形的面积来表示频数百分比变化的图形。 – 百分比(Percent) 分布状况

第四章 SPSS基本统计分析共60页文档

第四章 SPSS基本统计分析共60页文档

操作步骤:
打开数据文件“婴儿体重.sav”。打开 Descriptives主对话框,选定变量t进入 Variable栏中。
选中Save standardized values as variables复选框,要求计算变量的z值,并 保存结果到当前数据集中。
单击Options按钮,选中Mean、 Std.Deviation、Minimum、Maximum 、 Variance 项。
统计量
选择一个或多个 变量右移入 Variable(s)框。
统计图 频数输出的顺序
输出统计量对话框
Chart 对话框
按变量值的升序输出 按频数的升序输出
统计表中变量的各 项分析结果在一张 表并列显示
按各个变量组织输 出,输出结果将按 照每个变量一张表 的形式显示
控制频数表输出范围 类型的最大数目为
• 统计结果表明:本市户口家庭的人均住房面 积的均值是21.7平方米,低于外地户口家庭 26.7。无论是本市户口还是外地户口,人均住 房面积的分布均呈一定的右偏分布(两个偏 度统计量分别为2.18和1.43),且本市户口的 偏度更大些;同时,本市户口和外地户口家 庭人均住房面积均呈尖峰分布(两个峰度统 计量分别为8.3和2.1)。由此可见,本市户口 和外地户口中的大部分家庭的人均住房面积 都低于各自的平均水平,此时,仅用均值刻 画住房状况是不准确的。
(二)基本描述统计量
• 常见的基本描述统计量可以分为三大类: 1、集中趋势的描述统计量(均值、中位 值、众值); 2、离散程度的描述统计量(标准差、方 差、极差); 3、分布形态的描述统计量(偏度系数、 峰度系数)。
(三)应用举例
• 利用住房状况调查问卷数据, 对人均住房面积计算基本描 述统计量,并分别对本市户 口和外地户口家庭进行比较。 (首先进行数据拆分)

4-1.SPSS基本统计分析

4-1.SPSS基本统计分析

口”的两类调查对象在居室面积(变量a7)
上的分布差异。
具体要求—— 上述各题,均要求随机选择规定数量的 个案来进行分析。(数量的确定:用 自己学号的最后两位数乘以10,再加 上1600,所得数字为各人要分析的个 案数量。)
第二节
描述性统计分析
一、概述
SPSS的描述性统计分析过程的功能与 频数分析过程类似,但没有图形功能。
集 中 值
离散值
分布参数栏
其中,选项“values are group midpoints”,如果数据已经分组,就 按分组的数据计算中位数和百分位数。
在“Chart(图形)”对话框中,其 中“Histogram(s)(直方图)”下方的 “With normai curve(绘制正态分布曲 线)”,表示在显示的直方图中添加正 态曲线图,用于推断数据是否近似服从 正态分布。

SPSS输出的频数分布表包括的内容:
⑴频数(Frequency)
⑵百分比(Percent)
⑶有效百分比(Valid Percent)
⑷累计百分比(Cumulative Percent)
三、操作演示与例题分析1
数据:“2000某市房产抽查”数据
变量:a6房屋结构
结果呈现的内容:
⑴ 频数分布表;
⑵ 基本图形;
注意—— 不同层次变量能够适用的集中值和离散 值是不一样的。在Statistics对话框中,要 根据不同的变量选择不同的统计值。 定类变量:众值、异众比率。 定序变量:中位数、四分互差;众值、 异众比率。
定距变量:均值、极差和方差;众值、 异众比率;中位数、四分互差。
Format(格式)对话框
选择频数表中排 列顺序 用于设置频数表输出的格式 多变量框中可设定多变量 表格输出的格式

第四章SPSS基本统计分析

第四章SPSS基本统计分析
SPSS (以5种饮料购买频数.sav为例)
菜单分析
描述统计
频率
SPSS
SPSS
SPSS
SPSS
SPSS
SPSS频数分析的扩展功能
• 计算分位数 • 计算其他描述统计量 • 频数分析表格式的定义
计算集中趋势
SPSS
计算 分位 数
计算离 散程度
SPSS
频数分布格式定义
频数分析应用举例 SPSS (以居民储蓄调查数据.sav为例)
根据样本数据,产生二维或多维交叉列联表
在交叉列联表的基础上,对两两变量间是否 存在一定的相关性进行分析
目的
分析多变量不同取值下的分布,掌握多变量的联合 分布特征,进而分析变量之间的相互影响和关系
交叉列联表的主要内容
SPSS
行 变 量
列变 量
二维 交叉 列联 表 行 边 缘 分 布
列边 缘分 布
SPSS
SPSS
SPSS
SPSS
对存款金额按照户口进行拆分
SPSS
按户 口拆 分好 的数 据
SPSS
对拆分好的数据进行频数分析
SPSS
SPSS
SPSS
练习
• 现有SY-3(公司职员统计表).sav,要求对 其中的变量年龄和受教育年限进行频数分 析,结果输出中要求有四分位数、均值、 标准差、方差、最大值、最小值、数据分 布的偏度和峰度情况,输出条形图,图表 值按照频率输出,格式则按照系统默认的 方式进行,要显示频率表格。
分析
多重 响应
定义变 量集
SPSS
SPSS
分析 SPSS
多重响应
频率
SPSS
SPSS
储户的存款目的 SPSS

第4章 SPSS基本统计分析

第4章 SPSS基本统计分析
第4章 SPSS基本统计分析
▪ 4.1 频数分析 4.1.1 频数分析的目的和基本任务 4.1.2 频数分析的基本操作 4.1.3 SPSS频数分析的扩展功能 4.1.4 频数分析的应用举例
▪ 4.1.1 频数分析的目的和基本任务 ▪ 目的 ▪ 粗略把握变量值的分布状况。 ▪ 例:研究被调查者的特征(如:性别、年龄、收入) ▪ 研究被调查者对某个问题的总体看法(如:教学方式、
12
10
2
4
0.4
B
14
10
4
16
1.6
C
9
10
-1
1
0.1
D
5
10
-5Βιβλιοθήκη 252.5E10
10
0
0
0.0
∑ χ2 (fofe)2 4.6
fe
▪ 自由度:df=k-1 ▪ 在0.05的显著性水平下,查表自由度为4时的
卡方临界值为:9.488
▪ 在spss中的操作
卡方检验原理 例二
▪ 我们假设有一位社会研究者有兴趣调查高级中学学 生对于大学学历的重要性的态度。她询问了一个60 名高级中学学生的样本,接受大学教育是否变得更 加重要、更不重要或者没有变化。
户 城镇户口 口
农村户口
买东西 113
59
存钱 合计
87
200
23
82
合计
172
110
282
2
n
Cramer's V
▪ Cramer's V是基于卡 方统计量的关联性测 量。
2
V nmin(R1)(C1)
选择行、列数最小一个
收 300元以下 入 300~800 水 平 800~1500

第四章_SPSS基本统计分析

第四章_SPSS基本统计分析

S .E.of .Mean

(x X )
M
2

[ x E ( x )]2 M

n
其中: 为总体标准差,n为样本单位数
2.刻画离散程度的描述统计量
离散程度是指一组数据远离其“中心值”的程度
。 (1)如果数据都紧密地集中在“中心值”的周围,数据 的离散程度较小,说明这个“中心值”对数据的代表 性好。 (2)如果数据仅是比较松散地分布在“中心值”的周围 ,数据的离散程度较大,则此“中心值”说明数据特 征是不具有代表性的。
• 4.2.2 计算基本描述统计量的操作
(1)选择菜单Analyze-Descriptive Statistics-Descriptives,出现如下窗口:
(2)将需计算的数值型变量选择到Variable(s)框中。 (3)单击Option按钮指定计算哪些基本描述统计量,出现 如下窗口:
基本统计量 分布
基本描述统计量的应用举例
(1)利用住房状况调查数据,对人均住房面积计算 基本统计量,并分别对本市户口和外地户口进行家 庭比较。 (2)利用住房状况调查数据,分析人均住房面积是 否存在不均衡现象。
基本描述统计量的应用举例
分析: (1)不均衡现象可以通过分析是否存在大量异常值—根据 3 准则,处于3倍标准差之外的值一般为异常值。 (2)可通过对数据的标准化处理来判断。标准化的数学定义 为:
2.计算其他基本描述统计量
SPSS频数分析还能够计算其他基本统计量,其中包括: (1)描述集中趋势(Central Tendency)的基本统计量 (2)描述离散程度(Dispersion)的基本统计量 (3)描述分布形态(Distribution)的基本统计量

第4章 SPSS基本统计分析讲解

第4章 SPSS基本统计分析讲解
4.1 频数分析 4.2 计算基本描述统计量 4.3 交叉分组下的频数分析 4.4 多选项分析 4.5 比率分析
学习目标及内容:
掌握SPSS 频数分析的基本方法及其操作 明确基本描述统计量的含义,并掌握其操作
掌握交叉列联分析的基本方法,了解卡方检验的基本 思想,并熟练操作
掌握对多选项问题的不同拆分方法和应用场合,并能 用于数据分析
25%、50%、75%的百分 位数;
将数据平均分为所设定 的相等等份,可输入2— 100 的整数,如键入4则输 出第25、50、75百分位数
自定义百分位数,可输 入0—统计量对话框
案例:分析人均住房面积的分布情况,并对本 市户口和外地户口家庭进行比较
?展示所有样本的四分位数:在变量【variable(s)】 中选择“人均面积”,在【statistics】中选择四分位 数【quartiles】即可。
?SPSS 提供了计算任意分位数的功能,用户可以指定将 数据等分为n份(Cut points for n equal groups )。
?还可以直接指定分位点(Percentile )。
四分位差(也称内距或四分位距)
?它是上四分位数(QU,即位于75% )与下四分位数 (QL,即位于25% )。计算公式为:Qd =QU-QL
操作:运用前面介绍的分组操作按“人均面积”将住房 分成1、2、3、4组,并赋给变量值,如1为人均住房 “小于10平方米”…
?【transform 】→【recode into different variables 】
?然后选择频数分析【analyze 】→【descriptive statistics 】→ 【frequercies 】,采用“分组后的 人均面积”作为计算频数的变量。在【charts 】中使 用直方图histograms ,带正态曲线with normal curve;

第 章 SPSS 基本统计量的描述

第 章 SPSS 基本统计量的描述

存 (取 )款 金 额
直方图
二、计算基本描述统计量
目的:精确把握变量的总体分布状况。 基本操作: ✓ 描述统计-频率过程:统计 ✓ 描述统计- 描述过程 ✓ 描述统计- 探索过程 ✓ 均值比较-均值 过程(分组显示) 用途:计算变量的集中趋势、离散趋势、偏度、
峰度等指标,绘制统计图。
几个过程的基本描述统计量比较
农村户口
户口
城镇户口
饼图
Frequency
100
0 0.0
Std. Dev = 10945.57 Mean = 4738.1 10000.0 20000.0 30000.0 40000.0 50000.0 60000.0 70000.0 80000.0 90000.0N10=000208.02.00
McNemar:配对计数资料的卡方检验。零假设
为两变量的阳性率无差别源自2(bc 1)2
bc
Kappa一致性检验:系数取值-1~1。测量同 一观测对象在两变量(两变量服从二项分布) 上取值的一致性程度。其绝对值越接近1,说明 一致性程度越高。一般来说:
✓ 系数>=0.7,一致性程度较高;
✓ 0.4~0.7,一致性程度一般;
卡方检验操作:统计量选项
【单元格】:用于定义列联表单元格中需 要计算的指标:
计数:是否输出实际观察数和理论数;
百分比:是否输出行百分数、列百分数以及合 计百分数;
残差:选择残差的显示方式;
【格式】:用于选择行变量是升序还是降 序排列。
结果:城乡储户的收入水平没有明显差异。
Pearson卡方值的影响因素
C
2 2 n
A11A22A12A21
R1R2C1C2
2
  1. 1、下载文档前请自行甄别文档内容的完整性,平台不提供额外的编辑、内容补充、找答案等附加服务。
  2. 2、"仅部分预览"的文档,不可在线预览部分如存在完整性等问题,可反馈申请退款(可完整预览的文档不适用该条件!)。
  3. 3、如文档侵犯您的权益,请联系客服反馈,我们会尽快为您处理(人工客服工作时间:9:00-18:30)。

职业 Frequency 54 35 35 34 24 18 18 17 15 15 10 4 3 282 Percent 19.1 12.4 12.4 12.1 8.5 6.4 6.4 6.0 5.3 5.3 3.5 1.4 1.1 100.0 Valid Percent 19.1 12.4 12.4 12.1 8.5 6.4 6.4 6.0 5.3 5.3 3.5 1.4 1.1 100.0 Cumulative Percent 19.1 31.6 44.0 56.0 64.5 70.9 77.3 83.3 88.7 94.0 97.5 98.9 100.0
列联表的例子:
本科 高级工 1 程师 工程师 1 文化程度 专科 高中 1 1 Total 初中
职称
3 4
3
1 3 3
助理工 2 程师 无技术 职称 Total 4
6 3
4
5
3
16
4.3.3 列联表行列变量间关系的分析
分析行变量和列变量的关系,是列联表分 析的第二个任务; 可以得到行变量和列变量是否有联系,联 系的紧密程度等更深层的信息; 这种关系,有时候是明显的,有时候是隐 藏的,可以通过卡方检验得到。

4.3.3.1 交叉列表的卡方检验

卡方检验属于假设检验的内容,主要步骤为:


建立零假设; 选择和计算检验统计量,这里选择的是皮尔逊卡方 统计量; 确立显著性水平和临界值; 结论和决策,卡方值越大,独立性存在的可能越小, 如果大于临界值,则认为不独立。
4.3.3.2 交叉列联表卡方检验的说明
1 n Kurtosis ( xi x ) 4 / S 4 3 n 1 i 1
4.2.2 计算基本描述统计量的基本操 作
1.
Analyze菜单 Descriptive Statistics
Discriptives
如下窗口
4.2.2 描述统计量的基本操作(续)
Variable (s)
列联表中不应该有期望频数小于1的单元 格,也不应该有大量期望频数小于5的单 元格; 样本量不宜过大。

4.3.4 交叉分组下频数分析的操作
1.
Analyze菜单 Descriptive Statistics
Crosstab
如下窗口
操作图
Row (s)
OK 行变量 Paste column (s) 列变量 Layer 1 of Reset Cancel Help
4.1.2 频数分析的基本操作(续)
Chart Type None
Continue
Cancel Help
Bar Chart
Pie Chart Histograms With normal curve
Chart Values Frequencies Percentages
4.1.2 频数分析的基本操作(续)
存 款金 额 Valid N (listwise)
a. 户 口 = 农 村户 口
Байду номын сангаас OUTPUT
3.00
2.00
4.3 交叉分组下的频数分析 4.3.1 目的和基本任务

目的:
分析多个变量不同取值下的分布; 掌握多变量的联合分布; 分析变量之间的相互影响和关系;


例子:居民储蓄问题的分析
目的和任务(续)


集中趋势是指一组数 据向某一中心值靠拢 的倾向; 表现集中趋势的统计 量主要有

均值:数学定义 中位数: 众数:
1 x xi n i 1
n
4.2 .1.2 刻画离散程度的描述统计量


离散程度是指一组数据远离其 中心值的程度; 刻画离散程度的常见统计量主 要有

样本标准差:数学定义 S 样本方差:数学定义 2 全距:样本最大最小值的差
S
1 2 n ( xi x ) 1 n 1 i 1
i 1 i
n
(x x n 1
4.2.1.3 刻画分布形态的描述统计量


分布形态是指数据分布是否对 称,偏斜程度,陡缓程度; 刻画分布形态的常见统计量主 要有 1 n 3 3 偏度:数学定义 Skewness ( xi x ) / S n 1 i 1 峰度:数学定义

引言(续):采用的常用方法

往往采用两种方式实现上述分析功能;
数值计算,通过数值准确的反映数据的统计 特征; 图形绘制,通过图形直观的反映数据的分布 特点;


数值计算和图形绘制使混合使用的,相辅 相成。
4.1 频数分析:4.1.1 目的和基本任 务

通过频数分析能够了解变量取值的状况,把握 分布特征; SPSS中的频数分布表;
引言:基本数据分析的重要地位和 作用

数据处理通常都是从基本统计分析入手的;
能够使分析者掌握数据的基本统计特征; 把握数据的整体分布形态; 对以后的分析起到重要的指导和参考作用。

引言(续):基本统计分析内容
编制单个变量频数分析表; 计算单个变量的描述统计量以及在不同分 组下的描述统计量; 编制多个变量的交叉频数分析表并分析各 变量关系; 其他探索性分析; 数据的多选项分析。
Continue
Min Max S.E.mean Cancel Help
4.2.3 描述统计量的基本操作举例
计算存(取)款金额的基本描述统计
量,并对城镇储户和农村储户进行比 较;
分析储户一次存(取)款数量是否存
在不均衡现象。
Descriptive Statisticsa N Statistic 200 200 Range Statistic 79999.00 Minimum Statistic 1.00 Maximum Statistic 80000.00 Mean Statistic 4956.935 Std. Deviation Statistic 9792.515 Skewness Statistic Std. Error 4.293 .172 Kurtosis Statistic Std. Error 23.208 .342
4.1.2 频数分析的基本操作
1.
Analyze菜单 Descriptive Statistics
Frequencies
如下窗口
4.1.2 频数分析的基本操作(续)
Variable (s)
OK Paste Reset Cancel Help
Display frequency tables Statistics… Charts… Format…

列联表分析的两大基本任务;
列联表分析的两大任务; 根据收集到的数据,产生二维或者多维的交 叉列联表; 在交叉列联表的基础上,对两两变量是否存 在相关性进行分析。

4.3.2 交叉列联表的主要内容




交叉列联表是两个或两个以上的变量交叉分 组后形成的频数分布表; 交叉列联表是由行列构成,行列分别代替一 个变量,分别代表行变量和列变量; 行列标题是两个变量的值,表格中是观测频 数和各种百分比; 行列还有边缘分布;
所有data数据中 的变量
Previous
Display clustered bar charts Suppress tables Exact…


频数即变量值落在某个区间中的次数; 百分比即各频数占总样本数的百分比; 有效百分比即各频数占总有效样本数的百分比; 累计百分比即各百分比逐级累加起来的结果。
4.1.1 目的和基本任务(续)

频数分析中的常用统计图,最为直接的数据刻 画方式;



条形图(Bar Chart):用条形的高度和长短表示频 数分布的图形,适用定序和定类变量的分析; 饼图(Pie Chart):用圆形和圆内扇形面积表示频 数百分比,圆内扇形既可以表示频数也可以表示百 分比; 直方图(Histograms):用矩形面积表示频数分布 变化,试用与定距变量的分析,可以附加正态曲线
Ascending Values Descending Values Ascending Counts Descending Counts Suppress tables with more than categories 18 Organize output by variables Multiple Variables Continue Compare variables Cancel
Help
格式的参数说明即操作

调整频数分布表中数据输出顺序(order by)
按值的升序或者降序输出; 按频数的升序或者降序输出;


压缩频数分布表
如果变量取值太多或者区间太多,就需要压缩 分布表; 系统默认大于10不输出,可以修改。

举例操作:居民储蓄调查数据频数 分析
分析户口和就业的基本情况;
OK Paste Reset Cancel Help
Save standardized values as variables
Options…
4.2.2 描述统计量的基本操作(续)



将需要计算的数值型变量选入Variable (s) 框中; 单击Option…按钮指定计算哪些基本统计量, 出现如下图对话框 指定输出顺序:
第4章 SPSS基本统计分析
制作人:夏怡凡
主要内容:


引言介绍基本统计分析的重要性和主要内容; 频数分析介绍如何对数据的频数分布进行把握; 计算基本描述统计量进一步描述更为精确的数据 分布特征; 列联表分析描述多个变量之间是否存在相关关系; 多选项分析对应处理问卷种多选的问题; 比率分析描述两变量间比率的变化(新增功能)。
相关文档
最新文档