第9章 含定性变量的回归模型
计量经济学10(1)
l 方差分析模型(Analysis of variance models,ANOVA):仅包含定性变量或 虚拟变量的回归模型,其形式如下:
Yi=B1+B2Di+ui l 假定Y:每年食品支出(美元);Di=1表示
女性;Di=0表示男性,则: l 男性食品支出的期望:E(Yi|Di=0)=B0 l 女性食品支出的期望: E(Yi|Di=0)=B0+B1
• D2=1表东北和中北部地区,D2=0为其它地区; • D3=1表南部地区,D3=0为其它地区
Ÿ 这是将西部地区看成是基准类。
计量经济学10(1)
¡ 再考虑政府机构用于每个学生的花费和地区对 教师平均年薪水的影响: AASi=B1+B2D2i+B3D3i+B4PPSi
¡ 对模型的解释:
l D2显著,而D3不显著,表明原模型存在设定误差; l PPS的系数的含义
计量经济学10(1)
l 上述模型的含义: l 截距B1表示男性平均食品支出,斜率系数
B2表示女性平均食品支出与男性的差异, B1 + B2表示女性平均食品支出。 l 对这类模型,零假设为:H0:B2=0
¡ 表示男女平均食品支出没有差异。我们可根据t 检验判定是否统计显著。
计量经济学10(1)
l 例10-1(P213):性别差异对食品消费支出 的影响
X 0.0803
5.54
DX -0.065
-4.096
1970-1995 C 62.423
4.89
X 0.0376
8.89
1970-1981 C 1.016
X 0.0803
1982-1995 C 153.49(1.016+152.479)
回归分析
回归分析的模型
按是否线性分:线性回归模型和非线性回归模型 按自变量个数分:简单的一元回归,多元回归 基本的步骤:利用SPSS得到模型关系式,是否 是我们所要的,要看回归方程的显著性检验(F 检验)和回归系数b的显著性检验(T检验),还要 看拟合程度R2 (相关系数的平方,一元回归用R Square,多元回归用Adjusted R Square)
(Prob(event) <0.5 预测事件将不会发生, > 0.5 预测事件将会发生)
补充:回归分析
以下的讲义是吴喜之教授有 关回归分析的讲义,很简单, 但很实用
定量变量的线性回归分析
对例1(highschoo.sav)的两个变量的数据进行线性回归, 就是要找到一条直线来最好地代表散点图中的那些点。
b0为常数项 b1、b2、…、称为y对应于x1、x2、…、xn的偏回归系数 用Adjusted R2调整判定系数判定一个多元线性回归方程的拟合程度:
用来说明用自变量解释因变量变异的程度(所占比例)
一元线性回归模型的确定:一般先做散点图(Graphs ->Scatter>Simple),以便进行简单地观测(如:Salary与Salbegin的关系) 若散点图的趋势大概呈线性关系,可以建立线性方程,若不呈线 性分布,可建立其它方程模型,并比较R2 (-->1)来确定一种最佳 方程式(曲线估计)
关系是否有线性特点
Graphs ->Scatter->Simple X Axis: Salbegin Y Axis: Salary
2. 若散点图的趋势大概呈线性关系,可以建立线性回归模型
Analyze->Regression->Linear Dependent: Salary Independents: Salbegin,prevexp,jobtime,jobcat,edcu等变量 Method: Stepwise
古扎拉蒂《计量经济学基础》复习笔记和课后习题详解(虚拟变量回归模型)【圣才出品】
第9章虚拟变量回归模型9.1 复习笔记考点一:ANOVA模型★★★1.虚拟变量含义虚拟变量是指仅有0和1两个取值的变量,是一种定性变量。
一般而言,虚拟变量等于0表示变量不具有某种性质,等于1表示具有某种性质。
虚拟变量也可以放到回归模型中。
这种模型被称为方差分析(ANOVA)模型。
2.虚拟变量模型(1)虚拟变量的表达式Y i=β1+β2D2i+β3D3i+u i应看到,除了不是定量回归元而是定性或虚拟回归元(若观测值属于某特定组则取值为1,若它不属于那一组则取值0)之外,方程与前面考虑的任何一个多元回归模型都是一样的。
所有的虚拟变量都用字母D表示。
(2)使用虚拟变量的注意事项①若定性变量有m个类别,则只需引入m-1个虚拟变量,否则就会陷入虚拟变量陷阱,即完全共线性或完全多重共线性(若变量之间存在不止一个精确的关系)情形。
对每个定性变量而言,所引入的虚拟变量的个数必须比该变量的类别数少一个。
②不指定其虚拟变量的那一组被称为基组、基准组、控制组、比较组、参照组或省略组。
所有其他的组都与基准组进行比较。
③截距值(β1)代表了基准组的均值。
④附属于方程中虚拟变量的系数被称为级差截距系数,它反映取值为1的地区的截距值与基准组的截距系数之间的差别。
⑤如果定性变量不止一类,那么,基准组的选择完全取决于研究者。
⑥对于虚拟变量陷阱,如果在这种模型中不使用截距项,那么引入与变量的类别相同数量的虚拟变量就能够回避虚拟变量陷阱的问题。
因此,如果从方程中去掉截距项,并考虑如下模型Y i=β1D1i+β2D2i+β3D3i+u i由于此时没有完全共线性,所以就不会陷入虚拟变量陷阱。
但要确定做这个回归时,一定要使用回归软件包中的无截距选项。
⑦在一个含有截距的方程中,能更容易地处理是否有某个组与基准组有所不同以及有多大的不同,所以在方程中包括截距更方便。
为了检查分组是否得当,也可通过将虚拟变量的系数相对0做t检验(或者更一般地,对适当的虚拟变量系数集做一个F检验),就可以检验分类是否适当。
第9章 相关与回归分析
第九章相关与回归分析习题一、单选题1.下面的函数关系是()。
A、销售人员测验成绩与销售额大小的关系B、圆周的长度决定于它的半径C、家庭的收入和消费的关系D、数学成绩与统计学成绩的关系2.若要证明两变量之间线性相关程度是高的,则计算出的相关系数应接近于()。
A、+1B、0C、0.5D、+1或-13.回归系数和相关系数的符号是一致的,其符号均可用来判断现象()。
A、线性相关还是非线性相关B、正相关还是负相关C、完全相关还是不完全相关D、单相关还是复相关4.在线性相关的条件下,自变量的均方差为2,因变量均方差为5,而相关系数为0.8时,则其回归系数为( )。
A、8B、0.32C、2D、12.55.下面现象间的关系属于相关关系的是()。
A、圆的周长和它的半径之间的关系B、价格不变条件下,商品销售额与销售量之间的关系C、家庭收入愈多,其消费支出也有增长的趋势D、正方形面积和它的边长之间的关系6.下列关系中,属于正相关关系的是()。
A、合理限度内,施肥量和平均单产量之间的关系B、产品产量与单位产品成本之间的关系C、商品的流通费用与销售利润之间的关系D、流通费用率与商品销售量之间的关系7.相关分析是研究()。
A、变量之间的数量关系B、变量之间的变动关系C、变量之间的相互关系的密切程度D、变量之间的因果关系8.在回归直线y=a+bx中,b<0,则x与y之间的相关系数( )。
A、r=0B、r=lC、0<r<1D、-1<r<09.在回归直线y=a+bx中,b表示()。
A、当x增加一个单位时,y增加a的数量B、当y增加一个单位时,x增加b的数量C、当x增加一个单位时,y的平均增加量D、当y增加一个单位时,x的平均增加量10.当相关系数r=0时,表明()。
A、现象之间完全无关B、相关程度较小C、现象之间完全相关D、无直线相关关系11.下列现象相关密切程度最高的是()。
A、某商店的职工人数与商品销售额之间的相关系数0.87B、流通费用水平与利润率之间的相关关系为-0.94C、商品销售额与利润率之间的相关系数为0.51D、商品销售额与流通费用水平的相关系数为-0.8112.估计标准误差是反映()。
9-1回归预测法
一元线性回归
D 常数), ),即各个随机误差项 (3)同方差假定: (e ) = σ (常数),即各个随机误差项 )同方差假定: 的离散程度(或波动幅度)是相同的。这样结合假定2, 的离散程度(或波动幅度)是相同的。这样结合假定 ,虽 具体取哪些值, 然我们无法知道随机误差项 ei 具体取哪些值,但可以将其 固定”在一定范围内。 “固定”在一定范围内。 Cov (4)非自相关假定: (ei,e j ) = 0(i ≠ j ) ,即随机误差 )非自相关假定: 项之间是互不相关、互不影响的。 项之间是互不相关、互不影响的。这样可以独立考虑各个 水平下随机误差项的影响。 水平下随机误差项的影响。 Cov (5)解释变量与随机误差项不相关假定, (ei,xi ) = 0 )解释变量与随机误差项不相关假定, 即解释变量与随机误差项不相关,彼此独立的对y产生 即解释变量与随机误差项不相关,彼此独立的对 产生 影响。在假定1成立的情况下 该假定自动成立。 成立的情况下, 影响。在假定 成立的情况下,该假定自动成立。 (6)无多重共线性假定,即解释变量之间不存在完全 )无多重共线性假定, 的线性关系,这样才能分析每个解释变量对y的单独影响 的单独影响。 的线性关系,这样才能分析每个解释变量对 的单独影响。
教学重点与难点
一元线性回归和二元线性回归的原理和分析过程, 一元线性回归和二元线性回归的原理和分析过程,回归 模型的统计检验原理和计量经济检验原理。 模型的统计检验原理和计量经济检验原理。
讲授与训练
在市场预测的定量方法中, 在市场预测的定量方法中,因果分析预测法是与时间序列预 测法不同的另一类预测方法。 测法不同的另一类预测方法。时间序列法侧重从时间来考虑预测 对象的变化和发展,时间序列发展数学模型一般都是时间的函数。 对象的变化和发展,时间序列发展数学模型一般都是时间的函数。 而因果分析预测法是一类从分析事物变化的因果联系入手, 而因果分析预测法是一类从分析事物变化的因果联系入手,通过 统计分析和建立数学模型揭示预测目标与其他有关的经济变量之 间的数量变化关系,据此进行预测的方法, 间的数量变化关系,据此进行预测的方法,即把其相关因素的变 化看做“ 把预测对象的变化看做“ 化看做“因”,把预测对象的变化看做“果”,建立因果之间的 数学模型,并根据相关因素的变化,推断预测对象的变动趋势。 数学模型,并根据相关因素的变化,推断预测对象的变动趋势。 因果分析预测法最常用的有回归分析预测法和投入产出分析预测 法。 所谓回归分析预测法, 所谓回归分析预测法,就是依据数理统计的回归分析理论 和方法,找出因变量和自变量之间的依存关系, 和方法,找出因变量和自变量之间的依存关系,建立起一个回归 方程用于预测的方法。 方程用于预测的方法。
经验分享,使用eviews做回归分析
[经验分享] 使用eviews做线性回归分析Glossary:ls(least squares)最小二乘法R-sequared样本决定系数(R2):值为0-1,越接近1表示拟合越好,>0.8认为可以接受,但是R2随因变量的增多而增大,解决这个问题使用来调整Adjust R-seqaured()S.E of regression回归标准误差Log likelihood对数似然比:残差越小,L值越大,越大说明模型越正确Durbin-Watson stat:DW统计量,0-4之间Mean dependent var因变量的均值S.D. dependent var因变量的标准差Akaike info criterion赤池信息量(AIC)(越小说明模型越精确)Schwarz ctiterion:施瓦兹信息量(SC)(越小说明模型越精确)Prob(F-statistic)相伴概率fitted(拟合值)线性回归的基本假设:1.自变量之间不相关2.随机误差相互独立,且服从期望为0,标准差为σ的正态分布3.样本个数多于参数个数建模方法:ls y c x1 x2 x3 ...x1 x2 x3的选择先做各序列之间的简单相关系数计算,选择同因变量相关系数大而自变量相关系数小的一些变量。
模型的实际业务含义也有指导意义,比如m1同gdp肯定是相关的。
模型的建立是简单的,复杂的是模型的检验、评价和之后的调整、择优。
模型检验:1)方程显著性检验(F检验):模型拟合样本的效果,即选择的所有自变量对因变量的解释力度F大于临界值则说明拒绝0假设。
Eviews给出了拒绝0假设(所有系统为0的假设)犯错误(第一类错误或α错误)的概率(收尾概率或相伴概率)p 值,若p小于置信度(如0.05)则可以拒绝0假设,即认为方程显著性明显。
2)回归系数显著性检验(t检验):检验每一个自变量的合理性|t|大于临界值表示可拒绝系数为0的假设,即系数合理。
经验分享,使用eviews做回归分析
[经验分享] 使用eviews做线性回归分析Glossary:ls(least squares)最小二乘法R-sequared样本决定系数(R2):值为0-1,越接近1表示拟合越好,>0.8认为可以接受,但是R2随因变量的增多而增大,解决这个问题使用来调整Adjust R-seqaured()S.E of regression回归标准误差Log likelihood对数似然比:残差越小,L值越大,越大说明模型越正确Durbin-Watson stat:DW统计量,0-4之间Mean dependent var因变量的均值S.D. dependent var因变量的标准差Akaike info criterion赤池信息量(AIC)(越小说明模型越精确)Schwarz ctiterion:施瓦兹信息量(SC)(越小说明模型越精确)Prob(F-statistic)相伴概率fitted(拟合值)线性回归的基本假设:1.自变量之间不相关2.随机误差相互独立,且服从期望为0,标准差为σ的正态分布3.样本个数多于参数个数建模方法:ls y c x1 x2 x3 ...x1 x2 x3的选择先做各序列之间的简单相关系数计算,选择同因变量相关系数大而自变量相关系数小的一些变量。
模型的实际业务含义也有指导意义,比如m1同gdp肯定是相关的。
模型的建立是简单的,复杂的是模型的检验、评价和之后的调整、择优。
模型检验:1)方程显著性检验(F检验):模型拟合样本的效果,即选择的所有自变量对因变量的解释力度F大于临界值则说明拒绝0假设。
Eviews给出了拒绝0假设(所有系统为0的假设)犯错误(第一类错误或α错误)的概率(收尾概率或相伴概率)p 值,若p小于置信度(如0.05)则可以拒绝0假设,即认为方程显著性明显。
2)回归系数显著性检验(t检验):检验每一个自变量的合理性|t|大于临界值表示可拒绝系数为0的假设,即系数合理。
应用回归分析 第十章
第10章 含定性变量的回归模型10.1 一个学生使用含有季节定性自变量的回归模型,对春夏秋冬四个季节引入4个0-1型自变量,用SPSS 软件计算的结果中总是自动删除了其中的一个自变量,他为此感到困惑不解。
出现这种情况的原因是什么? 答:假如这个含有季节定性自变量的回归模型为:其中含有k 个定量变量,记为x i 。
对春夏秋冬四个季节引入4个0-1型自变量,记为D i ,只取了6个观测值,其中春季与夏季取了两次,秋、冬各取到一次观测值,则样本设计矩阵为:显然,(X,D)中的第1列可表示成后4列的线性组合,从而(X,D)不满秩,参数无法唯一求出。
这就是所谓的“虚拟变量陷井”,应避免。
当某自变量x j 对其余p-1个自变量的复判定系数2j R 超过一定界限时,SPSS 软件将拒绝这个自变量x j 进入回归模型。
称Tol j =1-2j R 为自变量x j 的容忍度(Tolerance ),SPSS 软件的默认容忍度为0.0001。
也就是说,当2j R >0.9999时,自变量x j 将被自动拒绝在回归方程之外,除非我们修改容忍度的默认值。
而在这个模型中出现了完全共线性,所以SPSS 软件计算的结果中总是自动删除了其中的一个定性自变量。
10.2对自变量中含有定性变量的问题,为什么不对同一属性分别建立回归模型,而采取设虚拟变量的方法建立回归模型?答:原因有两个,以例10.1说明。
一是因为模型假设对每类家庭具有相同的斜率和误差方差,把两类家庭放在一起可以对公共斜率做出最佳估计;二是对于其tt t t kt k t t D D D X X Y μαααβββ++++++=332211110 ⎪⎪⎪⎪⎪⎪⎪⎪⎭⎫⎝⎛=000110010110001010010010100011)(616515414313212111k k k k k k X X X X X X X X X X X XD X,⎪⎪⎪⎪⎪⎭⎫⎝⎛=k βββ 10β⎪⎪⎪⎪⎪⎭⎫ ⎝⎛=4321ααααα他统计推断,用一个带有虚拟变量的回归模型来进行也会更加准确,这是均方误差的自由度更多。
市场调查与预测实验——回归分析
残差项
▼回归分析的主要目的:根据样本回归函数, 估计总体回归函数。
注意:这里总体回归函 数可能永远无法知道。
一、 回归模型的构建
❖一元线性回归模型
Y 0 1X
❖一元线性回归模型的基本假设 1. 对模型设定的假设 2. 对解释变量的假设 3. 对随机误差项的假设
二、 回归模型的检验
F检验
F检验是根据平方和分解式,直接从回归效果检验回归方 程的显著性。
F SSR /1 SSE / (n 2)
总平方和SST中,包括能够由自变量解释的部分SSR,以及 不能由自变量解释的部分SSE。回归平方和SSR越大,回归 的效果就越好。
回归分析的内容
线性回归
一元线性回归 多元线性回归 多个因变量与多个自变量的回归
假设1:回归模型是正确设定的。
假设2:解(释1)变模量型X是选确择定了性正变确量的,变不量是;随机变量,在重复抽 样(中2取)固模定型值选。择了正确的函数形式;
假设3:解释变量X在所抽取的样本中具有变异性,而且随着 样本容量的无限增加,解释变量X的样本方差趋于一 个非零的有限常数。
假设4:随机误差项µ具有给定X条件下的零均值、同方差以 及不序列相关性。
❖ 回归分析关心的是根据解释变量的已
知或给定值,考察被解释变量的总体均 值,即当解释变量取某个确定值时,与 之统计相关的被解释变量所有可能出现 的对应值的平均值。
研究过程:将该99户家庭划分为组内收入差不多的10 组,以分析每一收入组的家庭消费支出。
E(Y|X)=f(X)
一、 回归模型的构建
❖总体回归函数 E(Y|X)=f(X)
函数的具体 形式?
3500
每 月 消 费 2000 1500 1000
Logistic回归模型 (2)
欢迎共阅Logistic 回归模型1 Logistic 回归模型的基本知识 1.1 Logistic 模型简介主要应用在研究某些现象发生的概率p ,比如股票涨还是跌,公司成功或失败的概率,以及讨论概率p 与那些因素有关。
显然作为概率值,一定有10≤≤p ,因此很难用线性模型描述概率p 与自变量的关系,另外如果p 接近两个极端值,此时一般方法难以较好地反映p究p Logit (1) (2)1的概率i 个(3)差形式服从伯努利分布而非正态分布,即没有正态性假设前提;二是二值变量方差不是常数,有异方差性。
不同于多元线性回归的最小二乘估计法则(残差平方和最小),Logistic 变换的非线性特征采用极大似然估计的方法寻求最佳的回归系数。
因此评价模型的拟合度的标准变为似然值而非离差平方和。
定义1 称事件发生与不发生的概率比为 优势比(比数比 odds ratio 简称OR),形式上表示为OR=kx k x e pp βββ+++=- 1101 (4)定义2 Logistic 回归模型是通过极大似然估计法得到的,故模型好坏的评价准则有似然值来表征,称-2ˆln ()L β为估计值βˆ的拟合似然度,该值越小越好,如果模型完全拟合,则似然值ˆ()L β为1,而拟合似然度达到最小,值为0。
其中ˆ()lnL β表示βˆ的对数似然函数值。
定义3 记)ˆ(βVar 为估计值βˆ的方差-协方差矩阵,21)]ˆ([)ˆ(ββVar S =为βˆ的标准差矩阵,则称k i S w iii i ,,2,1,ˆ[2 ==β (5)为iβˆ (6) 1.22 2.1因变量(反应变量)分为两类,取值有两种,设事件发生记为y=1,不发生记为 y=0,设自变量T k x x x X ),,,(21 =是分组数据,取有限的几个值;研究事件发生的概率)|1(X y P =与自变量X 的关系,其Logistic 回归方程为:k k x x X y P X y P βββ+++=== 110)|0()|1(ln 或 kx k x kxk x ee X y P ββββββ+++++++== 1101101)|1( 例2.1.1 分组数据[1] 在一次住房展销会上,与房地产商签订初步购房意向书的有n=325人,在随后的3个月时间内,只有一部分顾客购买了房屋。
