32多元线性回归参数估计(精)
2
3
Q0 ˆ 化简 0 Q0 ˆ 1 ˆ Q0 2 Q0 ˆ k
ˆ ˆ X ˆ X ˆ X ) Y ( 0 1 1i 2 2i k ki i ˆ ˆ ˆ ˆ ( 0 1 X 1i 2 X 2 i k X ki ) X 1i Yi X 1i ˆ ˆ X ˆ X ˆ X ) X Y X ( 0 1 1i 2i 2i k ki 2i i 2i ˆ ˆ ˆ ˆ ( 0 1 X 1i 2 X 2 i k X ki ) X ki Yi X ki
(*)
方程组(*)称为正规方程组(normal equations)。
4
正规方程组的矩阵形式
n X 1i X ki
X X
1i 2 1i
X X X
ki
X
ki
X 1i
ˆ 1 0 ˆ X 11 1i ki 1 2 ˆ X ki k X k 1
ˆ x ˆ x ˆ x e 离差形式为: yi 1 1i 2 2i k ki i
y1 y2 y y n
x11 x x 12 x 1n x 21 x k 1 x 22 x k 2 x 2 n x kn
和
1 n Y Yi n 1
为Xj和Y的样本均值
x ji x ji X j 和 yi Yi Y 为Xji和Yi对均值的离差
可得样本回归函数的离差形式为:
ˆ x ˆ x ˆ x e yi 1 1i 2 2i k ki i
如何得到?
i=1,2…n
9
样本回归函数的离差形式的矩阵表示
需要讨论满足建模基本要求所需的样本容量和最小样本 容量。
23
五、样本容量问题
⒈ 最小样本容量
所谓“最小样本容量”,即从最小二乘原理 和最大或然原理出发,欲得到参数估计量,不管 其质量如何,所要求的样本容量的下限。 样本最小容量必须不少于模型中解释变量 的数目(包括常数项),即不少于要估计的参 数的个数 n k+1 why? 因为,无多重共线性要求:秩(X)=k+1
这里利用了假设: E(X’)=0
3、有效性(最小方差性) why?
22
五、样本容量问题
一方面,计量经济学模型是从已经发生的经济活动的样 本数据中寻找经济活动中蕴涵的规律。因此,对样本数 据具有很强的依赖性。从建模需要的角度来讲,样本容 量越大越好。 另一方面,收集和整理样本数据是非常困难的工作(收 集,加工并以某种形式展现数据-经济统计学),从减 轻收集数据的困难角度,样本数据越少越好。 怎样选择合适的样本容量,使其既能满足建模的需要, 又能减少收集数据的困难?
Why?
14
*二、最大似然估计
对于多元线性回归模型
Yi 0 1 X 1i 2 X 2 i k X ki i
易知
Yi ~ N ( X i β , 2 )
Y的随机抽取的n组样本观测值的联合概率
即为变量Y的似然函数
15
对数似然函数为
对对数或然函数求极大值,也就是对 求极小值。 寻找一组参数估计值 ,使得残差平方和最小。
§3.2 多元线性回归模型的估计
一、普通最小二乘估计
*二、最大或然估计
*三、矩估计 四、参数估计量的性质 五、样本容量问题 六、估计实例
1
参数的普通最小二乘估计(OLS)
普通最小二乘法给出的判断标准是:观测值与回 归函数值二者之差的平方和最小。
对于随机抽取的n组观测值 有:
(Yi , X ji ), i 1,2, , n, j 0,1,2, k
1 X 12 X k2
1 Y1 X 1n Y2 Y X kn n
即
ˆ X Y (X X) β
记住
由于X’X满秩,故有
ˆ ( X X) 1 X Y β
如何用矩阵证明 ?
5
将上述过程用矩阵表示如下:(见教材P61)
ˆ 1 ˆ ˆ β 2 ˆ k
i=1,2…n
注意:此 处的 不 包括0
令
则离差形式可用矩阵形式为
ˆ e y xβ
在离差形式下,参数的最小二乘估计结果为 why?
ˆ Y ˆ X ˆ X 0 1 1 k k
10
24
2、满足基本要求的样本容量
从统计检验的角度: n30 时,Z检验才能应用; n-k8时, t分布较为稳定
模型的良好性质只有在大样本下才能 得到理论上的证明
一般经验认为:
当n30或者至少n3(k+1)时,才能说满足 模型估计的基本要求。
25
六、多元线性回归模型的参数估计实例 例3.2.2 在例2.5.1中,已建立了中国居 民人均消费一元线性模型。这里我们写法
对于正规方程组
ˆ XY XXβ
ˆ X e X Xβ ˆ X Xβ
于是
Xe 0
或
e
i
(*) (**)
i
0
ji i
X
e 0
(*)或(**)是多元线性回归模型正规方程组的另一 种写法
8
参数的普通最小二乘估计的离差形式
1 n 记 X j X ji n i 1
解释变量:人均GDP:GDPP 前期消费:CONSP(-1) 估计区间:1979~2000年
26
Eviews软件估计结果
LS // Dependent Variable is CONS Sample(adjusted): 1979 2000 Included observations: 22 after adjusting endpoints Variable C GDPP CONSP(-1) Coefficient 120.7000 0.221327 0.451507 0.995403 0.994920 26.56078 13404.02 -101.7516 1.278500 Std. Error 36.51036 0.060969 0.170308 t-Statistic 3.305912 3.630145 2.651125 Prob. 0.0037 0.0018 0.0158 928.4946 372.6424 6.684995 6.833774 2057.271 0.000000
Y Xβ μ XY XXβ Xμ X(Y Xβ ) Xμ
求期望 :
E(X(Y Xβ )0
18
E(X(Y Xβ )0
称为原总体回归方程的一组矩条件,表明了原总 体回归方程所具有的内在特征。
1 ˆ)0 X (Y Xβ n
由此得到正规方程组
ˆ X' Y X' Xβ
得到: 于是:
ˆ XY XXβ
ˆ ( X X) 1 X Y β
记住
6
例3.2.1:在例2.1.1的家庭收入-消费支出例中,
1 ( X ' X) X 1 1 X2 1 X1 1 1 X 2 n X Xn i 1 X n
同时,随着样本容量增加,参数估计量具有: 渐近无偏性、渐近有效性、一致性。 1、线性性
why?
ˆ ( X X) 1 X Y CY β
其中,C=(X’X)-1 X’ 为一仅与固定的X有关的行向量
21
2、无偏性
why?
ˆ ) E (( X X ) 1 X Y ) E (β E (( X X ) 1 X ( Xβ μ )) β ( X X ) 1 E ( X μ ) β
解此正规方程组即得参数的MM估计量。
易知MM估计量与OLS、ML估计量等价。
19
矩方法是工具变量方法(Instrumental Variables,IV) 和广义矩估计方法(Generalized Moment Method, GMM)的基础
• 在矩方法中关键是利用了
E(X’)=0
(X1,X2,…,Xn是工具变量)
即求解方程组:
ˆ ) ( Y Xβ ˆ)0 ( Y Xβ ˆ β
ˆ X Y Y Xβ ˆ β ˆ X Xβ ˆ)0 (Y Y β ˆ β
ˆ β ˆ X Xβ ˆ) 0 ( Y Y 2Y Xβ ˆ β
ˆ 0 X Y X Xβ
因此,参数的最大或然估计与参数的普通最小二乘估 计相同,为:
16
2的最大似然估计
已知: 则有:
此估计量不同于OLS的估计联,不是无偏估计量
17
*三、矩估计(Moment Method, MM)
OLS估计是通过得到一个关于参数估计值的正 规方程组
ˆ X Y (X X) β
并对它进行求解而完成的。 该正规方程组 可以从另外一种思路来导出:
2的最小二乘估计
随机误差项的方差的估计量为
ˆ2 e e n k 1 n k 1
2 e i
其中,n- k+1是 ei2的自由度。 注意:该估计量为无偏估计量 why?
11
估计参数的方差-协方差矩阵(补充)
的方差-协方差矩阵如下:
Why?
Why?
12
多变量OLS回归线的性质
X X
i 2 i
10 21500
21500 53650000
1 X Y X 1
1 X2
Y1 1 Y2 Yi 15674 X Y 39468400 Xn i i Y n
多元线性回归模型参数的最大似然估计
其中 Λ 是X X 的特征值构成的对角矩阵。 从而 VarB
XX VΛ
V- 1
XX1 2VV1
, k 0,1, , K
2 2 2 v v v k0 k1 kK Varbk 2 1 K 0
17
(五)岭回归方法
设一个多元线性回归模型为 Y Xβ ε 普通最小二乘估计的公式为 B XX1 XY XX 矩阵 当解释变量间存在严重的多重共线性时, 接近于奇异。 用 XX λD 代替 XX 代入最小二乘估计的公式,得 ˆ XX D1 XY 到: β 其中 称为“岭回归参数”,一般 0 1 ,D 2 2 2 k 1,2,, K d X k ki X X 是用 矩阵对角线上元素d0 n 和 i 构成的对角线矩阵 。
多元回归工具变量法估计 引进、选择多个关键变量。 向量、矩阵表示。
工具变量的选择问题: 与替代解释变量相关性强 与误差相相关性小 避免引起共线性问题
27
四、参数估计量分布问题和统计推断
问题:分布未知 两变量线性回归模型参数估计量
b1
X
i i
i
X Yi Y
i
X
以 X 为条件的 b1 的条件方差 Varb X X X Varb E Varb X 也是 是最小方差,从而 b1 的方差 最小方差。
1 2 i i
2
1
X
1
23
如果 X 是随机变量,与误差项小样本不独立, 但大样本渐进不相关,即 X X
前一个模型变为 logQ 0 b1 logY 2 log P 整理这个模型可以得到
多元线性回归模型
Cov( X ji , i ) 0
j 1,2, k
假设4,随机项满足正态分布
i ~ N (0, 2 )
上述假设的矩阵符号表示 式:
假设1,n(k+1)维矩阵X是非随机的,且X的秩=k+1,
即X满秩。
回忆线性代数中关于满秩、线性无关!
假设2,
E (μ)
E
1
E (1 )
0
n E( n )
X ki ) ) X 1i ) X 2i
Yi Yi X 1i Yi X 2i
(ˆ0 ˆ1 X 1i ˆ2 X 2i ˆk X ki ) X ki Yi X ki
解该( k+1)个方程组成的线性代数方程组,即
可得到(k+1) 个待估参数的估计值
$ j
,
j
0,1,2, ,
k
。
□正规方程组的矩阵形式
en
二、多元线性回归模型的基本假定
假设1,解释变量是非随机的或固定的,且各X之间互不 相关(无多重共线性)。
假设2,随机误差项具有零均值、同方差及不序列相关 性。
E(i ) 0
i j i, j 1,2,, n
Var
(i
)
E
(
2 i
)
2
Cov(i , j ) E(i j ) 0
假设3,解释变量与随机项不相关
这里利用了假设: E(X’)=0
等于0,因为解释变 量与随机扰动项不相 关。
3、有效性(最小方差性)
ˆ 的方差-协方差矩阵为
Co(v ˆ) E{[ˆ E(ˆ)][ˆ E(ˆ)]}
E[(ˆ )(ˆ )]
E{([ X X)-1X ]([ X X)-1X ]}
计量经济学-多元线性回归模型
Y=β0+β1X1+β2X2+...+βkXk+ε,其中Y为因变 量,X1, X2,..., Xk为自变量,β0, β1,..., βk为回归 系数,ε为随机误差项。
多元线性回归模型的假设条件
包括线性关系假设、误差项独立同分布假设、无 多重共线性假设等。
研究目的与意义
研究目的
政策与其他因素的交互作用
多元线性回归模型可以引入交互项,分析政策与其他因素(如技 术进步、国际贸易等)的交互作用,更全面地评估政策效应。
实例分析:基于多元线性回归模型的实证分析
实例一
预测某国GDP增长率:收集该国历史数据,包括GDP、投资、消费、出口等变量,建立 多元线性回归模型进行预测,并根据预测结果提出政策建议。
最小二乘法原理
最小二乘法是一种数学优化技术,用 于找到最佳函数匹配数据。
残差是观测值与预测值之间的差,即 e=y−(β0+β1x1+⋯+βkxk)e = y (beta_0 + beta_1 x_1 + cdots + beta_k x_k)e=y−(β0+β1x1+⋯+βkxk)。
在多元线性回归中,最小二乘法的目 标是使残差平方和最小。
t检验
用于检验单个解释变量对被解释变量的影响 是否显著。
F检验
用于检验所有解释变量对被解释变量的联合 影响是否显著。
拟合优度检验
通过计算可决系数(R-squared)等指标, 评估模型对数据的拟合程度。
残差诊断
检查残差是否满足独立同分布等假设,以验 证模型的合理性。
04
多元线性回归模型的检验与 诊断
多元线性回归模型
第二节 多元线性回归模型的参数估计
一、多元线性回归参数的最小二乘估计
二、最小二乘估计量的数值性质
三、最小二乘估计量的统计性质
四、参数的估计误差与置信区间
二 、最小二乘估计量的数值性质
ˆ ˆ ˆ 1.样本均值点在样本平面上,即Y 0 1 X 1 2 X 2
2.剩余项(残差)ei的均值为零,即 e
另外两个要求 假定8:无设定偏误,模型被正确地设定。
假定9:解释变量之间不存在完全共线性,没有精确的线性
关系。
三、多元线性回归模型的基本假定
无多重共线性假定: 各解释变量之间不存在严格的线性关系,或者说各解
释变量之间线性无关;亦即解释变量之间不存在精确的线
性关系,即是说不存在一列不全为0的数 1 , 2 , , k , 能使下式成立:
其中,残差项ei是随机扰动项ui的估计。
二 、样本线性回归模型
特别地,当K=2时,二元线性样本回归函数为
ˆ ˆ ˆ ˆ Yi 0 1 X 1i 2 X 2i
二元线性样本回归模型为:
ˆ ˆ ˆ Yi 0 1 X 1i 2 X 2i ei
2 ei ˆ X X ) 0 2X 2i Yi ( 0 1 1i 2 2i ˆ 2
e i 0 ei X 1i 0 e i X 2 i 0
2.化简得正规方程
ˆ ˆ ˆ n 0 X 1i X 2i Y i
四、参数的估计误差与置信区间
三、最小二乘估计量的统计性质
在古典线性回归模型的基本假定下,一元线性回 归模型的OLS估计量是最优线性无偏估计量,这个性
线性回归模型的参数估计
计算过程
牛顿-拉夫森方法首先计算误差函数的Hessian矩阵,然 后使用这个矩阵来构造一个线性方程组,求解该方程组可 以得到参数的更新值。
缺点
对初值敏感,且计算Hessian矩阵的开销较大。
2023
PART 03
线性回归模型的假设和限 制
REPORTING
线性关系假设
01
线性关系假设是线性回归模型的 核心,即因变量和自变量之间存 在一种线性关系,可以用一条直 线来描述。
2023
线性回归模型的参数 估计
https://
REPORTING
2023
目录
• 引言 • 参数估计的方法 • 线性回归模型的假设和限制 • 参数估计的步骤 • 参数估计的挑战与解决方案 • 参数估计的应用场景
2023
PART 01
引言
REPORTING
线性回归模型的定义
2023
THANKS
感谢观看
https://
REPORTING
最小二乘法
原理
最小二乘法是一种数学优化技术 ,通过最小化预测值与实际值之
间的平方误差来估计参数。
计算过程
最小二乘法通过构建一个误差 的平方和,然后找到使这个和 最小的参数值。
优点
计算简单,易于理解和实现。
缺点
对异常值敏感,且无法处理非 线性问题。
梯度下降法
原理
梯度下降法是一种迭代优化算法,通 过不断沿着误差函数的负梯度方向更 新参数,以最小化误差函数。
市场细分
通过分析消费者行为数据,利用线性回归模型对 市场进行细分,帮助企业更好地了解目标客户群 体。
价格预测
在商品定价方面,利用线性回归模型预测商品价 格变动趋势,为企业制定合理的定价策略提供依 据。
§3.3 多元线性回归模型的统计检验
t=
βj βj Sβ
j
=
βj βj e′e cjj n k 1
~ t(nk 1)
2、t检验 、 检验
设计原假设与备择假设: 设计原假设与备择假设: H0:βi=0 H1:βi≠0 给定显著性水平α,可得到临界值tα/2(n-k-1), 给定显著性水平α 可得到临界值 ) 由样本求出统计量t的数值 的数值, 由样本求出统计量 的数值,通过 |t|> |t|> tα/2(n-k-1) ) 或 |t|≤ |t|≤tα/2(n-k-1) )
RSS = ∑ ei
2
2 总体平方和
Y )2 ESS = ∑(Y
回归平方和 残差平方和
则
TSS = Σ(Yi Y ) 2 = Σ((Yi Yi ) + (Yi Y )) 2 = Σ(Yi Yi ) 2 + 2Σ(Yi Yi )(Yi Y ) + Σ(Yi Y ) 2
由于
n 1 R = 1 (1 R ) n k 1
2 2
*2、赤池信息准则和施瓦茨准则 、
赤池信息准则( 赤池信息准则(AIC) )
AIC=-2L/n + 2(k + 1) / n
施瓦茨准则(SC) 施瓦茨准则( )
SC=-2L/n + (k + 1) ln n / n
L为对数似然值,n为样本容量,k为解释变量个数。 这两准则均要求仅当所增加的解释变量能够减少 这两准则均要求仅当所增加的解释变量能够减少 AIC值或AC值时才在原模型中增加该解释变量 值或AC值时才在原模型中增加该解释变量。 AIC值或AC值时才在原模型中增加该解释变量
β 0 = 120.70 β 1 = 0.2213 β 2 = 0.4515 s β = 36.51
多元线性回归模型的参数估计
在最小二乘法基础上,对不同的观测值赋予不同的权重,以调整其 对回归参数估计的影响。
广义最小二乘法(GLS)
考虑自变量之间的相关性,通过转换自变量和因变量来消除自变量 之间的多重共线性影响。
03
参数估计的方法
普通最小二乘法
最小二乘法是一种常用的参数估计方法,通过最小化误差 平方和来估计参数。在多元线性回归模型中,普通最小二 乘法通过求解线性方程组来得到参数的估计值。
模型选择
选择多元线性回归模型作 为预测模型,以商品价格 和用户评价作为自变量, 销量作为因变量。
参数估计
使用最小二乘法进行参数 估计,通过最小化误差平 方和来求解回归系数。
模型检验
对模型进行假设检验,确 保满足线性回归的前提假 设。
结果解释与模型评估
结果解释
根据回归系数的大小和符号,解释各自变量对因变量 的影响程度和方向。
05
参数估计的实例分析
数据来源与预处理
数据来源
数据来源于某大型电商平台的销售数据,包括商 品价格、销量、用户评价等。
数据清洗
对原始数据进行清洗,去除异常值、缺失值和重 复值,确保数据质量。
数据转换
对连续变量进行离散化处理,对分类变量进行独 热编码,以便进行回归分析。
模型建立与参数估计
01
02
03
THANKS
感谢观看
04
参数估计的步骤
确定模型形式
确定自变量和因变
量
首先需要确定回归模型中的自变 量和因变量,通常因变量是研究 的响应变量,自变量是对响应变 量有影响的预测变量。
确定模型的形式
根据自变量和因变量的关系,选 择合适的回归模型形式,如线性 回归、多项式回归等。
3.2 双变量线性回归模型的参数估计
i
i
i
ˆ
X Y X
2 i
i i
样本回归线的性质
通过Y和X的样本均值点 估计的Yi的均值等于实际观测的Yi的 均值 残差的均值为0 残差与解释变量Xi不相关 残差与估计的Yi值不相关
高斯定理
结论:在古典假定条件下 ,OLS 估计式是最佳线 性无偏估计式(BLUE)
三、最大似然估计法(ML)
2
评价要素(高斯定理前奏)
1.无偏性,方法、样本一定,抽样不同 2.最小方差性,样本一定,方法不同 3.渐进性,大样本时,具有最小渐近方差 (渐近有效)
二、参数的普通最小二乘估计(OLS)
给定一组样本观测值(Xi, Yi)(i=1,2,…n)要 求样本回归函数尽可能好地拟合这组值。
普通最小二乘法(Ordinary least squares, OLS)给出的判断标准是:残差的平方和最小。
基本原理: 对于最大似然法,当从模型总体随机抽 取n组样本观测值后,最合理的参数估计量 应该使得从总体中抽取该n组样本观测值的 概率最大。
双变量线性回归模型: Yi 1 2 X i ui
在满足11条基本假定的条件下
Yi ~ i.i.n.(1 2 X i , )
2
Yi的概率密度函数为 (i=1,2,…n)
将该似然函数极大化,即可求得到模型参 数的最大似然估计量。
对lnLF求极大值:
解得模型的参数估计量为:
2
~ ( X X )(Y Y ) x y x (X X )
i i i 2 i 2 i i
1 Y 2 X
~
~
2 ~2 u ˆ i n
可见,在满足一系列基本假设的情况下, 模型结构参数的最大似然估计量与普通最小 二乘估计量是相同的。
32多元线性回归参数估计(精)
(*)
方程组(*)称为正规方程组(normal equations)。
4
正规方程组的矩阵形式
n X 1i X ki
X X
1i 2 1i
X X X
ki
X
ki
X 1i
ˆ 1 0 ˆ X 11 1i ki 1 2 ˆ X ki k X k 1
1
可求得
0.0003 0.7226 ( XX) 0.0003 1.35 E 07
ˆ 0.7226 0.0003 15674 103 .172 1 ˆ β ˆ 2 0.0003 1.35 E 07 39648400 0.7770
ˆ 1 ˆ ˆ β 2 ˆ k
i=1,2…n
注意:此 处的 不 包括0
令
则离差形式可用形式下,参数的最小二乘估计结果为 why?
ˆ Y ˆ X ˆ X 0 1 1 k k
10
2的最小二乘估计
随机误差项的方差的估计量为
ˆ2 e e n k 1 n k 1
2 e i
其中,n- k+1是 ei2的自由度。 注意:该估计量为无偏估计量 why?
11
估计参数的方差-协方差矩阵(补充)
的方差-协方差矩阵如下:
Why?
Why?
12
多变量OLS回归线的性质
R-squared Adjusted R-squared S.E. of regression Sum squared resid Log likelihood Durbin-Watson stat
多元线性回归的计算方法
多元线性回归的计算方法 摘要在实际经济问题中,一个变量往往受到多个变量的影响。
例如,家庭消费支出,除了受家庭可支配收入的影响外,还受诸如家庭所有的财富、物价水平、金融机构存款利息等多种因素的影响,表现在线性回归模型中的解释变量有多个。
这样的模型被称为多元线性回归模型。
多元线性回归的基本原理和基本计算过程与一元线性回归相同,但由于自变量个数多,计算相当麻烦,一般在实际中应用时都要借助统计软件。
这里只介绍多元线性回归的一些基本问题。
但由于各个自变量的单位可能不一样,比如说一个消费水平的关系式中,工资水平、受教育程度、职业、地区、家庭负担等等因素都会影响到消费水平,而这些影响因素(自变量)的单位显然是不同的,因此自变量前系数的大小并不能说明该因素的重要程度,更简单地来说,同样工资收入,如果用元为单位就比用百元为单位所得的回归系数要小,但是工资水平对消费的影响程度并没有变,所以得想办法将各个自变量化到统一的单位上来。
前面学到的标准分就有这个功能,具体到这里来说,就是将所有变量包括因变量都先转化为标准分,再进行线性回归,此时得到的回归系数就能反映对应自变量的重要程度。
这时的回归方程称为标准回归方程,回归系数称为标准回归系数,表示如下:Zy=β1Zx1+β2Zx2+…+βkZxk注意,由于都化成了标准分,所以就不再有常数项a 了,因为各自变量都取平均水平时,因变量也应该取平均水平,而平均水平正好对应标准分0,当等式两端的变量都取0时,常数项也就为0了。
多元线性回归模型的建立多元线性回归模型的一般形式为Yi=β0+β1X1i+β2X2i+…+i i i i h x υβ+ =1,2,…,n其中 k 为解释变量的数目,j β=(j=1,2,…,k)称为回归系数(regression coefficient)。
上式也被称为总体回归函数的随机表达式。
它的非随机表达式为E(Y∣X1i,X2i,…Xki,)=β0+β1X1i+β2X2i+…+βkXkiβj 也被称为偏回归系数(partial regression coefficient) 多元线性回归的计算模型一元线性回归是一个主要影响因素作为自变量来解释因变量的变化,在现实问题研究中,因变量的变化往往受几个重要因素的影响,此时就需要用两个或两个以上的影响因素作为自变量来解释因变量的变化,这就是多元回归亦称多重回归。
