计量经济学8第八章 虚拟变量回归new
第八章-虚拟变量回归
1 高中 D2 0 其它
1 博士 D5 0 其它
1 大 学 D3 0 其 它
1 小 学 D6 0 其 它
则总体回归模型:
w 0 1 X 2 D1 3 D2 4 D3 5 D4 6 D5 7 D6+u
17
二、用虚拟变量测量斜率变动
基本思想
引入虚拟变量测量斜率变动,是在所设立的模型中,将虚 拟解释变量与其它解释变量的乘积,作为新的解释变量出 现在模型中,以达到其调整设定模型斜率系数的目的。
可能的情形:
(1)截距不变;
(2)截距和斜率均发生变化;
分析手段:仍然是条件期望。
18
(1)截距不变
模型形式:
意义:若α1显著,表明城市居民的平均人均可支配收入比农村 高α1元。但这种差异可能是由其它因素引起的,并不一定是由 户籍差异引起。
12
(2) 一个两属性定性解释变量和一个定量 解释变量
模型形式 Yi = f(Di,X i )+ μi 例如:Yi = 0 1 Di + X i + μi 1 城市 其中: Y-人均可支配收入;X-工作时间; Di 0 农村
会受到一些定性因素的影响,如性别、国籍、民族、自 然灾害和政治体制等。
问题:我们如何把这些定性想:将这些定性因素进行量化
由于定性变量通常表示某种属性是否存在,如是否男性、 是否经济特区、是否有色人和等。因此若该属性存在, 我们就将变量赋值为1,否则赋值为0,从而将定性因素 定量化。 计量经济学中,将取值为0和1的人工变量称为虚拟变量 (DUMMY)或哑元变量。通常用字母D或DUM表示。
7
一个例子(虚拟变量陷阱)
研究工资收入与学历之间的关系:
计量经济学第八章 虚拟变量回归
第八章
虚拟变量回归
1
第八章 虚拟变量回归
本章主要讨论:
●虚拟变量
●虚拟解释变量的回归
2
本章的教学目标
(1)深刻理解定性因素在计量经济分析中的 背景和含义; (2)明确虚拟变量在建立和估计计量经济模 型中的意义和作用; (3)熟练掌握引入和应用虚拟变量的基本思 想和方法; (4)能够运用虚拟变量模型作相应的经济实 证分析方面的应用; (5)掌握Eviews软件中相关内容的操作方法。
这表明三个时期居民储蓄增加额的回归方程在统计 意义上确实是不相同的。1996年以前收入每增加1 亿元,居民储蓄存款的平均增加0.1445亿元;在 2000年以后,则为0.4133亿元,已发生了很大变化。
20
上述模型与城乡居民储蓄存款与国民总收入之间 的散布图是吻合的,与当时中国的实际经济运行 状况也是相符的。 需要指出的是,在上述建模过程中,主要是从教 学的目的出发运用虚拟变量法则,没有考虑通货 膨胀因素。而在实证分析中,储蓄函数还应当考
单位:亿元
城乡居民 人民币储 蓄存款增 额 (YY) 2121.8 2517.8 3444.1 6315.3 8143.5 8858.5
年 份
城乡居民 国民总收 人民币储 蓄存款年 入 (GNI) 底余额 (Y) 3624.1 4038.2 4517.8 4860.3 5301.8 5957.4 210.6 281 399.5 532.7 675.4 892.5
(1,0) 天气阴 如:(D1 ,D2)= (0,1) 天气雨 (0,0) 其 他
29
虚拟变量数量的设置规则
1.若定性因素具有 m 个 (m 2) 相互排斥属性(或 几个水平),当回归模型有截距项时,只能引入
虚拟变量回归模型:计量经济学
对未来研究的展望
拓展模型应用领域
未来研究可以进一步拓展虚拟变 量回归模型的应用领域,如环境 经济学、劳动经济学、金融经济 学等,以更深入地揭示经济现象 背后的规律。
宏观经济学领域应用
经济增长研究
引入虚拟变量以刻画不同国家或地区的经济增 长模式,并分析各种因素对经济增长的贡献。
通货膨胀与货币政策研究
利用虚拟变量回归模型,探讨通货膨胀的成因、 传导机制及货币政策的效应。
国际贸易研究
通过构建虚拟变量,分析贸易自由化、关税壁垒等因素对国际贸易流量的影响。
金融学领域应用
线性问题,影响模型的稳定性和解释性。
预测能力有限
03
对于具有复杂关系的数据,虚拟变量回归模型可能无法提供准
确的预测。
与其他模型的比较
01
与线性回归模型的比较
虚拟变量回归模型是线性回归模型的一种扩展,通过引入 虚拟变量来处理分类变量。线性回归模型则主要关注连续 变量的影响。
02 03
与逻辑回归模型的比引言 • 虚拟变量回归模型基本原理 • 虚拟变量回归模型应用举例 • 虚拟变量回归模型优缺点分析 • 虚拟变量回归模型在实证研究中的应用 • 虚拟变量回归模型的发展趋势和前景
01 引言
计量经济学简介
1 2
计量经济学定义
计量经济学是应用数学、统计学和经济学方法, 对经济现象进行定量分析的学科。
完善模型理论和方法
在模型理论和方法方面,未来研 究可以进一步完善虚拟变量回归 模型的理论基础和方法体系,提 高模型的解释力和预测能力。
计量经济学第八章关于虚拟变量的回归.
类的截距。
2
2:级差截距系数
教龄X
1
0
薪金与性别:估计结果
1,若是男性 Di 0,若是女性
ˆ 17.969 1.371X 3.334D Y i i i se : (0.192) (0.036) (0.155) t : (93.61) (38.45) (21.455) r 2 0.993
一、虚拟变量的性质
例:教授薪金与性别、教龄的关系
男教授平均薪金和女 教授平均薪金水平相 差2,但平均年薪对 教龄的变化率是一样 的
Yi=1+2Di+Xi+I (1) 1,若是男性 D 其中:Yi=教授的薪金, Xi=教龄, Di=性别 0,若是女性 i 女教授平均薪金:E(Yi | X i , Di 0) 1 X i 被赋予0值的 男教授平均薪金:E(Yi | X i , Di 1) (1 2) X i 类别是基底(基 准),1是基底 男教授
比较英国在第二次大战后重建时期和重建后时期的总 储蓄-收入关系是否发生变化。数据如表。 Yt 1 2 Dt 1 X t 2 ( Dt X t ) t
D=1,重建时期
级差截距:区分两 个时期的截距 级差斜率系数:区分 两个时期的斜率 =0,重建后时期
D=1 D=0
E(Yt | Dt 0, X t ) 1 1 X t E(Yt | Dt 1, X t ) (1 2 ) ( 1 2 ) X t
男教授平均薪金水平比 女教授显著高$3.334K (男:21.3,女:17.969)
1,若是女性 Di 0,若是男性
ˆ 21.303 1.371X 3.334D Y i i i se : (0.182) (0.036) (0.155) t : (117.2) (38.45) (21.455)
9第八章 虚拟变量回归模型
Logit 模型的估计
区分两类数据:
(1)个体水平数据
购房概率 p 0 0 1 1
收入 X(千美元) 6 8 10 12
如果
pi
0,
Zi
ln
0 1
pi
1,
Zi
ln
1 0
可见,Z 表达式无意义,无法用OLS,需用ML(最大似然法)
冰箱销售量(千台) FRIG 1317 1615 1662 1295 1271 1555 1639 1238 1277 1258 1417 1185 1196 1410 1417 919 943 1175 1269
耐用品支出(10亿美元) DUR 252.6 272.4 270.9 273.9 268.9 262.9 270.9 263.4 260.6 231.9 242.7 248.6 258.7 248.4 255.5 240.4 247.7 249.1 251.8
4 回归分析操作命令: equation eq.ls Frig c Dur D1 D2 D3
提问 根据回归分析结果,发现存在什么问题?如何修改回归模型?
8.4 虚拟被解释变量的回归模型
【例】 研究是否购买住房与收入水平的关系。
设是否购房为被解释变量,用 Y 表示;收入为解释变量, 用 X 表示。
1 变量分析:
将DUR作为解释变量;FRIG作为被解释变量; 引入3个季度虚拟变量D1,D2,D3。 (虚拟变量数 = 属性数 – 1 )
2 季度虚拟变量的赋值规则:
D1=
1 (第1季度) 0 (其他季度)
D3=
1 (第3季度) 0 (其他季度)
D2=
第八章虚拟解释变量回归
第八章虚拟解释变量回归第一节虚拟变量一、虚拟变量的差不多概念在前面的分析中,被说明变量要紧受到一些能够直截了当度量的变量阻碍,如收入、产出、商品需求量、价格、成本、资金、人数等。
但现实经济生活中,阻碍被说明变量变动的因素,除了这些能够直截了当获得实际观测数据的定量变量外,还包括一些本质上为定性因素(或称属性因素)的阻碍,例如性别、种族、肤色、职业、季节、文化程度、战争、自然灾难、政府经济政策的变动等因素。
在实际经济分析中,这些定性变量有时具有不可忽视的重要阻碍。
例如,研究某个企业的销售水平,产业部门(制造业、零售业)、所有制(私营、非私营)、地理位置(东、中、西部)、治理者素养的高低等是值得经常考虑的阻碍因素,这些因素有共同的特点,即差不多上表示某种属性的,不能直截了当用数据精确描述的因素。
因此,被说明变量的变动经常是定量因素和属性因素共同作用的结果。
在计量经济模型中,应当同时包含定量和属性两种因素对被说明变量的阻碍作用。
定量因素是指那些可直截了当测度的数值型因素,如GDP、M2等。
定性因素,或称为属性因素,是不能直截了当测度的、说明某种属性或状态存在与否的非数值型因素,如男性或女性、都市居民或非都市居民、气候条件正常或专门、政府经济政策不变与改革等。
在计量经济学的建模中应当将定量因素和定性因素同时纳入模型之内。
为了在模型中反映定性因素,能够将定性因素转化为虚拟变量去表现。
虚拟变量(或称为属性变量、双值变量、类型变量、定性变量、二元型变量等),是人工构造的取值为0和1的作为属性变量代表的变量,一样用字母D(或DUM,英文dummy的缩写)表示。
属性因素通常具有若干类型或水平,通常虚拟变量的取值为0和1,当虚拟变量取值为0,即D=0时,表示某种属性或状态不显现或不存在,即不是某种类型;当虚拟变量取值为1,即D=1时,表示某种属性或状态显现或存在,即是某种类型。
例如,构造政府经济政策人工变量,当经济政策不变时,虚拟变量取值为0,当经济政策改变时,虚拟变量取值为1。
计量经济学第八章虚拟变量回归
Y D D D X i 0 1 1 2 2 3 3 4 i i
D1
D2
1 一季度
1 二季度
D3
1 三季度
2 0 其他
2 0 其他
2 0 其他
15
例:美国制造业利润-销售额模型分析
Y X D D D 0 1 i 2 2 i 3 3 i 3 4 i i
比如在研究居民消费函数的时候,考虑到城乡差距和收入差距, 消费函数可以表示为: Y b b X b D b D
i 0 1i 2 1 i 32 i
i
D1i
1 城镇居民 2 0 农村 居民 农村低收入家庭 农村高收入家庭 城市低收入家庭 城市高收入家庭
D2i
1 高收入家庭
2 0 低收入家庭
计参数是否能通过显著性检验,最终确定虚拟变量的具体引入 方式。
9
课本P125页例7中数据建立的我国城镇居民彩电消费模型
ˆ Y 57 . 6113 0 . 0118 X 31 . 8731 D 0 . 0088 D X i i i i i
t
Di
(9.03)
(8.32)
(-6.59)
从这一章开始引入定性变量作为自变量,从而使线性 回归模型作为一种及其灵活的工具,可以处理经验研究中
许多实际的问题
2
• 由于这些定性变量通常指某一性质或属性的出现或不出现,
比如男性或女性、大学学历或专科学历等,因此量化这些 变量的方法就是构造一个取值为0或1的人为变量,可以用 0表示某种属性不出现,1表示某种属性出现。 • 这种人为设定的变量就称作虚拟变量(Dummy Variable) 1 大学毕业
计量经济学第八章 虚拟变量
Yi X i Di X i i
如果该模型设定正确,此时有:
E(Yi
)
(
X
)
i
X
i
D 1 D0
可见,城镇ቤተ መጻሕፍቲ ባይዱ民的边际消费倾向为 ( ) ,农
村居民的边际消费倾向为 。
如果不同属性类别对应的截距项和斜率项都 是有差异的,可在回归模型中同时引入虚拟 变量的加法方式和乘法方式,结果如下:
1 东部 D1 0 其他
1 中部 D2 0 其他
若考虑不同区域居民对应回归模型截距的不同 ,可构建模型如下:
Yi 1D1i 2 D2i X i i
则有:
E (Yi
)
( (
2) 1)
X i X i
Xi
Yi Di X i Di X i i
对于城镇居民和农村居民这两个类别,有总 体回归函数如下:
E(Yi
)
(
)
( X i
)X
i
D 1 D0
可见, 和 分别表示城镇居民与农村居民
的消费函数在截距和斜率上的差异。
注:
对于包含多个类别(M个)的属性变量,构 建M-1个虚拟变量,如在消费模型中,考虑 区域因素(东部,中部,西部)影响,可构 建2个虚拟变量:
Yi 1D1i 2 D2i (D1i D2i ) X i i
• 则有: ( 1 2 ) Xi
E
(Yi
)
( 1) Xi ( 2 ) Xi
8第八章虚拟变量回归new
三类年薪函数的差异情况如下图所示:
年薪 α1
α2 -α1
研究生 本科 大专以下
工龄
设置虚拟变量D或增设D3行吗?
2 D= 1
0
博士研究生
硕士研究D生 2
本科及以下
1 0
研究生 其他
(2)多个因素各两种类型
如果有m个定性因素,且每个因素各有两个不 同的属性类型,则引入 m 个虚拟变量。
例如,研究居民住房消费函数时,考虑到城乡 的差异以及不同收入层次的影响,将消费函数取成: yi=a+bxi+α1D1i+α2D2i +εi
【例】现有1998年我国城镇居民人均收入与彩 电每百户拥有量的统计资料。
9
观察相关图
从相关图可以看出, 前3个样本点与后5个样 本点存在较大差异,因 此,可设置虚拟变量反 映“收入层次”:
D
1 0
中高收入家庭 低收入家庭
10
将我国城镇居民的彩电需求函数设成:
Yi=a+bxi+αDi+βXDi+εi DATA D1
其中y ,x分别是居民住房消费支出和可支配收 入,虚拟变量设为:
1 农村居民 D1 0 城镇居民
1 高收入家庭 D2 0 低费情况:
城市低收入家庭 城市高收入家庭 农村低收入家庭 农村高收入家庭
(D1=0,D2=0)
(D1=0,D2=1) (D1=1,D2=0) (D1=1,D2=1)
政策紧缩 政策宽松
D
1 0
本科以上学历 本科以下学历
变量的划分应遵循穷举与互斥原则。
5
二、作用
⑴可以描述和测量定性因素的影响。
⑵能够正确反映经济变量之间的相互关系,提高模 型的精度。
计量经济学第二版第8章-虚拟变量ppt课件
表1 我国各地区城乡居民收入 单位:元、人
地区 城镇居民
农村居民
人均可支配收入
人均纯收入
北 京 26738.48
11668.59
天 津 21402.01
8687.56
河 北 14718.25
5149.67
山 西 13996.55
4244.10
内蒙古 15849.19
4937.80
辽 宁 15761.38
➢ 了解线性概率模型、Logit模型和Probit模型的基 本思想和估计方法。
精品课件
引例:男女大学生的消费差异
在校大学生的消费行为越来越受到社会的关 注,学生家长也很关心自己的子女上大学的 花费问题。由共青团、全国学联共同发布的 《2004中国大学生消费与生活形态研究报告》 显示,当代大学生在消费结构方面呈现多元 化趋势。大学生除了日常生活费开支以外, 还有人际交往、网络通信、书报、衣着类、 化妆品类、电脑类、旅游类、食品类、学习 用品类、各类考证类等多重消费。
Yi=(a+α2)+ bxi+εi 研究生(D1=0,D2=1)
三类年薪函数的差异情况如下图所示:
上图直观地描述了三类 年薪函数的差异情况, 通过检验、 α1 、α2的 显著性,可以判断学历 层次对职员的年薪是否 有显著影响。
年薪
α1
精品课件
α2 -α1
研究生 本科 大专以下
工龄
虚拟变量数量的设置规则
4478.35
四 川 13839.40
4462.05
贵 州 12862.53
3005.41
云 南 14423.93
3369.34
西 藏 13544.41
3531.72
虚拟变量回归课件
例1
(1)
D
=
1 0
男 女
( 2)D=1 0
改 革 开 放 以 后 改 革 开 放 以 前
(3)D1 =0 1
天气阴 其 他(4)D2
=1 0
天气雨 其他
问题:
为何只选0、1,选2、3、4行吗?为什么?
虚拟变量回归
14
属性的状态(水平)数与虚拟变量 数量的关系
定性因素的属性既可能为两种状态,也可能为多种 状态。例如,性别(男、女两种)、季节(4种状 态),地理位置(东、中、西部),行业归属,所 有制,收入的分组等。
虚拟变量回归
11
二、虚拟变量设置规则
虚拟变量的设置规则涉及三个方面: 1.“0”和“1”选取原则 2.属性(状态、水平)因素与设置虚拟变量
数量的关系 3.虚拟变量在回归分析中的角色以及作用等
方面的问题
虚拟变量回归
12
“0”和“1”选取原则
虚拟变量取“1”或“0”的原则,应从分析问题的 目的出发予以界定。
虚拟变量回归
16
一个例子(虚拟变量陷阱)
研究居民住房消费支出 Yi 和居民可支配收入 Xi 之间的
数量关系。回归模型的设定为:Y i= 0 + 1 X i+ u i( 1 )
现在要考虑城镇居民和农村居民之间的差异,如何办?
为了对 “城镇居民”、“农村居民”进行区分,分析
各自在住房消费支出 Yi上的差异,设 D1i = 1 为城镇;
非数值性的因素。 基本思想: 直接在回归模型中加入定性因素存在诸多的困难 (那些困难?),是否可将这些定性因素进行量 化,以达到定性因素能与定量因素有着相同作用 之目的。
虚拟变量回归
10
计量经济学第8章
6443.33 8631.94 1
最高收入户
7593.95 10962.1 0
8262.42 12083.79 1
表 回归结果
这表明1998年、1999年我国城镇居民消费函数并没有显著差 异。因此,可以将两年的样本数据合并成一个样本,估计城镇居 民的消费函数,结果如下:
回归结果
虚拟变量的特殊应用
0
1
0
1988.1
3929.8 25 0
0
0
1984.4
4270.6 12
1
0
0
1988.2
4126.2 26 0
0
1
1985.1
3044.1 13
0
0
0
1988.3
4015.1 27 0
1
0
1985.2
3078.8 14 0
0
1
1988.4
4904.2 28 1
0
0
由于受取暖用煤的影响,每年第四季度的销售量大大高于其
设根据同一总体两个样本估计的回归模型分别为
为“相异回归”(Dissimilar regressions)。 上述情况中,只有第(1)种情况模型结构是稳定的,其余情况都表明模 型结构不稳定。
3.分段回归
回归系数反映了奖金的提高程度。使用虚拟变量既能如实描述不同阶段 的经济关系,又未减少估计模型时的样本容量,保证了模型的估计精度。
后期变动一个单位对Y的影响,即x的滞后影响。 如果 b = bi 存在,i=0,1,2…,k
b 称为长期分布或总分布乘数。表示X 变动一个单
位时,由于滞后效应而形成的对Y值的总的影响。
分布滞后模型的参数估计
对分布滞后模型直接采用OLS不适宜 • 没有先验准则确定滞后期长度;
【精选】计量经济学八章_06[1].5(XS)43
Y
.
检验ˆ2对应的t值,判断是否在X *处存在突变。 X*
X
低于X * : Yˆt ˆ0 ˆ1 X t
高于X * : Yˆt (ˆ0 ˆ2 X * ) (ˆ1 ˆ2)X t
ˆ1是销售低于X(* 第一段回归直线)的斜率; (ˆ1 ˆ2)是销售高于X(* 第二段回归直线)的斜率;
(一)加法类型 设定的虚拟变量以相加的形式出现
作用:改变了设定模型的截距水平,称为截距变动模型。
1、加法类型的虚拟变量模型(截距变动模型 )
(1)解释变量只有虚拟变量:Yi f (Di ) i
例:Yi 0 1Di i
其中:Di
1 0
男 女
男性 Yi (0 1) i
Yi f (Xi,D1,D2 ) i
例:......
(d)多个定性变量的模型
Yt 0 1D1t D2t Dkt X t ut
例:......
(二)乘法类型
乘法类型引入虚拟变量,是在所设立的模型中,将虚拟解释变 量与其它解释变量(Xi或Di)相乘作为新的解释变量出现在模型中。 目的:调整设定模型的斜率系数。
1、回归模型的比较(结构变化检验) 通过对模型的参数检验,可以检验模型是否有不同的结构。即
定性变量D的引入,是否影响不同类型(属性)模型的平均水平(截距项)? 定性变量D的引入,是否影响不同类型(属性)模型的相对变化(斜率系数)?
例:……
一般: Yt 1 2 X t u1t Yt 1 2 X t u2t
t
0
1t
2
3
t
t
D
1 0
t 1979 t 1979
计量经济学-虚拟变量回归
虚拟变量模型有三种类型
1. 解释变量中只包含虚拟变量 2. 解释变量中既包含定量变量也包含虚拟
变量。 3. 被解释变量本身为虚拟变量。
20
第二节 虚拟解释变量的回归
本节基本内容:
●加法类型 ●乘法类型 ●虚拟解释变量综合应用
21
在计量经济学中,通常引入虚拟变量的方式分为 加法方式和乘法方式两种:即
分为四种情形讨论: (1)解释变量只有一个定性变量而无定量变量,而且定性
变量为两种相互排斥的属性; (2)解释变量分别为一个定性变量(两种属性)和一个定
量解释变量;
23
(3)解释变量分别为一个定性变量(两种以上属 性)和一个定量解释变量;
(4)解释变量分别为两个定性变量(各自分别是 两种属性)和一个定量解释变量;
计量经济学
第八章 虚拟变量回归
1
引子:男女大学生消费真有差异吗?
由共青团中央,全国学联共同发布的 《 2004中国大学生消费与生活型态研究报 告》显示,当代大学生的消费行为呈现多元 化的结构。除日常生活开支外还有人际交往 消费、手机类消费、衣着类消费、化妆品类 消费、电脑类消费、旅游类消费等等。
2
4
第一节 虚拟变量
本节基本内容:
●基本概念 ●虚拟变量设置规则
5
一、基本概念
定量因素:可直接测度的数值型因素。 如收入、产出、价格、人数等。
定性因素:属性因素,不能直接测度、 表征某种属性或状态存在与否的非数值型 因素。如性别、婚否、政府经济政策不变 与改革、城市居民或非城市居民等。
6
在以前的学习中,解释变量主要是定 量变量,但现实经济生活中影响被解释 变量的还包括定性变量,比如:研究某 个企业的销售水平,所有制(私营、非 私营)、地理位置(东、中、西部)等 是必须考虑的因素。
计量经济学:第八章虚拟变量回归
计量经济学:第⼋章虚拟变量回归第⼋章虚拟变量回归第⼀节虚拟变量的概念⼀、问题的提出计量经济学模型对变量的要求——可观测、可计量。
但在现实经济问题中,存在定性影响因素,⽐如1、属性(品质)因素的表达。
在经济活动中,有的经济变量的变动要受到属性因素(或品质因素)的影响。
如收⼊在形成过程中,不同的性别所得到的收⼊是不⼀样的;在城乡、不同地区等收⼊存在差距;再⽐如,在我国,经济的发展⽔平对于不同的区域有不同的表现。
2、异常值现象。
当经济运⾏过程中,可能会受到突发事件的影响,那么,其值有可能出现异常,偏离正常轨迹很远,对这类现象需要加以修正。
3、季节因素的影响。
有的经济现象存在明显的季节特征,如啤酒的消费。
那么,在建模过程中,季节变动这⼀因素怎样考虑?4、离散选择现象的描述。
如公共交通与私⼈交通的选择、商品购买与否的决策、求职者对职业的选择等。
第1、2、3种情况属于解释变量为定性变量,第4情况为被解释变量属于定性变量。
称前⼀种情况为虚拟解释变量,后⼀种为虚拟被解释变量。
本章主要介绍虚拟解释变量的内容。
⼆、虚拟变量的定义1、定义。
设变量D 表⽰某种属性,该属性有两种类型,即当属性存在时D 取值为1;当属性不存在时D 取值为0。
记为=不具有该属性具有某种属性01D2、虚拟变量引⼊的规则。
(1)在模型⾥存在截距项的条件下,如果⼀个属性存在m 个相互排斥类型(⾮此即彼),则在模型⾥引⼊m-1个虚拟变量。
否则,会出现完全的多重共线性。
但要注意,在模型⽆截距项的情况下,如果⼀个属性存在m 个类型,即便引⼊m 个变量,不会出现多重共线性问题。
(请思考为什么?)(2)虚拟变量取值为0,意味着所对应的类型是基础类型。
⽽虚拟变量取值为1,代表与基础类型相⽐较的类型,称为⽐较类型。
例如“有学历”D 为1,“⽆学历”D 为0,则“⽆学历”就是基础类型,“有学历”为⽐较类型。
(3)当属性有m 个类型时,不能把虚拟变量的取值设成如下情况D=0,第⼀个类型;D=1,第⼆个类型;……D=m-1,第m 个类型。
第八章虚拟变量回归课件
9.房地产投机因素:投机者在房地产市场中的投机活动;
10.自然因素:包括自然环境、地质、地形、地势及气候等。
(资料来源:徐静; 武乐杰, 房地产价格影响因素的解释结构模型分析, 金融
经济, 2009年 10期)
第八章虚拟变量回归
2
在影响房地产价格的众多因素中,有定量的因素:
成本因素、房地产供求因素、经济因素、人口因素等;
Y t 0 1 X 1 t k X k 1 t D 1 t 2 D 2 t 3 D 3 t 4 D 4 t t
其矩阵形式为:
Y(XD, )α βμ
第八章虚拟变量回归
如果只取六个观测值,其中春季与夏季取了两次, 秋、冬各取到一次观测值,则式中的:
1 1
X 11 X 12
X k1 Xk2
被解释变量本身是定性变量
第八章虚拟变量回归
6
二、虚拟变量模型
虚拟变量模型:包含有虚拟变量的模型称虚拟变量模型 三种类型: 1、 解释变量中只包含虚拟变量
作用:假定其他因素都不变,只研究某种定性因素在某定
量变量上是否表现出显著差异
2、 解释变量中既含定量变量,又含虚拟变量
作用:研究定量变量和虚拟变量同时对被解释变量的影响
也有定性的因素:
社会因素、行政因素、区位因素、个别因素、投机因
素、 自然因素等。
在研究房地产价格影响机理时,需要分析那些不易量化
的定性因素对房地产价格是否真的有显著影响。
能否把定性的因素也引入计量经济模型中呢? 怎样才能
在模型中有效地表示这些定性因素的作用呢?
第八章虚拟变量回归
3
引子2 男女大学生的消费真的有差异吗?
例如:D=0 如果是女性(基础类型)
第八章 虚拟变量回归
其中括号内这T-统计量,所有参数 均为显著的,拟合集优度R2=0.999 ,但DW值存在自相关,进行AR(1)
修正,重新估计得:
以上回归的模拟效果:
2500 2000 1500 40 20 0 -20 -40 1975 1980 1985 1990 Actual 1995 2000 Fitted 1000 500 0
有时我们所研究的变量之间 的变化趋势在某一时点上发生 了转折,如图8-3中所呈现的样 本散布点图,它表明变量Y与变 量X之间的变化关系在点X*处发 生了转折,一般来说,这样的 转折点是由于突发
Y
X X
*
0
图8.3
从图中可以算出,消费随时间 有规律地变化,为了模拟消费的 变化趋势,从而对其进行预测, 我们选择时间变量(T)为解释 变量,考虑到季节变动,引入虚 拟 变 量 , D1,D2,D3( 定 义 同 上)等。 由图可知,PCE随时间的变化 是二次曲线,设定模型为下式:
PCEt 0 4Tt 5 D1 t * T 6 D2 t * T 2 7 D3 t * T 8T ut
假设模型中仅有一个解释 变量X,线性概率模型可以表 示为:
Yi 0 1 Xi u i
由于Yi 只取两个值0与1, 设Yi 取1的概率为Pi ,则Yi 取0 的概率为(1-Pi ),于是,
E(Yi ) 1* Pi 0 * (1 Pi ) Pi
而
E(Yi ) 0 1Xi
Pi
1
0 1X i) (
作出该项选择与不作出该项选 择的概率之比的对数值增加一 个 1 。
三、概率单位模型(Probit)
- 1、下载文档前请自行甄别文档内容的完整性,平台不提供额外的编辑、内容补充、找答案等附加服务。
- 2、"仅部分预览"的文档,不可在线预览部分如存在完整性等问题,可反馈申请退款(可完整预览的文档不适用该条件!)。
- 3、如文档侵犯您的权益,请联系客服反馈,我们会尽快为您处理(人工客服工作时间:9:00-18:30)。
25
SMPL 1 16 GENR XD=X*D1 LS Y C X D1 XD 估计结果为: 操作演示
t统计量
样本期调至1998~1999年 生成XD的值 利用混合样本估计模型
R2的值
单位:亿元
城乡居民人 民币储蓄存 款增加额 (YY)
年 份
城乡居 民人民 国民总收 币储蓄 入 (GNI) 存款年 底余额 (Y ) 7206.7 8989.1 10201.4 11954.5 14922.3 16917.8 18598.4 1214.7 1622.6 2237.6 3073.3 3801.5 5146.9 7119.8
YY
NA 70.4 118.5 124.2 151.7 217.1 1991 1992 1993 1994 1995 1996
城乡居民人 民币储蓄存 国民总收 款年底余额 入 (GNI) (Y ) 21662.5 26651.9 34560.5 46670 57494.9 66850.5 9241.6 11759.4 15203.5 21518.8 29662.3 38520.8
第三节 虚拟变量的特殊应用
一、调整季节波动 例如,用季度数据分析某公司利润y与销售 收入x之间的相互关系时,为研究四个季度的季 节性影响,引入三个虚拟变量(设第1季度为基 础类型): 第i+1季度 i=1,2,3 1 Di 其他季度 0 利润函数可取为 : Yi=a+bxi+ α 1D1i+ α 2D2i + α 3D3i + ε i
计量经济学
第八章
虚拟变量回归
1
引子:男女大学生消费真有差异吗?
在对在校学生的消费行为进行的调查中,发现在校
生的消费行为呈现多元化的结构。人际交往消费、
手机类消费、衣着类消费、化妆品类消费、电脑类 消费、旅游类消费占有较大的比例;而食品类消费、 学习用品类消费不突显。 显然,男女生在消费上存在差异。为了了解男、女
二、检验模型结构的稳定性 设根据两个样本估计的回归模型分别为: 样本1: Yi=a1+b1xi +ε i 样本2: Yi=a2+b2xi +ε i 1 样本2 设置虚拟变量: D 0 样本1
估计模型:Yi=a1+b1xi+(a2-a1)Di+(b2-b1)XDi+ε 其中,XDi=xi*Di。
21
1 设虚拟变量为: D 0
三、分段回归
x>x* x<x*
分段回归模型设置成: Yi= a+bxi+β (xi-x*)Di+ε i 其中,x*是已知的临界水平(分段点)。 这样各段的函数为: Yi= a +bxi+ε i x<x* Yi= (a-β )+(b+β )xi+ε i x>x*
6
第二节 虚拟变量的设定
一、虚拟变量的引入方式 (1)加法方式 Yi=a+bxi+α Di+ε i a+α 等价为: 当Di =0时:Yi=a+bxi+ε i a 当Di =1时:Yi=(a+α )+bxi+ε i
D=1 α D=0
以加法方式引入,反映定性因素对截距的影响
(2)乘法方式
Yi=a+bxi+β XDi+ε i 其中:XDi=Xi*Di, 上式等价于: a 当Di =0时:Yi=a+bxi+ε i 当Di =1时:Yi=a+(b+β )xi+ε
1 农村居民 D1 0 城镇居民
城市低收入家庭 城市高收入家庭 农村低收入家庭 农村高收入家庭
1 高收入家庭 D2 0 低收入家庭
(D1=0,D2=0) (D1=0,D2=1) (D1=1,D2=0) (D1=1,D2=1)
这样可以反映各类居民家庭的住房消费情况:
思考:若是多因素、多个属性水平的问题,如何设置?
调整的R2值
26
第四节 案例分析
为了考察改革开放以来中国居民的储蓄存款与收 入的关系是否已发生变化,以城乡居民人民币储 蓄存款年底余额代表居民储蓄( Y ),以国民总
收入GNI代表城乡居民收入,分析居民收入对储
蓄存款影响的数量关系,并建立相应的计量经济
学模型 。
27
表8.1
国民总收入与居民储蓄存款
城乡居民 人民币储 年 蓄存款增 份 加额( )
单位:亿元
城乡居民 人民币储 蓄存款增 额 (YY) 2121.8 2517.8 3444.1 6315.3 8143.5 8858.5
年 份
城乡居民 国民总收 人民币储 蓄存款年 入 (GNI) 底余额 (Y) 3624.1 4038.2 4517.8 4860.3 5301.8 5957.4 210.6 281 399.5 532.7 675.4 892.5
1 D 0
政策紧缩
政策宽松
1 D 0
本科以上学历
本科以下学历
变量的划分应遵循穷举与互斥原则。
5
二、作用
⑴可以描述和测量定性因素的影响。
⑵能够正确反映经济变量之间的相互关系,提高模 型的精度。 ⑶便于处理异常数据。 即将异常数据作为一个特殊的定性因素
1 D 0
异常时期 正常时期
生的消费支出结构差异,应当如何建立模型?
面临的问题:如何把男女生这样的非数量变量引
入方程?
2
问题的一般性描述
在实际建模中,一些定性变量具有不可忽视的重要
影响。例如,研究某个企业的销售水平,产业属性
(制造业、零售业)、所有制(私营、非私营)、
地理位置(东、中、西部)、管理者的素质、不同
的收入水平等是值得考虑的重要影响因素,但这些 因素共同的特征是定性描述的。 如何对非定量因素进行回归分析? 采用“虚拟变量”对定性变量进行量化一种思路。
为比较两年的消费函数是否有显著差异,设置虚拟 变量: 1 1999年
D 0
1998年
并且合并两年的数据,估计以下模型: Yi= a1 +b1xi+α Di+β XDi +ε i 其中α =a2-a1 ,β =b2-b1。
24
使用EViews软件的估计过程如下: CREATE U 16 建立工作文件 DATA Y X (输入1998、1999年消费支出和收入的数据,1~8期 为1998年资料,9~16期为1999年资料) SMPL 1 8 样本期调为1998年
1978 1979 1980 1981 1982 1983
数据来源:《中国统计年鉴2004》,中国统计出版社。表中“城乡居民人民币 储蓄存款年增加额”为年鉴数值,与用年底余额计算的数值有差异。 28
表8.1
国民总收入与居民储蓄存款 (续)
城乡居 民人民 币储蓄 存款增 加额 (YY ) 322.2 407.9 615 835.7 728.2 1374.2 1923.4
使用虚拟变量能如 实描述不同阶段的 经济关系,又未减 少估计模型时样本 容量,保证了估计 精度。
22
四、混合回归 能否将变量的时序数据和横截面数据混合建模 【例】现有我国城镇居民1998年、1999年全年人均消 费支出和可支配收入的统计资料。试使用混合样本 数据估计我国城镇居民消费函数。 设1998年、1999年我国城镇居民消费函数分别为: 1998年:Yi=a1+b1xi +ε i 1999年:Yi=a2+b2xi +ε i
9
观察相关图
从相关图可以看出, 前3 个样本点与后 5 个样 本点存在较大差异,因 此,可设置虚拟变量反 映“收入层次”:
1 D 0
中高收入家庭 低收入家庭
10
将我国城镇居民的彩电需求函数设成: Yi=a+bxi+α Di+β XDi+ε i DATA D1 (由于D是EViews软件的保留字,所以将虚拟变量取 名为D1;另外,此时也可以用SMPL和GENR命令直 接生成D1变量) GENR XD=X*D1 生成变量XD LS Y C X D1 XD 估计需求函数 结果如下图所示:
1 本科 D1 0 其他
1 研究生 D2 0 其他
而将年薪模型取成(假设以加法方式引入):
Yi=a+bxi+α 1D1i+α 2D2i +ε 其等价于:
i
Yi=a+bxi+ε i Yi=(a+α 1)+ bxi+ε Yi=(a+α 2)+ bxi+ε
i i
大专以下(D1=D2=0) 本科(D1=1,D2=0) 研究生(D1=0,D2=1)
i
20
第(1)种情况下模型结构是稳定的, 利用t检验判断D、XD系数的显著性,得到四种 其余情况都表明模型结构不稳定。 重合回归检验结果: (1)a2=a1,b2=b1,两个回归模型没有显著差异。 (2)a2≠a1 ,b2=b1 ,两个回归模型之间的差异仅仅 平行回归 表现在截距上。 (3)a2=a1 ,b2≠b1 ,两个回归模型的截距相同,但 汇合回归 斜率存在显著差异。 (4)a2≠a1,b2≠b1,表明两个回归模型完全不同。 相异回归
年 份
国民总收入 (GNI)
城乡居民人 民币储蓄存 款年底余额 (Y )
1984 1985 1986 1987 1988 1989 1990
1997 1998 1999 2000 2001 2002 2003
73142.7 76967.2 80579.4 88254 95727.9 103935.3 116603.2