面板数据分析系列第3讲:固定效应模型:一个完整的 Stata 示例
在前两讲中,我们已经反复提到一个现象:
在现实研究中,固定效应几乎成了面板数据分析的默认选项。
这一讲,我们通过一个结构完整、但刻意保持克制的示例,看一看固定效应模型在 Stata 中是如何被实际使用的。
这个例子的目的,并不是展示“多显著的结果”,而是帮助理解——固定效应究竟在解决什么问题。
01 问题设定:一个典型的“城市—年份”面板数据
假设我们关心这样一个问题:
教育投入是否会影响学生成绩?
我们拥有一份城市层面的面板数据,记录了多个城市在多个年份中的:
- 学生成绩(
score) - 人均教育投入(
edu_spend_pc) - 以及经济发展水平、城市化率、教师配置等控制变量
在这样的数据中,一个几乎不可回避的现实是:
- 即便控制了所有可观测变量,不同城市之间,仍然可能存在长期、稳定、但难以量化的差异。
例如教育传统、制度环境、家长期望等。
这正是面板数据分析要面对的核心情境。
02为什么这里适合使用固定效应?
如果忽略城市之间的差异,把所有观测值直接合并回归,就等于隐含地假设:
- 不同城市在结构上并不存在系统性差别。
这一假设在多数现实问题中都很难成立。
固定效应模型的处理方式是:
- 允许每一个城市拥有自己的“基准水平”
- 但不试图解释它,而是在估计过程中将其整体剔除
这样,模型真正利用的是:
同一个城市,在不同年份中的变化。
03主模型:固定效应在 Stata 中“做了什么”?
在这个示例中,我们采用如下设定:
- 城市固定效应
- 年份固定效应
- 教育投入设为滞后一期(效应可能存在时间延迟)
- 标准误按城市聚类
这里不展开公式推导,只强调一个关键点:
固定效应不是“多加控制变量”,而是通过结构性方式,把时间不变的城市差异整体剔除。
图 1:固定效应回归结果(主模型)
上述固定效应模型中:控制城市与年份效应,标准误按城市聚类。
- 表中并不存在一行叫“城市固定效应”的变量
- 固定效应体现为:回归系数的估计,完全来自同一城市在不同时期的变化
也就是说,这里的系数并不是在比较“福州和厦门谁更好”,而是在问:
当某一个城市自身的教育投入发生变化时,它的学生成绩是否随之变化?
从结果中,可以注意到三点信息:
- 教育投入使用的是滞后一期
- 年份效应被统一控制
rho接近 1,说明城市层面的长期差异在总变异中占据主导地位
这已经在提示我们:
如果忽略城市效应,很可能会带来系统性偏误。
04一个必要但克制的对照:忽视城市效应会怎样?
为了帮助理解固定效应的现实意义,我们做一个非常简单的对照:
暂时忽略城市层面的差异,将所有观测值合并回归。
这等价于假设:
不同城市在结构上是“可互换的”。
图 2:合并回归(忽视城市效应)结果
这里,我们看到一个现象:
- 教育投入的系数非常显著
- 结果“看起来”比固定效应更漂亮
但问题恰恰在于,这种设定隐含了一个极强的假设:
城市之间不存在长期、稳定的结构性差异。
在现实中,城市层面的教育传统、制度环境、人口结构,既可能影响教育投入,也可能直接影响学生成绩。
因此,合并回归中得到的“显著关系”,很可能混合了两种不同的信息:
- 城市之间的长期差异
- 城市内部随时间变化的关系
相比之下,固定效应模型只利用城市内部的变化,结果不再“好看”,但更接近模型能够可靠识别的部分。
05关于滞后设定:这是方法要求吗?
在这个示例中,我们将教育投入设为滞后一期。需要强调的是:
- 是否引入滞后,并不是固定效应模型的必然要求
- 而是研究设定的选择
如果研究关注的是当期关联关系,也完全可以使用当期投入;引入滞后,更多反映的是对作用时点的判断,而非技术上的“更高级”。
06随机效应与 Hausman 检验:点到为止
在完整的面板分析中,研究者通常还会估计随机效应模型,并进行 Hausman 检验。
Hausman 检验的核心思想是:检验随机效应模型所依赖的一个关键假设是否可以接受——即个体的不可观测特征,是否与解释变量无关。
在本例中,Hausman 检验的结果显示,固定效应与随机效应的估计存在系统性差异,这意味着随机效应模型的核心假设在这里难以被确信。
因此,选择固定效应,并不是因为它“更显著”,而是因为在当前问题设定下,它对个体异质性的假设要求更低,也更稳妥。
图 3:随机效应结果与 Hausman 检验输出
在实践中,Hausman 检验更多起到的是一种提示作用,而不是自动裁决工具。
当核心假设难以被确信时,研究者往往更倾向于选择假设要求更低的固定效应。
07小结:这个示例真正想说明什么?
通过这一组设定与对照,可以清楚看到:
- 固定效应不是“多加几个控制变量”
- 它通过结构性方式,剔除了时间不变的个体差异
- 估计结果主要来自个体内部的变化
这也正是为什么,在现实研究中,当个体差异难以被明确建模时,固定效应往往成为更稳妥的选择。
写在最后
这一讲,我们刻意控制了模型复杂度,只保留理解固定效应所必需的结构。
结果是否显著,并不是重点;方法究竟在做什么,才是最重要的。
下一讲,我们将进一步讨论一个经常被问到的问题:
如果固定效应这么稳妥,随机效应究竟在什么情况下还有意义?
附录:本文的Stata代码
clear all
import excel “education_panel.xlsx”, firstrow clear
encode city, gen(city_id)
xtset city_id year
gen edu_spend_pc_l1 = L.edu_spend_pc
- A. 固定效应(聚类稳健标准误)
xtreg score edu_spend_pc_l1 gdp_pc urban_rate teacher_per100 i.year, ///
fe vce(cluster city_id)
- B. Hausman 只用于模型比较:用默认方差(不要加 vce(cluster))
xtreg score edu_spend_pc_l1 gdp_pc urban_rate teacher_per100 i.year, fe
est store FE
xtreg score edu_spend_pc_l1 gdp_pc urban_rate teacher_per100 i.year, re
est store RE
hausman FE RE, sigmamore
- C.(可选)对照:忽视城市效应(合并回归)
reg score edu_spend_pc_l1 gdp_pc urban_rate teacher_per100 i.year, ///
vce(robust)