面板数据分析系列第3讲:固定效应模型:一个完整的 Stata 示例

统计

在前两讲中,我们已经反复提到一个现象:

在现实研究中,固定效应几乎成了面板数据分析的默认选项。

这一讲,我们通过一个结构完整、但刻意保持克制的示例,看一看固定效应模型在 Stata 中是如何被实际使用的。

这个例子的目的,并不是展示“多显著的结果”,而是帮助理解——固定效应究竟在解决什么问题。

01 问题设定:一个典型的“城市—年份”面板数据

假设我们关心这样一个问题:

教育投入是否会影响学生成绩?

我们拥有一份城市层面的面板数据,记录了多个城市在多个年份中的:

  • 学生成绩(score)
  • 人均教育投入(edu_spend_pc)
  • 以及经济发展水平、城市化率、教师配置等控制变量

在这样的数据中,一个几乎不可回避的现实是:

  • 即便控制了所有可观测变量,不同城市之间,仍然可能存在长期、稳定、但难以量化的差异。

例如教育传统、制度环境、家长期望等。

这正是面板数据分析要面对的核心情境。

02为什么这里适合使用固定效应?

如果忽略城市之间的差异,把所有观测值直接合并回归,就等于隐含地假设:

  • 不同城市在结构上并不存在系统性差别。

这一假设在多数现实问题中都很难成立。

固定效应模型的处理方式是:

  • 允许每一个城市拥有自己的“基准水平”
  • 但不试图解释它,而是在估计过程中将其整体剔除

这样,模型真正利用的是:

同一个城市,在不同年份中的变化。

03主模型:固定效应在 Stata 中“做了什么”?

在这个示例中,我们采用如下设定:

  • 城市固定效应
  • 年份固定效应
  • 教育投入设为滞后一期(效应可能存在时间延迟)
  • 标准误按城市聚类

这里不展开公式推导,只强调一个关键点:

固定效应不是“多加控制变量”,而是通过结构性方式,把时间不变的城市差异整体剔除。 图片

 图 1:固定效应回归结果(主模型)

上述固定效应模型中:控制城市与年份效应,标准误按城市聚类。

  • 表中并不存在一行叫“城市固定效应”的变量
  • 固定效应体现为:回归系数的估计,完全来自同一城市在不同时期的变化

也就是说,这里的系数并不是在比较“福州和厦门谁更好”,而是在问:

当某一个城市自身的教育投入发生变化时,它的学生成绩是否随之变化?

从结果中,可以注意到三点信息:

  • 教育投入使用的是滞后一期
  • 年份效应被统一控制
  • rho 接近 1,说明城市层面的长期差异在总变异中占据主导地位

这已经在提示我们:

如果忽略城市效应,很可能会带来系统性偏误。

04一个必要但克制的对照:忽视城市效应会怎样?

为了帮助理解固定效应的现实意义,我们做一个非常简单的对照:

暂时忽略城市层面的差异,将所有观测值合并回归。

这等价于假设:

不同城市在结构上是“可互换的”。 图片

图 2:合并回归(忽视城市效应)结果

这里,我们看到一个现象:

  • 教育投入的系数非常显著
  • 结果“看起来”比固定效应更漂亮

但问题恰恰在于,这种设定隐含了一个极强的假设:

城市之间不存在长期、稳定的结构性差异。

在现实中,城市层面的教育传统、制度环境、人口结构,既可能影响教育投入,也可能直接影响学生成绩。

因此,合并回归中得到的“显著关系”,很可能混合了两种不同的信息:

  • 城市之间的长期差异
  • 城市内部随时间变化的关系

相比之下,固定效应模型只利用城市内部的变化,结果不再“好看”,但更接近模型能够可靠识别的部分。

05关于滞后设定:这是方法要求吗?

在这个示例中,我们将教育投入设为滞后一期。需要强调的是:

  • 是否引入滞后,并不是固定效应模型的必然要求
  • 而是研究设定的选择

如果研究关注的是当期关联关系,也完全可以使用当期投入;引入滞后,更多反映的是对作用时点的判断,而非技术上的“更高级”。

06随机效应与 Hausman 检验:点到为止

在完整的面板分析中,研究者通常还会估计随机效应模型,并进行 Hausman 检验。

Hausman 检验的核心思想是:检验随机效应模型所依赖的一个关键假设是否可以接受——即个体的不可观测特征,是否与解释变量无关。

在本例中,Hausman 检验的结果显示,固定效应与随机效应的估计存在系统性差异,这意味着随机效应模型的核心假设在这里难以被确信。

因此,选择固定效应,并不是因为它“更显著”,而是因为在当前问题设定下,它对个体异质性的假设要求更低,也更稳妥。

图片

 图 3:随机效应结果与 Hausman 检验输出

在实践中,Hausman 检验更多起到的是一种提示作用,而不是自动裁决工具。

当核心假设难以被确信时,研究者往往更倾向于选择假设要求更低的固定效应。

07小结:这个示例真正想说明什么?

通过这一组设定与对照,可以清楚看到:

  • 固定效应不是“多加几个控制变量”
  • 它通过结构性方式,剔除了时间不变的个体差异
  • 估计结果主要来自个体内部的变化

这也正是为什么,在现实研究中,当个体差异难以被明确建模时,固定效应往往成为更稳妥的选择。

写在最后

这一讲,我们刻意控制了模型复杂度,只保留理解固定效应所必需的结构。

结果是否显著,并不是重点;方法究竟在做什么,才是最重要的。

下一讲,我们将进一步讨论一个经常被问到的问题:

如果固定效应这么稳妥,随机效应究竟在什么情况下还有意义?


附录:本文的Stata代码

clear all

import excel “education_panel.xlsx”, firstrow clear

encode city, gen(city_id)

xtset city_id year

gen edu_spend_pc_l1 = L.edu_spend_pc

  • A. 固定效应(聚类稳健标准误)

xtreg score edu_spend_pc_l1 gdp_pc urban_rate teacher_per100 i.year, ///

   fe vce(cluster city_id)

  • B. Hausman 只用于模型比较:用默认方差(不要加 vce(cluster))

xtreg score edu_spend_pc_l1 gdp_pc urban_rate teacher_per100 i.year, fe

est store FE

xtreg score edu_spend_pc_l1 gdp_pc urban_rate teacher_per100 i.year, re

est store RE 

hausman FE RE, sigmamore

  • C.(可选)对照:忽视城市效应(合并回归)

reg score edu_spend_pc_l1 gdp_pc urban_rate teacher_per100 i.year, ///

   vce(robust)