面板数据分析系列第2讲:为什么固定效应几乎成了默认选项,而随机效应却越来越少出现?

统计

在不少统计教材和课程安排中,面板数据分析往往被拆成几个“并列的方法”:合并回归、固定效应、随机效应,各自有公式、有假设,也各自有适用条件。

但当研究者真正开始读论文、写论文时,往往会产生一个困惑:

为什么在现实研究中,固定效应几乎成了默认选项,而随机效应却越来越少出现?

要理解这个问题,关键不在于方法“高不高级”,而在于:

不同模型,究竟在处理哪一类不可观测的差异。

01面板数据分析,并不是在“换一种回归”

从形式上看,面板数据分析仍然是回归分析。变化并不在于是否回归,而在于:数据中多了一层结构。

当我们同时观察多个个体、并在多个时间点上反复观测它们时,几乎不可避免地会遇到这样一种情况:

即便控制了所有可观测变量,不同个体之间,仍然存在长期、稳定、难以量化的差异。

这些差异,可能来自能力、偏好、制度环境,也可能来自一些我们根本无法测量的特征。面板数据模型之间的区别,核心就在于:

这些“看不见的差异”,究竟该怎么处理。

02固定效应,到底“固定”的是什么?

固定效应模型的出发点非常直接:

既然不同个体之间存在稳定差异,而这些差异又可能影响因变量,那就干脆不去假设它们是什么,而是允许它们存在。

在模型中,这种想法可以写成一个非常简单的形式:

图片

这里的关键,不在于公式本身,而在于其中的图片。

它表示的是:

每一个个体,都被允许拥有一个自己的“基准水平”。

这个基准水平不需要被解释,也不需要我们真的去估计“第 i 个体到底是多少”,它只是被当作一种长期存在、且不随时间变化的个体特征。

固定效应模型真正做的事情,是在估计过程中,把这些图片整体剔除掉,只利用同一个体在不同时点上的变化,来识别图片对图片 的影响。 

从这个角度看,固定效应并不是“多加了控制变量”,而是通过一种结构性的方式,回答这样一个问题:

当个体自身的特征保持不变时,解释变量的变化,是否会带来结果的变化?

也正因为如此,它天然具有一个优势:

只要个体差异是时间不变的,它们就不会干扰估计结果。

03随机效应,原本是为了解决什么问题?

与固定效应不同,随机效应模型选择了一条更“节省信息”的路径。

它并不完全消除个体差异,而是把这些差异当作一种随机成分,纳入误差结构中统一处理。在形式上,这可以写成:

图片

它同样表示个体之间长期存在的差异,但在随机效应模型中,这种差异不再被当作“需要剔除的常数项”,而是被视为一类随机扰动,与误差项一起进入模型结构。

随机效应模型之所以在理论上具有吸引力,正是因为它引入了一个关键假设:

如果这一假设成立,那么模型就可以在保留更多变异信息的同时,提高估计效率。也正因如此,在不少教材中,随机效应常被介绍为一种“更高效”的方法。

问题并不在于这种说法是否正确,而在于:

但在大多数应用研究中,研究者很难对这一假设给出令人信服的论证。

当个体特征既影响解释变量的取值,又直接影响研究结果时,把这些差异当作“随机噪声”,反而可能引入系统性偏误。

04为什么现实研究更偏向固定效应?

在真实的数据环境中,个体差异与解释变量完全不相关,往往只是一个理想化前提。

企业规模、地区发展水平、个人能力、制度环境,这些因素既影响解释变量的取值,也往往直接影响研究结果。

一旦这种关联存在,随机效应模型的优势就会迅速转化为风险。

而固定效应的“稳妥”,并不来自模型更复杂,而是来自它对假设的要求更低。

在假设难以验证的情况下,研究者更倾向于选择:

即便牺牲一些效率,也能换来更稳健结论的方法。

这也是为什么,在越来越多的实证研究中,固定效应逐渐成为默认选择。

05Hausman 检验,为什么没能“终结”这个问题?

很多初学者会问:

既然有 Hausman 检验,不能直接用它来决定选哪一个模型吗?

从形式上看,Hausman 检验确实是在比较固定效应和随机效应的差异。

但在实践中,它更多起到的是一种“警示”作用,而不是裁决作用。

当检验结果高度依赖样本设定、变量选择或模型形式时,本身就说明:

结论对假设非常敏感。

在这种情况下,研究者往往不会因为一次检验结果,就轻易接受随机效应的设定。

写在最后

随机效应在现实研究中被使用得越来越少,并不是因为它“错了”,而是因为在多数应用场景下,我们很难对它的核心假设有足够信心。

固定效应的流行,反映的并不是统计技术的升级,而是一种研究态度的变化:当无法确定假设是否成立时,优先选择更稳妥、更透明的处理方式。

理解这一点,固定效应与随机效应之间的关系,就不再是“谁更高级”,而是:

在什么问题下,我们愿意承担怎样的假设风险。