面板数据分析系列第4讲:随机效应模型:同一组数据,换一种假设,会发生什么?
在上一讲中,我们在同一组城市—年份面板数据上,采用了固定效应模型。
通过引入城市固定效应与年份效应,模型在结构上剔除了城市层面不随时间变化的长期差异,使回归系数的估计仅来源于同一城市在不同时期的变化。
一个自然的问题是:
如果这些城市层面的长期差异,并不与教育投入等解释变量系统相关,会发生什么?
01### 同一份数据,随机效应“多用了什么信息”?
与固定效应模型不同,随机效应模型并不将城市层面的长期差异整体剔除,而是将其视为随机扰动的一部分,并假定这些不可观测特征与解释变量不相关。
在这一假设下,在这一假设下,模型可以同时利用城市之间的长期差异与城市内部随时间变化的信息。
因此,随机效应并不是“放松控制”,而是选择保留并利用跨城市的差异信息。
02随机效应回归结果:设定保持不变,处理方式改变
在本例中,我们保持与固定效应模型完全一致的设定:
- 被解释变量:学生成绩(score)
- 核心解释变量:滞后一期人均教育投入(edu_spend_pc_l1)
- 控制变量:经济发展水平、城市化率、教师配置
- 年份效应:统一控制
唯一的变化在于:
城市层面的异质性由“固定”改为“随机”。
除城市效应处理方式外,其余设定与固定效应模型一致。随机效应模型同时利用城市之间的差异与城市内部的时间变化。
该随机效应回归结果显示,在同时利用城市间差异与城市内部时间变化的信息后,教育投入与学生成绩之间呈现出显著的正相关关系。模型估计中,城市层面的长期差异在总变异中占据较大比重,反映出跨城市差异在解释学生成绩时的重要作用。
03一个关键对照:为什么固定效应中很多变量并不显著?
将这一结果与固定效应回归对照,可以发现一个非常典型的现象:
在固定效应模型中,多数变量并不显著;而在随机效应模型中,相同变量却呈现出较强的统计显著性
原因并不复杂。
图 2 固定效应回归结果:城市固定效应与年份效应
模型控制城市与年份固定效应,标准误在城市层面聚类。回归系数的估计仅基于同一城市在不同时期的变化。
在固定效应模型中,城市层面长期稳定的差异被整体吸收,这意味着模型不再利用“哪些城市整体水平更高”这一跨城市信息,而仅依赖城市自身随时间的变化进行识别。
在城市数量有限、时间维度较短的样本中,这种处理方式会显著压缩可用于估计的有效变异,其结果往往表现为参数估计精度下降,统计显著性减弱。
在图2的固定效应模型中,多数变量未呈现统计显著性,并不意味着变量之间不存在关联关系。固定效应模型在估计过程中,已将城市层面不随时间变化的长期差异整体吸收,回归系数仅基于同一城市内部随时间的变化进行识别。在城市数量有限、时间跨度较短的样本中,城市内部可用于识别的变异本身就较为有限,这会显著降低参数估计的精度,从而表现为统计显著性减弱。因此,这一结果更多反映了模型所能利用的信息范围,而非对变量作用方向的否定。
04 Hausman 检验:在这个例子中,它提示了什么?
在同一份数据下,固定效应与随机效应给出了明显不同的估计结果。为判断这种差异是否可以忽略,通常会引入 Hausman 检验。
图 3 固定效应与随机效应的 Hausman 检验结果
Hausman 检验用于比较固定效应与随机效应估计是否存在系统性差异,其结果为模型选择提供方法上的提示。
在本例中,Hausman 检验未能拒绝“固定效应与随机效应的系数差异不是系统性的”这一原假设,这意味着在当前数据与模型设定下,尚未发现随机效应模型存在系统性偏误的统计证据。换言之,随机效应模型所依赖的关键假设——城市层面的不可观测特征与解释变量不相关——在统计意义上尚未被证伪。
Hausman 检验并不是一种“自动裁决工具”。它的作用更多在于提示研究者检视模型所依赖的假设是否可以接受,而最终的模型选择仍应结合研究问题本身与对个体异质性的判断。
05再看一个必要的对照:忽视城市效应会怎样?
为了进一步理解个体异质性的作用,我们再次将所有观测值直接合并,进行普通最小二乘回归。
在这一设定下,教育投入及多项控制变量均呈现出较强的统计显著性,结果“看起来”比固定效应模型更为理想。但需要注意的是,这种设定隐含了一个极强的假设:
不同城市在结构上是可互换的,长期差异可以忽略。
图 4 合并回归结果:忽视城市层面异质性的估计
该模型未控制城市固定效应,仅作为对照,用以说明忽视个体异质性可能带来的估计偏差。
在现实中,教育传统、制度环境、人口结构等因素,既可能影响教育投入决策,也可能直接影响学生成绩。如果忽视这些差异,合并回归中得到的“显著关系”,往往混合了城市之间的长期差异与城市内部随时间变化的关系。
相比之下,固定效应模型虽然结果不再“好看”,但更接近模型在当前数据条件下能够可靠识别的部分。
06小结:同一份数据,不同模型,回答的是不同问题
通过这一组对照可以清楚看到:
- 固定效应关注的是:当一个城市自身发生变化时,会发生什么?
- 随机效应尝试回答的是:为什么有些城市整体水平更高?
- 合并回归则隐含假设:城市之间不存在系统性结构差异
因此,模型选择并不存在“谁更高级”的问题,关键在于:
研究问题所允许的假设,是否与模型假设相匹配。
写在最后
在这一示例中,我们再次刻意控制了模型复杂度。
结果是否显著,并不是重点;方法究竟在做什么,才是最重要的。