回归分析第26讲:内生性:为什么“相关 ≠ 因果”?

统计

在看到一组回归结果时,很多人会下意识地认为:

“X 显著影响 Y,说明 X 导致了 Y。”

但在实证研究中,这种判断往往并不成立。

因为回归分析中,存在一个比共线性、异方差更致命的问题:内生性。

它的危险在于:

模型可能看起来完全正常,系数方向合理、显著性也很漂亮,但结论在因果逻辑上却是站不住的。

这一讲,我们不讨论“怎么解决内生性”,而是回答三个更基础的问题:

什么是内生性?它从哪里来?什么时候必须保持警惕?

【一】什么是内生性?

如果在回归模型中,自变量与误差项相关,那么模型就存在内生性问题。

一旦存在内生性,OLS 估计不再无偏,显著性检验也就失去了因果解释的意义,回归结果最多只能被理解为相关关系。

这不是“技术细节”,而是因果推断失败的信号。

【二】内生性通常从哪三种地方出现?

大多数实证研究中的内生性,主要来自三类来源:

第一,反向因果。
现实中,X 和 Y 往往是相互影响的,直接回归无法区分因果方向。

第二,遗漏变量。
某些未被纳入模型的因素同时影响 X 和 Y,其作用会被错误地归入 X 的系数。

第三,测量误差。
当自变量是问卷、指数或代理变量时,测量误差会系统性地扭曲回归结果。

【三】为什么内生性比异方差、自相关更严重?

异方差、自相关或模型形式问题,影响的是统计推断的精度,通常可以通过调整标准误或模型设定加以修正。

而内生性破坏的,是模型本身的因果逻辑。

一旦存在内生性,再稳健的标准误也无法赋予回归结果因果含义,此时结果只能作为相关性描述。

【四】什么时候必须对“相关 ≠ 因果”保持警惕?

如果你的研究中出现以下情况,就不能轻易作因果解释:

  • X 和 Y 在现实中明显可能相互影响
  • 使用横截面数据,却试图讨论因果关系
  • 关键变量来自问卷、主观评价或指数构造
  • 研究对象涉及行为选择或自我选择

这并不意味着一定存在内生性,而是意味着:

在没有额外识别之前,不能直接把相关当成因果。

【五】一个直观案例:教育与收入

本案例用于说明内生性中遗漏变量导致的偏误,考察教育年限与个人收入之间的关系。

  • income:个人收入
  • education:受教育年限
  • ability:个体能力(不可观测,真实中往往被遗漏)

(1)基准回归:教育与收入的“表面关系”

先看不控制能力的基准回归结果(图1)。

回归结果显示,教育年限的系数约为 5789,且高度显著,表明受教育年限越高,个人收入水平越高。表面上看,这一结果支持“教育提高收入”的结论。

但需要注意的是,这个基准回归隐含了一个关键假设:教育是外生的。而在现实中,个体能力同时影响教育选择和收入水平,因此该结果只能被理解为教育与收入之间的相关关系,而非严格的因果效应。

图片 图1 基准回归结果

(2)控制能力后的模型:教育系数下降

在模型中进一步控制个体能力后,回归结果发生明显变化(图2)。

教育变量的系数下降至约3253,虽然仍然显著,但相比基准回归明显减小。同时,能力变量本身对收入具有显著的正向影响,说明能力既影响教育选择,也直接影响收入水平。

图片

图2 控制能力后的模型输出结果

(3)两个模型的对比:典型的遗漏变量导致的内生性

对比两个模型可以发现,不控制能力时,教育对收入的估计效应被系统性高估;而在控制能力后,教育系数回落到一个更合理的水平。

这并不意味着教育“没那么重要”,而是因为在基准回归中,能力这一遗漏变量的作用被错误地归入了教育的系数。这正是内生性中最典型的一种情形——遗漏变量问题。

因此,在未能识别和处理内生性的情况下,即使回归结果显著,也不能直接将其解释为教育对收入的因果效应。

【六】论文中,遇到内生性应当怎么“写”?

下面是论文写作时的参考。

  • 情况一:只做相关性分析(最安全)

“本文基于横截面数据,主要分析变量之间的相关关系,不对因果关系作严格识别。”

  • 情况二:明确承认潜在内生性

“本文的回归结果可能受到反向因果和遗漏变量的影响,相关结论需谨慎解释。”

  • 情况三:为后续方法铺垫(但本讲不展开)

“为进一步缓解潜在内生性问题,后续研究可采用工具变量或准自然实验方法。”

【七】一句话总结

回归能告诉你“有没有关系”,但只有在排除了内生性之后,它才能回答“是不是因果”。