回归分析第26讲:内生性:为什么“相关 ≠ 因果”?
在看到一组回归结果时,很多人会下意识地认为:
“X 显著影响 Y,说明 X 导致了 Y。”
但在实证研究中,这种判断往往并不成立。
因为回归分析中,存在一个比共线性、异方差更致命的问题:内生性。
它的危险在于:
模型可能看起来完全正常,系数方向合理、显著性也很漂亮,但结论在因果逻辑上却是站不住的。
这一讲,我们不讨论“怎么解决内生性”,而是回答三个更基础的问题:
什么是内生性?它从哪里来?什么时候必须保持警惕?
【一】什么是内生性?
如果在回归模型中,自变量与误差项相关,那么模型就存在内生性问题。
一旦存在内生性,OLS 估计不再无偏,显著性检验也就失去了因果解释的意义,回归结果最多只能被理解为相关关系。
这不是“技术细节”,而是因果推断失败的信号。
【二】内生性通常从哪三种地方出现?
大多数实证研究中的内生性,主要来自三类来源:
第一,反向因果。
现实中,X 和 Y 往往是相互影响的,直接回归无法区分因果方向。
第二,遗漏变量。
某些未被纳入模型的因素同时影响 X 和 Y,其作用会被错误地归入 X 的系数。
第三,测量误差。
当自变量是问卷、指数或代理变量时,测量误差会系统性地扭曲回归结果。
【三】为什么内生性比异方差、自相关更严重?
异方差、自相关或模型形式问题,影响的是统计推断的精度,通常可以通过调整标准误或模型设定加以修正。
而内生性破坏的,是模型本身的因果逻辑。
一旦存在内生性,再稳健的标准误也无法赋予回归结果因果含义,此时结果只能作为相关性描述。
【四】什么时候必须对“相关 ≠ 因果”保持警惕?
如果你的研究中出现以下情况,就不能轻易作因果解释:
- X 和 Y 在现实中明显可能相互影响
- 使用横截面数据,却试图讨论因果关系
- 关键变量来自问卷、主观评价或指数构造
- 研究对象涉及行为选择或自我选择
这并不意味着一定存在内生性,而是意味着:
在没有额外识别之前,不能直接把相关当成因果。
【五】一个直观案例:教育与收入
本案例用于说明内生性中遗漏变量导致的偏误,考察教育年限与个人收入之间的关系。
- income:个人收入
- education:受教育年限
- ability:个体能力(不可观测,真实中往往被遗漏)
(1)基准回归:教育与收入的“表面关系”
先看不控制能力的基准回归结果(图1)。
回归结果显示,教育年限的系数约为 5789,且高度显著,表明受教育年限越高,个人收入水平越高。表面上看,这一结果支持“教育提高收入”的结论。
但需要注意的是,这个基准回归隐含了一个关键假设:教育是外生的。而在现实中,个体能力同时影响教育选择和收入水平,因此该结果只能被理解为教育与收入之间的相关关系,而非严格的因果效应。
图1 基准回归结果
(2)控制能力后的模型:教育系数下降
在模型中进一步控制个体能力后,回归结果发生明显变化(图2)。
教育变量的系数下降至约3253,虽然仍然显著,但相比基准回归明显减小。同时,能力变量本身对收入具有显著的正向影响,说明能力既影响教育选择,也直接影响收入水平。
图2 控制能力后的模型输出结果
(3)两个模型的对比:典型的遗漏变量导致的内生性
对比两个模型可以发现,不控制能力时,教育对收入的估计效应被系统性高估;而在控制能力后,教育系数回落到一个更合理的水平。
这并不意味着教育“没那么重要”,而是因为在基准回归中,能力这一遗漏变量的作用被错误地归入了教育的系数。这正是内生性中最典型的一种情形——遗漏变量问题。
因此,在未能识别和处理内生性的情况下,即使回归结果显著,也不能直接将其解释为教育对收入的因果效应。
【六】论文中,遇到内生性应当怎么“写”?
下面是论文写作时的参考。
- 情况一:只做相关性分析(最安全)
“本文基于横截面数据,主要分析变量之间的相关关系,不对因果关系作严格识别。”
- 情况二:明确承认潜在内生性
“本文的回归结果可能受到反向因果和遗漏变量的影响,相关结论需谨慎解释。”
- 情况三:为后续方法铺垫(但本讲不展开)
“为进一步缓解潜在内生性问题,后续研究可采用工具变量或准自然实验方法。”
【七】一句话总结
回归能告诉你“有没有关系”,但只有在排除了内生性之后,它才能回答“是不是因果”。