相关性分析(3):相关 ≠ 因果!为什么误把相关当因果很危险?

统计

在前两篇文章中,我们讲了什么是相关性、如何正确解读 r。但无论理解得多好,都必须记住一个统计学中最重要、也最容易被忽视的原则——相关不代表因果(Correlation ≠ Causation)。

很多数据看起来“同时变化”,但背后的原因可能完全不同。如果不区分因果与相关,就可能得出完全错误的政策结论、商业判断,甚至研究结论。

本篇我们要讲的是:为什么高度相关也可能毫无因果关系?为什么必须用回归控制其他变量?又为什么实证研究永远不能停留在“相关”层面?

【一】为什么高度相关也可能完全没有因果?

皮尔逊相关系数 r 衡量的是“两个变量的同步变动”。但两个变量可能因为各种原因同时变化,而其中“因果机制”可能根本不存在。

或者说:

相关是一种“现象”,因果是一种“解释”。

要证明因果,需要机制、理论、时间顺序、控制变量甚至自然实验;而相关,只需要两个变量“看起来一起联动”。

下面用几个经典例子,带你真正理解这件事。

【二】案例 1:冰激凌销量与溺水人数——看似相关,其实没有因果

在很多统计教材和新闻中都会出现这个例子:夏天冰激凌销量增加,溺水人数也增加;两个变量的相关系数甚至可能超过0.7。

是不是吃冰激凌导致溺水?当然不是。

真正的“幕后推手”是——温度。

  • 天气越热 → 人们越喜欢吃冰激凌
  • 天气越热 → 更多人去海边、湖边游泳,事故风险更高

温度是一个隐藏变量(lurking variable),同时影响两个结果,使它们看起来有强相关。

✔ 这是典型的“共同原因(common cause)”情形。

【三】案例 2:医护人数与人口老龄化——看似因果,方向却反了

一个地区医护人数越多,老年人口比例越高——这是在多个国家都观测到的现象。

但你不能说:

“更多医生导致老人更多。”

正确解释是:

  • 人口老龄化 → 医疗需求增加
  • 医疗需求增加 → 医护资源扩张

所以相关方向是反的:

老龄化导致医护人数增加,而不是医护人数导致老龄人口增加。

✔ 这是“因果方向反转(reverse causality)”的典型案例。在回归分析中,这类错判非常常见。

【四】案例 3:GDP与手机数量——关系强,但并无直接因果

2000—2020年的数据几乎可以得出:

GDP越高的国家,手机数量越多。相关系数甚至可能超过 0.9。

但你不能说:

“手机数量越多 → GDP越高。”

真正的路径是:

经济发展水平提高 → 家庭可支配收入增加 → 手机普及率上升

这类变量属于**发展水平共同演进的结果。**他们“看起来”同步增减,但并无直接因果链。

✔ 这是“共同趋势(shared trend)”造成的假相关(spurious correlation)。这种误判在时间序列研究中特别危险。

【五】中介因素、隐藏变量如何让“假相关”看起来像“真关系”?

在社会科学研究中,几乎每一个变量都受到其他因素影响。如果不加控制,相关性很容易出现偏差。

(1)隐藏变量(lurking variables)。影响两个变量,使它们看上去相关,但实际上是被第三方驱动。

例如:

  • 城市化率既影响家庭收入,也影响教育支出
  • 城市规模既影响工资,也影响创新产出

(2)中介变量(mediators)。A影响B,但A并不是直接原因,而是通过C起作用。

例如:

  • 收入 → 生活自主性 ↑ → 幸福感 ↑
  • 数字经济发展 → 企业信息透明度 ↑ → 创新投入 ↑

如果不考虑中介,相关性会给你“强关系的错觉”。

(3)遗漏变量(omitted variables)。回归中未包含某个关键变量,会导致相关性强烈偏误,是实证研究的常见大坑。

【六】为什么必须用回归分析控制变量?

在现实研究中,要判断“是否有因果”,不能停留在相关层面。

回归分析的核心目的之一,就是:

将不可控的混合影响分离开,只看“净效应”。

例如:

  • 控制年龄后,医护人数与老龄化的关系会消失
  • 控制温度后,溺水与冰激凌的关系会消失
  • 控制收入后,手机与GDP的相关性大幅降低

这说明:

相关不是终点,而是进入因果推断的起点。

没有控制变量,就无法解释“真正的因果机制”。

图片

【七】小结:相关可以提示线索,但永远不能代表因果

我们总结一下:

  • 相关只说明“同时变化”,不说明“谁影响谁”。
  • 很多强相关都是隐藏变量、共同原因、趋势演进造成的。
  • 因果方向可能反转。
  • 遗漏变量会制造虚假的强相关。
  • 要进行因果分析,必须用回归、面板、工具变量等方法。

理解这一点,你才能真正看懂数据,也能避免论文与研究中最常出现的逻辑误区。