回归分析第2讲:回归能回答什么?不能回答什么?

统计

上一讲我们讲了“回归”这个词的由来,以及它如何从一项身高研究发展成现代统计学最重要的方法之一。本讲不再讲历史,而是回答一个更关键的问题:

回归具体能回答什么?又有哪些问题,即使用再复杂的回归,也永远回答不了?

理解这一点,会决定你是否能科学、谨慎地解读回归结果。

【一】回归能回答的三个核心问题

(1)关系是否存在?方向是什么?

回归分析最基本的能力,是判断两个变量之间是否存在一种稳定的、可重复的关系。在具体研究中,我们首先想知道的往往是:

  • 某个变量与结果之间是否存在系统性关系
  • 这种关系是正向、负向,还是不存在
  • 是否具有统计意义

例如:

  • 城市 PM2.5 上升,医疗支出是否随之上升?
  • 数字经济指数越高的地区,是否消费越旺?
  • 企业 ESG 表现越好,融资成本是否越低?

回归通过系数的正负号、显著性水平告诉我们:

这些趋势在数据中是否具有“稳定性”。

这一步不能回答因果,但能给我们非常清晰的“方向性证据”。

(2)影响有多大?(回归最重要的价值之一)

回归模型能够通过系数的方向和显著性,告诉我们这种关系在数据中是否成立。但回归的价值远不止判断方向。更重要的是,它能量化这种关系的“大小”。我们更关心:

“到底影响多少?”

例如:

  • 教育年限每增加 1 年,收入平均提高多少?
  • 广告投入增加 10%,销量平均提升多少?
  • 数字普惠金融指数提高 0.1,农村消费提升多少?

这种量化的影响,是政策评估、商业决策和学术解释中最重要的内容。相关性只告诉你两个变量“走向差不多”,而回归告诉你“增加1单位,会带来怎样的平均变化”。例如:

  • 政策制定需要判断成本是否值得
  • 企业决策需要比较投入产出
  • 学术研究需要解释经济意义,而不是只报告了一个p值

所以即使显著性不高,一个有意义的“影响方向 + 影响幅度”依然能为研究提供价值。

(3)在控制其他因素后,这种关系是否仍然存在?

这是回归的“灵魂”。

回归分析的另一个核心能力,是将多个变量同时纳入考虑,找到某个因素对结果的“净影响”。

真实世界中,一个结果变量几乎不可能由单一因素决定。房价、收入、销量、健康状况……几乎都受到多重因素共同作用。如果不控制这些因素,很容易把条件差异误当成“影响”。

回归正是通过加入控制变量,把这些背景因素“扣除”,让我们看到某个变量本身的独立效果,也就是经济学中常说的“other things being equal(其他条件不变)”。

例如:

大城市数字经济越发达 → 收入越高

但这是因为数字经济导致的?
还是因为“大城市本来就更富裕”?

因此,回归让我们能同时纳入:

  • 城市规模
  • 教育水平
  • 产业结构
  • 固定效应
  • 地理特征
  • 政策因素

结果可以变成:

在控制城市规模、教育、产业结构等因素后,数字经济每提高 0.1,收入仍然提升 X%。

这才是我们真正想知道的“净效应”。

【二】回归不能回答什么?(三个最容易被误解的地方)

回归分析的局限同样明显,而且远比初学者想象的更严格。下面是回归分析最容易被误解的地方:

(1)回归不能自动推断“因果关系”

这是所有初学者最容易犯的错误。即使回归结果显示:

  • 系数显著
  • p 值小到 0.000
  • R² 很高

你仍然不能说:

“X 导致了 Y。”

这背后的原因,可能包括:

  • 反向因果:收入高的地区更容易发展数字经济
  • 遗漏变量偏误:家庭背景、城市治理未被控制
  • 共同驱动因素:政策、经济周期同时影响 X 和 Y

要想推断因果,需要:

  • 工具变量(IV)
  • 双重差分(DID)
  • 自然实验
  • 随机实验
  • 固定效应模型
  • 断点回归(RDD)

没有这些额外设计,你只能说:

“关系存在”,而不能说“原因是它”。

(2)回归无法保证你的模型是完全正确的

回归模型永远不可能“完美”,很多因素不是回归本身可以判断的,包括:

  • 变量选择可能不完整
  • 函数形式可能设定错误
  • 有些变量测量不准确
  • 有些因素无法观察
  • 模型没有考虑非线性结构

例如:

研究教育对收入的影响,却没有控制“家庭背景” → 结果一定偏误。

模型设定偏误无法通过“回归本身”解决,这就是为什么高级计量方法强调识别策略。

(3)回归不能控制无法测量的因素

回归只能控制那些可量化、可观察、且被纳入模型的因素。但现实中存在大量无法测量的因素:

  • 企业家能力
  • 地方治理效率
  • 城市文化氛围
  • 居民风险偏好
  • 企业内部管理水平

这些因素“真实存在”,但无法进入回归模型,于是:

回归永远无法完全消除偏误,它只能尽量减少偏误。

理解这一点,是写论文必须有的“谦逊”。

【三】一个形象的比喻:回归是数据世界里的“显微镜”

如果要给回归找一个形象的比喻,那么它就是数据世界里的显微镜。显微镜能让我们看到肉眼无法观察到的结构,而回归能让我们看到变量之间的系统性关系。显微镜能“放大”细节,但会受到镜头质量、光线、材料透明度等限制;同样,回归能“放大”影响,但会受到变量选择、测量精度、模型设定、数据质量等限制。

回归的力量在于:

  • 它能把变量之间的系统性关系“放大”
  • 它能剔除部分背景噪音
  • 它能量化影响的幅度

但它的局限在于:

  • 模型设定问题
  • 不可观测因素
  • 数据缺失
  • 样本质量差

所以回归是一种强大的工具,但不是万能工具。

【四】本讲小结

本讲我们从能力与边界两个角度重新审视了回归分析:

✔ 回归能够做的是:

  • 方向:关系是否存在
  • 幅度:影响有多大
  • 净效应:控制其他因素后是否依然存在

✘ 回归不能做的是:

  • 自动判断因果
  • 保证模型绝对正确
  • 控制不可测量或不可观测的因素

理解这些,是写好任何回归论文的第一步。