回归分析第25讲:控制变量到底该不该加?什么时候“控制”反而是错的?

统计

很多人在做回归时,都有一个朴素的直觉:

控制变量加得越多,结论就越可靠。

于是,回归表越做越长,模型看起来也越来越“严谨”。

但现实中,不少结果恰恰是被这些控制变量“控制错”的。

这一讲,我们专门讨论一个关键问题:

什么时候该控制?什么时候控制反而是错的?

【一】控制变量,本来是用来干什么的?

在回归分析中,引入控制变量的核心目的只有一个:

隔离自变量与因变量之间的干扰因素,避免遗漏变量偏误。

具体来说,如果某些变量同时影响自变量 Y,而这些变量又不在研究的核心机制之中,那么如果不加以控制,它们的作用就可能被“混进”  的回归系数里,导致估计结果产生偏误。

因此,控制变量的作用,并不是为了让结果更显著,也不是为了让模型看起来更复杂,而是为了让核心关系的解释更加清晰。

【二】为什么“控制得越多”,反而越容易出问题?

问题往往出在一个看似稳妥、却非常危险的想法上:

“反正多控制几个变量,总不会有坏处。”

实际上,过度控制往往会带来至少三类严重问题。

第一,把中介变量当成控制变量。

如果真实的作用路径是:X 作为控制变量加入,相当于人为切断了  影响 Y 的一部分真实路径,得到的系数已不再是研究者最初关心的效应。

第二,把“结果变量的近亲”当成控制变量。

某些变量在逻辑或统计上与因变量高度接近,控制它们往往会引发严重的共线性问题,使系数不稳定、显著性判断失真。

第三,机械式控制,导致模型不可解释。

在一些论文中,控制变量的选择缺乏明确逻辑,仅以“参考已有文献”为依据,结果是模型越来越复杂,但结论却难以解释其经济含义。

【三】什么时候“必须控制”?什么时候“千万别控制”?

一个相对稳妥的判断标准是:

通常应该控制的变量,是那些同时影响 X 和 Y,但并不处于研究机制中的因素。

这类变量往往具有以下特征:

不受 X 的直接影响,但会系统性地干扰 X 与 Y 之间的关系。

需要高度警惕、通常不应控制的变量,主要包括:

  • 明显处于 X 与 Y 之间的中介变量
  • 与因变量高度重合或高度同步变化的变量
  • 明显发生在 X 之后的结果变量

一旦控制了这些变量,回归结果往往刻画的是一个被“截断后的效应”,而非研究者真正关心的原始关系。因此,是否控制某个变量,本身就是一个需要被认真论证的建模选择。

【四】一个典型案例:为什么“控制以后,结果反而不对了?”

以“数字化水平对企业绩效的影响”为例。研究者希望考察企业数字化转型是否能够提升经营绩效,于是在回归模型中以企业绩效作为因变量,以数字化水平作为核心自变量。

该案例的数据中, performance 表示企业绩效,digital 表示企业数字化水平,efficiency 表示企业运营效率(中介变量),同时控制企业规模(size)和行业差异(industry)。

在模型的构建过程中,数字化水平不仅直接影响企业绩效,同时还会通过提升运营效率间接影响绩效。

  1. 基准回归:数字化的总体效应

先看Stata的基准回归结果(图1)。

在不控制中介变量的情况下,模型仅控制企业规模和行业差异,用来估计数字化水平对企业绩效的总体影响。图1回归结果显示,数字化变量的系数约为 0.86,且在统计上高度显著,表明数字化水平越高,企业绩效整体上越好。

这里的基准回归刻画的是数字化的总体效应,其中既包含数字化的直接作用,也包含其通过效率提升等渠道产生的间接影响。

图片

图1 基准回归结果

  1. 控制效率后:效应被“削弱”一部分

再看加入效率变量后的结果(图2)。

当在模型中进一步控制企业运营效率后,数字化的系数明显下降,降至约 0.48,虽然仍然显著,但幅度已经显著小于基准回归的估计结果。同时,效率变量本身对绩效的影响非常显著,说明效率正是数字化影响绩效的重要传导路径。

在这里,企业运营效率就是中介变量。控制中介变量后的模型中,效应被“削弱”。

图片

图2 加入企业运营效率后的模型输出结果

  1. 两个模型的对比:为什么“控制反而会出问题”

对比两个模型可以发现,一旦将效率这一中介变量纳入控制变量,数字化对绩效的估计效应明显被削弱。这并不意味着数字化的作用变弱,而是因为模型在控制效率的同时,人为切断了数字化通过效率影响绩效的部分路径。

如果研究关心的是数字化的总体效果,那么控制效率,反而会让结论“看起来没那么有力”。相应地,基准回归更适合用于评估数字化的整体影响,而在引入效率后的模型中,估计结果应被理解为数字化在既定效率条件下的剩余直接效应。

【五】论文中,控制变量应该怎么“写”才规范?

下面是三个可以直接用在论文里的模板:

  •  模板一:明确控制逻辑

“为避免遗漏变量偏误,本文在回归模型中控制了可能同时影响 X 与 Y 的个体特征与环境变量。”

  • 模板二:解释为什么不控制某些变量

“考虑到 M 可能是 X 影响 Y 的中介变量,本文未将其纳入控制变量,以避免对核心效应的低估。”

  • 模板三:作为稳健性检验处理

“在稳健性分析中,本文进一步加入相关控制变量,结果显示核心结论保持一致。”

【六】一句话总结

控制变量不是越多越好,而是要控制“该控制的那一类”。