回归分析第25讲:控制变量到底该不该加?什么时候“控制”反而是错的?
很多人在做回归时,都有一个朴素的直觉:
控制变量加得越多,结论就越可靠。
于是,回归表越做越长,模型看起来也越来越“严谨”。
但现实中,不少结果恰恰是被这些控制变量“控制错”的。
这一讲,我们专门讨论一个关键问题:
什么时候该控制?什么时候控制反而是错的?
【一】控制变量,本来是用来干什么的?
在回归分析中,引入控制变量的核心目的只有一个:
隔离自变量与因变量之间的干扰因素,避免遗漏变量偏误。
具体来说,如果某些变量同时影响自变量 Y,而这些变量又不在研究的核心机制之中,那么如果不加以控制,它们的作用就可能被“混进” 的回归系数里,导致估计结果产生偏误。
因此,控制变量的作用,并不是为了让结果更显著,也不是为了让模型看起来更复杂,而是为了让核心关系的解释更加清晰。
【二】为什么“控制得越多”,反而越容易出问题?
问题往往出在一个看似稳妥、却非常危险的想法上:
“反正多控制几个变量,总不会有坏处。”
实际上,过度控制往往会带来至少三类严重问题。
第一,把中介变量当成控制变量。
如果真实的作用路径是:X 作为控制变量加入,相当于人为切断了 影响 Y 的一部分真实路径,得到的系数已不再是研究者最初关心的效应。
第二,把“结果变量的近亲”当成控制变量。
某些变量在逻辑或统计上与因变量高度接近,控制它们往往会引发严重的共线性问题,使系数不稳定、显著性判断失真。
第三,机械式控制,导致模型不可解释。
在一些论文中,控制变量的选择缺乏明确逻辑,仅以“参考已有文献”为依据,结果是模型越来越复杂,但结论却难以解释其经济含义。
【三】什么时候“必须控制”?什么时候“千万别控制”?
一个相对稳妥的判断标准是:
通常应该控制的变量,是那些同时影响 X 和 Y,但并不处于研究机制中的因素。
这类变量往往具有以下特征:
不受 X 的直接影响,但会系统性地干扰 X 与 Y 之间的关系。
需要高度警惕、通常不应控制的变量,主要包括:
- 明显处于 X 与 Y 之间的中介变量
- 与因变量高度重合或高度同步变化的变量
- 明显发生在 X 之后的结果变量
一旦控制了这些变量,回归结果往往刻画的是一个被“截断后的效应”,而非研究者真正关心的原始关系。因此,是否控制某个变量,本身就是一个需要被认真论证的建模选择。
【四】一个典型案例:为什么“控制以后,结果反而不对了?”
以“数字化水平对企业绩效的影响”为例。研究者希望考察企业数字化转型是否能够提升经营绩效,于是在回归模型中以企业绩效作为因变量,以数字化水平作为核心自变量。
该案例的数据中, performance 表示企业绩效,digital 表示企业数字化水平,efficiency 表示企业运营效率(中介变量),同时控制企业规模(size)和行业差异(industry)。
在模型的构建过程中,数字化水平不仅直接影响企业绩效,同时还会通过提升运营效率间接影响绩效。
- 基准回归:数字化的总体效应
先看Stata的基准回归结果(图1)。
在不控制中介变量的情况下,模型仅控制企业规模和行业差异,用来估计数字化水平对企业绩效的总体影响。图1回归结果显示,数字化变量的系数约为 0.86,且在统计上高度显著,表明数字化水平越高,企业绩效整体上越好。
这里的基准回归刻画的是数字化的总体效应,其中既包含数字化的直接作用,也包含其通过效率提升等渠道产生的间接影响。
图1 基准回归结果
- 控制效率后:效应被“削弱”一部分
再看加入效率变量后的结果(图2)。
当在模型中进一步控制企业运营效率后,数字化的系数明显下降,降至约 0.48,虽然仍然显著,但幅度已经显著小于基准回归的估计结果。同时,效率变量本身对绩效的影响非常显著,说明效率正是数字化影响绩效的重要传导路径。
在这里,企业运营效率就是中介变量。控制中介变量后的模型中,效应被“削弱”。
图2 加入企业运营效率后的模型输出结果
- 两个模型的对比:为什么“控制反而会出问题”
对比两个模型可以发现,一旦将效率这一中介变量纳入控制变量,数字化对绩效的估计效应明显被削弱。这并不意味着数字化的作用变弱,而是因为模型在控制效率的同时,人为切断了数字化通过效率影响绩效的部分路径。
如果研究关心的是数字化的总体效果,那么控制效率,反而会让结论“看起来没那么有力”。相应地,基准回归更适合用于评估数字化的整体影响,而在引入效率后的模型中,估计结果应被理解为数字化在既定效率条件下的剩余直接效应。
【五】论文中,控制变量应该怎么“写”才规范?
下面是三个可以直接用在论文里的模板:
- 模板一:明确控制逻辑
“为避免遗漏变量偏误,本文在回归模型中控制了可能同时影响 X 与 Y 的个体特征与环境变量。”
- 模板二:解释为什么不控制某些变量
“考虑到 M 可能是 X 影响 Y 的中介变量,本文未将其纳入控制变量,以避免对核心效应的低估。”
- 模板三:作为稳健性检验处理
“在稳健性分析中,本文进一步加入相关控制变量,结果显示核心结论保持一致。”
【六】一句话总结
控制变量不是越多越好,而是要控制“该控制的那一类”。