实证研究常见误区(3):为什么很多论文控制变量越加越多?

统计

在前两讲中,我们讨论了两个在实证研究中经常被忽视的问题:研究问题是否真的能被数据回答,以及变量是否真正测量了我们想研究的对象。

当研究问题和核心变量已经确定之后,很多研究就会进入回归分析阶段。而在这个阶段,研究者几乎一定会遇到一个看起来很技术、但其实非常关键的问题:

模型中到底该加入哪些控制变量?

在很多论文里,我们都能看到一种很熟悉的写法。主模型先放几个变量,接着再逐步加入行业变量、地区变量、宏观变量、个体特征变量,回归表一列一列展开,控制变量也越来越多。

很多人会自然地觉得:控制变量越多,模型就越严谨。

但这恰恰是实证研究里很常见的一个误区。控制变量当然重要,但问题不在于要不要控制,而在于:你到底在控制什么,为什么控制,以及哪些变量其实不该控制。

01控制变量到底在控制什么?

很多人一提到控制变量,直觉就是“把可能有影响的变量都加进去”。但控制变量的真正作用,并不是让模型看起来更完整,而是帮助我们在分析核心变量与结果变量关系时,尽量排除其他混杂因素的干扰。

比如,我们想研究:教育是否会提高收入。

如果只看教育和收入的相关关系,结论往往并不可靠。因为收入不仅受教育影响,还可能受到工作经验、地区发展水平、行业类型、家庭背景等因素影响。而这些因素,又可能和教育水平有关。

这时候,加入控制变量的目的,就是希望在“其他条件大致相同”的情况下,去看教育和收入之间的关系。

所以,一个合理的控制变量,通常要满足一个更具体的条件:

  • 它既可能影响因变量,也可能和核心解释变量相关。

这才是控制变量真正的意义。

如果一个变量和研究问题关系不大,只是“看起来可能相关”,那它加入模型后,未必会让结果更可信,反而可能让模型更混乱。

02为什么很多研究会不断增加控制变量?

在实际论文写作中,控制变量越加越多,通常有两个原因。

一个原因,是研究者确实担心遗漏变量偏误。这点完全可以理解。因为如果某个重要因素同时影响解释变量和因变量,而它又没有进入模型,那么回归结果就可能有偏。于是,很多人会采取一种很自然的应对方式:宁可多加,不要漏掉。

另一个原因,则是论文写作中的模仿习惯。很多研究者在看文献时,会发现已有论文控制了很多变量,于是自己写论文时,也倾向于照着加。时间久了,控制变量就变成了一种“默认配置”:别人放了,我也放;别人控制了地区、行业、宏观指标,我最好也都控制上。

但是这样做虽然看起来更“像论文”,但并不一定意味着研究设计更清楚。相反,很多模型越往后加变量,研究逻辑越模糊。变量是怎么选出来的,为什么控制它们,它们在研究框架中处于什么位置,作者自己有时也说不清楚。

这时候,控制变量就不再是研究设计的一部分,而变成了一种形式上的堆砌。

03控制变量越多,真的越好吗?

很多研究者真正容易犯的错误,不是忘记控制变量,而是以为控制变量越多越安全。但在实证分析中,过多控制变量至少会带来三类问题。

第一类问题,是“控制错了”。

这是最容易被忽视的一种情况。有些变量虽然和因变量有关,但它们其实位于核心解释变量影响因变量的路径上。这样的变量,不是普通控制变量,而更像是中介变量。把它们加进模型,实际上会把你原本想研究的效应“截断”。

举个最典型的例子,如果你研究的是:教育 → 收入

那么职业类型、岗位层级,往往就是教育影响收入的一部分机制,可能是教育 →职业 → 收入 这样的关系。如果你把“职业”直接控制进去,模型估计出来的教育效应,很可能就会变小,甚至变得不显著。这并不一定说明教育不重要,而可能只是因为你把教育的一部分真实作用给控制掉了。

这类变量,在计量研究里常被称为 bad control。它的问题不在于变量本身不重要,而在于它在研究框架中的位置不对。

第二类问题,是共线性和不稳定。

控制变量一多,变量之间相互高度相关的可能性也会提高。比如在地区层面的研究里,你同时加入:人均 GDP、居民收入、消费水平、城镇化率、财政支出。这些变量大多都和地区发展水平有关,彼此之间往往高度相关。结果就是,模型看起来控制得很全面,但系数可能开始不稳定,标准误变大,显著性下降,甚至不同模型中符号都开始变化。这时候,问题并不是“控制得不够多”,而是“控制得太乱了”。

第三类问题,是解释越来越困难。

控制变量最怕的,不是数量多,而是加进去之后说不清。一篇论文里如果有十几个控制变量,读者自然会问:这些变量为什么要控制?如果研究者只能回答“文献里都这么做”或者“这些变量可能有影响”,那其实说明模型设定还停留在经验模仿层面,而不是基于清晰的研究逻辑。

04在实证分析中,到底该怎么选控制变量?

这部分最重要。因为很多人知道“不能乱加”,但真正写论文时,还是不知道该怎么操作。一个比较实用的办法是:不要一开始就问“我要控制几个变量”,而是换成下面三个问题。

第一问:这个变量是不是潜在混杂因素?也就是,它是否同时影响核心解释变量和因变量。如果答案是“是”,那它通常更值得被控制。

比如你研究数字经济对消费的影响,那么地区收入水平、人口结构、产业结构,往往就可能同时影响数字经济发展和居民消费行为,这类变量更有理由进入模型。反过来,如果某个变量只和因变量有关,但和核心解释变量几乎无关,它未必是关键控制变量。如果某个变量既不影响因变量,也和解释变量无关,那就更没有必要进入模型。

第二问:它在研究机制中处于什么位置?这是最容易被忽视,但最关键的一步。你最好先在纸上画一画变量关系,哪怕不是正式的因果图,也至少要想清楚:哪些变量是前因、哪些变量是混杂因素、哪些变量可能是中介、哪些变量可能只是结果的伴随变量?

如果一个变量位于 X → M → Y 这条路径上,那么它更可能是中介,而不是普通控制变量。这时候,你不应该简单把它塞进主回归,而应该分开处理:

  • 主模型先不控制它,看总效应
  • 机制分析时再单独讨论它

第三问:这个变量能不能说清楚为什么要控制?这是一个特别实用的自检标准。

在写论文时,你可以要求自己对每一个控制变量都写出一句理由:

  • “控制企业规模,是因为规模可能同时影响 ESG 表现和融资成本。”
  • “控制地区收入水平,是因为收入水平可能同时影响数字基础设施和消费能力。”

如果一句话写不出来,通常说明这个变量进入模型的理由还不够充分。

05一个更实用的操作框架:控制变量到底怎么放?

这里给你一个很适合论文写作的实操框架作为参考。

做法一:先有“基准模型”,再逐步扩展。

不要一开始就把所有变量都塞进主模型。比较好的做法是分层报告:

模型 1:只放核心解释变量。先看最基本的相关关系。

模型 2:加入关键个体特征或地区特征变量。控制最核心的混杂因素。

模型 3:再加入固定效应或更高层面的控制变量。比如行业固定效应、年份固定效应、地区固定效应。

这样做的好处是,你能清楚看到系数在不同设定下如何变化,也更容易解释“为什么变”。

做法二:控制变量数量不追求多,追求有层次。

在很多应用研究里,一个比较常见、也比较稳妥的结构是:

  • 核心解释变量 1—2 个
  • 控制变量 4—8 个
  • 再加必要的固定效应

这不是硬性标准,但至少说明一个事实:

  • 多数论文的问题不在于控制变量太少,而在于控制变量没有逻辑。

做法三:把“可能是中介”的变量单独放在机制分析里。

比如你研究数字经济对企业绩效的影响,而你怀疑融资约束是中介机制。那融资约束就不应该在主模型里直接作为普通控制变量出现,而更适合在后面单独讨论:

  • 数字经济是否影响融资约束
  • 融资约束是否进一步影响绩效

这样,研究逻辑会清楚得多。

做法四:不要把“数据里有的变量”都当成控制变量。

这是很常见的操作误区。很多数据库变量很多,于是研究者容易陷入一种冲动:反正都有,就多放一点。但变量能不能控制,不取决于数据库里有没有,而取决于它在研究设计里有没有位置。

06一个例子:控制变量该怎么判断?

假设你要研究:

ESG 表现是否会降低企业融资成本。

这时候常见的控制变量可能包括:

  • 企业规模
  • 资产负债率
  • 企业年龄
  • 盈利能力
  • 成长性
  • 行业固定效应
  • 年份固定效应

这些变量大多有明确理由,因为它们既可能影响企业的 ESG 表现,也可能影响融资成本。

但如果你进一步把“分析师关注度”也作为普通控制变量放进主模型,就要小心了。因为它可能并不只是外部背景因素,而有可能是 ESG 影响融资成本的一条作用机制:ESG 更好 → 信息披露更充分 → 分析师关注更多 → 融资成本下降。

如果是这样,分析师关注度就更像中介,而不是普通控制变量。把它直接控制进去,可能就会低估 ESG 的总效应。

这就是实证分析里非常具体、也非常常见的一个操作问题:

一个变量能不能控制,不是看它重不重要,而是看它在机制中的位置。

总结

很多论文控制变量越加越多,并不是因为研究真的越来越严谨,而往往是因为研究者把“控制变量”理解成了一种安全操作:加得越多,越不容易出错。

但控制变量的关键,从来不在于数量,而在于逻辑。它不是为了把模型变复杂,而是为了更清楚地识别你真正想研究的关系。

所以,在实证研究里,更值得反复追问的不是:我还能再加哪些变量?

而是:这个变量为什么要控制?它在研究框架中处于什么位置?

简单来说,好的控制变量不是“加得多”,而是“加得对”。