实证研究常见误区(10):为什么稳健性检验,说服不了审稿人
在大多数实证论文中,主回归之后,几乎一定会跟着一段内容——
- 稳健性检验。
换变量、换样本、换模型,看起来做了很多“不同设定”,最后再给出一句总结:结果依然显著,因此结论是稳健的。
从论文结构上看,这已经成了一种“标准配置”。很多审稿人也确实会要求:请补充稳健性检验。
但如果你认真读一些论文,会发现:有些稳健性检验,看起来做了很多,但其实并没有真正检验什么。它们只是对原模型做了一些表面调整,而这些调整,并不会改变研究的核心逻辑。
在这种情况下,稳健性检验更像是一种“写作流程”,而不是研究设计的一部分。所以,我们要讨论的是:
- 稳健性检验,到底在检验什么?为什么很多论文其实没有做对?
01稳健性检验,本质上是在问一个问题
如果把所有形式都拿掉,稳健性检验其实只是在回答一个非常简单的问题:
- 这个结论,是不是只在某一种设定下才成立?
换句话说,你的结果有没有“依赖条件”。
例如:
- 如果只在某个变量定义下显著,换一种合理定义就消失
- 如果只在某一类样本中成立,换个样本就不显著
- 如果只在某种模型设定下成立,稍微调整就改变方向
那么,这个结论其实是“脆弱的”。
稳健性检验的意义,就是去主动“破坏”你的设定,看结果还能不能站住。
所以,从研究逻辑上讲:
- 稳健性检验不是在证明你是对的,而是在尝试“证明你可能是错的”。
如果在多种合理设定下,结果依然稳定,才说明结论更可信。
02为什么很多稳健性检验只是“换个写法”?
在很多论文中,你会看到类似这样的操作:
- 把变量A换成A的对数
- 在模型里多加几个控制变量
- 换一种回归形式(OLS → FE)
这些都可以算作“稳健性检验”。
但有一个疑问:这些调整,是否真的触及了研究的关键假设?
如果没有,那么它们只是“换个写法”。
举个典型情况:
有些研究的核心问题,其实是变量度量是否合理,或者样本是否存在选择偏误。
但稳健性检验却只是:
- 多加几个控制变量
- 或者把变量稍微变形一下
这种调整,并没有真正回答关键问题。结果就是:表格变多了,但信息没有变多。
出现这种现象的一个重要原因是:很多研究者在做稳健性检验时,考虑的是“论文该怎么写”,而不是“这个结果哪里最可能出问题”。
于是,稳健性检验变成了一种:
- 结构上的完整,而不是逻辑上的检验。
03真正有价值的稳健性检验,往往是“直接针对问题”
如果把视角从“论文结构”转向“研究设计”,你会发现:
好的稳健性检验,几乎都在做一件事——
- 直接挑战研究结论最脆弱的地方。
例如:
如果你的结论依赖于某个变量的度量方式,那么自然要问:换一种同样合理的度量方式,结果还在吗?
如果你的识别来自某一类样本,那么就应该问:换一类样本,结果是否还能成立?
如果你的模型依赖某个关键假设(比如线性关系、固定效应设定),那么就可以问:放松这个假设,结果会不会变化?
好的稳健性检验有一个共同特点:
- 不需要做很多的检验,但每一个检验都是“关键问题”。
相比之下,一些论文虽然有十几张稳健性表,但都围绕同一类微小调整,其实信息是重复的。
04审稿人为什么越来越看重“有针对性的稳健性检验”?
这几年一个很明显的变化是:
审稿人不再满足于“有没有做稳健性检验”,而是开始看:你到底在检验什么。
原因很简单:一方面,数据越来越多,模型越来越容易“做出显著结果”。另一方面,一些“机械式稳健性检验”已经很难区分研究质量。
因此,评价标准在发生变化:从“有没有做”,转向“有没有检验关键假设”。
这其实和另一个趋势是相通的:研究评价正在从“是否显著”,转向“是否可信”(前一篇文章才提到过)。而稳健性检验,正是“可信度”的核心来源之一。
总结
很多论文的问题,并不在于没有做稳健性检验,而在于:
- 做了很多,但没有真正检验关键问题。
稳健性检验的核心,不是多做几张回归表,而是去回答一个更重要的问题:
这个结论,是否依赖某些特定设定?
如果只是对模型做一些表面调整,那么即使结果保持一致,也很难说明结论真的稳健。
真正有价值的稳健性检验,关键在于:
是否围绕研究设计本身,去挑战最可能出问题的地方。