实证研究常见误区(7):回归结果里,你不能只看p值
在很多实证研究中,经常会看到这样一种情况:
回归结果一出来,大家第一眼看的,不是系数本身,而是那一列星号。
有没有 ,有没有 ,有没有 ,成了一种下意识的反应。在一些论文中,整段结果解释,最后都落在一句话上——“该变量在 1% 水平显著”。
如果多思考一下,可能会有另一个问题:显著,真的等于重要吗?
01为什么大家习惯先看 p 值?
在学习统计的早期阶段,我们反复接触的,是各种显著性检验:t 检验、p 值、0.05 这一套判断规则。久而久之,很容易形成一种近乎自动化的理解方式——只要 p 值足够小,就说明变量“有作用”;如果不显著,就可以不再讨论。
从统计学角度看,这个逻辑并没有问题。p 值确实回答了一个非常清晰的问题:在零假设成立的前提下,当前样本结果出现的概率有多大。
但是在实际研究中,它并不能替代我们作出最后的判断。
比如:这个变量是否值得讨论?这个关系是否重要?这个结果是否有现实意义?这些问题,都不是 p 值能够直接回答的。
02一个常见的例子:显著,但几乎没有影响
可以看一个非常典型的情形。
假设你在研究教育对收入的影响,回归结果显示:教育年限的系数是 0.002,同时 p 值非常小,几乎为 0。从统计意义上看,这是一个“非常显著”的结果。
但如果把这个系数换一种方式表达——教育每增加一年,收入提高约 0.2%——我们可能会犹豫,这样的影响到底算不算重要?
这里的问题就在于:统计意义和实际意义,并不总是一致。
在大样本数据中,这种情况尤其常见。随着样本量增加,标准误不断下降,原本非常微弱的关系,也更容易通过显著性检验。
结果就是,回归表里可能充满“高度显著”的变量,但其中相当一部分,对现实问题几乎没有实质影响。
03回归真正想回答的,其实不是“有没有关系”
如果回到回归分析最基本的目的,就会发现一个很容易被忽略的事实:
我们真正关心的,实际上不是“有没有关系”,而是“影响有多大”。
再看一个更贴近研究决策的例子。
假设你在评估一项补贴政策对企业投资的影响。现在有两个回归结果:
一个结果显示,政策系数大约为 0.15,但 p 值在 0.08 左右;另一个结果系数只有 0.01,却在统计上高度显著。
如果只看显著性,大多数人会更倾向于第二个结果。但如果站在政策制定者的角度,问题就会变得完全不同:
- 哪个结果更有实际意义?
一个影响幅度较大但不那么显著的结果,和一个几乎没有影响却“非常显著”的结果,显然不能用同一个标准来评价。
也正是在这种情境下,系数本身所代表的“效应大小”,才真正接近研究问题的核心。
04为什么现在越来越强调“效应大小”
如果你看近几年的论文,会发现一个变化:评价重点,正在慢慢从“是否显著”,转向“效应是否有意义”。
审稿人更常问的,不再只是 p 值,而是:
- 这个效应到底有多大?
- 是否具有现实或经济意义?
- 在不同模型设定下是否稳定?
原因其实很简单。p 值只能告诉我们,这个系数是否和 0 有显著差异,但实践中的问题,并不是问“它是不是等于 0”。
而是在问:这个影响,是 0.1,还是 10。
也正因为如此,越来越多的研究开始强调报告效应大小(effect size),以及所谓的“经济显著性”,而不仅仅停留在统计显著性上。
05那 p 值是不是就不重要了?
当然不是。
p 值依然有一个非常重要的作用:它提供了一个关于结果稳定性的判断。
如果一个系数很大,但不显著,往往意味着估计存在较大的不确定性,可能来自样本量不足,或者数据本身波动较大。在这种情况下,仅凭系数做判断,同样是有风险的。
更合理的理解方式是:
- 系数告诉我们“影响有多大”,
- 而 p 值帮助我们判断“这个估计是否可靠”。
两者是互补关系,而不是替代关系。
总结
在解读回归结果时,很多人习惯性地把问题简化为:
这个变量显不显著?
但真正值得回答的问题,其实是:
这个变量影响有多大,这个影响是否具有实际意义。
从这个角度看,p 值和回归系数,分别对应两个不同层面的信息:
- 一个是“是否存在”,一个是“影响程度”。
在实际研究中,如果只关注前者,而忽略后者,就很容易得到“统计上成立,但现实中无关紧要”的结论。