「假设检验八讲」第7讲:显著性不代表重要性——从统计结果到实际意义
很多学生第一次做回归或方差分析时,看到结果“p < 0.05”都会很兴奋:
“显著啦!我发现了规律!”
但在科研与实践中,我们常常需要冷静地追问一句:
“虽然显著,但这个结果真的重要吗?”
【一】 显著性与重要性的区别
显著性(Significance)指的是统计意义,表示样本结果不太可能由随机波动造成。
重要性(Importance)则关心效应的大小与现实价值,也就是“即使差异真实存在,它到底有多大意义”。
📊 举个例子:
假设有10万人的调查,结果显示:
男性平均每天比女性多睡0.03小时(约1.8分钟),且p<0.001。
这当然“极显著”,但你会说“男性睡得显著多”有实际意义吗?
——显然没有。
这说明:
显著性反映的是“结果罕见程度”,而重要性反映的是“结果影响程度”。
【二】 大样本陷阱:显著,但微不足道
样本量越大,统计检验越容易“发现显著”。在大数据时代,这个问题尤其突出。
想象一下你在分析一个包含50万用户的消费数据,即使两个广告文案点击率差0.1%,系统也可能报告p<0.001。但这差0.1%,真能带来商业上的意义吗?未必。
所以,除了p值,我们更应关注:
- 效应量(effect size)
- 实际差异大小
- 决策影响力
📘 小结一句话:
样本量放大,可以放大“显著性”,却不一定放大“意义”。
【三】 效应量:显著性之外的“第二把尺子”
效应量(Effect Size)用来衡量变量间关系的强度。常见的指标包括:
- Cohen’s d:两组均值差的标准化度量;
- r 或 R²:相关或回归解释度;
- η²(Eta squared):方差分析中的解释比例。
例如,一项教育实验显示:
p=0.001,但Cohen’s d=0.18。
说明虽然显著,但效应很小(通常d>0.5才算中等效应)。换句话说:差异存在,但实际影响有限。
【四】 显著≠解释力:回归R²的启示
在回归分析中,p值可以告诉你“系数显著”,但R²(决定系数)才说明“模型解释了多少”。
一个消费模型的结果是:
所有变量的系数都显著(p<0.05),但R²仅为0.07。
意味着这些变量虽然显著,但整体只能解释7%的消费差异。这种结果就属于“统计上成立”,但“解释力薄弱”。
📌 启示:
显著性只是第一步,更关键的是——模型是否有足够的解释力与预测力。
【五】 科研中的“显著性崇拜”
长期以来,科研界存在一种“显著性偏好”:p<0.05 被视为“通过门槛”,而 p≥0.05 则常被忽略或视为“无结果”。这导致了“显著性歧视”和“发表偏倚”(Publication Bias)。一些研究者为了追求“显著”,可能会反复筛选模型、调整变量,甚至“选择性报告”。
📘 学术界的反思:
2016年,美国统计学会(ASA)发表官方声明,强调 p值不能单独作为科学结论的依据,应结合效应量、置信区间与实际背景共同解释。这份声明标志着统计学界正式进入“后p值时代”——关注实质性显著(practical significance),而不仅仅是统计显著。
【六】 实践中的判断:从“显著”到“有用”
在应用研究中,我们常要回答这样的问题:
“结果显著”是否足以支持政策或商业决策?
这时,需要综合考虑:
1️⃣ 效应量的大小(影响幅度)
2️⃣ 成本与收益(现实可行性)
3️⃣ 稳健性(是否在不同样本、时期下仍成立)
📊 例如:
某政策使企业创新投入显著提高(p=0.01),但幅度仅为0.02%,而执行成本却很高。这种“显著但无效”的结论,在现实中就没有推广价值。
【七】 小结
统计显著是科研语言中的“起跑线”,而不是“终点线”。
| 维度 | 问题 | 解读方式 |
|---|---|---|
| 显著性 | 差异是否存在? | 看p值 |
| 重要性 | 差异有多大? | 看效应量 |
| 意义性 | 差异是否值得? | 看实践场景 |
一句话总结:
p值让我们谨慎地相信,效应量让我们冷静地衡量,实际意义让我们智慧地决策。
📚【延伸阅读】
-
Cohen, J. (1988). Statistical Power Analysis for the Behavioral Sciences.
-
Wasserstein, R.L. & Lazar, N.A. (2016). The ASA’s Statement on p-Values: Context, Process, and Purpose.
-
Amrhein, V., Greenland, S., & McShane, B. (2019). Retire statistical significance.Nature, 567, 305–307.
思考题:
如果一个结果p=0.001,但效应量极小,应如何在论文中表述?