回归分析第9讲:为什么 t 显著但系数很小?显著≠重要吗?
上一讲我们讲了标准误、t检验、F检验。
很多同学做到这里,以为:
t 显著 → 变量有影响 → 结果很重要
但是,我们会在大量论文、实际分析中看到这种奇怪现象:
| 变量 | 系数 | t 值 | 结论 |
|---|---|---|---|
| 数字化投资指数 | 0.0031 | 7.82* | 显著但效果极弱 |
| ESG与融资成本 | -0.06 | 4.05* | 显著但降低幅度极小 |
| 广告投入与销量 | 0.002 | 5.9* | 显著,但几乎推动不了销量 |
t值很大、p值很小,但系数本身小到可以忽略不计。
这些就是 显著≠重要 的典型案例。
显著和重要性不能划等号的问题,我们在前面多篇文章中也提到过。
【一】明明显著,为什么效果却很弱?
答案其实很简单:
t 值显著看的不是效果大小,而是是否“存在影响”
至于这个影响大不大,t 值并没有告诉我们。
统计显著解决的是:
| 问题 | 统计能回答吗? |
|---|---|
| 这个变量影响Y吗? | 能 |
| 影响有多大? | ❌ 不知道 |
| 有研究意义吗?经济价值高吗? | ❌ 不知道 |
也就是说:
- t 显著 → 代表不是随机的,确实是“有影响”
- 效果大小 → 则要看系数本身,不是看 t
数学上 t 大并不代表 β 大,因为:
当SE很小(样本非常稳定、波动很弱)时,即使 β 很小,t 也能非常大。
这就是“确实有关系,但效果很微弱”的数学根源。
【二】英语学习函数的例子:显著,但成绩提升不多
我们回到班上同学的英语学习函数案例:
- Y = 英语成绩(Score)
- X = 每天学习英语的小时数(StudyHours)
在 SPSS 中运行回归,ANOVA 输出如下:
我们解释一下上述表格的含义:
| 统计量 | 含义 | 结果说明 |
|---|---|---|
| F = 39.378 | 检验模型整体是否有效 | p < .001 → 模型整体显著 |
| 回归平方和 288.709 | X 解释的波动 | 学习时间确实能解释成绩变化 |
| 残差平方和 278.603 | 模型没解释的部分 | 仍有不少因素未纳入,例如英语基础、词汇量、学习方法… |
| 总平方和 567.311 | 总体离散程度 | 学习时长 + 其他因素 |
- F = 39.378 且 p < 0.001 ➜ 整体模型显著
- 意味着:学习时长对成绩不是随机现象,整体存在解释力
- 但这只能说明“有效”,不能说明“效果大”
F显著 → 至少有一个变量对Y真的有影响
但此时我们仍不知道:
影响多大?值不值得投入?效果是否具有现实意义?
这就需要看 t检验 + 系数大小。
SPSS输出的系数表如下:
对自变量 StudyHours 的解释如下:
| 指标 | 含义 | 本例结果意味 |
|---|---|---|
| t = 6.275(非常大) | 学习时长对成绩影响显著 | p < 0.001,显著成立 |
| SE = 0.367(标准误小) | 估计稳定、置信度高 | β靠得住、波动不大 |
| B = 2.30 | 效果量 | 每天多学1小时,英语成绩约提升 2.3分 |
得到的结论是:
每天多学习1小时英语,平均可提升约2.3分。
这个结果不是巧合,统计上显著,很可靠。
但是!重点来了——
显著 ≠ 重要
t 再大,也不能代替“效果量”判断
换句话说:
- 变量是真的有效,值得花时间投入学习
- 但每天多学1小时只加2.3分,提升幅度并不惊人
如果是英语六级、雅思或托福备考,也许不够;
如果只是提高期末成绩,也许已经很有意义。
【三】显著 ≠ 重要 —— 回归分析最终目的是决策
统计检验帮助我们判断:
这个关系是否真实存在?(显著性问题)
而研究与决策真正关心的是:
变量存在归存在,但值不值得投入资源?(重要性与效益问题)
因此模型分析不能停在 p 值,而要继续问四个关键问题:
| 追问方向 | 含义 |
|---|---|
| 效果够大吗? | β是否小得微不足道? |
| 可解释吗? | 是否有明确经济或理论逻辑? |
| 成本划算吗? | 提升单位效果需要多少资源? |
| 相比其他变量强吗? | 是否有更值得投的因素? |
如果 t 显著但 β 很小,你应该问:
我们真的要为提升2.3分,每天投入一个小时学习英语吗?一天多读5小时英语,才提高10分左右。有没有更高性价比的学习方法(其它变量)?
【四】本讲总结
| 概念 | 要点 |
|---|---|
| 显著(Significance) | 说明变量影响不是0 |
| 效果大小(Effect Size) | 影响到底强不强、值不值实际使用 |
| t大但系数小 | 常见于样本量大/SE小,但经济效果弱 |
最后一句总结:
会读 p 值很容易,但不被 p 值误导却很难。