回归分析第27讲:样本量与回归——为什么显著性常常“不够用”?
导语:一个经常被低估的问题
在课程论文、毕业论文和实证作业中,你经常会看到这样的数据描述:
- “本文使用 30 个样本进行回归分析。”
- “样本量为 28,回归结果如表 4 所示。”
接着是熟悉的一套结果:t 值显著、p < 0.05、R² 看起来也不低,于是结论往往被写成:
“结果显著,结论成立。”
但问题在于:当样本量只有几十个观测值时,回归分析本身就很难支撑可靠的统计推断。
这一讲讨论一个更基础的问题:样本量为什么如此重要?小样本回归究竟容易在哪些地方出问题?
【一】“样本量只有几十个观测值”意味着什么?
在回归分析中,样本量指的是有效观测值的数量(n)。
当我们说“样本量只有几十个观测值”,通常指的是 n≈20–40,有时甚至不到 30。
这在课程论文和毕业论文里很常见,但从统计推断角度看,这是一个风险较高的样本规模,需要格外谨慎。
【二】为什么显著性检验高度依赖样本量?
t 检验、F 检验和 p 值并不是“天然可靠”的工具,它们隐含的前提是:样本量足够大,统计量才会逐渐稳定。
在小样本下,常见现象是:标准误不稳定、t 值对个别观测值高度敏感、p 值随样本轻微变动而明显波动。
这意味着:只要删掉或加入一两个观测值,结论就可能发生明显变化。
【三】小样本回归中最常见的三类“假象”
1. 看起来“显著”,其实只是偶然结果
样本量只有几十个观测值时,标准误可能被低估,t 值被放大,p 值“刚好”落在 0.05 以下。但这种显著性往往难以复现,对样本选择极其敏感。
2. 系数方向不稳定,甚至反复变号
更换控制变量、调整样本区间,符号就变了——这在小样本中并不少见。原因往往不是机制改变,而是数据量不足以支撑多个参数的稳定估计。
3. R² 不低,但几乎没有预测价值
小样本里 R² 很容易被“拟合出来”,样本内好看,样本外崩盘。很多时候,这更像是过拟合,而不是解释力强。
【四】一个非常直观的例子
假设我们研究一个很简单的问题:教育年限是否与收入正相关?
变量说明(两份数据结构一致,样本量不同):
income:收入(因变量)education:受教育年限age:年龄(可作为控制变量)
1. 样本量为 300:结果稳定、解释清晰
在样本量为 300 的情况下,教育年限对收入的回归系数约为 3498,且在 1% 显著性水平下高度显著。年龄变量的系数虽为正,但未通过常用显著性检验。整体来看,系数大小、显著性水平以及 R² 均表现出较好的稳定性。
此时,单个观测值对估计结果的影响相对有限,回归结果对样本轻微变动并不敏感,模型所反映的是一种较为稳健的统计关系。
图1 300个样本量下的回归结果
2. 样本量为 30:显著性存在,但结果高度敏感
当样本量缩小至 30 个观测值时,模型同样能够得到“显著”的回归结果,教育变量的系数约为 2345,并在统计上通过显著性检验。
但需要注意的是:
- 教育系数的大小与大样本结果存在明显差异
- 年龄变量的符号发生变化,且显著性完全不稳
- R² 明显下降,估计结果对样本选择更加敏感
这说明,在样本量只有几十个观测值的情况下,即便模型在技术诊断上“没有问题”,回归结果依然容易受到个别观测值的强烈影响。
图2 30个样本量下的回归结果
3.对比带来的核心启示
对比两个模型可以发现,小样本回归的问题,并不在于“是否通过了异方差或自相关检验”(两个模型都通过了检验),而在于:
样本量本身不足以支撑稳定的参数估计。
在样本量较大的情况下,回归结果更可能反映总体规律;而在样本量只有几十个观测值时,即便显著性成立,系数的大小、方向和稳定性也都需要谨慎解读。
【五】为什么小样本下,R² 反而可能更高?
在上面的案例中可以注意到一个现象:
样本量较小的回归,R² 并不一定更低,反而有时“看起来更好”。
这并不意味着小样本模型更优,而恰恰相反。
原因在于:
R² 只是样本内拟合度指标,在样本量较小的情况下,模型更容易“贴着数据走”,从而把噪声也一并拟合进去。
换句话说:
当样本量较小时,模型的自由度有限,回归线更容易受到个别观测值的影响。在这种情况下,模型往往可以较好地贴合样本数据,甚至把随机噪声一并拟合进去,从而抬高 R² 的数值。
因此,小样本下的 R² 往往缺乏稳定性和可推广性,不能作为模型可靠性的依据。
这也是为什么在小样本回归中:
R² 看起来不错,并不代表模型真的解释力强,而往往只是过拟合的结果。
【六】变量越多,小样本问题越突出
小样本最棘手的情况,往往不是“样本少”,而是:样本少 + 自变量多。
例如 n=30 却放入 10 个自变量,每个系数能利用的信息极为有限,共线性更容易出现,估计结果高度不稳定,最终表现为系数乱跳、标准误变大、模型对设定极度敏感。
【七】那是不是“小样本就不能回归”?
不是不能做,而是不能过度相信。
在样本量只有几十个观测值时,更合理的态度是:把回归结果视为探索性分析,更关注方向和一致性,而不是 p 值;并且避免给出强因果解释。
一句很重要的话是:
在小样本回归中,显著性并不等于可靠性。
【八】论文中,遇到小样本该怎么“写”?
-
模板一: 主动说明样本限制 “受数据可得性限制,本文样本量相对有限,相关结论需谨慎解释。”
-
模板二: 弱化显著性表述 “回归结果主要用于考察变量关系的方向与一致性,而非进行严格的显著性推断。”
-
模板三: 为后续研究铺垫 “未来研究可在更大样本或面板数据条件下进一步验证本文结论。”
【九】总结
当样本量只有几十个观测值时,回归分析更接近一种描述工具,而不是严格意义上的推断工具。