回归分析第27讲:样本量与回归——为什么显著性常常“不够用”?

统计

导语:一个经常被低估的问题

在课程论文、毕业论文和实证作业中,你经常会看到这样的数据描述:

  • “本文使用 30 个样本进行回归分析。”
  • “样本量为 28,回归结果如表 4 所示。”

接着是熟悉的一套结果:t 值显著、p < 0.05、R² 看起来也不低,于是结论往往被写成:

“结果显著,结论成立。”

但问题在于:当样本量只有几十个观测值时,回归分析本身就很难支撑可靠的统计推断。

这一讲讨论一个更基础的问题:样本量为什么如此重要?小样本回归究竟容易在哪些地方出问题?

【一】“样本量只有几十个观测值”意味着什么?

在回归分析中,样本量指的是有效观测值的数量(n)。

当我们说“样本量只有几十个观测值”,通常指的是 n≈20–40,有时甚至不到 30。

这在课程论文和毕业论文里很常见,但从统计推断角度看,这是一个风险较高的样本规模,需要格外谨慎。

【二】为什么显著性检验高度依赖样本量?

t 检验、F 检验和 p 值并不是“天然可靠”的工具,它们隐含的前提是:样本量足够大,统计量才会逐渐稳定。

在小样本下,常见现象是:标准误不稳定、t 值对个别观测值高度敏感、p 值随样本轻微变动而明显波动。

这意味着:只要删掉或加入一两个观测值,结论就可能发生明显变化。

【三】小样本回归中最常见的三类“假象”

1. 看起来“显著”,其实只是偶然结果

样本量只有几十个观测值时,标准误可能被低估,t 值被放大,p 值“刚好”落在 0.05 以下。但这种显著性往往难以复现,对样本选择极其敏感。

2. 系数方向不稳定,甚至反复变号

更换控制变量、调整样本区间,符号就变了——这在小样本中并不少见。原因往往不是机制改变,而是数据量不足以支撑多个参数的稳定估计。

3. R² 不低,但几乎没有预测价值

小样本里 R² 很容易被“拟合出来”,样本内好看,样本外崩盘。很多时候,这更像是过拟合,而不是解释力强。

【四】一个非常直观的例子

假设我们研究一个很简单的问题:教育年限是否与收入正相关?

变量说明(两份数据结构一致,样本量不同):

  • income:收入(因变量)
  • education:受教育年限
  • age:年龄(可作为控制变量)

1.  样本量为 300:结果稳定、解释清晰

在样本量为 300 的情况下,教育年限对收入的回归系数约为 3498,且在 1% 显著性水平下高度显著。年龄变量的系数虽为正,但未通过常用显著性检验。整体来看,系数大小、显著性水平以及 R² 均表现出较好的稳定性。

此时,单个观测值对估计结果的影响相对有限,回归结果对样本轻微变动并不敏感,模型所反映的是一种较为稳健的统计关系。

图片

图1 300个样本量下的回归结果

2. 样本量为 30:显著性存在,但结果高度敏感

当样本量缩小至 30 个观测值时,模型同样能够得到“显著”的回归结果,教育变量的系数约为 2345,并在统计上通过显著性检验。

但需要注意的是:

  • 教育系数的大小与大样本结果存在明显差异
  • 年龄变量的符号发生变化,且显著性完全不稳
  • R² 明显下降,估计结果对样本选择更加敏感

这说明,在样本量只有几十个观测值的情况下,即便模型在技术诊断上“没有问题”,回归结果依然容易受到个别观测值的强烈影响。

图片

图2 30个样本量下的回归结果

3.对比带来的核心启示

对比两个模型可以发现,小样本回归的问题,并不在于“是否通过了异方差或自相关检验”(两个模型都通过了检验),而在于:

样本量本身不足以支撑稳定的参数估计。

在样本量较大的情况下,回归结果更可能反映总体规律;而在样本量只有几十个观测值时,即便显著性成立,系数的大小、方向和稳定性也都需要谨慎解读。

【五】为什么小样本下,R² 反而可能更高?

在上面的案例中可以注意到一个现象:

样本量较小的回归,R² 并不一定更低,反而有时“看起来更好”。

这并不意味着小样本模型更优,而恰恰相反。

原因在于:

R² 只是样本内拟合度指标,在样本量较小的情况下,模型更容易“贴着数据走”,从而把噪声也一并拟合进去。

换句话说:

当样本量较小时,模型的自由度有限,回归线更容易受到个别观测值的影响。在这种情况下,模型往往可以较好地贴合样本数据,甚至把随机噪声一并拟合进去,从而抬高 R² 的数值。

因此,小样本下的 R² 往往缺乏稳定性和可推广性,不能作为模型可靠性的依据。

这也是为什么在小样本回归中:

R² 看起来不错,并不代表模型真的解释力强,而往往只是过拟合的结果。

【六】变量越多,小样本问题越突出

小样本最棘手的情况,往往不是“样本少”,而是:样本少 + 自变量多。

例如 n=30 却放入 10 个自变量,每个系数能利用的信息极为有限,共线性更容易出现,估计结果高度不稳定,最终表现为系数乱跳、标准误变大、模型对设定极度敏感。

【七】那是不是“小样本就不能回归”?

不是不能做,而是不能过度相信。

在样本量只有几十个观测值时,更合理的态度是:把回归结果视为探索性分析,更关注方向和一致性,而不是 p 值;并且避免给出强因果解释。

一句很重要的话是:

在小样本回归中,显著性并不等于可靠性。

【八】论文中,遇到小样本该怎么“写”? 

  • 模板一: 主动说明样本限制 “受数据可得性限制,本文样本量相对有限,相关结论需谨慎解释。”

  • 模板二: 弱化显著性表述 “回归结果主要用于考察变量关系的方向与一致性,而非进行严格的显著性推断。”

  • 模板三: 为后续研究铺垫 “未来研究可在更大样本或面板数据条件下进一步验证本文结论。”

【九】总结

当样本量只有几十个观测值时,回归分析更接近一种描述工具,而不是严格意义上的推断工具。