回归分析第14讲:为什么逐步回归不能用了?

统计

在论文写作或日常数据分析中,很多同学都会遇到一个常见难题:

自变量太多,模型不稳,共线性严重。

此时 SPSS、JASP、Stata、EViews 里都会跳出一个看似“贴心”的功能:

逐步回归(Stepwise Regression)9

它能自动帮你选变量、删变量,让模型变得“显著”、让 R² 更好看、让表格更干净。

很多同学因此觉得它特别省事。但问题来了:

逐步回归因为“太省事”,反而是所有方法里最危险的一种。

在国际统计界,它已被明确认为是不可靠、不稳定、不适合科研的方法。

【一】为什么逐步回归曾经那么流行?

因为它太“贴心”:

  • 自动挑出显著变量
  • 自动删除“不显著”变量
  • 让模型 R² 看起来很好
  • 输出干干净净、特别像一篇“漂亮的论文”

也正是因为这种“看起来太好”的便捷,它在国内论文里非常常见。

但事实上,越是“自动出好结果”的方法,越需要警惕。

【二】逐步回归的三大致命问题(一定要记住)

它们就是逐步回归被国际学界淘汰的原因。

1. 极度不稳定:换一批样本,结果完全不一样

逐步回归根据样本里的“显著性”来决定变量的去留。稍微换点数据:

  • 多删一行
  • 样本区间变动
  • 或者噪声稍微变化

最终模型可能完全不同。

逐步回归最大的缺点就是:结果不可复现。

而科研最忌讳的就是这一点。

2. 它选的是“显著性”,不是“重要性”

逐步回归只看 p 值:

  • p 小 → 变量留下
  • p 大 → 变量删除

但 p 值本身受到:共线性、样本量、噪声、变量单位的强烈影响。

于是你会得到:

  • 本来重要的变量被删掉
  • 本来不重要的变量“刚好显著”而被保留

逐步回归就是一种统计上的“显著性贪吃蛇”,看什么显著就吃什么。

3. 在共线性条件下,会选错变量

这点在回归模型里最常见、也最致命。

上一讲我们说过:

如果面积(area)和房间数(rooms)高度相关,逐步回归可能:

  • 面积(area)和房间数(rooms)高度共线
  • 逐步回归只会保留 p 值更小的那个
  • 另一个无论是否重要,都会被删

而且:

  • 换一批样本 → 保留的变量可能完全相反
  • 噪声多一点 → 两个都可能被删
  • 样本少一点 → 结果毫无规律

总结成一句话:

逐步回归不是选“理论上重要的变量”,而是选“运气好刚好显著的变量”。

它的决定不是科学,而是随机。

【三】SPSS 案例:逐步回归如何“错删变量”?

我们用上一讲的房价案例:

  • area(面积)
  • rooms(房间数)
  • price(房价)

因为 area 和 rooms 高度相关,SPSS 逐步回归中的结果如下:

图片

👉 自动删除 rooms,只保留 area,原因是:

  • area 与 price 的 p 值略小
  • rooms 的贡献被 area“吸走了”
  • rooms 看起来“不显著”,因此被删

但这并不意味着:

  • rooms 不重要
  • area 更好
  • 模型更科学

而是说明:

逐步回归在共线性下完全不知道怎么判断,只能随缘选一个。

这就是逐步回归最大的危险。

【四】那论文里到底怎么办?

根据不同研究目的,写法如下:

1. 有明确理论框架时(最推荐)

不要用逐步回归。可以这样写:

“考虑到逐步回归对样本变动高度敏感且存在显著性偏误,本文根据理论预期选取变量,而未采用基于显著性阈值的自动变量选择方法。”

2. 只是做探索性分析(可以用,但要说明)

“逐步回归仅作为探索性工具,用于了解潜在重要变量。最终模型仍以理论框架为主,并通过稳健性检验进行验证。”

3. 共线性严重(千万不要用逐步回归)

此时应使用更稳定的方法:

  • 岭回归(Ridge)
  • LASSO
  • Elastic Net
  • 或 AIC/BIC 模型选择
  • 交叉验证(cross-validation)

论文可以这样写:

“由于自变量之间存在较强共线性,逐步回归不够稳定,因此本文采用正则化方法以获得更稳健的参数估计。”

【五】 逐步回归的现代替代方案

✔ LASSO:真正能筛选变量
✔ Ridge:解决共线性最稳的方法
✔ Elastic Net:综合两者优点
✔ AIC/BIC:基于模型复杂度选择
✔ 交叉验证:最现代、最稳健的模型选择方式

这些方法的共同特点:

  • 更稳定
  • 更科学
  • 更符合国际论文规范

【六】一句话总结

逐步回归的问题不在于“算错”,而在于它“太看运气”,容易把随机显著性错当成真相。