回归分析第14讲:为什么逐步回归不能用了?
在论文写作或日常数据分析中,很多同学都会遇到一个常见难题:
自变量太多,模型不稳,共线性严重。
此时 SPSS、JASP、Stata、EViews 里都会跳出一个看似“贴心”的功能:
逐步回归(Stepwise Regression)9
它能自动帮你选变量、删变量,让模型变得“显著”、让 R² 更好看、让表格更干净。
很多同学因此觉得它特别省事。但问题来了:
逐步回归因为“太省事”,反而是所有方法里最危险的一种。
在国际统计界,它已被明确认为是不可靠、不稳定、不适合科研的方法。
【一】为什么逐步回归曾经那么流行?
因为它太“贴心”:
- 自动挑出显著变量
- 自动删除“不显著”变量
- 让模型 R² 看起来很好
- 输出干干净净、特别像一篇“漂亮的论文”
也正是因为这种“看起来太好”的便捷,它在国内论文里非常常见。
但事实上,越是“自动出好结果”的方法,越需要警惕。
【二】逐步回归的三大致命问题(一定要记住)
它们就是逐步回归被国际学界淘汰的原因。
1. 极度不稳定:换一批样本,结果完全不一样
逐步回归根据样本里的“显著性”来决定变量的去留。稍微换点数据:
- 多删一行
- 样本区间变动
- 或者噪声稍微变化
最终模型可能完全不同。
逐步回归最大的缺点就是:结果不可复现。
而科研最忌讳的就是这一点。
2. 它选的是“显著性”,不是“重要性”
逐步回归只看 p 值:
- p 小 → 变量留下
- p 大 → 变量删除
但 p 值本身受到:共线性、样本量、噪声、变量单位的强烈影响。
于是你会得到:
- 本来重要的变量被删掉
- 本来不重要的变量“刚好显著”而被保留
逐步回归就是一种统计上的“显著性贪吃蛇”,看什么显著就吃什么。
3. 在共线性条件下,会选错变量
这点在回归模型里最常见、也最致命。
上一讲我们说过:
如果面积(area)和房间数(rooms)高度相关,逐步回归可能:
- 面积(area)和房间数(rooms)高度共线
- 逐步回归只会保留 p 值更小的那个
- 另一个无论是否重要,都会被删
而且:
- 换一批样本 → 保留的变量可能完全相反
- 噪声多一点 → 两个都可能被删
- 样本少一点 → 结果毫无规律
总结成一句话:
逐步回归不是选“理论上重要的变量”,而是选“运气好刚好显著的变量”。
它的决定不是科学,而是随机。
【三】SPSS 案例:逐步回归如何“错删变量”?
我们用上一讲的房价案例:
- area(面积)
- rooms(房间数)
- price(房价)
因为 area 和 rooms 高度相关,SPSS 逐步回归中的结果如下:
👉 自动删除 rooms,只保留 area,原因是:
- area 与 price 的 p 值略小
- rooms 的贡献被 area“吸走了”
- rooms 看起来“不显著”,因此被删
但这并不意味着:
- rooms 不重要
- area 更好
- 模型更科学
而是说明:
逐步回归在共线性下完全不知道怎么判断,只能随缘选一个。
这就是逐步回归最大的危险。
【四】那论文里到底怎么办?
根据不同研究目的,写法如下:
1. 有明确理论框架时(最推荐)
不要用逐步回归。可以这样写:
“考虑到逐步回归对样本变动高度敏感且存在显著性偏误,本文根据理论预期选取变量,而未采用基于显著性阈值的自动变量选择方法。”
2. 只是做探索性分析(可以用,但要说明)
“逐步回归仅作为探索性工具,用于了解潜在重要变量。最终模型仍以理论框架为主,并通过稳健性检验进行验证。”
3. 共线性严重(千万不要用逐步回归)
此时应使用更稳定的方法:
- 岭回归(Ridge)
- LASSO
- Elastic Net
- 或 AIC/BIC 模型选择
- 交叉验证(cross-validation)
论文可以这样写:
“由于自变量之间存在较强共线性,逐步回归不够稳定,因此本文采用正则化方法以获得更稳健的参数估计。”
【五】 逐步回归的现代替代方案
✔ LASSO:真正能筛选变量
✔ Ridge:解决共线性最稳的方法
✔ Elastic Net:综合两者优点
✔ AIC/BIC:基于模型复杂度选择
✔ 交叉验证:最现代、最稳健的模型选择方式
这些方法的共同特点:
- 更稳定
- 更科学
- 更符合国际论文规范
【六】一句话总结
逐步回归的问题不在于“算错”,而在于它“太看运气”,容易把随机显著性错当成真相。