回归分析第5讲:回归分析的前提条件是什么?
在前面几讲,我们已经知道回归能回答什么、如何理解斜率 β₁、样本回归与总体回归的区别。这一讲我们说一下:
回归分析并不是简单地找出回归线,它有比较严格的前提条件。
回归模型是很容易拟合的,但 OLS(普通最小二乘法)作为最经典的线性回归方法,要想估计可靠、推断有效,其背后依赖一套统计假设。
【一】教材给出的经典假设
对于回归分析的前提条件,不同教材的提法中略有差异,有的列 4 条、有的 7 条、甚至 10+ 条。
比如《EViews在数据分析中的应用》(何晓琦,清华大学出版社)一书的第5章中列出 8 项经典假定,包括:
(1)模型的线性假定:被解释变量是解释变量的线性函数。(2)解释变量不能完全相同:至少有一个观察值与其它观察值是不同的。(3)解释变量是非随机的:说明解释变量与随机误差项是相互独立的。(4)观察值大于2:观察值个数大于解释变量个数,以保证解释变量之间不会存在严格的线性关系。(5)误差的期望值为零:即无偏性假定。(6)误差项同方差:所有随机误差项的方差相等。(7)序列独立:无序列相关性假定,即随机误差项之间无序列相关性。(8)残差正态分布:随机误差项服从均值为零的正态分布。”
以上假定,后面四项都是关于随机误差项的假定。
对初学者来说,不需要记这么多。Henry老师把这些假定,重新整理为OLS估计的五个核心前提。
【二】OLS 回归依赖的五个核心前提
(1)回归是线性的,变量之间是“直线关系”,也就是斜率是真实存在的。
也就是说,我们认为 X 每增加 1 单位,Y 会平均变化 β₁。
现实中非常多这样的例子:
- 每多学1小时英语 → 成绩平均提升?
- 每多投放1万元广告 → 销量平均增加?
- 企业ESG得分提高1分 → 融资成本变化?
如果真实关系是弯曲的、跳跃的、有明显拐点,那么“勉强拟合”线性回归,只会得到误导的结论,这就是模型中多项式回归、对数回归、非参数回归存在的意义。
比如,正常的英语学习函数是线性的,每多学 1 小时英语 ≈ 平均多考 2 分;但是,如果“学到第3小时突然跳升50分”,这个就不是正常的线性函数。
(2)解释变量必须有变化、不能全部相同
如果一个班所有同学每天都学习一小时的英语1小时,那么——你根本无法研究“学习时长对成绩有没有影响”。
因为 X 没有变化,β₁无法估计。
一句话记住:
回归要研究 X 对 Y 的影响,X 必须是真实在变化的。
现实研究也一样——如果你只研究沿海城市,根本无法判断“城市化率差异是否影响全国的住房价格”。
(3)解释变量与误差独立 —— 最关键的灵魂假设
这一条是回归里“最不起眼但最重要的条件”:
X 不能与误差项 ε 有系统性的关联。
它的意思是——Y 的其他影响因素(误差项 ε )不能刚好和 X 同方向或反方向变化,否则回归会把它们误当成 X 的效果。
还是Henry老师的经典课堂例子“英语学习函数”:
假设我们发现每天学习 1 小时的学生普遍基础更好,那么:
- 他们原本就应该考得高
- 但回归模型会把这部分优势错算成“学习时长贡献的效果”
于是我们看到这批同学的英语成绩被高估,像这样:
- 看起来多学 1 小时 → 成绩 + 5 分
- 但真实可能只有 +2 分,其余 3 分来自他们的基础比较好,原来就掌握了这部分知识(模型把它归入误差项ε)
换句话说:
模型在回归时,把“基础好带来的成绩提升”误认为是“学习时长带来的效果”。因为模型只有一个自变量“学习时长”,未观测到的变量“英语基础好”则被归入了误差项 ε,但它却与学习时长产生了同方向变化,从而导致“学习时长→成绩”的影响被高估。
这就是内生性(Endogeneity)的本质:自变量与误差项发生系统性关联。
一旦这条假设不成立,再漂亮的OLS都站不稳。
(4)误差项方差恒定
要求误差项在不同样本区间中波动幅度相近,不能出现“有时安静、有时剧烈”的情况。如果低水平样本波动很小,高水平样本波动却极不稳定,就意味着模型可能存在异方差。
在英语学习成绩这个例子中,就可能会出现:
- 学得少的人成绩波动小
- 学得多的人成绩忽高忽低
这时候,尽管回归系数仍可估计,但标准误不再可信、t检验和显著性结论可能偏离真实情况。
所以研究中常见做法是:
- White / Breusch-Pagan 检验用于识别异方差
- 采用稳健标准误(Robust SE / HC 标准误)进行修正
(5)误差项分布近似正态
严格说 OLS 稳定运行不需要残差正态(所以很多论文并没有做这项检验),但模型中的显著性检验、置信区间、t值/F值推断都依赖此条件,在小样本场景尤为关键。
例如:
- 班级样本仅 45 人进行成绩回归 → 误差正态性显得非常关键。
- 全国大样本 10,000 人 → 中心极限定理可弱化对正态的依赖。
因此,在研究中,一般要做残差正态QQ图、Shapiro检验。
可以这么说:
回归能跑,并不代表推断有效。
残差越接近正态,统计推断越可信。
【三】英语学习案例映射五条假设
还是用我们上一讲的“英语学习函数,它的回归模型的前提是否满足我们刚才讲的几点。
假设我们研究 45 名大学生,X = 每天学习英语时长,Y = 英语成绩。
若满足五大假设:
- 线性:多花一些时间学习 ≈ 成绩平均上升(二者线性相关)
- 无系统偏差:班级整体不是特别特殊(如全是学霸或全是零基础就不成立)
- X 与误差独立:解释变量 X(学习时长)不能与误差项中的未观测因素(例如英语基础水平、天赋、学习能力)系统相关,否则有内生性问题
- 同方差:学得少的和学得多的人成绩波动都差不多
- 无自相关:互相不抄作业、不组团影响成绩
那么 OLS 就可以稳定估计出
“每增加 1 小时学习 → 成绩平均提升多少”
【四】小结
经典OLS假设看起来很多,但它们都围绕一个核心展开:
我们希望回归线反映的是真实规律,而不是噪声与偏误。