回归分析第21讲:自相关——残差图、DW 和自相关图该怎么看?
很多同学很认真地完成回归:
- 看了系数方向
- 看了 p 值
- 查了异方差
- 甚至还用了稳健标准误
但论文送审、答辩或返修时,仍然会被指出一句话:
“模型可能存在自相关问题。”
一个普通 OLS 回归,为什么要进行自相关检验?
答案仍然是那两个字:残差。
【一】什么是“残差自相关”?
在前面几讲我们已经反复强调:
残差不是噪音,而是模型没解释掉的那一部分信息。
如果这些“没解释掉的误差”:
- 今天偏大
- 明天也偏大
- 后天还是偏大
那么这个问题就来了——残差在“时间维度”上是有记忆的。
这就是残差自相关(autocorrelation)。
可以用一句非常直观的话来理解:
- 如果上一期的误差,会系统性地影响下一期的误差,
- 那么残差就不再是“独立的”。
【二】为什么自相关在时间数据中特别常见?
自相关几乎是时间数据的“默认风险”,原因并不复杂:
- 宏观经济变量具有惯性
- 收入、产出、消费不会“突然断裂”
- 制度、政策、结构性因素具有持续性
这意味着:
模型遗漏的那部分结构性因素,很容易在时间上延续下来。
结果就是:
- 即使模型形式是线性的、变量看起来也合理,
- 残差仍然会“一段时间同方向偏离”。
【三】自相关会带来什么后果?重点还是这三点
和异方差一样,自相关最危险的地方不在“系数本身”,而在推断层面。
在存在自相关时:
- 回归系数仍然可能是无偏的
- 但标准误通常会被低估
- t 值被放大,p 值出现“假显著”
这意味着什么?
看起来非常显著的结果,可能只是因为你“高估了信息量”。
所以,在时间或序列数据中:
- DW 检验不通过
- t 值、p 值的可信度就要打折扣
【四】如何判断自相关:继续上一讲的案例
这里我们用上一讲的案例(来自《EViews在数据分析中的应用》,清华大学出版社),来研究模型的残差:
1999-2019年加拿大家庭的平均可支配收入与家庭平均消费支出数据,建立一个简单的凯恩斯消费函数模型。其中,income是家庭的平均可支配收入,consumption是家庭的平均最终消费支出。
建立回归模型后,相关的输出结果如下:
- 残差 VS 时间图(最直观、但不定量)
下图是模型的残差序列图,这个图主要靠直觉判断。
图1 残差 vs 时间图
从上图可以看到,残差随时间而变化,并非随机地围绕 0 上下波动,而是呈现出明显的连续同方向波动:一段时间内持续为正,随后又持续为负。这种“成段出现”的特征,往往是自相关存在的直观信号。
- DW值(一个粗略的检验)
在 EViews、Stata 等软件中,DW(Durbin–Watson)统计量几乎是自动给出的。
(1)DW 到底在“看”什么?
Durbin–Watson 统计量本质上是在衡量:相邻残差之间是否“走在同一方向”。
- DW ≈ 2 → 基本无一阶自相关
- DW < 2 → 正自相关
- DW > 2 → 负自相关
(2)为什么说 DW 只能“粗略判断”?
因为DW 只看“一阶自相关”,看不到更复杂结构
DW 本质上只对下面这种情况敏感:εₜ 和 εₜ₋₁ 是否相关?
但现实数据中,常见的是:
- 二阶自相关(εₜ 和 εₜ₋₂)
- 多阶衰减型自相关(AR(2)、AR(p))
- 周期性相关(宏观数据很常见)
👉 这些情况,DW 可能完全看不出来。
图2 回归估计结果图
本案例中 DW ≈ 0.99,明显偏离 2,可以认为残差可能存在正自相关。
- 残差自相关图ACF(结构性证据)
学过时间序列分析的同学,对ACF图不陌生,当然也非常熟悉如何解读ACF图。
图3 残差的自相关图
从残差的自相关函数(ACF)可以看到,多个滞后阶数上的自相关系数显著偏离 0,同时 Ljung–Box Q 统计量对应的 p 值显著小于 0.05,拒绝“残差不存在自相关”的原假设,说明残差序列存在显著的自相关结构。
综合残差时序图、DW 统计量和残差自相关函数可以确认:该模型的残差存在显著的正自相关,仅依赖 DW 值是不够的,必须结合更系统的诊断工具。
【五】发现自相关后,该怎么办?
这里不展开建模,只给一个方案。
在存在自相关风险时,最常见、也最安全的处理是:
- 使用 Newey–West(HAC)稳健标准误
- 保持系数不变
- 修正标准误和统计推断
这是很多经济学论文的标准操作。
至于:
- 要不要加滞后项
- 要不要改成动态模型
- 要不要进入时间序列或面板框架
👉 我们放在后面的专题系列中系统讲。
【六】一句话总结
- 异方差让“不同样本点”的误差不稳定,
- 自相关让“不同时间点”的误差不独立。