回归分析第19讲:异方差——最容易被忽视、却最容易导致误判的回归问题
在经典线性回归分析中,异方差是最常见、也最容易被忽视的问题之一。本讲将介绍:什么是异方差,异方差通常如何产生,如何在实证分析中识别异方差,以及在发现异方差后应当采取哪些合理的处理方式。
【一】什么是异方差?它违反了 OLS 的什么假设?
在经典线性回归中,OLS 有一个非常关键、但常被忽略的假设:
总体回归模型中的误差项具有同方差性。
这意味着,在不同自变量取值下,误差项的波动程度应当保持稳定;在实际分析中,我们通常通过残差的分布形态来判断这一假设是否可能被违反,因为残差是误差项的“样本映射”。
如果这个假设成立,我们称为同方差;如果残差的波动随着自变量或拟合值系统性变化,就出现了异方差。
需要特别强调的是:
- 异方差 ≠ 残差大
- 异方差指的是残差“波动结构”不稳定
有的样本区间残差很集中,有的区间却剧烈波动——
这时,即便回归系数本身看起来“很合理”,统计推断也可能已经失效。
【二】异方差通常从哪里来?
异方差并不是“异常情况”,恰恰相反,它在经济数据中非常常见。
最典型的来源包括以下几类:
第一,规模效应。例如收入、产值、企业规模等变量。规模越大,个体差异往往越大,残差自然随之放大。
第二,发展阶段差异。在时间序列或面板数据中,早期阶段波动小,后期阶段波动大,是非常常见的现象。
第三,分组结构未建模。如城乡差异、行业差异、地区差异。如果模型中没有显式区分,残差往往会“替你分组”。
第四,变量度量方式不当。直接使用水平值而非对数值,是诱发异方差的经典原因之一。
用一句话来总结,就是:
现实世界的不均衡性,几乎所有的数据都包含了异方差。
【三】如何判断异方差?先看图,再谈检验
我们有两种基本的方法来判断异方差,但首要的方法并不是检验统计量,而是观察残差图。
1. 残差 vs 拟合值(最重要的一张图)
这是所有残差诊断中信息量最大的一张图。
- 如果残差呈现“漏斗形 / 喇叭形”
- 即:随着拟合值增大,残差波动明显变宽或变窄
那么,异方差几乎可以确定存在。
我们来看一个案例,同样来自何老师的《EViews在数据分析中的应用》:
根据1999-2019年加拿大家庭的平均可支配收入与家庭平均消费支出数据,建立一个简单的凯恩斯消费函数模型。其中,income是家庭的平均可支配收入,consumption是家庭的平均最终消费支出。
图1 回归分析的输出结果
图2 回归模型的残差图
图1是回归结果,图2给出了该回归模型的残差序列图。从图中可以看到,残差在样本期内的波动幅度相对稳定,未呈现出明显的喇叭形(漏斗形)结构。基于残差图的初步判断,模型并不存在显著的异方差问题。
2. 统计量的检验:只是辅助而非核心
White 检验、BP 检验等可以作为补充工具,但不应替代图形判断。原因很简单:
- 检验只能告诉你“拒绝不拒绝”,
- 但图形告诉你“异方差问题长什么样”。
图3 残差序列的White(怀特)检验结果
为了进一步检验模型是否存在异方差问题,我们对加拿大居民消费函数的残差序列进行了 White 异方差检验。White 检验的原假设为:残差具有同方差性,备择假设为:残差存在异方差。
从图3的结果可以看到,White 检验中常用的统计量 Obs*R-squared = 1.822595,其对应的 p 值为 0.4020,明显大于常用的显著性水平(如 5%)。因此,我们不能拒绝同方差性的原假设,说明在本例中,没有统计证据表明模型存在异方差问题。
结合前面的残差图分析,可以认为该模型在同方差假设下是成立的,OLS 估计结果在这一点上是可靠的。
【四】发现异方差后,应当如何处理?
这是学生和论文作者最关心、也最容易走偏的一步。
需要先明确一个原则:
不是所有异方差都需要被“消灭”,但所有异方差都必须“交代清楚”。
常见处理思路可以分为三个层次。
第一层:不改模型,只修正推断(最常用)
当异方差存在时,一个最稳妥的做法是:不改变回归系数本身,而是修正标准误的计算方式。
常见做法包括使用 White / HC 稳健标准误,此时回归系数保持不变,但 t 值与 p 值在异方差条件下依然是可信的。
这是经济学实证论文中最常见、也最安全的处理方式,尤其适用于异方差程度不算严重、模型结构本身合理的情形。
第二层:通过变量变换缓解异方差(结构性修正)
在很多经验研究中,异方差并非“随机噪声”,而是源于变量量级或经济结构本身。例如,收入、规模、总量类变量往往随着水平提高而波动加大。
在这种情况下,可以通过改变变量形式来缓解异方差问题,包括:
- 对数化(log 变换)
- 使用比例或人均指标
- 对变量进行适当缩放或标准化
这类方法的优点在于:
既改善了异方差问题,而且更符合经济含义。
不过要注意,变量变换应当有明确的经济或统计理由,而不是仅为“通过检验”。
第三层:改变估计方法(结构性调整)
在异方差结构较为明确、且可以合理建模的情况下,也可以考虑改变估计方法,例如:
- 加权最小二乘(WLS)
- 广义最小二乘(GLS)
这类方法通过显式刻画误差项的方差结构,提高估计效率。但它们对模型设定要求较高,一旦权重或方差结构设定不当,反而可能引入新的偏误。
因此,在实证研究中,这类方法通常作为进阶或稳健性分析手段,而非首选方案。
【五】论文中应当如何表述异方差问题?
在论文写作中,异方差问题并不可惜,但作者不能回避这个问题,对存在的异方差问题要有必要的解释。
以下是三种常见、规范的写法思路:
- 发现异方差但已修正 “残差诊断结果显示模型存在一定程度的异方差,本文采用 White 稳健标准误进行修正。”
- 异方差不严重,结论稳健 “尽管残差存在轻微异方差,但采用稳健标准误后,主要结论保持不变。”
- 作为稳健性说明 “考虑到潜在的异方差问题,本文在基准回归之外进一步报告稳健标准误结果。”
【六】总结
在回归分析中,模型是否可靠,往往不是写在系数里,而是写在残差里。
异方差本身并不可怕,可怕的是在异方差存在的情况下,仍然用“看似显著”的 p 值去讲故事。