回归分析第3讲:总体回归是什么?样本回归又是什么?误差项 ε 为什么是模型的灵魂?

统计

在前两讲中,我们分别讨论了回归的起源,以及回归能够回答什么、不能回答什么。本讲要迈出一个关键步骤:从“直觉层面”走向“模型层面”,正式进入回归的数学逻辑。

但本讲不会进入任何复杂推导。我们的目标很简单:

  • 弄清楚回归模型到底意味着什么?
  • **什么是“总体回归方程”? **
  • **我们为什么要通过“样本”去估计它? **
  • 误差项 ε 又代表了哪些我们无法直接观察到的东西?

理解这些问题,是掌握整个回归体系的基础。

【一】为什么要区分“总体回归”和“样本回归”?

做回归时,我们在软件里输入数据、点击回归按钮,最后得到一组系数 图片(beta-hat)。但很少有人停下来问:

这个 图片,到底在估计什么?
它为什么“有时准、有时不准”?

要回答这个问题,我们需要区分两个概念:

  • 总体回归(population regression):真实世界中的“真正规律”
  • 样本回归(sample regression):我们用有限数据估计出来的“近似规律”

这就像:

  • 总体回归 = “世界上真实存在的但无法直接看到的那条线”
  • 样本回归 = “我们用手上的样本画出的那条线”

而现实研究中,我们永远无法直接看到“总体回归”。我们只能通过有限样本,尽量逼近它。

【二】总体回归:现实世界中的“真实规律线”是什么?**

总体回归的基本形式是:

图片

这不是一条数学上的精确直线,而是一个概率关系。

它表示:

在真实世界中,Y 的平均变化趋势可以用 β₀ + β₁ X 描述,而所有无法完全解释的部分被放入误差项 ε。

也就是说:

  • β₁ 描述的是 “平均规律”,不是“每个人的规律”
  • ε 则包含了所有“我们无法观测或无法解释的东西”

在现实世界中:

  • 收入不仅受教育影响,还受家庭背景、行业、城市发展水平、能力等影响
  • 销量不仅受广告影响,还受竞争、季节、价格变化影响
  • 健康不仅受空气污染影响,还受生活习惯、基因差异、医疗资源影响

这些复杂因素不可能全部进入模型,因此:

总体回归方程是一个“平均规律 + 不可控扰动”的组合。

【三】误差项 ε 到底是什么?它为什么是模型的灵魂?

误差项 ε 是回归模型中最容易被忽略、但最重要的部分。它不是“错误”,更不是“噪声”,而是:

我们没有纳入模型的所有影响因素的集合。

换句话说,ε 是:

  • 统计上:不可观测变量
  • 经济上:所有“我们解释不了的部分”
  • 方法论上:回归模型是否有效的关键

ε 通常包含:

  1. 遗漏变量(无法测量或未被纳入)。
    如:家庭背景、企业家能力、城市氛围

  2. 随机冲击
    如:一次性事件、个人选择、天气、突发事件

  3. 测量误差
    如:收入自报误差、问卷评分偏差

  4. 个体差异
    每个人都有不同的特质,无法完全量化

所以误差项反映的是:

现实世界复杂性 —— 模型永远无法完全解释全部变化。

因此,整个回归理论绕不开的核心问题就是:

X 与 ε 是否相关?

  • 如果相关 → 内生性
  • 如果无关 → 模型可以得到一致的 β̂

这就是为什么 ε 是“模型的灵魂”:

它代表了模型能否正确估计 β 的关键。

【四】 样本回归:我们用数据画出的“近似规律线”

总体回归是我们想知道的,但永远看不见。因此,我们只能用样本数据来估计:

图片

回归软件里跑出来的图片、图片不是“真实值”,而是:

样本中的最好估计(best linear unbiased estimator)

你可以这样理解,我们获得的回归方程,永远不可能完全代表总体,因为它是从有限的样本中推导出来的。

这就像你用有限的人群做身高调查:

  • 真正的中国男性平均身高是“总体”
  • 你调查300人得到的平均身高是“样本”

他们可能接近,也可能偏离,但只要样本足够多、抽样足够随机,你的样本平均值就能逼近真实平均值。

回归亦然:

  • β是总体真值

  • 图片是样本估计

  • 图片≠β,但图片→β(样本增大时逼近真值)

这就是回归理论中最重要的思想之一:

样本逼近总体。

【五】为什么样本会“逼近”总体?**

直觉上可以这样理解:

  • 如果你的数据足够多
  • 如果抽样方式不是偏的
  • 如果误差项 ε 的均值是零(没有系统偏误)
  • 如果 X 与 ε 不相关(核心条件)

那么:

样本中的趋势,最终会无限接近总体中的真实趋势。

这就是统计学中的“大数定律”与“无偏性”思想在回归中的体现,也解释了为什么我们可以用有限样本做经济学、金融学、社会学研究。

【六】一个课堂例子

为了理解“总体回归”和“样本回归”,这里用Henry老师《统计学》课堂上的一个例子,研究“学习时间是否影响英语成绩”。

假设我们要研究大学生的英语学习函数:

  • 自变量 X:每天学习英语的时长
  • 因变量 Y:期末的英语成绩

如果我们关心的是“全国所有大学生”的真实规律,例如:每天多学 1 小时英语,平均能提高几分成绩——这就是总体回归。

它描述的是一种“真实存在但无法直接看到”的关系,代表全校甚至全国大学生的平均趋势。

但现实中,我们不可能调查全国所有学生,于是我们用上课的(1)班 45位同学的数据来做一次回归。我们从这45位同学的散点图中画出一条最佳拟合线,会得到2个系数:β₀ 和 β₁,这就是一次样本回归。

如果我们换(2)班的学生,或隔一年再抽一批学生重做一次回归,得到的回归线会略有不同——因为每次抽样得到的“样本”不同,但它们都在逼近那条真正的总体规律。

换句话说:

  • 总体回归:全国大学生的英语成绩,真实存在的一条“平均规律线”,我们看不见。
  • 样本回归:我们用手上的数据(如全班45人)画出的那条“近似规律线”,可以多次抽样重复估计。

也正是因为样本会随机波动,而总体不会,所以统计学才需要研究:样本估计如何逼近总体,以及误差项 ε 在其中扮演的关键角色。

图片

上面这张图展示了回归分析中非常重要的概念:总体回归与样本回归的区别。

  • 黑色虚线代表 总体回归线:
    它对应真实世界中所有个体(例如全国所有学生)的“平均规律”,是一条固定不变的理论直线;我们永远无法直接看到它,只能通过样本去推断。

  • 多条橙色虚线代表 样本回归线:
    每一条橙色线都对应一次“抽一批样本、做一次回归”的结果。例如只抽取一个班级、或者从不同学校抽样,不同的样本会得到不同的回归线,因此斜率与位置略有差异。

  • 黑色散点代表样本数据点,体现了真实个体之间的差异和误差项的存在。

这张图说明了一个关键事实:

样本回归线会随着样本不同而变化,但总体回归线只有一条。
样本越多、抽样越随机,样本回归线就越集中、越接近那条总体回归线。

【七】本讲小结

本讲我们进入了回归分析的“模型框架”,弄清了几个关键概念:

  • 总体回归是“真实世界的平均规律”

  • 样本回归是我们用有限数据估计出来的“近似规律”

  • 误差项 ε 是所有无法解释、无法测量、无法控制的因素

  • 估计 β 的关键在于:X 是否与 ε 独立

  • 样本 图片不是“真值”,但在一定条件下会逼近总体 β

理解这一讲,你就真正建立起回归分析的逻辑基础。