回归分析第3讲:总体回归是什么?样本回归又是什么?误差项 ε 为什么是模型的灵魂?
在前两讲中,我们分别讨论了回归的起源,以及回归能够回答什么、不能回答什么。本讲要迈出一个关键步骤:从“直觉层面”走向“模型层面”,正式进入回归的数学逻辑。
但本讲不会进入任何复杂推导。我们的目标很简单:
- 弄清楚回归模型到底意味着什么?
- **什么是“总体回归方程”? **
- **我们为什么要通过“样本”去估计它? **
- 误差项 ε 又代表了哪些我们无法直接观察到的东西?
理解这些问题,是掌握整个回归体系的基础。
【一】为什么要区分“总体回归”和“样本回归”?
做回归时,我们在软件里输入数据、点击回归按钮,最后得到一组系数 (beta-hat)。但很少有人停下来问:
这个 ,到底在估计什么?
它为什么“有时准、有时不准”?
要回答这个问题,我们需要区分两个概念:
- 总体回归(population regression):真实世界中的“真正规律”
- 样本回归(sample regression):我们用有限数据估计出来的“近似规律”
这就像:
- 总体回归 = “世界上真实存在的但无法直接看到的那条线”
- 样本回归 = “我们用手上的样本画出的那条线”
而现实研究中,我们永远无法直接看到“总体回归”。我们只能通过有限样本,尽量逼近它。
【二】总体回归:现实世界中的“真实规律线”是什么?**
总体回归的基本形式是:
这不是一条数学上的精确直线,而是一个概率关系。
它表示:
在真实世界中,Y 的平均变化趋势可以用 β₀ + β₁ X 描述,而所有无法完全解释的部分被放入误差项 ε。
也就是说:
- β₁ 描述的是 “平均规律”,不是“每个人的规律”
- ε 则包含了所有“我们无法观测或无法解释的东西”
在现实世界中:
- 收入不仅受教育影响,还受家庭背景、行业、城市发展水平、能力等影响
- 销量不仅受广告影响,还受竞争、季节、价格变化影响
- 健康不仅受空气污染影响,还受生活习惯、基因差异、医疗资源影响
这些复杂因素不可能全部进入模型,因此:
总体回归方程是一个“平均规律 + 不可控扰动”的组合。
【三】误差项 ε 到底是什么?它为什么是模型的灵魂?
误差项 ε 是回归模型中最容易被忽略、但最重要的部分。它不是“错误”,更不是“噪声”,而是:
我们没有纳入模型的所有影响因素的集合。
换句话说,ε 是:
- 统计上:不可观测变量
- 经济上:所有“我们解释不了的部分”
- 方法论上:回归模型是否有效的关键
ε 通常包含:
-
遗漏变量(无法测量或未被纳入)。
如:家庭背景、企业家能力、城市氛围 -
随机冲击
如:一次性事件、个人选择、天气、突发事件 -
测量误差
如:收入自报误差、问卷评分偏差 -
个体差异
每个人都有不同的特质,无法完全量化
所以误差项反映的是:
现实世界复杂性 —— 模型永远无法完全解释全部变化。
因此,整个回归理论绕不开的核心问题就是:
X 与 ε 是否相关?
- 如果相关 → 内生性
- 如果无关 → 模型可以得到一致的 β̂
这就是为什么 ε 是“模型的灵魂”:
它代表了模型能否正确估计 β 的关键。
【四】 样本回归:我们用数据画出的“近似规律线”
总体回归是我们想知道的,但永远看不见。因此,我们只能用样本数据来估计:
回归软件里跑出来的、
不是“真实值”,而是:
样本中的最好估计(best linear unbiased estimator)
你可以这样理解,我们获得的回归方程,永远不可能完全代表总体,因为它是从有限的样本中推导出来的。
这就像你用有限的人群做身高调查:
- 真正的中国男性平均身高是“总体”
- 你调查300人得到的平均身高是“样本”
他们可能接近,也可能偏离,但只要样本足够多、抽样足够随机,你的样本平均值就能逼近真实平均值。
回归亦然:
-
β是总体真值
-
是样本估计
-
≠β,但
→β(样本增大时逼近真值)
这就是回归理论中最重要的思想之一:
样本逼近总体。
【五】为什么样本会“逼近”总体?**
直觉上可以这样理解:
- 如果你的数据足够多
- 如果抽样方式不是偏的
- 如果误差项 ε 的均值是零(没有系统偏误)
- 如果 X 与 ε 不相关(核心条件)
那么:
样本中的趋势,最终会无限接近总体中的真实趋势。
这就是统计学中的“大数定律”与“无偏性”思想在回归中的体现,也解释了为什么我们可以用有限样本做经济学、金融学、社会学研究。
【六】一个课堂例子
为了理解“总体回归”和“样本回归”,这里用Henry老师《统计学》课堂上的一个例子,研究“学习时间是否影响英语成绩”。
假设我们要研究大学生的英语学习函数:
- 自变量 X:每天学习英语的时长
- 因变量 Y:期末的英语成绩
如果我们关心的是“全国所有大学生”的真实规律,例如:每天多学 1 小时英语,平均能提高几分成绩——这就是总体回归。
它描述的是一种“真实存在但无法直接看到”的关系,代表全校甚至全国大学生的平均趋势。
但现实中,我们不可能调查全国所有学生,于是我们用上课的(1)班 45位同学的数据来做一次回归。我们从这45位同学的散点图中画出一条最佳拟合线,会得到2个系数:β₀ 和 β₁,这就是一次样本回归。
如果我们换(2)班的学生,或隔一年再抽一批学生重做一次回归,得到的回归线会略有不同——因为每次抽样得到的“样本”不同,但它们都在逼近那条真正的总体规律。
换句话说:
- 总体回归:全国大学生的英语成绩,真实存在的一条“平均规律线”,我们看不见。
- 样本回归:我们用手上的数据(如全班45人)画出的那条“近似规律线”,可以多次抽样重复估计。
也正是因为样本会随机波动,而总体不会,所以统计学才需要研究:样本估计如何逼近总体,以及误差项 ε 在其中扮演的关键角色。
上面这张图展示了回归分析中非常重要的概念:总体回归与样本回归的区别。
-
黑色虚线代表 总体回归线:
它对应真实世界中所有个体(例如全国所有学生)的“平均规律”,是一条固定不变的理论直线;我们永远无法直接看到它,只能通过样本去推断。 -
多条橙色虚线代表 样本回归线:
每一条橙色线都对应一次“抽一批样本、做一次回归”的结果。例如只抽取一个班级、或者从不同学校抽样,不同的样本会得到不同的回归线,因此斜率与位置略有差异。 -
黑色散点代表样本数据点,体现了真实个体之间的差异和误差项的存在。
这张图说明了一个关键事实:
样本回归线会随着样本不同而变化,但总体回归线只有一条。
样本越多、抽样越随机,样本回归线就越集中、越接近那条总体回归线。
【七】本讲小结
本讲我们进入了回归分析的“模型框架”,弄清了几个关键概念:
-
总体回归是“真实世界的平均规律”
-
样本回归是我们用有限数据估计出来的“近似规律”
-
误差项 ε 是所有无法解释、无法测量、无法控制的因素
-
估计 β 的关键在于:X 是否与 ε 独立
-
样本
不是“真值”,但在一定条件下会逼近总体 β
理解这一讲,你就真正建立起回归分析的逻辑基础。