为什么标准误差要除以√n?——统计学的平方根法则

统计

在上一篇文章中,我们提到过“抽样误差”——当我们用样本去推断总体时,即使抽样方法完全随机,不同样本得到的结果也会略有不同,这种自然波动就是抽样误差(Sampling Error)。

但很多人不知道,抽样误差其实有不同的形式。要真正理解“为什么标准误差要除以√n”,我们得先从这些误差类型讲起。

一、抽样误差的几种形式

在统计学中,“抽样误差”并不是单一概念,而是一个家族。不同的误差,衡量的是不同层次的不确定性👇

类型 现代称谓 含义 举例
抽样平均误差 标准误差 (Standard Error) 衡量样本统计量的平均波动程度 多次抽样的平均身高略有不同
抽样极限误差 置信区间误差 (Margin of Error) 在置信水平下的最大可能偏差 民调结果 ±3%
抽样回归误差 回归系数标准误差 回归系数在不同样本下的波动 不同样本的回归斜率略有变化

📘 早期教材(尤其是苏联和日本的译本)常用“抽样平均误差”和“抽样极限误差”这两个术语。

在现代统计体系中,它们分别对应我们熟悉的 标准误差(SE) 和 置信区间误差(E)。

二、抽样平均误差 = 标准误差

所谓“抽样平均误差”,其实就是标准误差(Standard Error)。它反映的是:如果我们从总体中反复抽样、每次计算一个样本均值,那么这些样本均值之间的波动程度。

公式为:

图片

它告诉我们:样本均值的稳定性取决于总体波动(σ)和样本量(n)。样本越大,平均值就越稳定,抽样波动就越小。

三、抽样极限误差 = 置信区间的误差范围

“抽样极限误差”强调的是一个“区间”,它告诉我们:样本估计值与总体参数的最大偏离有多大。

公式为:

图片

例如,当置信水平为95%时,图片,这意味着我们有95%的把握认为总体参数落在“样本估计值 ± 1.96×SE”的范围内。

📊 民调中的“支持率52% ±3%”,其实正是基于这个计算得出的。

四、为什么标准误差要除以√n?

理解完“标准误差是什么”,我们终于可以回到核心问题:

为什么标准误差的公式是除以√n,而不是直接除以n?

这是因为,标准误差体现的是统计学中最优美的规律之一——平方根法则(Square Root Law)。

1️⃣ 从直觉理解:平均能“平滑”随机性

假设我们掷骰子:

  • 掷 1 次,结果完全随机;
  • 掷 10 次取平均,结果更接近 3.5;
  • 掷 100 次取平均,几乎总在 3.5 附近。

平均数越多,结果越稳定。

但这种稳定不是线性的:样本量扩大 4 倍,误差不会减少 4 倍,而是减少到 原来的 1/2。也就是说,误差的大小与样本量的平方根成反比。

这正是公式中 √n 的来源。

2️⃣ 从数学推导看:方差是可加的

样本均值是:

图片

如果每个样本的方差都是,且彼此独立,则样本均值的方差为:

图片

对方差开平方根,得到标准误差:

图片

换句话说:“除以√n”是因为方差与样本量成反比,而我们要用标准差表示波动,就需要开平方根。

3️⃣ 从实践例子看

一个人测量体温,可能误差较大;四个人各自测量取平均,误差约减半;一百个人测量取平均,误差几乎可以忽略。

样本量扩大 4 倍,误差减为原来的一半;样本量扩大 100 倍,误差约减为原来的十分之一。

这就是“平方根法则”的现实意义。


五、小结

概念 数学关系 含义
抽样平均误差 样本统计量的平均波动
抽样极限误差 给定置信水平下的最大偏离
平方根法则 样本越多,误差减半需样本增至4倍

📌 一句话总结:

“√n”是统计学对“样本越多越稳定”这一经验规律的数学刻画。它提醒我们:样本量增加确实能减小误差,但收益递减——这就是统计学的优雅之处。