「假设检验八讲」第5讲:第一类错误和第二类错误——统计学的两难选择

统计

在假设检验中,我们总是根据样本来判断总体,但样本有随机性。

这意味着——无论我们多么谨慎,总有可能“判断错”。

统计学家把这种风险分成两类:

第一类错误(Type I Error):冤枉了无辜的假设。
第二类错误(Type II Error):放过了其实有问题的假设。

【一】 从法庭的判决说起

假设有一位被告。

  • 原假设(H₀):被告无罪。

  • 备择假设(H₁):被告有罪。

法官根据证据(数据)来判断是否拒绝H₀。如果他错判,就可能出现两种后果:

错误类型 现实比喻 统计定义 概率符号
第一类错误 冤枉无辜 错误地拒绝了H₀ α
第二类错误 放过坏人 错误地接受了H₀ β

法庭不希望冤枉无辜(控制α),但也不希望放过坏人(降低β)。

问题是:两者往往无法同时最小化。

【二】 显著性水平α:我们愿意承担的“冤枉风险”

在统计检验中,显著性水平α就是我们事先愿意接受的第一类错误概率。比如 α=0.05,意味着我们愿意有5%的概率“冤枉”一个原本正确的假设。

这是一种“风险声明”,而不是结果说明。换句话说,我们并不是说“p=0.05时犯了错”,而是在检验前就规定:“我们最多容忍5%的错判风险”。

α值越小,我们越谨慎,但也越可能错过真实效应。例如在医学研究中,α常取0.01甚至0.001;而在市场实验或社会调查中,通常取0.05即可。

【三】 检验功效(Power):第二类错误的“对立面”

如果第一类错误是“冤枉”,那第二类错误就是“放过”。当原假设实际上是错的,但我们没能拒绝它,就犯了第二类错误。这类错误的概率记作β。

相应地,1−β 就是检验功效(Power)——也就是“在假设确实不成立时,检验能识别出来的能力”。功效越高,说明检验越敏感,越不容易漏掉真实效应。

【四】 样本量与错误概率的平衡

控制错误不是靠祈祷,而是靠设计。影响α、β和功效(Power)的主要因素有:

1️⃣ 显著性水平α:设得越严格,越难拒绝H₀,β就越大。
2️⃣ 样本量n:样本越多,统计量分布越集中,功效就越高。
3️⃣ 效应量Effect Size:真实差异越大,越容易被检出。

你可以理解为一场“侦查游戏”:

  • 降低α,就像“证据必须百分百充分”,可能放走真罪犯(β↑);

  • 提高功效,就像“扩大侦查范围”,需要更多样本或更强信号。

📌 所以,显著性水平、样本量和功效之间必须平衡设计。

【五】 现实例子:药物实验中的风险取舍

新药审批是典型的假设检验过程:

  • H₀:新药与旧药效果相同(无差异);
  • H₁:新药优于旧药。

如果犯了第一类错误(α),就是批准了无效药;如果犯了第二类错误(β),就是拒绝了有效药。

监管机构通常(应当)选择“宁可放过,不可错判”,因此α取得非常低(例如0.01)。同时,为了不漏掉好药,他们会增加样本量,提高功效(1−β)。

【六】 小结:统计学的取舍之道

统计推断的本质,是在“不确定”中做“尽可能理性的决策”。
我们不可能让α和β都为零,只能在风险与资源之间找到平衡。

一句话总结:

α代表谨慎的底线,β代表敏感的代价。
科学判断的智慧,不在于绝对正确,而在于清楚自己可能错在哪。


📚【延伸阅读】

  • Neyman, J. & Pearson, E.S. (1933). On the Problem of the Most Efficient Tests of Statistical Hypotheses.

  • Cohen, J. (1988). Statistical Power Analysis for the Behavioral Sciences. 

思考题:

如果样本量增加一倍,功效会怎样变化?是否总能减少错误?