「假设检验八讲」第5讲:第一类错误和第二类错误——统计学的两难选择
在假设检验中,我们总是根据样本来判断总体,但样本有随机性。
这意味着——无论我们多么谨慎,总有可能“判断错”。
统计学家把这种风险分成两类:
第一类错误(Type I Error):冤枉了无辜的假设。
第二类错误(Type II Error):放过了其实有问题的假设。
【一】 从法庭的判决说起
假设有一位被告。
-
原假设(H₀):被告无罪。
-
备择假设(H₁):被告有罪。
法官根据证据(数据)来判断是否拒绝H₀。如果他错判,就可能出现两种后果:
| 错误类型 | 现实比喻 | 统计定义 | 概率符号 |
|---|---|---|---|
| 第一类错误 | 冤枉无辜 | 错误地拒绝了H₀ | α |
| 第二类错误 | 放过坏人 | 错误地接受了H₀ | β |
法庭不希望冤枉无辜(控制α),但也不希望放过坏人(降低β)。
问题是:两者往往无法同时最小化。
【二】 显著性水平α:我们愿意承担的“冤枉风险”
在统计检验中,显著性水平α就是我们事先愿意接受的第一类错误概率。比如 α=0.05,意味着我们愿意有5%的概率“冤枉”一个原本正确的假设。
这是一种“风险声明”,而不是结果说明。换句话说,我们并不是说“p=0.05时犯了错”,而是在检验前就规定:“我们最多容忍5%的错判风险”。
α值越小,我们越谨慎,但也越可能错过真实效应。例如在医学研究中,α常取0.01甚至0.001;而在市场实验或社会调查中,通常取0.05即可。
【三】 检验功效(Power):第二类错误的“对立面”
如果第一类错误是“冤枉”,那第二类错误就是“放过”。当原假设实际上是错的,但我们没能拒绝它,就犯了第二类错误。这类错误的概率记作β。
相应地,1−β 就是检验功效(Power)——也就是“在假设确实不成立时,检验能识别出来的能力”。功效越高,说明检验越敏感,越不容易漏掉真实效应。
【四】 样本量与错误概率的平衡
控制错误不是靠祈祷,而是靠设计。影响α、β和功效(Power)的主要因素有:
1️⃣ 显著性水平α:设得越严格,越难拒绝H₀,β就越大。
2️⃣ 样本量n:样本越多,统计量分布越集中,功效就越高。
3️⃣ 效应量Effect Size:真实差异越大,越容易被检出。
你可以理解为一场“侦查游戏”:
-
降低α,就像“证据必须百分百充分”,可能放走真罪犯(β↑);
-
提高功效,就像“扩大侦查范围”,需要更多样本或更强信号。
📌 所以,显著性水平、样本量和功效之间必须平衡设计。
【五】 现实例子:药物实验中的风险取舍
新药审批是典型的假设检验过程:
- H₀:新药与旧药效果相同(无差异);
- H₁:新药优于旧药。
如果犯了第一类错误(α),就是批准了无效药;如果犯了第二类错误(β),就是拒绝了有效药。
监管机构通常(应当)选择“宁可放过,不可错判”,因此α取得非常低(例如0.01)。同时,为了不漏掉好药,他们会增加样本量,提高功效(1−β)。
【六】 小结:统计学的取舍之道
统计推断的本质,是在“不确定”中做“尽可能理性的决策”。
我们不可能让α和β都为零,只能在风险与资源之间找到平衡。
一句话总结:
α代表谨慎的底线,β代表敏感的代价。
科学判断的智慧,不在于绝对正确,而在于清楚自己可能错在哪。
📚【延伸阅读】
-
Neyman, J. & Pearson, E.S. (1933). On the Problem of the Most Efficient Tests of Statistical Hypotheses.
-
Cohen, J. (1988). Statistical Power Analysis for the Behavioral Sciences.
思考题:
如果样本量增加一倍,功效会怎样变化?是否总能减少错误?