假设检验之后:显著性水平为什么几乎都设为 0.05?你真正需要搞懂的问题

统计

在绝大多数论文、教材和统计分析软件中,我们都能看到一句熟悉的话:“显著性水平通常取0.05。”

许多学生和读者因此会问:

为什么偏偏是0.05?它是怎么算出来的吗?为什么不能是0.04或0.06?

要理解这个问题,必须回到显著性水平的含义本身。

【一】 什么是显著性水平?

显著性水平(α)本质上是一个容错上限——在原假设实际为真的情况下,我们错误拒绝它的最大风险概率。

当我们设定α=0.05时,意味着愿意接受“最多5%的概率冤枉原假设”。

举个例子,如果你研究某项政策是否提升了居民收入,而样本数据看起来“似乎有效”,显著性水平告诉你:你愿意承担5%的风险,把一个实际上无效的政策误判为有效。

因此,显著性水平并不是某个“自然常数”,而是一种研究者的风险偏好设定。

【二】  “0.05”并不是数学推导出来的

那么,0.05又是从哪里来的呢?

它并不是精确推导的结果,而是统计学家R. A. Fisher 在1925年提出的一种经验性建议。在他的著作_Statistical Methods for Research Workers_ 中,Fisher 认为:

如果某个结果在原假设下出现的概率小于5%,就可以认为“不太可能是偶然”,从而拒绝原假设。

换句话说,0.05是人为划出的“罕见事件”分界线:

  • 大于5% —— 常见
  • 小于5% —— 足够反常,可以引起怀疑

这一标准后来被各学科广泛采用,逐渐演化成国际惯例。就像“37℃算发烧”,更多是一种约定,而非天然规律。

【三】为什么不是0.04或0.06?

因为显著性水平本质上是一个人为设定的阈值,并不存在“0.05最科学”的结论。它只是最先被提出、也最容易被不同领域接受,因此形成了惯例。

理解0.05的统计逻辑比数字本身更关键。例如,当你得到p=0.03时,这表示:

在原假设为真的情况下,出现这样(或更极端)样本结果的概率仅为3%。

这就是常用的拒绝依据。但要注意:

这并不代表原假设一定错误,只是“样本证据足够少见”,足以产生怀疑。

另外,不同行业使用不同的显著性水平:

  • 医学、生命科学: 常用0.01或更严格,因为误判代价极高
  • 探索性研究、小样本研究: 可能用0.1
  • 社会科学: 通常使用0.05,兼顾判断严格性与实际可操作性

如果你研究“性别是否影响幸福感”,使用0.1也能接受;但研究“某药物是否有严重副作用”,就必须降低显著性水平。

显著性水平本质上是一种决策规则:你愿意承担多大误判风险,就设定多大的阈值。

【四】现代统计学界的态度:不要过度迷信0.05

值得一提的是,过去十几年,统计学界对“0.05统治一切”的做法出现了反思。Nature甚至发表文章Retire statistical significance,呼吁不要把0.05当作“生死线”,因为现实问题往往比一个阈值更复杂。

更科学的做法,是同时结合:

  • 效应量(effect size)
  • 置信区间
  • 理论预期
  • 样本量
  • 背景场景与误判成本

例如,一个政策的影响如果效应量很大,即便p值是0.06,也并不意味着“没有意义”;反之,一个p值0.001的结果,如果效应量几乎为零,也可能毫无实际意义。

这种误差在回归分析中尤为常见,因此理解显著性水平,对于读懂回归结果至关重要。

【五】为什么我们要单独学习显著性水平

因为在接下来的内容——相关性分析、回归分析、模型检验中,你会不断面对:

  • t 值
  • p 值
  • 显著性星号(*)
  • 模型整体显著性(F 检验)

如果不知道显著性水平的逻辑,就无法真正理解“显著”意味着什么,也无法判断统计显著与实际意义之间的差异。

在某种意义上,显著性水平就像“阅读说明书”:掌握了它,才能读懂后续所有的统计模型输出。

图片

✦ 小结:0.05的真正含义是什么?

当 p<0.05时,表示:

如果原假设是真的,这样极端的样本结果出现的概率小于5%。

因此我们倾向于认为:

“这样的结果太不寻常,原假设可能不成立。”

这就是拒绝原假设的逻辑起点。