「假设检验八讲」第2讲:p值到底是什么?——从“显著”到“有多显著”
每次讲到假设检验,总有人问:“我知道p值要小于0.05才显著,可p值到底是啥?”
其实,p值不是魔法数字,而是告诉你:
“在原假设成立的前提下,样本结果出现的概率有多小。”
【一】 先从一个生活例子开始
假设你投硬币100次,结果出现了70次正面。
我们自然会怀疑:这枚硬币是不是偏了?
统计学的做法是:
(1) 假设总体公平(原假设 H₀):正反面各50%。
(2) 计算观察结果的概率:在公平硬币条件下,出现70次正面的概率有多大?
(3) 如果这个概率(p值)非常小,比如不到5%,我们就说“太不寻常了”,有理由怀疑硬币不公平。
这,就是p值的直觉。
【二】 p值的定义:以概率衡量“反常程度”
正式一点地说:
p值是指在原假设成立的情况下,样本结果或更极端结果出现的概率。
这句话的重点有两个:
(1)它是基于原假设为真的前提。
(2)它反映了数据“有多反常”。
所以,p值小并不是在告诉你“假设为假的概率”,而是:
“如果假设是真的,出现这种结果的可能性太低了。”
【三】 p值小≠假设错误,大≠假设正确
很多初学者误解p值:
p值小 → 假设错了;p值大 → 假设对了。
其实都不对。
p值只是告诉我们数据是否反常,而不是假设真假。比如:
(1)p=0.04,说明数据和假设不太吻合,可以拒绝原假设;
(2)p=0.40,说明数据没那么反常,暂时没必要拒绝假设,但并不代表它就是真的。
p值是“证据强度”的指标,而不是“真伪判定”的按钮。
【四】 为什么0.05这么重要?
这个数字最早是费希尔(R.A. Fisher)在1925年随手设定的一个“经验界限”。他认为:
“如果某结果在原假设成立时仅有5%的概率发生,那就足够稀有,可以引起重视。”
后来,这个约定被广泛沿用,成了统计学界的“传统阈值”。
不过,在科研中我们也常看到更严格的标准:
(1)0.01 → 很显著,例如在药物实验中,新药的疗效明显优于旧药,出现这种结果的随机概率不到1%。
(2)0.001 → 极显著,比如在大样本社会调查中,教育水平与收入的正相关几乎不可能是偶然现象。
【五】 从“显著”到“有多显著”
显著性检验只是告诉我们“差异是否存在”;而p值更进一步,告诉我们“差异有多强烈”。
举个例子:
p=0.04 → 勉强显著,像法官“略带犹豫”地判决。
p=0.001 → 强烈证据,几乎没有偶然的可能。
但不要忘记:
统计显著 ≠ 实际重要。
哪怕差异再显著,如果影响幅度很小,也可能没有现实意义(这个问题,后续还会讲解)。
【六】 小结
p值的核心含义可以用一句话记住:
“在原假设为真时,样本结果出现的概率。”
它衡量的不是假设真假,而是数据与假设的“距离”。
理解p值,就是理解统计推断的“怀疑精神”——我们并不宣称真理,只是在判断事件“有多不寻常”。
📚【延伸阅读】
Fisher, R.A. (1925). Statistical Methods for Research Workers.
思考题:
如果p=0.049和p=0.051,结果真的有本质差别吗?