方差分析第3讲:为什么“事后检验”这么容易被误用?
在完成方差分析之后,很多人都会顺着问一句:
那接下来是不是要做事后检验了?
在不少作业、论文甚至已发表的研究中,这几乎已经成了一条默认路径:
方差分析显著 → 事后检验 → 报告哪几组不同。
问题恰恰出在这种“顺理成章”上。在实际研究中,事后检验并不是用得不够,而是用得太随意。
01 事后检验,本来就不是“必选步骤”
事后检验的前提其实非常明确:只有当整体检验显示各组之间确实存在系统性差异时,进一步比较才有意义。
这里所说的“整体检验”,指的是方差分析中对所有组别进行的一次总体判断。它并不关心哪一组与哪一组不同,而只回答一个更基础的问题:这些组,是否有必要被区分来看。
但在不少分析中,这一步常常被简化为一种形式流程。不论整体检验是否稳健、不论研究问题是否真的关心“组与组之间的差异”,事后检验都会被照例跑一遍。结果是,分析看起来更“完整”了,但判断反而变得零散。
事后检验的初衷,并不是把所有组两两比较一遍,而是在控制误判风险的前提下,定位差异可能出现的位置。
02 真正让人犯错的,不是“不会用”,而是不知道在权衡什么
事后检验之所以容易被误用,一个重要原因在于:不同事后检验方法,其实在权衡不同类型的风险,但这一点往往被忽略了。
当我们进行多组比较时,比起单次检验,更容易出现“碰巧显著”的情况。所谓“多重比较风险”,本质上是指:比较次数越多,即便各组之间并不存在真实差异,也越容易在统计上偶然得到显著结果。
正因如此,事后检验方法并不是简单地在“找差异”,而是在做取舍:一方面,要尽量避免误把随机波动当成真实差异;另一方面,又不能因为过度谨慎,把本来存在的差异一并忽略掉。
理解这一点,是理解事后检验的关键。
03几种常见事后检验方法,各自侧重的判断取向
实际应用中,几类常见的事后检验方法,各自有着不同的侧重点。
像 Tukey(或 Tukey-Kramer) 这类方法,目标是在多组比较中维持整体错误率的同时,尽量保留检验力。它更适合用于组数不多、样本量相对均衡的情形,因此在教学和实务中被广泛采用。
Bonferroni 及其一系列修正方法,逻辑则非常直接:比较次数越多,每一次判断就越谨慎。它的优势在于不容易误报差异,但代价也很明显——在样本量有限时,模型在发现真实差异方面会变得更迟钝。这里所说的“检验力下降”,并不是方法变得更准确了,而是模型在识别真实差异时,变得不那么敏感了。
相比之下,Fisher 的 LSD 方法几乎不对多重比较带来的风险进行控制。在组数较多的情形下,它很容易制造出“看起来哪一组都不同”的结果,因此在规范研究中需要格外谨慎。
还有一些方法,例如 Scheffé 或 Games–Howell,更强调在样本量不均或方差不齐条件下的稳健性。它们并不是“更高级”,而是针对更苛刻的数据条件而设计,相应地也会牺牲一部分检验力。
这些方法之间,并不存在简单的优劣之分。它们真正的区别,在于各自更侧重避免哪一种错误。
图1 SPSS单因素方差分析中的事后检验选项界面
在不同应用领域中,这种“错误偏好”的差异,也逐渐体现为事后检验方法的使用习惯。例如,在医学和临床研究中,由于假阳性可能带来较高的实际成本,研究者往往更倾向于采用较为保守的多重比较方法;而在教育、心理学或社会科学研究中,当研究目的更偏向探索性时,则更常见使用在控制整体错误率的同时,尽量保留检验力的方法。这种差异并非源于统计理论的分歧,而是不同研究领域在风险容忍度上的侧重不同。
04为什么“越保守”,并不一定越合理?
在教学和投稿实践中,一个常见倾向是:越保守的方法,看起来越“稳妥”。
但问题在于,过度保守并不自动等于科学。当研究设计本身已经受到样本量、数据质量等条件限制时,再叠加极端谨慎的修正方法,很容易把原本就微弱的信号彻底淹没。
结果往往是,“没有显著差异”被当作一种安全结论,但这种安全,有时只是方法选择带来的假象。事后检验真正要避免的,不只是误报差异,也包括在不合适的条件下,把差异一概否定。
05对审稿人来说,关键往往不在“用了哪一种”
在当前发表的研究中,方差分析并没有消失,但它出现的位置正在发生变化。相比过去将 ANOVA 作为主要实证工具,越来越多的论文将其作为一种结构性比较或探索性分析手段,用来检验分组是否具有整体差异,而将更复杂的因果分析和控制问题交由回归或混合模型来完成。审稿人真正关心的,并不是方法是否“经典”,而是分析是否与研究问题的复杂程度相匹配。
从审稿人的角度看,问题通常不在于你选了 Tukey 还是 Bonferroni,而在于你是否说明了:在当前研究条件下,为什么这种方法选择是合理的。
如果事后检验只是作为一个默认步骤出现,而方法选择背后缺乏判断说明,那么结果即便形式规范,也很难让人信服。不少论文被质疑,并不是因为方法“用错了”,而是因为作者没有交代清楚自己的判断逻辑。
写在最后
事后检验并不是方差分析的“自动续集”,更不是一套可以随手套用的固定流程。它真正考验的,并不是操作熟练度,而是研究者是否意识到:每一次比较,都是在不同类型错误之间做选择。
理解了这一点,事后检验才会回到它应有的位置——作为一种谨慎的、条件性的判断工具。