统计学101:论统计学显著性:P=0.05的起源
作者:MICHAEL COWLES,CAROLINE DAVIS
来源:AMERICAN PSYCHOLOGIST
译者:Wittt
摘要:对早于费希尔《研究工作者统计方法》的统计学和概率论文献的考察表明,尽管费希尔是第一个正式阐述统计学显著性0.05标准的人,但这一概念的历史要久远得多。在判断假设是否由随机因素引起时,倾向于使用约定俗成的拒绝水平,这种做法始于世纪之交。早期关于统计学显著性的陈述是以概率误差的术语给出的。这些早期的惯例被费希尔采纳并重新阐述。
人们普遍认为,将5%作为确定统计学显著性的最大可接受概率的惯例,是由罗纳德·费希尔爵士(Sir Ronald Fisher)在其研究方差分析程序时,某种程度上武断地确立的。
费希尔在其1925年的著作《研究工作者统计方法》(Statistical Methods for Research Workers)中的陈述,似乎是首次明确提到将p=0.05作为统计学显著性的判定标准。
在判断一个偏差是否应被视为显著时,将此点作为一个界限是方便的。因此,超过标准差两倍的偏差在形式上被认为是显著的。(第47页)
科克伦(Cochran,1976)在评论费希尔一个稍晚但基本相似的陈述时说道:“学生们有时会问,‘5%的显著性水平或第一类错误是如何被用作标准的?’……我不确定,但这是我已知的关于选择5%的第一个评论”。
在1926年的文章中,费希尔承认可以使用其他水平:
如果二十分之一看起来不够高,我们可以,如果我们愿意的话,将界限划在五十分之一(2%)或一百分之一(1%)。就个人而言,作者倾向于将低显著性标准设定在5%点,并完全忽略所有未能达到此水平的结果。一个科学事实只有当设计得当的实验很少未能达到此显著性水平时,才应被视为通过实验确立。(第504页)
科克伦认为费希尔对这个选择相当随意,“正如’方便的’和’倾向于’这些词所表明的那样”。然而,上述引用的陈述清楚地表明,一旦费希尔决定了这个水平,他就将其接受为关键的截断点。
其他精通概率历史和发展的作者也持有该水平是武断的看法。尤尔和肯德尔(Yule and Kendall ,1950)在其著作的第14版中陈述:
在我们给出的例子中……我们关于P__值__是否小到足以证明我们怀疑存在显著差异的判断……或多或少是直觉的。大多数人会同意……0.0001的概率是如此之小,以至于证据非常支持……假设我们得到了P=0.1……我们在哪里(如果有的话)划线?影响决策的观察事件发生的几率在一定程度上取决于研究者的谨慎程度。有些人(不一定是统计学家)会认为十比一的几率就足够了。其他人会更保守,保留判断直到几率大得多。这是个个人品味问题。(第471_-_472页)
克拉默(Cramer,1955)在其教科书完全重写的版本中告诉读者:
一个t值……如果超过5%值但低于1%值,将被称为几乎显著……如果t值介于 1%和0.1%值之间,则称为显著,如果t超过0.1%值,则称为高度显著。这当然是一个纯粹的惯例性术语。(第202页)
需要考虑的问题是,选择5%值是否如通常暗示的那样武断和随意。然而,对概率和统计理论历史的考察表明,这个选择远非武断,并且受到了先前科学惯例的影响,这些惯例本身基于"偶然性"的概念和事件发生的不可能性。
起源
正如戴维(David,1962)如此清晰而优雅地描述的那样,对长期相对频率、随机性以及稀有事件仅仅是偶然发生的可能性的认识的初步萌芽,至少可以追溯到希腊数学家和罗马哲学家。然而后来,基督教的传播和罗马帝国的崩溃使教会成为学者们的唯一避风港。这种接受宇宙中每个事件,无论多么琐碎,都是由全能上帝引起的宗教哲学,没有为研究随机事件留下空间。这很可能是数学概率论的种子直到17世纪末在法国才播下的原因。机会一直存在:因为考古和文字记录都表明赌博一直是一种非常流行的消遣方式,非正式且相对不系统的计算"赔率"的"系统"无疑得到了发展。
安托万·贡博迪,梅雷骑士提出的与某些赌博问题相关的问题,引发了布莱兹·帕斯卡和皮埃尔·德·费马在1654年的通信。这里是组合代数和数学概率论的开端。
在稍晚的发展中,伦敦服饰商约翰·格朗特根据《死亡记录》编制了表格,这些是自17世纪初定期记录的教区记录,最重要的是,他使用这些表格进行了一系列统计、精算推断。
例如,格朗特能够向他的读者保证:
这种死因[精神错乱]如此不确定,我不会强迫自己从我们在__记录__中发现的数字和比例中做出任何推断:只是我敢向任何目前神智正常的人保证,千分之一的可能性,他不会在未来七年内死于贝德兰姆的精神病,因为我发现大约一千五百人中只有一人这样死去。
这是一个基于数值数据的陈述,其措辞与现代文献中的报告相去不远。
1657年,惠更斯(Huygens ,1657/1970)发表了一篇基于帕斯卡和费马交流的论文《论掷骰子游戏中的推理》(On Reasoning in Games of Dice),1713年雅克·伯努利(Jacques Bernoulli)的著作《推测的艺术》(The Art of Conjecture)发展了一套机会游戏的理论。棣莫弗(De Moivre)的《机会的学说》(The Doctrine of Chances)是赌博手册中最重要的;它于1718年、1738年和1756年出版了三个版本。在后来两个版本中,棣莫弗提出了一种他于1733年首次发表的方法,用于近似大量二项式项的和。可以肯定地说,没有其他理论数学抽象像该方法那样对心理学和社会科学产生如此重要的影响,因为它产生了现在通常以卡尔·皮尔逊(Karl Pearson)赋予它的名字命名的钟形曲线:正态分布(the normal distribution)。
误差频率定律(The law of frequency of errors)通常归功于拉普拉斯和高斯(Laplace (1749-1827) and Gauss (1777-1855))。两人都在赌博之外发展了该分布的应用,特别是证明了它在评估天文学和大地测量中测量和观察的可变结果方面的效用。随着这种分布被引入生物和社会科学领域,我们可以开始追溯导致p=0.05水平的路径。
正态分布
将用于评估观察误差或赌博期望值的计算扩展到人类特征方面的功劳,归于比利时天文学家兰伯特·阿道夫·凯特莱(Lambert Adolphe Quetelet)。
例如,凯特莱发现5,738名苏格兰士兵的胸围频率分布非常接近正态曲线。此外,他使用该曲线推断他所认为的非偶然事件。在研究100,000名法国军队应征者的身高分布时,他观察到落在服役最低身高标准处男性的计算频率和报告频率之间存在差异。“难道不能合理地推测……构成这些数字差异的……人是被欺诈性地拒绝了吗?"。
弗朗西斯·高尔顿爵士(Sir Francis Galton (1822-1911))热切地采用该曲线来组织他收集的人体测量数据,并引入了百分位数的概念。
所有熟悉统计学的人都知道,这一假设将变异性纳入了偶然性规律的范畴,其结果是,当以任何独立的变异性单位(例如我们的Q)来衡量这些偏差量时,不同偏差量的相对频率就可以计算出来。(Galton,1889,第54-55页)
Q是半四分位距的符号,定义为第75百分位数(第三四分位数)和第25百分位数(第一四分位数)之间分数差值的一半。这意味着在分数分布中,一半的偏差落在均值的±Q范围内,在正态分布中,均值位于第50百分位数(第二四分位数)。这种变异性的度量等同于概率误差(probable error)。
概率误差
正态分布横坐标的度量单位有多种形式。如今标准差是首选单位,但多年来概率误差曾被普遍使用,并且偶尔仍在物理科学中使用。从根本上说,概率误差定义了一个中心度量的偏差,在该度量的正负值之间,预计会有一半的个案因偶然性而落入。
该术语最早出现在19世纪初的德国数学天文学家中。虽然棣莫弗提到了概率误差(PE)所基于的概念,但贝塞尔在1818年首次使用了该术语(der wahrscheinliche Fehler)。随后高斯采用了该术语,并发展了几种计算概率误差的方法(Walker,1929)。概率误差最初与正态分布结合使用,用于从一系列存在误差的测量或观测中确定某一点真实位置的最佳值。
直到卡尔·皮尔逊才创造了标准差这个术语,但等效值的计算自棣莫弗以来就已存在。简单计算表明,PE等于0.674560,或者大约标准差的2/3。
凯特莱和高尔顿显然习惯于将正态分布中的值表示为PE的函数,并且可以合理地假设他们的偏好是在后续统计实践中使用它的主要影响。顺便应该指出,高尔顿反对概率误差这个名称,称其为"一个笨拙、马虎且误导性的短语”。
概率误差,很明显,并非所有误差中最可能发生的,并且在描述人类特征变异时使用误差一词,可能将与测量误差分布的类比推得有点过远。
统计检验
1893年,皮尔逊开始研究将观察到的分布拟合到理论曲线的一般问题。这项工作最终导致了1900年"拟合优度"的χ2检验的制定,这是统计学史上最重要的发展之一。
生物计量学派的联合创始人韦尔登(Weldon)以更经验的方式处理理论与观察之间的差异问题,他投掷硬币和骰子,并将结果与二项式模型(binomial model)进行比较。
在1894年写给高尔顿的一封信中,韦尔登请求对由伦敦大学学院一名职员为他收集的12个骰子的约7,000 次投掷结果发表评论。
一两天前,皮尔逊急需一些此类记录用于讲座说明,我给了他那名职员的7,000 次投掷记录……经检查,他拒绝了它们,因为他认为与理论上最可能结果的偏差太大,以至于使该记录本质上不可信。(E. S. Pearson, 1965/1970, p. 331)
这一事件引发了生物计量学家之间的大量通信和讨论。这些交流包含各种关于赔率和概率的提及,超出这些值人们就准备断言结果不太可能是偶然的。当然,似乎已经达成共识,即我们现在所称的alpha水平(the alpha level)应该具有相对较低的值。
但只有随着χ2检验的发表,我们才能找到具体标准的迹象,这是第一个使我们能够确定分布中预期频率和测量频率之间差异发生概率的检验。在这里,我们看到了标准拒绝水平的开端。
皮尔逊并未选择一个特定值作为拒绝点。然而,从检查所呈现的各种χ2计算例子及其相应的概率值来看,可以看出可能被描述为直觉和统计拒绝混合发生范围。以下是皮尔逊论文中的评论:
p=0.5586(“我们可以认为拟合非常好”);p=0.28(“相当好地代表”);p=0.1(“观察到的频率与随机抽样相容并非非常不可能”);p=0.01(“这个非常不可能的结果”)。
从皮尔逊的评论来看,他似乎开始对0.1水平的拟合优度产生了一些怀疑;然而,他显然确信在0.01水平下拟合是不可能的。两者的中点当然是0.05水平。
威廉·戈塞特(William Gosset,他以“学生”的笔名写作)于1899年开始在都柏林的吉尼斯啤酒厂工作。科学方法刚刚开始应用于酿造行业。戈塞特的任务之一是监督本质上是质量控制的实验。使用小样本的必要性意味着他的结果充其量只是从正态曲线导出的概率值的近似值。因此,他工作的情况促使戈塞特制定了称为t分布的小样本分布。
关于显著性水平的确定,戈塞特在其发表t检验推导的文章中陈述,“在正态曲线中,三倍概率误差,对于大多数目的,将被认为是显著的”。
几年后,另一篇重要的文章在一名农学家和一名天文学家的合著下发表。这篇论文本质上是为在解释实验结果时使用概率提供指导。这些作者赞同使用PE作为度量:“天文学家……设计了一种估计其平均值准确性的方法……农学家最好效仿他的例子”。他们建议"将30比1作为可接受的最低概率,以实际确定差异是显著的"。这样的概率应用于正态概率曲线对应于与均值的3.2PE差异。
具体是什么决定了采用这一惯例,很大程度上是推测。也许是早期统计学家如高尔顿偏好使用PE作为度量,以及皮尔逊及其关于特定结果不可能性的陈述的影响共同作用的结果。无论如何,很明显,早在1908年,X±3PE就被接受为拒绝由偶然波动引起的差异的有用经验法则。
当然,到费希尔17年后出版他的第一本关于统计方法的书时,3PE已经是多种使用统计检验作为实验工具的科学中确定统计学显著性的常用惯例。例如,《英国心理学杂志》1925年卷的一篇文章报告说,所有计算出的相关性的几率"大于PE的3倍"。(Flugel, 1925)
麦高希(McGaughy (1924))使用术语临界比(critical ratio)表达X/3PE,其中X代表差值。他说,这是“对于获得的平均值之间的差异 的不容置疑的显著性的公认标准”,并引用了Jones(1921)。
考察了费希尔1925年发表论文之前的事件,并回顾了他的讨论背景,对他首次提及p= 0.05的思考清楚地表明,他所提出的观点并没有什么惊人或新颖之处,也并非任意的。
对于阅读他著作的大多数人来说,一个事实并不令人惊讶(事实上,费希尔也指出了这一点),那就是“三倍于可能误差的偏差实际上相当于两倍于标准误差的偏差”(Fisher, 1925,pp. 1)。47-48)。
因此,不能说费希尔确立了显著性水平的值。他或许可以归功于开启了一种趋势,即用分布自身的标准差而非其概率误差来表示该值。费希尔显然确信使用标准差(SD)的优势,正如他所说:“通常使用概率误差是它唯一的建议”(第48页)。
费希尔提供了一个“概率积分表”,从中可以计算出对于任何值(用其标准差的函数表示),有多少比例的总人口的偏差更大。因此,在进行任何关键检验时,使用此表就必须用标准差来表示值的偏差。
严格来说,传统的拒绝水平3PE相当于两倍的标准差(用现代术语来说,就是z分数为2),换算成百分比约为4.56%。但我们可以推测,费希尔为了便于解释,只是将这个值四舍五入到了5%。此外,随着统计分析的应用扩展到社会科学领域,人们倾向于用概率值而非z分数来报告实验结果,这为那些统计理论基础不深的人提供了更广泛的理解基础。换句话说,对于非专业人士而言,比起“某个结果的z分数约为2”,更容易理解“偶然获得某个结果的概率小于5%”这种说法。
主观概率
5%显著性水平如何被采纳为标准已经考虑过了。然而,为什么这个水平对早期统计学家来说似乎是合适的,或者为什么它在统计分析中持续流行了这么长时间,必须更多地从概率概念的角度来探讨,而不是历史角度。
该术语的定义通常基于对概率论形式数学理论的阐述。这可能反映了将日常生活中的现实事件与逻辑哲学联系起来的必要性。从这个意义上讲,概率是一种客观的实践,它运用基于排列和频率数学理论的数值计算来进行估计和预测。
常常难以精确定义的是这样一个概念:从根本上说,概率指的是个人的主观认知,通过这种认知,他们对过去经验的知识有助于形成一个期望系统,用以面对未来事件。这被称为主观概率(Subjective Probability),以将此概念与其更形式的数学对应物区分开来。
阿尔贝罗尼(Alberoni,1962a,1962b)对主观概率运作背后的认知过程进行了概念化。当人们无法找到原因或规律来解释现实世界中的某些差异或变化时,他们便会想到偶然性。反过来,这又会形成他们对未来事件的预期。然而,如果事件在某个时刻开始与他们已形成的预期相矛盾,他们就会引入原因,并放弃偶然性的概念。这种放弃偶然性的时刻很大程度上取决于差异的程度以及每个人如何解读这种差异。阿尔贝罗尼将这一点称为“放弃偶然性概念的临界点”。
剩下的根本问题其实很简单:人们,包括科学家和非科学家,是否普遍认为发生概率低于5%的事件属于罕见事件?他们是否愿意将这种罕见事件的发生归因于偶然性之外的其他原因?
如果这两个问题的答案都是“是”,或者至少是“一般来说,是”,那么将这一水平作为判断结果的标准就是合理的。
毫无疑问,“摒弃偶然性观念的阈值”取决于一系列复杂的因素,而这些因素因人而异。然而,作为一种正式的表述,这一水平的历史比人们通常认为的要长。