从《文学文摘》到杜鲁门大逆转:抽样方法的故事

统计

在统计学课堂上,有一个流传已久的故事:它让人明白 “大样本不一定是好样本”,也揭示了抽样方法演进的曲折历程。

【一】大样本输给小样本:1936 年的总统预测风波

1936 年,美国即将迎来总统大选。媒体最受瞩目的预测来自一本叫 《文学文摘》(Literary Digest) 的杂志。它有过辉煌战绩,连续五次大选预测正确,被认为是“最准的选举预言家”。

这一次,他们信心满满——向超过1000万人寄出了调查问卷,收回了240多万份。按照这些“海量样本”的结果,他们断言:共和党人兰登将大胜,罗斯福总统将黯然下台。

然而,最终罗斯福却以压倒性优势连任。为什么?因为他们的样本框来自电话簿、汽车登记和杂志订阅者——这些人多数是中上层,天然偏向共和党。

结局:240 万份“坏样本”带来了史上最著名的预测翻车。

【二】盖洛普的小样本奇迹

就在同一年,年轻的 乔治·盖洛普(George Gallup) 用区区几千份样本预测了罗斯福的胜利,而且结果和真实情况几乎一致。

这个年轻人,就是后来被称为“民调之父”的 乔治·盖洛普(George Gallup)。

盖洛普没有依赖庞大的地址簿或电话簿,而是采用了一种**配额抽样(quota sampling)**的方法。

他先研究了美国人口的结构:男女比例、城市与农村、收入与职业分布……然后规定调查员必须按这些比例去找受访者,确保样本结构与总体一致。

结果,哪怕只有几千份样本,他的预测却和真实结果几乎一致。相比之下,《文学文摘》的“大数据”却栽了大跟头。为什么?因为在1930年代,拥有汽车和电话的人往往更富裕,而这些人恰恰偏向支持共和党,导致预测严重偏差。

这一战,让人们第一次意识到:

👉 样本的代表性,比样本数量更重要。

图片

上图为富兰克林·德拉诺·罗斯福(Franklin D. Roosevelt,FDR),1936年连任,美国第32任总统,1933–1945连任四届。

【三】Neyman 的理论推动

1934年,统计学家 耶日·内曼(Jerzy Neyman) 已经提出了概率抽样的理论框架。他强调:只有通过随机化,才能真正保证样本代表性,并能够计算抽样误差。

这为后来概率抽样成为主流,奠定了坚实的数学基础。

图片

上图是耶日·内曼(Jerzy Neyman),统计学家,提出概率抽样理论,奠定了现代抽样调查的数学基础。

【四】1948 年:配额抽样的失手

1948 年大选,美国几乎所有民调机构(包括盖洛普公司)都预测共和党人杜威将击败现任总统杜鲁门。甚至有报纸提前印出头版:“Dewey Defeats Truman”。

然而,最终是杜鲁门大逆转胜出。

原因在于配额抽样依然存在偏差:调查员在完成配额时倾向选择“容易找到的人”,样本中工人和农民的声音被低估。

这一次,配额抽样输给了现实。

图片

上图是很多《统计学》教材中的经典照片:杜鲁门手举《芝加哥论坛报》头版,标题误称“杜威击败杜鲁门”。

【五】 概率抽样的胜利

1948 年之后,民调和社会调查逐渐全面采用概率抽样。

美国国家选举调查(ANES)等项目成为概率抽样的典范,社会科学研究也进入了“可量化、可推断”的新阶段。

盖洛普本人不得不调整方法,但他的名字已经深深刻在民意调查史中。

【六】 盖洛普公司的延续

值得一提的是,盖洛普公司(Gallup Inc.)一直延续至今。

从最初的政治预测,到今天的全球民意调查、幸福指数、企业咨询,盖洛普早已成为一个国际知名品牌。

虽然方法论上它早已拥抱概率抽样甚至新型大数据方法,但“Gallup”这个名字仍然象征着民意调查的历史与专业性。

图片

上图为乔治·盖洛普(George Gallup),美国民意调查先驱,1936 年用配额抽样成功预测罗斯福连任。


✨ 小结

  • 1936 年:大样本便利抽样失败,配额抽样崛起。
  • 1940s:Neyman 的概率抽样理论铺平道路。
  • 1948 年:配额抽样失误,概率抽样登上舞台。

👉 这段故事告诉我们:

  • 样本数量再大,如果来源有偏,也无法保证准确。
  • 科学的抽样方法,才是统计推断的基石。