不同学科如何理解“样本量”?

统计

在上一篇文章中,我们讨论了一个看似反直觉、但对统计学至关重要的结论:

统计学里,并不存在“绝对正确的样本量”。

但紧接着,一个更现实的问题往往会出现:

既然没有统一标准,为什么在不同学科中,人们却“默认”接受着截然不同规模的样本量?

心理学实验里,几十个样本就可以发表;社会科学研究中,几百上千似乎才算“安心”;而在生物医学领域,甚至出现了样本很小、维度却极高的反直觉情形。

这些差异,并不是统计学在不同学科中“变了规则”,而是研究对象、研究目标以及所能接受的风险结构,本身就不一样。

01不同学科,为什么会“接受”不同规模的样本量?

一个常被忽略、但非常关键的事实是:

样本量的“合理区间”,往往并不是由统计学公式直接决定的,而是由研究对象的噪声结构和研究成本共同塑造出来的。

以几个常见学科为例,这种差异其实非常直观。

  1. 在实验条件相对可控的领域(如部分心理学实验、生物实验),研究对象的波动通常较小,干预条件明确,而单次实验的成本往往较高。在这种情况下,几十到上百个样本,在很多研究中是被广泛接受的。

例如,在经典的心理学实验中,研究者通过严格的实验设计控制刺激条件、随机分组和测量误差,此时单纯增加样本量的边际收益并不总是很高,反而是实验设计本身的严谨性更为关键。

  1. 而在社会科学领域(如经济学、社会学、公共政策研究),研究对象往往来自现实世界,个体差异大、环境因素复杂、噪声水平高,而且效应本身常常并不强。在这种背景下,如果样本量过小,结论极易受到偶然因素影响。因此,样本量通常需要达到几百、几千,甚至更高,结论才可能具有一定稳定性。

例如,在研究“教育年限对收入的影响”这类问题时,个体能力、家庭背景和地区差异都会引入显著噪声,少量样本往往难以支撑稳健判断。

这一点在规范的实证研究中其实非常直观。我们看一篇发表于《经济研究》的微观实证论文,作者基于大规模微观数据,围绕个体特征与相关经济行为展开分析。尽管整体样本规模处于较大数量级,但在不同回归设定和分组分析中,回归表所对应的观测值并不完全一致(见下表)。

这并不是因为研究者“随意更换样本”,而是由于不同模型中引入的控制变量、样本筛选条件以及可用信息存在差异。一旦进一步区分群体特征、控制更多背景变量或引入机制分析,可用样本往往会自然发生变化。

这一现象恰恰说明,在噪声较大、异质性显著的现实问题中,样本量并不是一个固定数字,而是随着研究问题和模型设定动态变化的结果。也正因为如此,少量样本往往难以支撑稳健判断,而大样本本身也并不意味着分析过程是“简单”的。

图片

(“教育经费配置、流入地义务教育供给与儿童随迁 ——基于城市义务教育经费保障机制改革的研究”,《经济研究》2025年第9期)

  1. 在工程统计与质量控制领域,研究重点并不是解释复杂的因果关系,而是监控生产过程是否发生偏移、是否出现异常。在这种情形下,只要过程本身足够稳定,样本量反而可以很小,关键不在于“多”,而在于连续性和及时性。

例如,在统计过程控制(SPC)中,控制图往往只依赖每个时间点极少量观测,但通过持续监控,反而能够及时发现异常。

这些差异并不是“统计学标准不同”,而是一个更基本的事实在起作用:

研究对象的稳定性和噪声水平,决定了样本量的实践下限。

02学科中的“经验样本量”是怎么形成的?

需要特别强调的是,这些在不同学科中被反复提及的“经验样本量”,并不是统计理论给出的硬性要求,而是各个学科在长期实践和反复试错中逐渐形成的一种风险共识。

它们背后的隐含逻辑通常是:

  • 在这个样本规模以下,结论往往高度不稳定;

  • 在这个规模附近,结论开始具备一定可重复性;

  • 继续扩大样本,边际收益逐渐下降。

因此,这些经验值更像是在回答这样一个问题:

在当前研究范式下,大家普遍还能接受多大的不确定性?

而不是在划定一条“低于这个数就不合格,高于这个数就一定可靠”的硬性分界线。

03生物医学中的一个“极端情形”:当样本量与维度不再同向增长

如果说前面对心理学、社会科学和工程统计的讨论,大致仍符合多数人的直觉,那么生物医学领域中的大量研究,往往会让初学者产生困惑。

在基因表达、蛋白质组学、代谢组学等研究中,一个非常常见的情形是:

样本量 n 只有几十,但变量维度 p 却动辄上万。

从传统统计的视角看,这几乎是一个“不可接受”的设定。但这类研究不仅长期存在,而且已经形成了一整套相对成熟的方法体系。

关键原因并不在于统计学标准被“放宽”了,而在于研究目标本身发生了变化。

在这类高维小样本研究中,研究者通常并不试图稳定估计每一个变量的回归系数,也很少围绕单个参数是否显著展开讨论。分析关注的重点,往往转向能否区分不同状态或人群、哪些变量具有潜在的判别信息,以及模型在交叉验证或独立样本中的表现是否稳定。

也正因为如此,统计分析的核心随之发生转移。与传统低维模型相比,高维研究更强调预测与筛选能力,而不是精确的参数估计;更依赖交叉验证和外部验证,而不是单次显著性检验;判断模型是否可靠的依据,也从“样本量是否超过某个固定阈值”,转向“验证是否充分、结果是否可重复”。

在这样的分析框架下,“样本量是否足够大”这个问题本身,并没有消失,但它已经不再是一个单独决定可靠性的变量。样本量需要与正则化和变量选择策略、降维方法、验证设计,以及研究目标本身(是探索、筛选还是预测)一起被理解。

因此,小样本不会自动否定一项生物医学研究,但几乎必然要求更严格、更透明的验证策略,以弥补样本规模带来的不确定性。

写在最后

从不同学科的实践经验来看:

样本量不是一个跨学科统一的尺度,而是由研究对象、研究目标和方法体系共同决定的。

统计学不是告诉你“多少才算对”,而是告诉你:风险在哪里。

讨论样本量,本质上不是在找一个数字答案,而是在理解不确定性。