相关性分析(8):相关分析的样本量到底要多少?

统计

相关分析的样本量到底要多少?什么同一个 r 在不同数据里显著性不同?

在做论文或数据分析时,你一定见过这种情况:

明明两个变量的相关系数r=0.25,在A的论文里显著,在B的论文里却完全不显著,到底为什么? 相关分析到底需要多少样本才够?

其实背后的答案非常简单:

相关系数 r 的稳定性、显著性、解释力,都高度依赖样本量(n)。
n 决定了 r 是否可信。

这一篇,我们用直觉、数学、案例和权威文献,讲清楚“样本量与相关分析”的关系。

本篇是相关分析系列的最后一讲。

【一】为什么相关分析需要足够大的样本?

相关系数是从样本计算出来的,而样本越小,它就越会“抖动”(波动)。

你可以想象:

  • 抽 10 人测“学习时间与成绩”,你算出的 r 可能是+0.8、-0.2、+0.1……完全随机。
  • 抽 200 人再测一次,r 就会趋近真实值(如 0.45)。

这是统计学的基本规律:

样本越少,r 越不稳定;样本越多,r 越接近真实。

📌 你可以把样本量想象成“望远镜的清晰度”:

样本越多,看到的关系越清晰;样本越少,看到的关系越模糊。

【二】数学解释:相关系数的稳定性与样本量成反比

皮尔逊相关的稳定性来自 Fisher Z 转换,其标准误差为:

图片

当我们代入常见样本量时:

样本量 n 相关系数标准误(SE) 稳定性
20 0.24 极差,完全不稳
50 0.15 仍不稳
100 0.10 开始可用
250 0.06 稳定
1000 0.03 非常稳定

你会发现:

相关分析并不是“只计算r就行了”,而是“样本量决定你能不能正确估计r”。

这就是为什么很多学生论文跑不出显著性,根本原因不是模型不好,而是——样本太小。

【三】显著性(p 值)为什么也受样本量影响?

皮尔逊相关的显著性检验,公式是这样的:

图片

你会注意到,t 统计量的值和 n 的关系非常密切:

📌 n 在分子中 → 样本量越大 → t 值越大 → p 值更容易显著

这导致两个常见现象:

(1)小样本:r = 0.30 也可能不显著

例如 n=20 时:

  • r = 0.30
    → p 可能大于 0.1
    → “不显著”

(2)大样本:r = 0.05 居然也可能显著

例如 n=1000 时:

  • r = 0.05
    → p < 0.05
    → “显著”

但显著不代表关系强,因为 r 只有 0.05。

所以:

显著 ≠ 强相关
不显著 ≠ 没关系
p 值反映的是样本量,不是相关性的本质。

【四】那到底需要多少样本?

以下的数据来自非常严谨的统计学与实证研究结论:

(1)课程论文:n ≥ 30

来源:中心极限定理
用途:展示概念
缺点:r 完全不稳,只建议用于课堂演示。

(2)本科毕业论文:n ≥ 100–300

依据:

  • Cohen(1988):中等效应(r ≈ 0.30)需 n≈85–100
  • Schönbrodt & Perugini(2013):r 在 n≈250 左右才真正“稳定”

所以最稳妥建议:

✔ n=100–150:可以
✔ n=150–300:最好
❌ n<80:不建议做相关 + 回归

这也是很多老师平时要求学生“最至少 150–200 样本”的原因。

(3)学术论文:n ≥ 300–500

理由:

  • 相关系数的 SE 降到 0.06
  • 控制变量多时更稳定
  • 回归结果更可靠

适用于:经济学、管理学、心理学等领域。

(4)机器学习与行为数据:n ≥ 1000–3000

真实效应通常很弱(r≈0.05–0.10),只有大样本才能准确识别。

典型场景:

  • 广告点击(如 E13-2 案例)
  • 电商行为
  • 用户留存、用户路径分析

(5)互联网数据:n ≥ 10,000–100,000

长尾效应显著,需要海量样本才能减少噪声。

【五】同一个r,在不同样本量下表现完全不同

假设真实相关 r = 0.30,我们用模拟看一下:

样本量 n 模拟得到的 r 区间
20 -0.1 ~ +0.7(波动非常大)
50 0.1 ~ 0.5(波动仍大)
100 0.2 ~ 0.4(开始稳定)
250 0.28 ~ 0.32(非常稳定)
1000 0.29 ~ 0.31(几乎不变)

一句话总结:

小样本,r 完全靠运气;
大样本,r 才是科学。

当然,在很多流行的《统计学》教材中,我们通常使用20~30个样本的小数据集,是为了便于展示计算步骤与讲解方法本身,而不是为了做真正的统计推断。小样本能够让学生清楚看到每一个数据点、手算协方差、绘制散点图、理解 r 的定义逻辑;但在实际研究中,相关系数的稳定性和显著性都高度依赖样本量,真正的实证分析往往需要 100、300,甚至上千的样本。换句话说:教材的小样本例子是教学工具,而科研中的大样本才是推断依据。

【六】一句话总结

✔ n < 30:别做相关分析
✔ n = 100–300:毕业论文最佳区间
✔ n ≥ 300:结果显著稳定
✔ n ≥ 1000:适合行为数据
✔ n ≥ 10,000:互联网数据基本配置

r 是否显著,不取决于 r,而取决于 n。 样本越多,相关越稳;样本越少,相关越靠运气。