相关性分析(8):相关分析的样本量到底要多少?
相关分析的样本量到底要多少?什么同一个 r 在不同数据里显著性不同?
在做论文或数据分析时,你一定见过这种情况:
明明两个变量的相关系数r=0.25,在A的论文里显著,在B的论文里却完全不显著,到底为什么? 相关分析到底需要多少样本才够?
其实背后的答案非常简单:
相关系数 r 的稳定性、显著性、解释力,都高度依赖样本量(n)。
n 决定了 r 是否可信。
这一篇,我们用直觉、数学、案例和权威文献,讲清楚“样本量与相关分析”的关系。
本篇是相关分析系列的最后一讲。
【一】为什么相关分析需要足够大的样本?
相关系数是从样本计算出来的,而样本越小,它就越会“抖动”(波动)。
你可以想象:
- 抽 10 人测“学习时间与成绩”,你算出的 r 可能是+0.8、-0.2、+0.1……完全随机。
- 抽 200 人再测一次,r 就会趋近真实值(如 0.45)。
这是统计学的基本规律:
样本越少,r 越不稳定;样本越多,r 越接近真实。
📌 你可以把样本量想象成“望远镜的清晰度”:
样本越多,看到的关系越清晰;样本越少,看到的关系越模糊。
【二】数学解释:相关系数的稳定性与样本量成反比
皮尔逊相关的稳定性来自 Fisher Z 转换,其标准误差为:
当我们代入常见样本量时:
| 样本量 n | 相关系数标准误(SE) | 稳定性 |
|---|---|---|
| 20 | 0.24 | 极差,完全不稳 |
| 50 | 0.15 | 仍不稳 |
| 100 | 0.10 | 开始可用 |
| 250 | 0.06 | 稳定 |
| 1000 | 0.03 | 非常稳定 |
你会发现:
相关分析并不是“只计算r就行了”,而是“样本量决定你能不能正确估计r”。
这就是为什么很多学生论文跑不出显著性,根本原因不是模型不好,而是——样本太小。
【三】显著性(p 值)为什么也受样本量影响?
皮尔逊相关的显著性检验,公式是这样的:
你会注意到,t 统计量的值和 n 的关系非常密切:
📌 n 在分子中 → 样本量越大 → t 值越大 → p 值更容易显著
这导致两个常见现象:
(1)小样本:r = 0.30 也可能不显著
例如 n=20 时:
- r = 0.30
→ p 可能大于 0.1
→ “不显著”
(2)大样本:r = 0.05 居然也可能显著
例如 n=1000 时:
- r = 0.05
→ p < 0.05
→ “显著”
但显著不代表关系强,因为 r 只有 0.05。
所以:
显著 ≠ 强相关
不显著 ≠ 没关系
p 值反映的是样本量,不是相关性的本质。
【四】那到底需要多少样本?
以下的数据来自非常严谨的统计学与实证研究结论:
(1)课程论文:n ≥ 30
来源:中心极限定理
用途:展示概念
缺点:r 完全不稳,只建议用于课堂演示。
(2)本科毕业论文:n ≥ 100–300
依据:
- Cohen(1988):中等效应(r ≈ 0.30)需 n≈85–100
- Schönbrodt & Perugini(2013):r 在 n≈250 左右才真正“稳定”
所以最稳妥建议:
✔ n=100–150:可以
✔ n=150–300:最好
❌ n<80:不建议做相关 + 回归
这也是很多老师平时要求学生“最至少 150–200 样本”的原因。
(3)学术论文:n ≥ 300–500
理由:
- 相关系数的 SE 降到 0.06
- 控制变量多时更稳定
- 回归结果更可靠
适用于:经济学、管理学、心理学等领域。
(4)机器学习与行为数据:n ≥ 1000–3000
真实效应通常很弱(r≈0.05–0.10),只有大样本才能准确识别。
典型场景:
- 广告点击(如 E13-2 案例)
- 电商行为
- 用户留存、用户路径分析
(5)互联网数据:n ≥ 10,000–100,000
长尾效应显著,需要海量样本才能减少噪声。
【五】同一个r,在不同样本量下表现完全不同
假设真实相关 r = 0.30,我们用模拟看一下:
| 样本量 n | 模拟得到的 r 区间 |
|---|---|
| 20 | -0.1 ~ +0.7(波动非常大) |
| 50 | 0.1 ~ 0.5(波动仍大) |
| 100 | 0.2 ~ 0.4(开始稳定) |
| 250 | 0.28 ~ 0.32(非常稳定) |
| 1000 | 0.29 ~ 0.31(几乎不变) |
一句话总结:
小样本,r 完全靠运气;
大样本,r 才是科学。
当然,在很多流行的《统计学》教材中,我们通常使用20~30个样本的小数据集,是为了便于展示计算步骤与讲解方法本身,而不是为了做真正的统计推断。小样本能够让学生清楚看到每一个数据点、手算协方差、绘制散点图、理解 r 的定义逻辑;但在实际研究中,相关系数的稳定性和显著性都高度依赖样本量,真正的实证分析往往需要 100、300,甚至上千的样本。换句话说:教材的小样本例子是教学工具,而科研中的大样本才是推断依据。
【六】一句话总结
✔ n < 30:别做相关分析
✔ n = 100–300:毕业论文最佳区间
✔ n ≥ 300:结果显著稳定
✔ n ≥ 1000:适合行为数据
✔ n ≥ 10,000:互联网数据基本配置
r 是否显著,不取决于 r,而取决于 n。 样本越多,相关越稳;样本越少,相关越靠运气。