相关性分析(5)斯皮尔曼相关是什么?什么时候更好用?
在前面几篇中,我们重点讲了皮尔逊相关的含义、误区和使用条件。你可能已经意识到:皮尔逊相关系数 r 虽然常用,但它有明显局限——必须是连续变量、对离群点极其敏感、只能捕捉线性关系。
那么问题来了:
如果你的数据是等级型(ordinal)、有离群点(outliers)、或呈现单调但不线性的结构,该怎么衡量相关性?
答案就是——斯皮尔曼等级相关系数(Spearman’s rho)。
它是皮尔逊相关最重要的“补位选手”。
【一】斯皮尔曼相关是什么?一句话总结:它是基于“排序”的相关性
皮尔逊相关基于原始数值,而斯皮尔曼相关基于排序(rank)。
换句话说,它不关心你得了 85 分还是 90 分,只关心你的 名次:
- 你的收入在全体中的排序是多少?
- 你的幸福感在 1–5 分中的相对位置是什么?
- 城镇化率高的省份是否也更可能创新产出高?
因此,斯皮尔曼相关衡量的是:
两个变量在排序上的“同步程度”。如果 X 增加时 Y 的排序也随之上升,就说明二者有较强的单调关系。
“单调关系”比“线性关系”更宽松,也更贴近现实。
这也解释了为什么斯皮尔曼相关特别适合社会调查数据、心理测量数据、等级评分数据。
【二】什么时候应该使用斯皮尔曼相关?三大典型场景
场景 1:变量是有序分类变量(Ordinal Data)
例如:
- 幸福感评分(1-5)
- 满意度(非常满意—满意—一般—不满意)
- 疼痛程度(低—中—高)
这些数据虽然看起来像“数字”,但类别之间的差距并不均等。用皮尔逊相关会引入间距假设(interval assumption),可能失真。
斯皮尔曼相关天然适用:只用排序,不需要假设间距一致。
例如:
在研究“教育水平与政治参与度的关系”时,教育水平(小学/中学/本科/研究生)是明确的序数数据,用斯皮尔曼比皮尔逊稳健得多。
场景 2:存在明显异常值(Outliers)
皮尔逊相关对离群点极其敏感。
而斯皮尔曼相关基于排序,即使某个点特别极端,也只影响一个排名,不会把整个趋势“拉偏”。
例如:
在研究“学习时间与考试成绩”时,只要有一个学生连续三天没睡觉狂学 40 小时,他的点就会严重扭曲皮尔逊 r,但不会影响斯皮尔曼 rho。
总结:斯皮尔曼是“抗离群点能力最强”的相关指标之一。
场景 3:关系是“单调”的,但不是线性的
这是许多研究中最常见的情况:
- 收入增加 → 幸福感增加,但边际递减(对数函数)
- 城市规模扩大 → 创新数量增加,但不是直线
- 社会支持增加 → 心理压力下降,但呈弯曲关系
- 学习时间增加 → 成绩提高到一定程度后趋于平稳
这些关系虽然“方向一致”,但不是严格的直线。
皮尔逊相关在这种情况下会低估关系强度,甚至给出 r≈0 的误导性结果。
斯皮尔曼相关可以捕捉“方向一致”的趋势,因此更贴近实际关系:
只要 X 增加的时候,Y 的排序也倾向于增加,斯皮尔曼相关就会高。
【三】斯皮尔曼相关如何计算?
斯皮尔曼相关(Spearman’s ρ)是基于 排序(rank) 而不是原始数值的一种相关系数。它关注的不是“数值之间的距离”,而是:
两个变量的排序是否一致。
Spearman ρ 的计算公式是:
其中:
- di 第 i 个样本在两个变量排序中的“秩差”(rank difference)
- n:样本量
一句通俗解释就是:
斯皮尔曼相关不是比较数值本身,而是比较“谁排前、谁排后”。秩差越小(排序越一致),ρ 越接近 1;秩差越大,ρ 越接近 -1。
我们不需要学习如何做数学推导,只需要理解下面的步骤:
- 将变量 X 的所有数值按大小排序,赋予 rank
- 将变量 Y 的数值按大小排序
- 比较两个排序的“同步程度”
排序说明一切,如果排序非常一致:
- X 排名上升时
- Y 排名也上升。
→ Spearman ρ 接近 +1
如果排序完全相反:
- X 排名越高
- Y 排名越低
→ ρ 接近 –1
如果排序没有规律,则:
→ ρ 接近 0
- 说明两者之间没有明显的“单调关系”。
| 指标 | 衡量什么 |
|---|---|
| 皮尔逊相关(Pearson r) | 数值是否贴近“一条直线” |
| 斯皮尔曼相关(Spearman ρ) | 两个变量的“排序”是否同步 |
到了这里,你会发现,这与皮尔逊“贴近直线”的思想完全不同。
皮尔逊:衡量“直线关系强度”
斯皮尔曼:衡量“排序关系强度”
这也是为什么 在非线性、量表数据、含极端值的数据中,Spearman 更稳、更可靠。
【四】案例:皮尔逊低、但斯皮尔曼高的典型例子
(1)收入与幸福感(对数型)。
真实数据中,皮尔逊 r ≈ 0.25,但斯皮尔曼 ρ ≈ 0.45。因为关系是递减型而非直线。
(2)企业规模与创新数量(幂函数)。
皮尔逊给出 r ≈ 0.3,但斯皮尔曼可能达到 0.6。
(3)心理压力与绩效(倒 U 型)。
皮尔逊 r ≈ 0,但斯皮尔曼可以检测到“单调片段”。
【五】皮尔逊 vs 斯皮尔曼:到底怎么选?一张最实用的判断表**
| 数据特征 | 用皮尔逊(Pearson) | 用斯皮尔曼(Spearman) |
|---|---|---|
| 连续变量 + 接近线性 | ✔ 最佳 | ✔ 可用 |
| 有序分类变量 | ✘ 不适用 | ✔ 最佳 |
| 有明显离群点 | ✘ 容易失真 | ✔ 稳健 |
| 非线性但单调 | ✘ 低估关系 | ✔ 最优 |
| 非线性且非单调 | ✘ 无意义 | ✘ 两者都不适用(应建模) |
一句话总结:
皮尔逊适合“线性的世界”,斯皮尔曼适合“现实的世界”。
【六】小结
- 斯皮尔曼相关基于排序,是对皮尔逊相关的重要补充。
- 适用场景:有序数据、异常值多、非线性但单调。
- 比皮尔逊更稳健、更贴近实际关系。
- 皮尔逊偏向“数学结构”,斯皮尔曼更适合社会科学。
理解两者的区别,你就能在后续的回归建模中做出更合理的选择,也能避免误将“弱相关”当作“无关系”。