相关性分析(5)斯皮尔曼相关是什么?什么时候更好用?

统计

在前面几篇中,我们重点讲了皮尔逊相关的含义、误区和使用条件。你可能已经意识到:皮尔逊相关系数 r 虽然常用,但它有明显局限——必须是连续变量、对离群点极其敏感、只能捕捉线性关系。

那么问题来了:

如果你的数据是等级型(ordinal)、有离群点(outliers)、或呈现单调但不线性的结构,该怎么衡量相关性?

答案就是——斯皮尔曼等级相关系数(Spearman’s rho)。

它是皮尔逊相关最重要的“补位选手”。

【一】斯皮尔曼相关是什么?一句话总结:它是基于“排序”的相关性

皮尔逊相关基于原始数值,而斯皮尔曼相关基于排序(rank)。

换句话说,它不关心你得了 85 分还是 90 分,只关心你的 名次:

  • 你的收入在全体中的排序是多少?
  • 你的幸福感在 1–5 分中的相对位置是什么?
  • 城镇化率高的省份是否也更可能创新产出高?

因此,斯皮尔曼相关衡量的是:

两个变量在排序上的“同步程度”。如果 X 增加时 Y 的排序也随之上升,就说明二者有较强的单调关系。

“单调关系”比“线性关系”更宽松,也更贴近现实。

这也解释了为什么斯皮尔曼相关特别适合社会调查数据、心理测量数据、等级评分数据。

【二】什么时候应该使用斯皮尔曼相关?三大典型场景

场景 1:变量是有序分类变量(Ordinal Data)

例如:

  • 幸福感评分(1-5)
  • 满意度(非常满意—满意—一般—不满意)
  • 疼痛程度(低—中—高)

这些数据虽然看起来像“数字”,但类别之间的差距并不均等。用皮尔逊相关会引入间距假设(interval assumption),可能失真。

斯皮尔曼相关天然适用:只用排序,不需要假设间距一致。

例如:

在研究“教育水平与政治参与度的关系”时,教育水平(小学/中学/本科/研究生)是明确的序数数据,用斯皮尔曼比皮尔逊稳健得多。

场景 2:存在明显异常值(Outliers)

皮尔逊相关对离群点极其敏感。
而斯皮尔曼相关基于排序,即使某个点特别极端,也只影响一个排名,不会把整个趋势“拉偏”。

例如:

在研究“学习时间与考试成绩”时,只要有一个学生连续三天没睡觉狂学 40 小时,他的点就会严重扭曲皮尔逊 r,但不会影响斯皮尔曼 rho。

总结:斯皮尔曼是“抗离群点能力最强”的相关指标之一。

场景 3:关系是“单调”的,但不是线性的

这是许多研究中最常见的情况:

  • 收入增加 → 幸福感增加,但边际递减(对数函数)
  • 城市规模扩大 → 创新数量增加,但不是直线
  • 社会支持增加 → 心理压力下降,但呈弯曲关系
  • 学习时间增加 → 成绩提高到一定程度后趋于平稳

这些关系虽然“方向一致”,但不是严格的直线。

皮尔逊相关在这种情况下会低估关系强度,甚至给出 r≈0 的误导性结果。

斯皮尔曼相关可以捕捉“方向一致”的趋势,因此更贴近实际关系:

只要 X 增加的时候,Y 的排序也倾向于增加,斯皮尔曼相关就会高。

图片

【三】斯皮尔曼相关如何计算?

斯皮尔曼相关(Spearman’s ρ)是基于 排序(rank) 而不是原始数值的一种相关系数。它关注的不是“数值之间的距离”,而是:

两个变量的排序是否一致。

Spearman ρ 的计算公式是:

图片

其中: 

  • di 第 i 个样本在两个变量排序中的“秩差”(rank difference)
  • n:样本量

一句通俗解释就是:

斯皮尔曼相关不是比较数值本身,而是比较“谁排前、谁排后”。秩差越小(排序越一致),ρ 越接近 1;秩差越大,ρ 越接近 -1。

我们不需要学习如何做数学推导,只需要理解下面的步骤:

  1. 将变量 X 的所有数值按大小排序,赋予 rank
  2. 将变量 Y 的数值按大小排序
  3. 比较两个排序的“同步程度”

排序说明一切,如果排序非常一致:

  • X 排名上升时
  • Y 排名也上升。
    → Spearman ρ 接近 +1

如果排序完全相反:

  • X 排名越高
  • Y 排名越低
    → ρ 接近 –1

如果排序没有规律,则:

→ ρ 接近 0

  • 说明两者之间没有明显的“单调关系”。
指标 衡量什么
皮尔逊相关(Pearson r) 数值是否贴近“一条直线”
斯皮尔曼相关(Spearman ρ) 两个变量的“排序”是否同步

到了这里,你会发现,这与皮尔逊“贴近直线”的思想完全不同。

皮尔逊:衡量“直线关系强度”
斯皮尔曼:衡量“排序关系强度”

这也是为什么 在非线性、量表数据、含极端值的数据中,Spearman 更稳、更可靠。

【四】案例:皮尔逊低、但斯皮尔曼高的典型例子

(1)收入与幸福感(对数型)。

真实数据中,皮尔逊 r ≈ 0.25,但斯皮尔曼 ρ ≈ 0.45。因为关系是递减型而非直线。

(2)企业规模与创新数量(幂函数)。

皮尔逊给出 r ≈ 0.3,但斯皮尔曼可能达到 0.6。

(3)心理压力与绩效(倒 U 型)。

皮尔逊 r ≈ 0,但斯皮尔曼可以检测到“单调片段”。

【五】皮尔逊 vs 斯皮尔曼:到底怎么选?一张最实用的判断表**

数据特征 用皮尔逊(Pearson) 用斯皮尔曼(Spearman)
连续变量 + 接近线性 ✔ 最佳 ✔ 可用
有序分类变量 ✘ 不适用 ✔ 最佳
有明显离群点 ✘ 容易失真 ✔ 稳健
非线性但单调 ✘ 低估关系 ✔ 最优
非线性且非单调 ✘ 无意义 ✘ 两者都不适用(应建模)

一句话总结:

皮尔逊适合“线性的世界”,斯皮尔曼适合“现实的世界”。

【六】小结

  • 斯皮尔曼相关基于排序,是对皮尔逊相关的重要补充。
  • 适用场景:有序数据、异常值多、非线性但单调。
  • 比皮尔逊更稳健、更贴近实际关系。
  • 皮尔逊偏向“数学结构”,斯皮尔曼更适合社会科学。

理解两者的区别,你就能在后续的回归建模中做出更合理的选择,也能避免误将“弱相关”当作“无关系”。