相关性分析(1):相关系数到底在度量什么?——从散点图讲起

统计

在进入回归分析之前,我们必须先回答一个基础问题:相关性到底是什么?

很多人以为皮尔逊相关系数 r 就是衡量两个变量“关系强弱”的万能指标,但实际上,如果不先看散点图、不了解“线性关系”的含义,相关系数往往会被误读,甚至得出完全错误的结论。

这篇文章,我们就从最直观的散点图开始,讲清楚相关的真正含义。

【一】为什么研究相关性要从散点图开始?

在统计学中,散点图是判断两个变量关系最直观的图形。

它告诉我们的不是数字,而是:变量之间的形状关系。

例如,假设你研究“学习时长与考试成绩”之间是否存在关系。把几十名学生的学习时长与考试分数画成散点图,会出现三种典型情况:

  • 点大致沿着一条“向上倾斜”的直线分布,说明学习越久,成绩越高;
  • 点向下倾斜,说明可能存在负相关;
  • 点完全乱散,说明没有明显的线性关系。

此时,你甚至不需要计算相关系数,就已经能判断二者是否“线性相关”。

散点图反映的是数据的形状,而相关系数只是对这种形状的量化。

一个典型案例来自经济学:

研究人员分析我国“居民可支配收入与消费支出”的关系时,散点图几乎是一条向上的直线,说明二者具有非常典型的线性关系。这时即便不算 r,我们也能预期它会接近 0.9 以上。

因此,散点图是相关性分析中最重要、也最常被忽视的一步。

【二】皮尔逊相关系数 r 到底在度量什么?

皮尔逊相关系数 r 本质上是在衡量:

两个变量沿着一条直线变化的“贴合程度”。

换句话说,它只关心“是否接近直线”。如果点都很紧地贴着一条向上直线,那 r 会非常高;如果点围绕直线分散得厉害,r 会变小;如果点完全不呈现线性,r 接近 0。

这意味着:

  • r 高 → 线性关系强
  • r 低 → 线性关系弱
  • r = 0 → 但可能存在非线性关系

例如,在幸福经济学研究中,“收入”与“幸福感”之间的 r 往往只有 0.2~0.3,看起来不高。但如果你看散点图,会发现二者的关系呈现“递减式的抛物线”:收入提升带来的幸福感增长越来越慢。

这正说明:皮尔逊相关系数只能捕捉线性关系,不能描述非线性。若强行用 r 来分析非线性,结论就会完全错位。

【三】相关性强不强,要结合“情境”判断

在不同研究领域,对 r 的“强弱评价”并不相同。

在自然而然的物理系统中(如密度与压力),r=0.9 是正常的;但在人类行为和社会调查中(如收入与幸福感),r=0.3 反而算是非常“可解释、有意义”的关系。

例如:

研究中国 30 个省份的“数字经济发展水平与企业创新产出”(专利数)时,r 常在 0.4~0.6 之间。在社会科学中,这已经是“较强”的相关性,足以支撑进一步的回归研究。

因此,r 不能孤立看数字,更不能简单地用“>0.5 强相关,<0.3 弱相关”这样的刻板规则来理解。

真正重要的是:

这个关系是否符合理论预期?是否具有解释意义?是否值得进一步建模?

【四】现实案例:r = 0.3,关系强吗?

考虑下面两个真实案例:

案例 1:收入 vs 幸福感(r ≈ 0.25)

虽然只有 0.25,但经济学家认为这是“很重要的相关性”,说明收入确实能提高幸福感,只不过作用有限、存在边际递减。

案例 2:学习时长 vs GPA(r ≈ 0.60)

这对教育研究者来说已经是“显著且较强”的线性关系,足以采用回归进一步分析不同专业、年级的异质性。

两者说明:r 的大小要结合背景解读,而不是机械地套用阈值。

【五】为什么本篇文章放在系列第一篇?

相关性分析是通往回归分析的“入口”。

如果不理解相关性,只靠公式进入回归,很容易陷入常见误区,例如:

  • 把相关当因果
  • 用指标型数据来套皮尔逊相关
  • 忽略散点图导致的“伪相关”
  • 对非线性数据错误计算相关系数

所以,本篇讲的是“观察关系的直觉”。