为什么收入分布总是“右偏”?——数据分布的秘密

统计

你有没有注意过一个现象:

  • 大多数人收入差不多,但总有少数人收入特别高;
  • 于是,整体收入的“尾巴”拖在右边,看起来“歪了一边”。

这就是统计学里常说的 右偏分布。

图片

其实,数据的“长相”并不总是对称的正态曲线,它可能左偏、右偏,也可能高高瘦瘦,或者矮矮胖胖。

在描述统计学中,我们通常从三个角度来刻画一组数据:

  • 集中趋势(均值、中位数、众数),告诉我们数据的“中心”;
  • 离散程度(方差、标准差、极差等),告诉我们数据的“差异大小”;
  • 分布形态(偏态、峰态),告诉我们数据的“整体长相”。

前面两篇文章我们已经讲了“中心”和“差异”,今天,就来看看数据的分布形态,为什么它同样不可或缺。

【一】 偏态(Skewness):数据歪向哪一边?

在理想的正态分布中,数据左右对称,均值、中位数和众数重合。但现实世界往往不是这样。

以收入为例,大多数人集中在低到中等收入水平,少数高收入人群把均值推得更高,曲线在右边拖出一条长尾巴。这就是典型的右偏分布,此时的关系是:

众数 < 中位数 < 均值。

图片

相反,如果是考试成绩,大部分学生都考得不错,分数集中在高分区,但仍有少数人得分很低。这种情况下,曲线的尾巴会拖到左边,形成左偏分布。这时的关系是:

均值 < 中位数 < 众数。

图片

📌 现实生活中的偏态例子:

  • 右偏:收入、房价、股票收益。
  • 左偏:考试成绩、寿命分布(大部分人寿命集中在长寿区,少数人早逝)。

👉 偏态告诉我们数据是否对称,也提醒我们是否存在极端值。

需要注意的是,数据“对称”并不一定就意味着正态分布。比如,有些数据会呈现 双峰分布:在两个不同位置出现高峰,中间反而较低。

双峰分布常见于“混合群体”的情况,例如:

  • 男性和女性的身高分布合在一起,就可能出现两个峰;
  • 不同消费习惯的人群支出数据,也可能形成双峰。

因此,在分析数据时,我们不仅要看它是左偏、右偏,还是对称,还要进一步观察它是否“单峰”还是“多峰”。

图片

【二】 峰态(Kurtosis):数据“尖”还是“平”?

除了左右歪斜,我们还要观察曲线的“尖平”程度,这就是峰态。

如果分布比正态更陡,就像山峰一样高而尖,说明大多数数据都挤在均值附近。比如一次小测验,绝大多数同学的分数都在 80–85 分之间,成绩差异很小。这就是高峰态(尖峰)。

图片

如果分布比正态更平,说明数据分散,尾巴更厚重。比如一次意见调查,大家的看法五花八门,几乎覆盖了所有选项。这就是低峰态(扁平)。

图片

正态分布则处在两者之间,被称为中峰态。它往往作为基准参照。

📌 峰态揭示了数据是否“集中一致”还是“分散多样”。

【三】 为什么要关心分布形态?

很多人会觉得:有了平均数和标准差,不就够了吗?

其实并不够。分布形态能提供的信息,平均数和标准差都给不了。

  • 在统计建模中,很多方法(比如回归分析)都要求残差近似正态分布。
  • 在实际解释中,偏态揭示了极端值,峰态说明了数据集中还是分散。
  • 在直观理解上,平均数告诉你“中心”,标准差告诉你“差异”,但只有分布形态能告诉你数据的“整体长相”。

举个例子:

两家公司的员工平均工资一样,标准差也一样,但一家是“金字塔型”(大部分人低工资,少部分人高工资),另一家是“橄榄型”(大部分人中等工资)。如果只看平均和标准差,你分辨不出来,只有看分布形态才能发现差异。

✨ 小结

  • 偏态:看数据是否对称,是否有长尾。
  • 峰态:看数据是尖还是平。
  • 意义:帮助我们发现数据背后的结构与特征。

集中趋势告诉我们数据的“中心”;
离散程度告诉我们数据的“差异”;
分布形态告诉我们数据的“长相”。

📌 这三者合起来,构成了描述统计学的完整框架。