降维分析系列第2讲:主成分分析到底在干什么?它真的能“解释”变量吗?

统计

在很多实证研究中,只要变量一多,主成分分析几乎就会出现。

尤其是在做综合评价、满意度分析、城市发展指数、企业竞争力指标时,研究者往往先做一次主成分分析,然后把得到的第一主成分解释为“综合能力”,第二主成分解释为“结构差异”,第三主成分解释为“潜在质量”。

从形式上看,这样的解释非常自然,因此很多人会认为:

主成分分析本身就能够揭示变量背后的真实结构。

但严格来说,这种理解并不准确。

主成分分析的目标,并不是发现现实中的潜在因素,而是通过数学方法对变量进行压缩,使得在尽量减少维度的情况下,尽可能保留原始数据中的方差信息。

这一讲讨论的是:主成分分析到底在做什么,以及为什么它不能被随意解释为“综合能力”或“潜在因素”。

01主成分分析最常见的误解:第一主成分就是“综合能力”

很多人第一次接触主成分分析,往往是在做综合评价研究。

例如,在研究城市发展水平时,可能同时收集了人均收入、教育水平、医疗资源、基础设施、财政支出等多个指标;在研究企业竞争力时,又会涉及规模、利润率、研发投入、市场份额、资产结构等一系列变量。

当变量数量较多时,直接进入回归模型往往会产生共线性问题,因此常见的做法是先做主成分分析,把多个变量压缩成几个主成分,再把这些主成分用于后续分析。

在得到结果之后,研究者通常会根据载荷大小,对主成分进行解释,例如把第一主成分称为“综合发展水平”,把第二主成分称为“结构差异”,甚至直接把第一主成分当作一个可以代表整体能力的指标。

这种做法在实际论文中非常常见,但需要注意的是,这种解释并不是主成分分析本身给出的,而是研究者在结果基础上进行的主观命名。

主成分分析并不会告诉你“综合能力”是什么,也不会自动识别“潜在维度”。它只是通过线性组合,把原来的变量重新排列,使新的变量能够在统计意义上解释更多的方差。因此,如果把主成分直接理解为现实中的某种能力或结构,就容易产生过度解释的问题。

02主成分分析真正的目标:解释方差,而不是解释现实

主成分分析确实可以用于降维,但降维并不等于解释结构。

从数学上看,主成分分析要解决的问题非常简单:

在多个相关变量中,能否构造出少数几个新的变量,使得这些新变量能够尽量保留原始数据中的信息。

假设原始数据中有十个变量,那么主成分分析会构造出一组新的变量,每个新变量都是原始变量的线性组合。这些新变量之间彼此不相关,并按照解释方差的大小进行排序。第一主成分解释的方差最多,第二主成分解释剩余部分中最多的方差,依此类推。

需要特别强调的是,这里的“解释”指的是解释数据的变异程度,而不是解释现实中的因果关系或结构含义。主成分分析关注的是统计上的信息保留,而不是理论上的变量关系。因此,第一主成分之所以重要,只是因为它在数学上能够解释最多的方差,而不是因为它在现实中一定代表最重要的因素。

很多误解恰恰来自这里。研究者往往看到第一主成分解释率最高,就自然地把它理解为最核心的能力或最关键的结构,但这种推断并没有理论保证。

03为什么主成分不能随便赋予现实含义

主成分是由原始变量线性组合得到的,而这种组合完全取决于样本数据中的相关结构。

如果换一组样本,或者换一组变量,主成分的系数就可能发生明显变化。因此,主成分本身并没有固定含义,它只是当前数据条件下的一种最优压缩方式。

举一个简单的例子。假设有四个变量:收入、教育年限、房价和医疗支出。主成分分析可能得到一个第一主成分,其中四个变量的载荷都比较高。这时研究者很容易把这个主成分解释为“社会经济水平”。这种解释在直觉上是合理的,但从方法本身来看,它只是说明这几个变量之间高度相关,并不能证明它们一定共同反映某一个真实存在的潜在因素。

如果换一组样本,例如换一个地区,或者换一个时间段,变量之间的相关结构可能会改变,主成分的组合方式也会随之改变。这说明主成分并不是稳定的结构,而是依赖于数据的统计结果。因此,在使用主成分时,可以进行合理解释,但不能把这种解释当作模型自动得到的结论。

04主成分适合做什么,不适合做什么

理解主成分分析的定位之后,就比较容易判断它适合用于哪些问题。

当变量数量很多,而且变量之间高度相关,需要减少维度以便进行回归分析、聚类分析或构造综合指标时,主成分分析是非常合适的方法。它能够在保留大部分信息的前提下,用较少的变量代替原始变量,从而提高模型的稳定性。

但如果研究的目标是解释潜在结构,例如想知道满意度由哪些维度构成,或者想分析能力是否可以分为几个不同方面,那么主成分分析就未必是最合适的选择。因为它并不假设存在真实的潜在因素,也不会尝试去估计这些因素,而只是进行数学上的降维。在这种情况下,更常见的方法是因子分析,而不是主成分分析。

换句话说,如果研究的重点是减少变量数量,可以考虑主成分分析;如果研究的重点是解释变量背后的结构,而不是压缩变量,那么单纯使用主成分分析往往不够,需要使用专门用于建模潜在结构的方法。

这一点我们会在下一讲单独讨论。

05一个真实例子:主成分真的等于“市场因子”吗?

为了更直观地理解主成分分析到底在做什么,我们来看一个真实数据的例子。本例来自何晓琦老师的《EViews在数据分析中的应用》(清华大学出版社,P61),数据包含 5 家美国上市公司在 1975 年 1 月至 1976 年 12 月期间的每周收益率,分别为 Allied Chemical、DuPont、Union Carbide、Exxon 和 Texaco,共 100 个观测值。

研究的问题很典型:

这 5 只股票的波动,是否可以用更少的变量来描述?

从相关矩阵可以看到,这些股票之间存在明显的相关性。例如 Allied 与 DuPont 的相关系数为 0.58,Exxon 与 Texaco 为 0.52,Union 与 Allied 为 0.51。这说明各只股票并不是独立波动,而是受到某些共同因素的影响。因此,我们希望通过降维的方法,用更少的综合变量来刻画这些共同变化,这正是主成分分析最常见的应用场景。

图片

主成分分析的结果表明,第一个主成分的特征值为 2.86,占总方差的 57%;第二个主成分为 0.81,占 16%;其余成分贡献较小。由于变量总数为 5,总方差为 5,第一个主成分已经解释了一半以上的波动。碎石图也显示,在第一个成分之后特征值迅速下降,这意味着用 1~2 个主成分就可以概括大部分信息。

图片

图片

再看载荷矩阵,第一主成分在五只股票上的系数分别约为 0.46、0.46、0.42 、0.42和0.47,数值非常接近,而且全部为正。这说明第一主成分本质上是五个收益率的加权组合,可以理解为一个共同波动方向。

图片

很多人在看到这样的结果时,会自然地把第一主成分解释为“市场因子”,甚至认为第二主成分代表行业差异。这正是主成分分析最典型的误读之一。

要注意的是,主成分分析本身并不会告诉我们这些含义。它所做的事情只有一件:在所有可能的线性组合中寻找方差最大的方向,从而尽量用更少的变量解释更多的波动。至于这个方向是否对应现实中的某种经济机制,需要依赖理论判断,而不是由算法自动给出。

这正是主成分分析最容易被误解的地方。

它适合用于降维和构造综合指标,但并不等同于发现潜在结构。如果研究目标是识别变量背后的真实维度,例如满意度的组成、能力结构或心理因素,那么更合适的方法往往是因子分析,而不是主成分分析。两种方法在形式上看起来相似,但理论出发点并不相同。

也正因为如此,在实际软件操作中,很多人第一次接触主成分分析时就已经产生误解。尤其是在 SPSS 中,主成分分析被放在“因子分析”的菜单里,很容易让人误以为主成分只是因子提取的一种方法。这个问题非常普遍,后续我们还会专门讨论。

06小结:主成分是数学压缩,不是现实结构

主成分分析解决的是变量过多、信息重复的问题,它通过构造新的变量来保留尽量多的方差信息,从而达到降维的目的。它并不假设存在真实的潜在因素,也不会自动给出变量的现实含义。

因此,在实际研究中,可以利用主成分分析来减少变量数量或构造综合指标,但在解释结果时需要保持谨慎。第一主成分解释方差最多,并不意味着它一定代表最重要的能力;主成分的载荷较高,也不意味着这些变量一定属于同一个真实结构。

简单地说,如果研究目标是减少变量,可以使用主成分分析;如果研究目标是解释结构,就需要考虑其他方法。

下一讲,我们单独讲因子分析:因子分析是在找“真正的原因”吗?