降维分析系列第3讲:因子分析是在找“真正的原因”吗?

统计

在做问卷分析、满意度分析、能力评价或心理测量时,因子分析几乎是最常见的方法之一。

很多论文在得到因子分析结果之后,往往会直接给每个因子命名,例如“学习能力”“服务质量”“发展水平”“满意度结构”等,然后把这些因子当作现实中真实存在的维度来解释。

这种写法非常常见,但也最容易产生误解。

这一讲要讨论的核心问题是:

  • 因子分析得到的因子,真的是现实中的“原因”吗?
  • 因子载荷是不是就代表真实结构?
  • 旋转之后的结果,是不是更接近真实世界?

理解这些问题,比学会软件操作更重要。

01因子分析最容易被误解的地方

很多人对因子分析有一种直觉性的理解:

  • 因子分析是在找潜在因素
  • 因子就是变量背后的真实能力
  • 旋转之后的结果,就是更合理的结构

例如,在满意度研究中,如果提取出三个因子,研究者可能会把它们解释为:服务质量、便利性、舒适度。然后认为,这三个维度就是满意度真正的组成部分。但从统计方法本身来看,这种理解并不完全准确。

因子分析并不会自动发现现实中的“原因”,它只是建立了一个模型,用来解释变量之间为什么会相关。

如果不理解这一点,就很容易把统计结果当成现实结构,从而产生过度解释。

02因子分析真正的出发点:解释相关性,而不是压缩变量

与主成分分析不同,因子分析并不是为了尽量保留方差信息,而是试图回答一个更具体的问题:

为什么这些变量会彼此相关?

因子分析假设:

  • 多个观测变量之间之所以相关,是因为它们受到少数几个共同因素的影响
  • 每个变量都可以表示为:公因子 + 特殊误差

也就是说,因子分析并不是简单的数学变换,而是一种模型假设。

在这个模型中:

  • 因子是看不见的
  • 因子数量需要估计
  • 因子含义需要解释

因此,因子分析的结果并不是现实本身,而是在模型假设下得到的一种解释方式。如果假设合理,解释就有意义;如果假设不合理,结果也可能看起来很漂亮,但并不可靠。

03一个更直观的例子:学生成绩数据

为了更容易理解因子分析在做什么,我们来看一个简单的数据例子。

这个例子选来自薛薇老师的《统计分析与SPSS的应用》,是第2章和第3章的课后练习题。书中要求对数据集“学生成绩一”“学生成绩二”进行预处理。这里先把两个数据集合并,然后对新数据集进行因子分析。

假设有一组学生成绩数据,包含 8 门课程:

  • 数学(math)
  • 物理(phy)
  • 化学(che)
  • 语文(chi)
  • 地理(geo)
  • 历史(his)
  • 外语(fore)
  • 政治(poli)

这些成绩之间往往存在相关性。例如:

  • 数学好的学生,物理和化学通常也不差
  • 文科成绩好的学生,历史、地理、政治往往也较好

如果对这 8 个变量进行因子分析,可以得到如下结果。

图片

从上图可以看到,在未旋转的因子矩阵中,各变量在两个因子上的载荷分布并不十分清晰。

再看旋转后的因子矩阵:

图片

可以看到,数学、物理、化学在因子1上的载荷较高,而历史、政治、语文、外语在因子2上的载荷较高。这种结构很容易让人把两个因子分别解释为:

  • 因子1:理科能力
  • 因子2:文科能力

但结果并不是完全分开的。例如地理在两个因子上的载荷都比较高,在因子1和因子2上都有较明显的贡献。这说明地理既包含一定的理科因素,也包含较多的文科因素,因此在统计上同时与两个潜在因子相关。

这种情况在因子分析中非常常见,并不意味着模型有问题,而是说明现实中的变量本身就未必严格属于某一个单一维度。因子分析所做的,是在当前数据的相关结构下,寻找一种能够较好解释变量关系的潜在模型。

因此,当我们把因子1解释为“理科能力”、把因子2解释为“文科能力”时,这种命名只是基于载荷模式的一种合理解释,而不是因子分析自动证明了现实中真的存在这样两个完全独立的能力结构。如果换一批学生,或者换一组课程,得到的因子结构很可能会不同。

换句话说,因子分析提供的是一种解释框架,而不是对现实结构的直接证明。

04为什么旋转之后看起来更合理?

很多人第一次做因子分析时,都会有一个疑问:

为什么旋转之后结果更好看?

实际上,旋转并不会改变模型能解释的总方差,它只是改变因子的坐标方向,让载荷分布更加集中,从而更容易解释。

换句话说:

旋转并不是让结果更真实,而是让结果更容易被人理解。

在学生成绩的例子中,如果不旋转,两个因子的载荷会分散在多个变量上;旋转之后,理科和文科的结构变得更加明显。

这并不是因为旋转发现了新的结构,而是因为我们选择了一种更方便解释的坐标系。因此,旋转是解释上的调整,而不是理论上的证明。

05因子分析什么时候才有意义

理解因子分析的假设之后,就可以判断它适用于什么情况。

一般来说,因子分析更适合用于:

  • 问卷量表
  • 心理测量
  • 满意度评价
  • 能力结构研究
  • 多指标评价体系

这些场景都有一个共同特点:

我们相信变量背后存在潜在结构。

如果只是因为变量多、共线性强,就直接做因子分析,往往是不合适的。
这种情况下,主成分分析通常更简单,也更符合目的。

换句话说:

  • 主成分分析是为了压缩信息
  • 因子分析是为了解释结构

两者看起来相似,但逻辑完全不同。

小结

因子分析并不是在自动寻找现实中的原因,而是在一个统计模型的假设下,尝试用少数潜在因素解释变量之间的相关性。

因子可以被解释,但不能被当作已经被证明的真实结构。

如果研究的目标是理解变量之间的潜在关系,因子分析是合适的方法;
如果只是为了减少变量数量,则不一定需要使用因子分析。

下一讲,我们讨论一个很多人都会遇到的问题:

为什么在 SPSS 中,主成分分析会出现在因子分析菜单里?
主成分到底算不算因子分析的一种方法?