降维分析系列第6讲:因子到底取几个?特征值大于1 真的可靠吗?

统计

做因子分析时,几乎所有人都会卡在同一个问题上:

到底应该提取几个因子?

软件会给出一张特征值表,还会自动标出“特征值大于1”的因子。很多论文也习惯这样写:“根据特征值大于1的标准,提取3个公因子。”看起来规范、简洁,甚至有一种“这是标准答案”的感觉。

但问题是,这个标准真的可靠吗?还是说,它只是一个方便的默认规则?

01特征值 > 1 这个标准从哪里来?

“特征值大于1”并不是随意规定的,它有一个很直观的逻辑。

在使用相关矩阵进行因子分析时,每个原始变量的方差都被标准化为1。如果一共有10个变量,总方差就是10。一个因子的特征值表示它解释了多少“变量方差”。如果某个因子的特征值大于1,说明它解释的方差超过了一个单独变量的贡献。

换句话说,如果一个因子连一个变量的解释力都达不到,那么保留它似乎没有太大意义。

这个逻辑听起来很合理,也因此成为最常见的经验规则。但需要意识到,它只是一个基于“平均方差”的判断方式,并不是在检验因子是否真实存在,更不是在判断结构是否合理。它解决的只是一个非常粗略的问题:这个因子解释的方差是否“够多”。

02为什么这个规则并不稳定?

问题恰恰出在这里。

特征值本身是样本相关结构的函数,它会随着变量数量、样本大小、变量间相关程度的变化而变化。如果增加或删除几个变量,特征值结构可能立刻发生改变;样本换一个群体,结果也可能不同。

在变量较多的情况下,前几个因子的特征值往往会自然偏大;变量较少时,特征值分布又会不同。也就是说,“大于1”这个门槛本身是相对于变量数量而言的,并不是一个绝对标准。

很多时候,按照特征值大于1的规则提取的因子数量,会显得偏多。结果就是:旋转之后结构混乱,变量在多个因子上都有载荷,解释起来很吃力。相反,有些数据结构本来比较清晰,但因为特征值略低于1,就被机械地剔除了。

因此,把“特征值>1”当成唯一标准,往往会让因子数量的判断变成一种机械操作,而不是结构判断。

03碎石图就一定更好吗?

很多研究者会说,那就看碎石图。

碎石图的思路,是观察特征值随因子序号变化的曲线,寻找由陡降转为平缓的“拐点”。理论上,拐点之前的因子包含了主要信息,之后的因子则贡献有限。

图片

这种方法比单纯看数值更直观,也更符合“结构判断”的思路。但现实情况是,碎石图并不总是清晰。有的曲线下降平滑,没有明显拐点;有的存在两个转折点;有的则需要研究者“凭感觉”选择。

换句话说,碎石图并没有消除主观判断,只是把判断从一个数值规则,转移到了图形判断上。

因此,碎石图比特征值大于1更灵活,但同样不是绝对标准。

04更严谨的方法是什么?

在心理测量和方法论研究中,更推荐使用 平行分析(Parallel Analysis)。

需要说明的是,这里的“平行分析(Parallel Analysis)”指的是因子分析中的一种方法,与经济学中常见的“平行趋势”(DID 双重差分)或有序模型中的“平行线假设(parallel lines)”并不是同一个概念。

平行分析的基本思路是:利用随机生成的数据计算特征值,并将其与真实数据的特征值进行比较。只有当真实特征值明显高于随机数据对应的特征值时,才认为该因子值得保留。换句话说,它是在判断某个因子解释的方差是否明显高于随机噪声。

相比“特征值大于1”的经验规则,这种方法有更明确的统计依据。不过在很多应用研究中,研究者往往不会做到这一步,而是结合多种信息进行判断,例如特征值、碎石图、旋转后的结构是否清晰,以及理论上是否具有合理解释。

因此,因子数量的确定通常并不是依靠某一个固定公式,而是一种综合判断的结果。

05真正重要的是解释

因子分析的目标,是解释变量之间的相关结构,而不是完成一个“数值达标”的任务。因子数量过多,结构会变得零散;因子数量过少,又可能把本来不同的维度压缩在一起。

因此,确定因子数量更像是一种结构决策,而不是一道可以算出标准答案的题目。特征值大于1可以作为参考,碎石图可以辅助判断,平行分析可以提供更严格的依据,但最终是否合理,仍然要回到结构是否清晰、解释是否连贯,以及理论上是否站得住脚。

真正需要回答的问题不是“是否大于1”,而是:

为什么保留这些因子,而不是更多或更少?

当你能够解释这个问题时,因子数量的选择才算是有依据的。


下一讲,我们讨论因子分析中的另一个关键问题:

为什么要旋转?旋转到底改变了什么?