降维分析系列第5讲:主成分OR因子 能不能直接拿去做回归?

统计

做完主成分分析或因子分析之后,很多人都会顺着往下走一步:既然变量已经被压缩成少数几个成分或因子,那是不是可以直接把它们拿去做回归?

例如,用“综合发展指数”解释经济增长,用“理科能力因子”预测学生排名,用“满意度因子”解释客户忠诚度。这种做法在论文里非常常见,看起来也很自然。

但这里其实涉及一个经常被忽略的问题:

主成分和因子,真的适合直接进回归吗?

01主成分拿去回归:通常没有问题

如果使用的是主成分分析,情况相对简单。

主成分本质上只是原始变量的线性组合,是一种变量变换。而且各主成分之间彼此不相关,这反而有利于回归分析。

从数学角度看,把前几个主成分作为新的自变量放进回归模型,是完全允许的。很多研究正是为了缓解共线性、减少变量数量,才会先做主成分分析,再进行回归。

但要注意一点:

主成分构造的目标,是最大化解释自变量内部的方差,而不是最大化解释因变量。

也就是说,它优化的是“信息压缩效果”,而不是“回归效果”。某个主成分解释的方差很多,并不意味着它对因变量一定最有解释力。

02因子得分进回归:需要更谨慎

如果使用的是因子分析,情况就稍微复杂一些。

因子分析假设存在潜在因子,然后根据模型估计出因子得分。但因子得分不是直接观测值,而是根据样本数据推算出来的估计值,本身带有误差。

当我们把因子得分直接放入回归模型时,实际上是在用一个“估计量”去解释另一个变量。一般应用研究中,这种做法是常见的,也通常被接受,但从更严格的统计角度看,这种做法并没有把因子得分的不确定性单独考虑进去。

如果研究的重点是潜在结构本身,更规范的处理方式往往是使用结构方程模型,在一个统一框架中同时估计因子结构和回归关系,而不是分两步完成。

03一个具体例子

以前面提到的学生成绩为例,假设我们对学生的数学、物理、化学、历史、政治、语文和外语成绩做了因子分析,提取出两个因子,可以解释为“理科能力”和“文科能力”。

接下来,用这两个因子去预测学生的综合排名,在技术上当然可行。

但需要意识到,我们用的并不是某种可以直接测量的“能力”,而是基于当前样本估计出来的因子得分。如果换一批学生,因子结构可能会变化,得分也会不同。

因此,在解释结果时,不能把因子当成现实中客观存在、稳定不变的量,而应该把它理解为当前样本条件下的一种模型表达。

04关键是“你在做什么”

主成分可以进回归,因子得分也可以进回归。

但两者性质不同:

  • 主成分是数学变换
  • 因子得分是模型估计

真正需要想清楚的,不是“能不能用”,而是“自己在用什么”。

如果目的是减少变量数量、缓解共线性,用主成分做回归完全合理。

如果目的是解释潜在结构,仅仅把因子得分丢进回归,可能就有些过于简单。

下一讲,我们聊一下:因子到底取几个?特征值>1可靠吗?