面板数据分析系列第13讲:群聚稳健标准误,应该聚类到哪一层?城市?企业?年份?

统计

在前两讲中,已经反复强调了一个结论:

在面板数据中,使用群聚稳健标准误,并不是一种“可选技巧”,而是对现实误差结构的基本尊重。

但紧接着,一个更具判断难度的问题随之而来:

  • 既然要 cluster,那到底该“聚”在哪一层?

这看似是一个技术设定问题,实际上却高度依赖研究者对误差结构的理解与判断。

01 一个常见误解:解释变量在哪一层,就聚在哪一层?

在实践中,经常可以听到这样一种说法:

“解释变量是城市层面的,所以就按城市聚类。”

这句话并非完全错误,但远远不够。

群聚稳健标准误的逻辑,并不是围绕“变量的层级”展开的,而是围绕一个更核心的问题:

  • 误差项最可能在哪一层发生系统性相关?

变量的层级,最多只是判断这一问题的参考信息之一,而不是决定因素。

02 Cluster 的真正逻辑:误差结构,而不是数据结构

回到 cluster 的定义本身。

当我们在某一层级进行聚类时,隐含的假设是:

  • 同一组内部的误差项可以任意相关
  • 不同组之间的误差项相互独立

因此,聚类层级的选择,本质上是对误差生成机制的判断,而不是对数据表格结构的简单映射。

以城市—年份面板为例,如果我们认为:

  • 同一城市内部存在长期未观测因素
  • 不同城市之间的误差相对独立

那么,按城市聚类,就是一个自然且有直觉支撑的选择。

03 三种常见聚类设定,各自在“假定”什么?

在实际研究中,最常见的聚类设定主要有三类。

第一类:按个体聚类(cluster(id))

这是面板数据中最常见、也最接近默认的做法。这种设定隐含的判断是:

  • 个体层面存在持续性的、难以观测的冲击
  • 误差项在个体内部高度相关
  • 时间维度上的相关性主要体现在个体内部

在城市、企业或个人层面的面板研究中,只要研究对象具有稳定特征或路径依赖,这通常是一个稳妥且容易被接受的起点。

第二类:按时间聚类(cluster(year))

按时间聚类,隐含的判断是:

  • 某些年份存在对所有个体同时生效的冲击
  • 这些冲击未被时间效应完全吸收
  • 不同年份之间的误差相对独立

这种设定更常见于时间维度较短、宏观冲击或制度变动极为显著的研究情形。

第三类:双向聚类(two-way clustering)

双向聚类允许以下两种误差相关同时存在:

  • 个体内部相关
  • 时间维度相关

但需要特别强调的是:

双向聚类并不是“更高级”的默认选项,而是一种针对特定误差结构的回应。

04 上市公司研究:到底该按企业、行业,还是地区聚类?

这是实证中经常遇到的问题,也是读者的留言问题。

在上市公司研究中,常见的困惑是:

有人按企业聚类,有人按行业聚类,也有人按地区聚类,到底怎么区分?

关键并不在于“别人怎么做”,而在于你认为:

  • 误差最可能在哪一层同步波动?

可以从三种最常见的判断出发。

(1)按企业聚类

隐含判断是:同一企业内部存在持续性冲击(如管理风格、治理结构、技术路径),并跨年份影响结果。

👉 这是上市公司研究中最常见、也最容易被接受的起点。

(2)按行业聚类

隐含判断是:行业层面的周期、监管或技术冲击,使同一行业内企业的误差同步波动。

👉 更适合行业政策、产业调整或行业景气度研究。

(3)按地区聚类

隐含判断是:地方制度、营商环境或区域政策,对辖区内企业产生共同影响。

👉 常见于区域政策与地方治理相关研究。

需要强调的是:这些选择并不存在统一的“正确答案”,但必须与研究对象和制度背景相匹配。

05 为什么“多聚一层”,并不一定更稳健?

一个常见直觉是:

“既然不确定,就双向聚类,应该更安全。”

但在实践中,这种做法并不总是合理。

原因在于:

  • 双向聚类对样本结构要求更高
  • 在时间维度较短的数据中,可能导致标准误严重膨胀
  • 有时只是机械地增加不确定性,而并未对应真实误差结构

因此,是否采用双向聚类,仍然必须回到一个根本问题:

误差的相关性,究竟主要来自哪里?

06 审稿人真正关心的是什么?

在审稿过程中,审稿人通常并不执着于:

你“选了哪一种 cluster”。

他们更关心的是:

  • 聚类选择是否有清晰的经济学或制度直觉
  • 是否与你的研究对象和数据结构一致
  • 是否在文中明确说明了判断依据

相比之下,“多聚一层但说不清原因”,反而更容易引发质疑。

07 小结:聚类选择,本质是一种研究判断

这一讲可以总结为三点:

  • Cluster 的对象,是误差结构,而不是变量本身
  • 聚类层级的选择,必须服务于对误差相关来源的判断
  • 清晰说明判断逻辑,往往比选择哪一种形式更重要

写在最后

在面板数据分析中,真正成熟的做法,并不是:

“把所有可能的问题都修正一遍”

而是清楚地知道:

  • 哪些不确定性是模型无法消除的
  • 并在推断阶段,对它们保持足够的谦逊