实证研究常见误区(2):为什么很多论文的变量从一开始就选错了?
上一讲讨论的是研究问题能不能被数据回答。这一讲想继续讨论另一个经常被忽视的问题:即使问题已经可以进入实证分析,变量本身是否真的测量了研究对象。
在很多实证研究中,人们往往把注意力集中在模型和方法上。
例如,使用什么回归模型,是否加入固定效应,标准误如何处理,结果是否显著。这些问题当然很重要,也是很多论文讨论最多的部分。但如果仔细阅读一些实证研究,就会发现很多研究的问题其实并不出在模型上,而是在一个更早的环节——变量的设定。
有些论文的回归表看起来非常完整,模型也比较标准,但如果回到研究问题本身,就会发现变量并没有真正对应研究者想讨论的对象。换句话说,变量看起来很规范,但它们并没有在数据中准确地描述研究问题。
这种情况在学生论文中尤其常见。很多人在开始做实证研究时,往往是先去寻找数据库,然后根据数据库中现有的变量去拼凑研究题目。这样一来,变量选择实际上就变成了一种“数据驱动”的过程,而不是研究设计的一部分。
然而在真正的实证研究中,变量并不是简单从数据库中拿出来的指标,而是理论概念在数据中的一种度量方式。如果这一点没有想清楚,后面的回归分析往往只是形式上的工作。
01变量并不是数据,而是研究概念的度量
很多人第一次做实证研究时,通常会从数据库开始。比如打开企业数据库,看一看有哪些变量:企业规模、资产负债率、研发投入、专利数量等等。接着再思考这些变量可以组合出什么样的研究问题。
这种做法其实非常普遍,但它很容易让研究顺序发生倒置。规范的研究逻辑通常是:先提出研究问题,再从理论上界定研究对象,最后才寻找能够度量这些概念的数据指标。
举一个简单的例子。如果研究的问题是“企业创新如何影响企业绩效”,那么“创新”本身是一个理论概念,而不是一个直接可以观察的数据。研究者必须进一步思考,在现实数据中可以用什么指标来近似地反映企业创新。
常见的做法包括使用研发投入、专利数量或者新产品收入等指标。这些变量都与创新有关,但它们并不完全相同,每一种变量其实都只是对“创新”这一概念的某种度量方式。
如果忽略这一点,直接把数据库中的变量当作研究对象本身,就很容易导致变量与研究问题之间出现偏差。
02数据变量并不一定等同于研究对象
在很多实证论文中,变量设定往往被简单处理。研究者通常会说明变量来源于某个数据库,并给出具体的计算方式,但很少进一步讨论这些变量是否真正反映了研究对象。
例如,在研究企业创新时,很多论文都会使用专利数量作为创新指标。这种做法在经验研究中非常常见,因为专利数据相对容易获取,也比较标准化。
但如果仔细思考,就会发现专利数量并不能完全代表企业创新能力。企业的创新活动实际上包含多个方面,例如技术研发、产品改进、工艺优化甚至组织创新,而专利更多反映的是某一类技术成果的申请情况。
同时,不同行业之间的专利制度差异也非常明显。有些行业专利申请非常普遍,而有些行业则更依赖商业秘密或技术积累。因此,仅仅使用专利数量来衡量创新,往往只能捕捉到创新活动的一部分。
这说明,数据中的变量往往只是研究对象的一种代理指标,而不是研究对象本身。在实证研究中,这类变量通常被称为 proxy 变量,也就是代理变量。所谓 proxy 变量,是指当研究对象本身无法被直接观测时,研究者用某个可以观测到的指标来间接反映这一概念。
这类做法在经验研究中非常普遍。例如,在研究人力资本时,很多论文会使用受教育年限作为 proxy;在研究技术创新时,常见的指标是研发投入或专利数量;在研究企业规模时,也可能使用员工人数、营业收入或资产规模等不同变量。
这些变量之所以被广泛使用,是因为许多研究对象本身都是抽象概念,例如创新能力、人力资本或企业规模,而这些概念很难被直接观察。研究者只能通过某些可观测指标来进行近似度量。
但需要注意的是,proxy 变量与研究对象之间往往并不是完全等同的关系。一个代理变量可能只能反映研究对象的某一个方面。因此,在解释实证结果时,研究者必须意识到这种度量上的局限。如果忽略这一点,就容易把统计结果直接解释为研究对象本身的变化,从而产生过度解读的问题。
不同变量虽然都与同一个研究对象有关,但它们所反映的经济含义并不完全相同。也正因为如此,变量选择才不能被简单理解为“数据库里有什么就用什么”。
03变量选择其实是研究设计的一部分
很多研究者在做实证分析时,会把变量选择看作一个数据处理问题。例如更关心变量是否容易获取、样本是否完整、是否存在缺失值等。这些问题当然重要,但它们并不是变量选择最核心的部分。
在实证研究中,变量选择实际上是研究设计的重要组成部分。因为变量不仅决定了研究问题能否被数据回答,也会影响研究结果应该如何解释。
例如,在研究企业创新与绩效关系时,如果使用研发投入作为变量,那么研究更接近讨论企业在创新方面的投入行为;而如果使用专利数量,则更接近讨论创新活动的产出结果。虽然研究主题看起来相同,但变量不同,研究结论的含义也会发生变化。
因此,变量选择不仅仅是技术问题,更是研究逻辑的一部分。一个合理的变量应该既能够反映理论概念,又能够在数据中被稳定地度量。如果变量本身与研究对象之间存在较大的偏差,那么后续的模型设定和统计方法即使再复杂,也很难真正提高研究的解释力。
总结
在很多实证研究训练中,人们往往把精力放在模型和方法上,例如如何设定回归模型、是否加入固定效应、结果是否具有统计显著性等。但一个更加基础的问题却经常被忽视,那就是变量是否真正对应研究问题。
数据库中的变量只是理论概念的一种度量方式,而不是研究对象本身。如果变量的设定没有经过充分思考,回归分析即使形式完整,也很难提供真正有解释力的研究结论。
从这个意义上说,实证研究的关键不仅在于如何进行统计分析,更在于研究者如何把理论问题转化为可以被数据观察的变量。如果变量选择从一开始就出现偏差,那么后续再复杂的模型也很难弥补这一问题。