实证研究常见误区(1):为什么很多论文一开始就选错了研究问题?

统计

在指导学生论文时,经常会遇到这样一种情况:学生提出的研究题目往往很宏大,例如“数字经济对经济高质量发展的影响”“人工智能对就业结构的影响”“金融科技对金融稳定的影响”等。这些题目听起来都很重要,也很有现实意义。

但如果继续追问一个问题:你准备用什么数据来回答这个问题?

很多学生往往会一时答不上来。原因很简单——他们通常是先想到一个题目,然后再去寻找数据。当真正面对数据时才发现,原来设想的问题并不容易通过现有数据来分析。

这种情况在实证研究中其实非常常见。很多论文的问题,看起来很宏大,但一旦进入具体的数据分析阶段,就会发现研究问题与数据之间并不能很好地对应。

01不是所有重要的问题都适合做实证研究

在社会科学研究中,有许多问题本身非常重要,但未必适合通过统计模型来研究。

例如,“人工智能是否会改变社会结构”“数字经济是否推动了社会进步”等问题都具有很强的宏观意义,但如果缺乏能够量化的指标,就很难直接进入实证分析。

在这种情况下,如果仍然试图做实证研究,往往只能用一些间接指标来替代原本的问题。例如用某种“数字经济指数”来代表数字化水平,或者用“就业人数变化”来反映就业结构变化。

这种替代在很多研究中是必要的,但如果指标与研究问题之间的关系并不清晰,就容易出现一个常见问题:研究的问题和分析的数据并不真正对应。

02实证研究必须能够转化为变量关系

一项实证研究能够成立的前提,是研究问题可以被转化为具体的变量关系。

例如,如果研究“教育对收入的影响”,那么至少需要能够观测到两个变量:教育水平和收入水平。当这些变量能够被清晰地定义,并且存在相应的数据样本时,研究问题才可以进入统计分析。

换句话说,一个适合做实证研究的问题,通常需要满足两个条件:一是可以被转化为具体变量,二是这些变量可以在数据中被观测到。如果无法满足这两个条件,即使问题本身很重要,也很难通过实证方法得到可靠的结论。

03为什么很多研究会在这里出现偏差

在实际的论文写作中,这种问题往往来自研究出发点的不同。

很多学生习惯先提出一个看起来比较宏大的题目,然后再去寻找可以使用的数据。但现实中的数据往往是有限的,因此研究问题不得不不断调整,甚至被迫使用一些并不完全合适的指标。

另一个常见原因,是忽视了变量的可操作性。在理论讨论中,我们可以使用很多抽象概念,例如“高质量发展”“社会福利”“经济韧性”等。但在实证研究中,这些概念必须被转化为具体、可测量的指标。如果变量定义本身就不清晰,那么后续的模型分析也很难成立。

04一个更稳妥的研究思路

在很多成熟的实证研究中,研究问题往往并不是凭空提出的,而是来自理论与数据之间的结合。理论为研究提供方向,而数据则决定了研究的可行性。

因此,一个比较稳妥的做法是:在明确研究方向之后,先了解数据结构和变量,再逐步形成可以通过数据回答的研究问题。这样得到的题目通常更加具体,也更容易进入实证分析。

与其一开始就设定一个宏大的研究题目,不如先问一个更实际的问题:现有的数据能够回答什么问题?

05如何判断一个问题是否适合做实证研究?

在实际研究中,可以用一个简单的判断框架来思考:

第一,核心概念能否转化为变量?
如果研究中的关键概念无法用变量表示,那么就很难进入统计模型。

第二,相关变量是否可以获得数据?
即使变量可以定义,如果没有可靠的数据来源,实证研究也很难开展。

第三,变量之间是否存在可识别的关系?
也就是说,数据结构是否允许我们分析变量之间的关系。

如果这三个问题中有一个无法回答,那么研究题目就需要进一步调整。

小结

在实证研究中,研究问题并不是越宏大越好。一个好的研究问题,既需要具有理论意义,也需要能够通过数据进行检验。

如果问题本身无法转化为可观测的变量关系,那么即使使用再复杂的模型,也很难得到有说服力的结论。很多论文在方法和模型上花费了大量精力,但真正的问题往往在研究一开始就已经出现。

对于实证研究而言,选择一个能够被数据回答的问题,往往比选择哪一种统计方法更加重要。