← 最新论文
📈 economics

Classification testing: A new framework for drawing qualitative conclusions from quantitative estimates

本文引入了“分类测试”(classification testing),这是一种新的统计框架,它允许研究人员在受控的误差率下为具有实质相关性的定性类别分配定量估计值,或者宣布结果为不确定,其论点在于这种方法通过更好地判定竞争性可能性并使假设面临证伪,从而改进了标准的假设检验。

原作者: Andrew C. Eggers, Zikai Li

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Andrew C. Eggers, Zikai Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在社会科学领域,研究人员致力于测量那些无法直接观察的事物:一项新政策如何改变一个社区,一条特定的信息是否改变了一个人的投票倾向,或者一种治疗方法是否改善了患者的健康。他们收集数据并进行数值计算,以寻找这些行为的平均效应。然而,他们最终讲述的故事很少是一串长长的数字。相反,他们将这些精确的数字转化为简单的、定性的判断。他们决定一个效应是真实的还是不存在的,是正向的还是负向的,或者是否微小到可以忽略不计。为了支持这些判断,科学家们依赖于一种被称为“假设检验”的标准方法。这种方法就像是一个守门人,旨在通过确保当研究人员声称某个结果是真实存在时,其声称错误的概率被控制在极低的水平,从而保护公众免受虚假警报的误导。

几十年来,这一系统在证实特定预测方面表现良好,但它有一个显著的盲点。它的构建初衷是证明某事正在发生,但在证明某事并未发生,或是在两个竞争的可能性之间进行公平裁决时却显得力不从心。如果研究人员试图证明某种疗法有效,只要证据足够充分,该系统就允许他们宣布胜利。但如果证据薄弱,系统只会简单地表示研究人员未能证明其观点;它并不允许他们自信地宣布该疗法实际上毫无作用。这造成了一个不平等的竞争环境,使得某些结论易于达成,而另一些结论则始终难以触及,从而可能使整个科学对话向过于乐观的发现倾斜。

政治学家安德鲁·埃格斯(Andrew Eggers)和李子凯(Zikai Li)提出了一种新的框架,为应对这些不确定性提供了一种不同的路径。他们称之为“分类检验”(classification testing)。这种方法不再强迫研究人员只去捍卫一个特定的偏好理论,而是要求他们根据现实世界中真正重要的标准,将所有可能的结果划分为不同的类别。例如,研究人员可以将可能性分为三组:效应是正向且足够显著的;效应是负向且足够显著的;或者效应微小到可以忽略不计。其目标不仅仅是看一个数字是否不同于零,而是将结果归入正确的“桶”中。

这种新方法的威力在于它能以同等水平的统计严谨性来对待所有这些类别。在旧系统中,研究人员只有在拒绝了“效应为零或为负”的假设后,才能自信地说“效应是正向的”。他们无法以同样的确定性来自信地说“效应为零”或“效应为负”,除非他们事先设定了一个非常具体且往往显得生硬的测试。分类检验消除了这种偏差。它允许研究人员观察数据,并以受控的误差率做出判断:结果属于“微不足道”类别,还是属于“正向且显著”类别,亦或是数据过于模糊而无法判定。它将科学问题从“我能否证明我的假设?”转变为“对这一结果最诚实的描述是什么?”

为了展示其实际应用效果,作者将该方法应用于一个著名的媒体消费领域实验。原始研究调查了福克斯新闻(Fox News)的常客接触到 CNN 时发生了什么。研究人员测量了三十二个不同的结果,范围涵盖了从政治偏好变化到对新闻来源信任度的转变。当他们应用大多数社会科学期刊所使用的标准检验方法时,发现其中十六个结果是“显著的”,另外十六个则不显著。这使得一半的结果处于不确定的状态,即研究人员无法自信地判断效应是真实的还是不存在的。

当作者使用分类检验重新分析相同的数据时,图景变得清晰得多。通过将结果分类为“正向且显著”、“负向且显著”或“微不足道”,他们能够对三十二个结果中的二十九个做出具有置信度且误差受控的陈述。他们可以自信地表示,对于某些指标,效应是巨大且正向的。对于另一些指标,他们可以自信地表示效应微小到可以忽略不计。即使对于那些被旧方法标记为“不显著”的结果,新方法通常也允许他们得出结论,即该效应确实是微不足道的,而不仅仅是“未知”。只有在数据确实过于嘈杂、无法支持任何明确主张时,他们才会不得不说结论是“不确定的”。

这种转变改变了研究进行的激励机制。在旧规则下,研究人员经常面临寻找正向结果以获得发表机会的压力,导致他们设计出那些很可能证实其预期的研究。新框架鼓励一种更加开放的态度。由于该方法允许研究人员自信地得出“效应很小”或“效应不存在”的结论,研究人员可以在无需担心“零结果”意味着失败的情况下,研究真正开放的问题。它将“微小效应”视为一种有效的、可测试的结果,而非一个死胡同。

作者认为,这种方法并没有降低科学的严谨性;事实上,它保持了避免虚假主张的同样高标准。它只是扩大了可以被自信回答的问题范围。通过允许科学家以声明一个效应是巨大的同等确定性,来声明一个效应是微不足道的,该方法减少了将数据强行纳入特定叙事的压力。这表明,最有价值的科学结论并不总是戏剧性的发现,有时是一个清晰、诚实的评估,即某项干预措施并未产生实质性的影响。作者认为,这种清晰度正是建立一个更可靠、更少偏见的社会运作理解的关键。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →