← 最新论文
🤖 AI

CausalReasoningBenchmark: A Real-World Benchmark for Disentangled Evaluation of Causal Identification and Estimation

本文介绍了 CausalReasoningBenchmark,这是一个包含 173 个查询的真实世界数据集,旨在分别评估因果推断中的识别与估计步骤,结果表明当前的大语言模型在研究设计的细微之处比在数值计算方面面临更大的困难。

原作者: Ayush Sawarni, Jiyuan Tan, Vasilis Syrgkanis

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Ayush Sawarni, Jiyuan Tan, Vasilis Syrgkanis

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在聘请一名侦探来解开一个谜团:“这个特定行为是否导致了那个特定结果?”

很长一段时间里,当我们测试 AI 侦探时,我们只关注他们的最终答案。如果 AI 说:“该行为导致结果增加了 5%”,且这个数字接近真相,我们就给他们一颗金星。

旧方法的弊端
本文作者认为,这就像只根据学生的最终数学答案来评分,而不检查他们的解题过程。

  • 步骤 1(识别): 这是侦探的逻辑。他们必须弄清楚如何破案。他们需要证人吗?隐藏摄像头吗?特定类型的指纹吗?这就是“研究设计”。
  • 步骤 2(估计): 这是侦探的数学。一旦他们确定了计划,就计算数字以得出最终百分比。

如果 AI 算对了数学,但逻辑错误(例如,他们认为一个证人可靠,而实际上证人在撒谎),最终数字可能碰巧看起来没问题,但推理过程是断裂的。旧的基准测试无法区分因计算错误而失误的天才侦探,与因运气好而得出正确数字的困惑侦探。

新方案:CausalReasoningBenchmark
作者创建了一个名为CausalReasoningBenchmark的新“考试”。他们不再仅仅要求一个数字,而是要求 AI 分两个明确的部分展示其解题过程:

  1. 蓝图: 一个结构化计划,命名策略(例如,“我们将使用断点回归设计”)、具体变量(“处理变量”、“结果变量”和“控制变量”)以及该策略的具体规则。
  2. 计算: 实际数字和误差范围。

他们分别对这两部分进行了评分。

数据来源
为了使考试具有现实性,他们没有使用虚构的假数据,而是深入现实世界,从以下来源收集了173 个问题

  • 79 篇真实的同行评审研究论文(主要来自政治学)。
  • 3 本关于如何进行因果研究的著名教科书

这意味着 AI 必须处理混乱的、现实世界的数据、缺失的信息以及复杂的研究设计,就像真正的研究人员一样。

他们的发现(结果)
他们在一个非常聪明的 AI(GPT-5.3)上测试了这份考试。情况如下:

  • “大局”很容易: AI 擅长猜测解决方案的大致类别。大约**79%**的情况下,它能正确地说出:“哦,这是一个工具变量研究!”或者“这是一个双重差分研究!”
  • “细节”很难: 当被要求填写蓝图的具体细节时,得分降至仅34%

失败的类比
这就像一位厨师知道自己在做“意大利面”(策略),但却忘了加盐,用错了面粉,还错误地加入了一种甜点食材(识别错误)。

  • AI 可以说:“我在做意大利面。”
  • 但当被要求列出食材时,它经常遗漏关键食材,或加入会毁掉这道菜的东西(例如“处理后变量”,这就像加入了一种实际上已经煮进酱汁里的装饰,从而改变了味道)。

为何这很重要
这篇论文表明,AI 在因果推理方面的最大瓶颈不在于做数学(估计),而在于理解设计。AI 难以区分导致问题的变量和仅仅是问题副作用的变量。

核心结论
这个新基准测试是一个工具,旨在阻止 AI“弄虚作假”。通过分别对计划和数学进行评分,作者现在可以确切地看到 AI 在哪里失败。他们发现,虽然 AI 在数字方面越来越擅长,但它仍需要学习如何成为一名更善于规划调查的侦探。这有助于开发者构建更智能的系统,这些系统不仅猜测数字,而且真正理解为什么这些数字是真实的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →