← 最新论文
💬 NLP

CORE-Bench: Fostering the Credibility of Published Research Through a Computational Reproducibility Agent Benchmark

本文介绍了 CORE-Bench,这是一个包含涵盖三个科学领域的 270 个任务的综合基准测试,旨在评估并提高 AI 智能体在计算性复现研究结果方面的能力,并强调了当前在自动化科学工作流方面存在的显著局限性。

原作者: Zachary S. Siegel, Sayash Kapoor, Nitya Nadgir, Benedikt Stroebl, Arvind Narayanan

发布于 2026-06-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Zachary S. Siegel, Sayash Kapoor, Nitya Nadgir, Benedikt Stroebl, Arvind Narayanan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位刚刚发表了完美舒芙蕾食谱的名厨。你向世界宣告:“这是食谱,这是食材,这是成品照片。”但当你的朋友们尝试制作时,舒芙蕾却塌陷了、烧焦了,或者吃起来像纸板一样。为什么?也许是因为他们用了错误的烤箱,用了错误的品牌鸡蛋,或者因为你的指令过于模糊而漏掉了某个步骤。

在科学界,这被称为**“复现性危机”**(reproducibility crisis)。科学家们会发表论文并附上代码和数据,但其他研究人员在尝试运行这些代码时,往往无法得到相同的结果。

这篇论文介绍了一个全新的“测试厨房”——CORE-Bench,旨在观察 AI 智能体(即“机器人”)是否可以被雇佣来解决这个乱局。

问题所在:科学的“黑盒”

科学依赖于信任。如果一项研究说某种新药有效,我们需要能够运行相同的数学模型和代码来验证它。但通常情况下,代码是混乱的,软件已经过时,或者说明书缺失。这就像是在没有说明书、使用着并不拥有的工具、且在光线不对的房间里组装宜家家具。

解决方案:一个新的“机器人厨师”测试

作者构建了 CORE-Bench,这是一个为 AI 智能体设计的巨大障碍赛场。

  • 设置: 他们从计算机科学、医学和社会科学领域选取了 90 篇真实的科学论文。
  • 任务: 他们要求 AI 智能体扮演研究助理的角色。智能体的任务是:
    1. 下载代码和数据。
    2. 安装所有必要的软件(就像为新手机下载必备的应用)。
    3. 运行代码。
    4. 查看结果(图表、数字、文本)并回答特定问题。
    5. 提交一份报告,说明:“我得到了与原论文一致的结果。”

难度等级

就像电子游戏一样,这个测试分为三个等级:

  1. 简单模式: AI 被给予了结果的完成“照片”。它只需要观察图片并回答问题。(就像被要求读一份菜单)。
  2. 中等模式: AI 被给予了一个“Docker”容器(一个预包装好的工具箱)并被告知去运行它。它必须知道如何打开盒子并按下“开始”按钮。
  3. 困难模式: AI 只得到了“食谱”(README 文件)。它必须搞清楚需要购买哪些工具、安装哪些工具、修复任何错误,并从头开始运行代码。这是现实世界的测试。

结果:机器人们仍在学习中

研究人员测试了两类 AI “厨师”:

  1. AutoGPT: 一个试图做任何事情的通用型机器人。
  2. CORE-Agent: 一个经过专门训练和指导,专门从事这项工作的机器人。

评分卡:

  • 在简单模式下: 专用机器人(CORE-Agent)表现得相当不错,完成了约 60% 的任务。
  • 在困难模式下: 分数显著下降。即使是最好的机器人,也只能完成约 21% 的最难任务。

哪里出了问题?

  • 迷失方向: 当文件夹中有许多文件时,机器人经常看错图表或文件。
  • 安装陷阱: 在困难模式下,机器人在尝试安装软件时陷入了困境。它们会反复尝试安装同一个东西,耗尽资金(API 成本),然后放弃。
  • 视觉问题: 对机器人来说,“阅读”图表和图片比阅读纯文本要难得多。
  • 语言问题: 与 Python 相比,机器人处理 R 语言编写的代码时更加吃力。

总结

论文得出结论:虽然 AI 在编程方面正在进步,但它目前还远未达到能够可靠地独立复现复杂科学研究的程度。

不过,也有好消息:专门的训练很有帮助。 当研究人员给通用机器人一些具体的提示和规则(例如“始终先检查输出文件夹”或“不要猜测,要查看文件”)时,它的表现有了显著提升。

核心观点:
我们不能仅仅把一篇科学论文交给机器人,就指望它今天就能验证科学。但是,如果我们给机器人一点指导和正确的工具,它就可以开始提供帮助。目标不是取代科学家,而是构建一个“机器人助手”,它可以处理那些枯燥、重复的检查数学逻辑是否正确的工作,从而让真人能够专注于真正的发现。

作者希望通过发布这个测试(CORE-Bench),能让其他开发者开发出更好的机器人,以帮助让科学变得更加值得信赖。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →