← 最新论文
💬 NLP

NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers?

该论文介绍了 NatureBench,这是一个源自 Nature 系列出版物的基准测试,它揭示了当前的 AI 编程智能体在处理真实的科学发现任务时难以超越现有的最先进水平(SOTA),其主要成功在于方法论的迁移而非真正的发明,并因错误的方法选择和有限的计算预算而失败。

原作者: Yuru Wang, Lejun Cheng, Yuxin Zuo, Sihang Zeng, Bingxiang He, Che Jiang, Junlin Yang, Yuchong Wang, Kaikai Zhao, Weifeng Huang, Kai Tian, Zhenzhao Yuan, Jincheng Zhong, Weizhi Wang, Ning Ding, Bowen Z
发布于 2026-06-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuru Wang, Lejun Cheng, Yuxin Zuo, Sihang Zeng, Bingxiang He, Che Jiang, Junlin Yang, Yuchong Wang, Kaikai Zhao, Weifeng Huang, Kai Tian, Zhenzhao Yuan, Jincheng Zhong, Weizhi Wang, Ning Ding, Bowen Zhou, Kaiyan Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一场规模宏大、赌注极高的烹饪大赛。评委们(研究人员)手里拿着一本装满了 90 道极其复杂食谱的食谱本,这些食谱都出自世界顶级烹饪杂志(即 Nature 系列科学期刊)。这些可不仅仅是“如何制作吐司”那样的简单食谱;它们是像“解构蛋白质结构”或“预测一种新药物分子的行为”这样复杂的菜肴。

参赛选手是 AI 编程智能体(AI Coding Agents)——旨在编写代码和解决问题的聪明计算机程序。

这里的转折在于:参赛选手 不允许看到原始食谱。他们只被给予了原材料(数据)以及对最终菜肴味道的描述(目标)。他们的任务是发明自己的方法,创造出一道与原版获奖作品一样出色、甚至更优秀的菜肴。

这就是 NatureBench 的故事,这是一个旨在测试 AI 是否能从仅仅“复制”食谱进化到真正“发明”新食谱的测试。

问题所在:“复制粘贴”陷阱

在此之前,许多 AI 基准测试就像是给学生一道数学题并附上答案,然后问他们展示解题过程。如果学生只是抄写了答案,就算通过了。但真正的科学并非关于复制,而是关于发现。

NatureBench 的创建者意识到之前的测试很混乱。有时“厨房”(计算机环境)是损坏的,或者缺少食材,导致人们无法判断 AI 的失败是因为它不够聪明,还是因为测试本身存在缺陷。

为了解决这个问题,他们构建了 NatureGym。把 NatureGym 想象成一个高度组织化、自动化的厨房团队。

  1. 过滤器: 他们扫描了数千篇论文,仅挑选出 90 篇公平、食材齐全且可以由机器评分的论文。
  2. 防火墙: 他们在 AI 周围建立了一道“玻璃墙”。AI 可以看到食材和目标,但无法看到原主厨的笔记或用于制作获胜菜肴的秘密酱汁。
  3. 容器: 每个任务都被放入自己密封、完美的微型厨房(容器)中,这样 AI 就无法通过使用外部工具或互联网来作弊。

竞赛:AI 表现如何?

他们邀请了 10 位最聪明的 AI “厨师”(如 Claude Opus 4.7、GPT-5.5 和 Gemini 3.5)来挑战这 90 道菜肴。他们有一个严格的规则:禁止谷歌搜索。 他们必须从零开始摸索。

结果令人清醒:

  • “足够好”俱乐部: 即便是最顶尖的 AI,也仅能在约 48% 的情况下达到或匹配原版获奖食谱的水准。
  • “超越原创”俱乐部: AI 仅在 18% 的案例中创造出了比原版更好的菜肴。
  • 现实的检验: 在其余 82% 的时间里,AI 要么做出的菜肴比原版差,要么根本无法完成。

他们是如何成功(或失败)的?

研究人员仔细观察了 AI 厨师的工作方式,以理解这些结果。

获胜策略:“翻译技巧”
当 AI 成功时,它通常并不是提出了一个灿烂的全新科学发现。相反,它使用了一种被称为**方法论转换(Methodological Translation)**的技巧。

  • 类比: 假设原版食谱是一个复杂的法式舒芙蕾(一个困难的科学问题)。AI 并没有尝试去做舒芙蕾。相反,它观察了食材并说:“嘿,这看起来像是我知道怎么做的披萨!”它将困难的科学问题转化为了一个它已经见过百万次的简单的、熟悉的数学问题。
  • 45% 的成功是因为 AI 仅仅将科学问题变成了一个标准的“猜答案”游戏。它并没有发明新的科学,而只是将旧技巧应用到了新数据上。

失败策略:“工具错误与时间耗尽”
当 AI 失败时,通常并不是因为它不理解指令。

  • 工具错误 (45%): 它选错了“厨房用具”。它试图用搅拌机,而实际上需要的是打蛋器。它选择的方法对于该类问题来说从根本上就是错误的。
  • 时间/预算耗尽 (24%): AI 开始烹饪,但耗尽了 4 小时的时限或完成菜肴所需的计算资源(预算)。
  • 误解(罕见): AI 仅仅是因为不理解菜肴应该是什样的情况非常罕见。

难度等级

并非所有食谱的难度都一样。

  • 简单的菜肴: 涉及“关系推理”(连接点与点)和“蛋白质生物学”的任务对 AI 来说是最容易的。
  • 困难的菜肴: “物理建模”(模拟物理过程)和“分子设计”是最难的。
  • “弗兰肯斯坦”菜肴: 最难的任务是那些混合了两个不同领域的任务(比如混合了生物学和物理学)。AI 很难结合不同“菜系”的知识。

核心启示

NatureBench 告诉我们,虽然 AI 编程智能体在遵循指令和修复 Bug 方面变得非常出色,但它们 还不是真正的科学发明家

它们非常擅长将一个复杂的科学问题转化为:“我知道一个针对这个问题的捷径!”但它们还不擅长面对一个问题并说:“我有一个从未有人想过的全新想法。”

论文总结道,为了让 AI 真正助力科学,我们需要停止仅仅要求它复制赢家,而是要教它如何选择正确的工具,以及如何像科学家一样思考,而不仅仅是一个程序员。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →