← 最新论文
💬 NLP

SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?

本文介绍了 SWE-bench Science,这是一个包含跨 20 个科学领域的 119 个仓库级任务的综合基准测试,它揭示了当前的编码智能体由于特定的失败机制(如知识匮乏和探索错误)而在解决科学软件中的工程任务时表现挣扎,同时也证明了显式科学指导的效用取决于其与修复上下文的一致性。

原作者: Zhipeng Xu, Jiahao Lu, Yining Zheng, Yuxin Wang, Xipeng Qiu

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhipeng Xu, Jiahao Lu, Yining Zheng, Yuxin Wang, Xipeng Qiu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

科学一直以来都依赖于工具:揭示遥远恒星的望远镜,揭开细胞隐藏世界的显微镜,以及探测物质结构的粒子加速器。如今,一种新型工具已变得不可或缺,它并不存在于实验室的抽屉里,而是存在于计算机代码的数字领域中。这种软件不再仅仅是为科学家处理数据的辅助工具;它本身已成为了实验仪器。当研究人员模拟一种新药、模拟气候模型或分析来自遥远星系的光线时,他们运行的程序就是观察现实本身的“透镜”。如果代码中存在缺陷,其结果不仅仅是一个计算机错误,而是一个可能破坏科学结论的受损证据。

多年来,研究人员一直试图教会人工智能去修复这些损坏的程序。他们构建了测试,以观察计算机是否能够阅读错误报告并编写补丁来修复软件。这些测试表明,机器在修复简单的编码错误方面做得越来越好。然而,一个关键问题仍悬而未决:这些智能系统能否应对复杂且高风险的科学软件世界?在这个领域,一个修复方案不仅要让程序运行起来,还必须保留代码试图表达的物理、化学或生物学的微妙规律。如果一个修复虽然让软件运行得更快,却改变了科学含义,那么即使计算机显示测试通过,它也是失败的。

一支研究团队现在通过创建一个名为 SWE-bench Science 的新测试场来解决这个问题。他们收集了来自 98 个不同软件项目的 119 个真实任务,这些项目被用于 20 个不同的科学领域,涵盖了从化学、生物学到天文学和土木工程等领域。这些任务并非简单的练习;它们源自科学家们遇到的实际问题,例如模拟过程产生的晶体能量值错误,或者数据分析工具误读了生物样本的坐标。研究人员将这些挑战分为三类:一些是已知错误的直接修复;另一些要求人工智能扮演专家调查员的角色,去查明为什么某个科学结果看起来不对;还有一部分则要求人工智能理解大型软件系统的不同部分是如何协同工作以完成整个工作流的。

实验结果具有启发性。即使是当今最先进的编程代理也面临着巨大的挑战。表现最好的系统——一个配备了强大编程助手的复杂模型——成功解决的任务比例不足一半。这一低成功率凸显了当前人工智能的能力与维护科学软件的要求之间存在的巨大鸿沟。研究人员发现,当这些系统失败时,通常表现为四种可预测的方式。首先,人工智能往往缺乏理解问题所需的特定科学知识,导致其提出的修复方案在计算机看来合乎逻辑,却违反了自然法则。有时,系统只会修复它能看到的表面症状(如一个看起来错误的数值),而没有追溯到错误的根源。在其他情况下,修复虽然对程序的某一部分有效,却破坏了与其他部分的连接,未能将修复整合进更大的系统中。最后,人工智能经常无法将科学原理应用于新情境,它会困在给定的特定案例中,无法将其解决方案进行泛化。

为了理解科学知识在这些失败中的作用,研究人员进行了一项特定的实验。他们选取了一组任务并进行了两次运行:一次是在给予人工智能有关相关科学背景的额外信息的情况下,另一次则没有。结果显示,这些额外的背景信息并非万灵药。对于一些较强的 AI 模型,提供科学背景反而使其完美解决问题的可能性略微降低,这可能是因为额外的文本分散了它们的注意力,或者导致它们过度依赖提供的解释而非通过测试自己的想法来进行验证。对于较弱的模型,额外的信息确实有所帮助,但也需要消耗更多的计算能力。这表明,仅仅向 AI 喂养更多事实并不能保证更好的修复;系统必须能够将这些事实与代码联系起来,并通过执行来验证它们。

研究得出结论,尽管人工智能在通用软件工程领域取得了进展,但科学计算的独特需求仍然是一个艰巨的挑战。修复科学代码需要一种超越语法和逻辑的理解力;它要求掌握代码所体现的物理和理论原则。在这些系统能够可靠地区分“一个可以运行的程序”与“一个在科学上有效的程序”之前,维护科学软件的数字仪器任务仍将是人类专家的工作。这一新的基准测试提供了一张清晰的地图,展示了这些系统目前的现状,表明通往完全自主的科学软件修复之路依然漫长且充满了复杂的障碍。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →