← 最新论文
🤖 AI

An Agentic Workflow for Legacy HPC Modernization: Converting the Two-Electron-Integral Core of GAMESS

本文介绍了一种智能体工作流,该工作流通过在人类监督下利用三个经过提示词专业化处理的 AI 智能体以及一个严格的逐位验证预言机,成功将 GAMESS 量子化学软件包中的 56,448 行遗留 Fortran 77 代码现代化为 Fortran 2008,并在 612 次测试运行中实现了完美的验证。

原作者: Yuzhong Shen, Masha Sosonkina, Peng Xu, Mark S. Gordon

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuzhong Shen, Masha Sosonkina, Peng Xu, Mark S. Gordon

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,超级计算机的世界就像一座宏伟而古老的图书馆,其中最珍贵的书籍是用一种叫做 Fortran 的语言编写的。几十年来,科学家们一直利用这些书籍来预测原子如何粘合、新药可能如何发挥作用,以及天气将如何变化。但其中许多书籍的写作风格非常陈旧,就像写在泛黄纸张上的手写笔记,只有少数专家才能读懂。这种“旧风格”使得使用现代工具(如超快速图形卡或新型处理器)来更快地解决问题变得异常困难。科学家面临的一个重大问题是:我们能否将这些古老的书籍改写成现代、易读的格式,同时又不小心改变其中数学内容的任何一个字?如果我们甚至改变了计算中哪怕一个微小的数字,整个预测都可能出错,导致多年后的实验失败或错误的科学发现。

这篇论文讲述了一个团队尝试使用一种被称为“AI 智能体”的新型“数字助手”来解决这一问题的故事。他们并没有让一名人类坐在那里去重写数百万行代码,而是建立了一个 AI 机器人团队来承担繁重的体力活。这些机器人不仅仅是在盲目地替换单词;它们被赋予了一套严格的规则和一个能够以完美精度检查其工作的“真相检测器”。该团队专注于一个名为 GAMESS 的著名化学软件包中一个特定且关键的部分,该部分负责计算电子之间的排斥作用。他们提出了一个问题:我们可以安全地将多少这种大规模、高风险的重写工作交给 AI,以及在哪些地方我们仍然需要人类来复核工作?

机器人重写者的故事

研究人员建立了一个巧妙的系统,涉及三个不同的“机器人角色”协同工作,并由一套由机器人自己编写并不断更新的规则手册进行引导。你可以把它想象成一个建筑施工队,其中一个机器人是建筑师(Builder),另一个是检查员(Inspector),第三个是架构师(Architect)

  1. 建筑师(Builder): 这个机器人获取旧的、混乱的代码(以 Fortran 77 风格编写),并将其重写为现代风格(Fortran 2008)。它必须非常小心,不要改变数学逻辑,只改变指令的编写方式。
  2. 检查员(Inspector): 这个机器人让新代码通过一系列测试。它将新代码的结果与旧代码进行对比,寻找哪怕是最微小的差异。
  3. 架构师(Architect): 这个机器人检查新代码是否遵循了所有的风格规则,例如确保没有留下旧式的、非必要的“Go To”跳转指令。

最令人兴奋的部分是,这些机器人被允许修复自己的错误。当它们发现问题时,它们不仅仅是停下来,而是会在自己的规则手册中写下一条新规则,以便以后不再犯同样的错误。

结果:完美的得分

团队选择了一个非常困难的目标:包含 56,448 行代码225 个子程序的 12 个源文件。这是 GAMASS 软件的“引擎”,是执行量子化学核心计算的部分。

结果非常成功。AI 智能体成功重写了所有 12 个文件。当运行测试时,新代码产生的结果与旧代码是位对位(bit-for-bit)完全一致的。这意味着,如果旧代码计算出的能量级为 12.3456789012,那么新代码计算出的结果也精确地是 12.3456789012。在科学界,小数点后第十二位的差异都被视为失败,但在这次任务中,差异为零。

612 次测试运行中,出现了零个与化学相关的差异。机器人通过了每一项测试,包括 GAMESS 社区使用的 49 项标准测试以及团队额外增加的 2 项测试。

一个小故障与人类安全网

然而,这个故事的主题并不是关于机器人如何完美,而是关于它们如何与人类协作。机器人确实犯了一种特定类型的错误。它们遇到了一个棘手的代码片段,其中的数字以一种特定的方式紧密排列。机器人忠实地翻译了代码,但它们没有意识到原始代码中隐藏着一个缺陷,这个缺陷只会在非常特定的极端条件下才会显现。因为机器人严格遵守规则,它们连同代码本身一起复制了这个缺陷。

这就是人类安全网发挥作用的地方。团队制定了一条严格的规则:在人类批准之前,机器人不得合并它们的工作。当测试运行时,人类抓住了这个错误。随后,机器人使用了一种叫做“二分法”(类似于侦探缩小嫌疑人名单)的巧妙技巧,找到了出错的具体行。它们修复了它,然后将一条新规则写入了规则手册,以确保未来的机器人永远不会再犯这种错误。

论文表明,虽然机器人可以完成几乎所有的工作——阅读代码、重写代码、测试代码,甚至修复它们自己的漏洞——但它们仍然需要人类来做出最终的判断,即决定结果是否可以接受。机器人处理了工作量,而人类处理了判断力。

为什么这很重要

这项研究证明,我们可以使用 AI 来实现大规模、古老科学代码库的现代化,而不破坏其原有功能。关键不在于拥有一个聪明的 AI,而在于拥有一个严格的验证系统(即“真相检测器”),它能够捕捉到哪怕是最细微的误差。因为科学家们拥有一种完美的检查答案的方法(将结果与已知正确值进行对比),所以他们可以信任机器人完成这项工作。

论文指出,这种方法可以应用于其他大型科学项目,但也警告说,这只有在拥有完美检查机制的情况下才有效。如果你没有一个可以用来对比的“金标准”,你就无法确定机器人是否改变了数学逻辑。在这种情况下,机器人承担了繁重的体力活,人类提供了安全网,两者共同成功地更新了一段科学历史,且未丢失任何一个数字的准确性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →