← 最新论文
🤖 AI

Specification Portability Across LLM Development Agents: Cross-Agent Compatibility in Specification-Driven Software Migration

本文表明,由一个 AI 智能体为 Oracle 到 PostgreSQL 迁移生成的规范往往无法有效地移植到其他智能体,这揭示了实现质量中显著的智能体依赖性退化,并强调了需要通过检索增强摄取等显式策略来确保软件工程工作流中的跨智能体兼容性。

原作者: Oleg Grynets, Oleksii Ilchuk, Dariia Zatulna, Vasyl Lyashkevych

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Oleg Grynets, Oleksii Ilchuk, Dariia Zatulna, Vasyl Lyashkevych

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代软件创作的世界中,一种新型的员工加入了团队:大语言模型。这些是基于海量文本和代码训练而成的强大计算机程序,能够阅读任务描述并编写计算机执行该任务所需的指令。随着这些工具变得越来越普遍,开发人员正在从仅仅要求它们编写代码,转向向它们提供详细的蓝图,即“规范”(specifications)。这些规范充当操作指南,精确地告诉模型应该构建什么、应该如何表现以及必须遵守哪些规则。这种被称为“规范驱动开发”的方法,有望使软件创作变得更加可靠和结构化。然而,随着团队开始使用多种不同的模型来构建单个系统,一个关键问题出现了:如果一个模型编写了一份完美的蓝图,另一个不同的模型是否能够阅读它并构建出同样的东西?人们一直假设一份好的计划无论由谁阅读都是好的计划,但这些机器理解信息的方式在现实中要复杂得多。

EPAM Systems 的研究人员通过将软件迁移作为一个受控实验,着手测试这一假设。他们选择了一个特定的、困难的任务:将数据库代码从一个系统(Oracle)迁移到另一个系统(PostgreSQL)。这两个系统使用的语言相似,但存在不同的方言,需要对逻辑、数据类型和函数进行精确的转换。研究团队首先建立了一个基准,即让单个模型生成一份规范,然后立即使用该规范编写新代码。这一过程运行得相当顺利;在超过一千个源文件中,该系统成功地重新生成了 600 多个,其中近 400 个新脚本在目标环境中正确运行。这证明了使用中间步骤规范的方法是可行的。但真正的考验在于,当他们引入第二个不同的模型时。

研究人员创建了一个场景:一个模型(例如 Amazon Kiro)编写规范,然后将该文档交给一个完全不同的模型(如 Google Gemini 或 GitHub Copelot)来生成代码。他们想看看第二个模型是否能在不损失质量的前提下理解第一个模型的计划。结果令人震惊且出人意料。规范的大小被证明与结果无关。一个模型生成了一份长达近 1,600 行文本的庞大详细文档,而另一个则生成了一个仅约 200 行的简洁版本。然而,文档的长度并不能预测代码运行的效果。事实上,最重要的发现是,规范的来源至关重要。当 Google Gemini 接收到由 Amazon Kiro 编写的规范时,生成的代码质量崩溃了。新脚本无法运行,包含语法错误,并且看起来与预期的目标完全不同。这种失败并非偶然的失误;研究人员重复了实验,并观察到了同样的性能剧烈下降,证实了这两个模型无法就如何解释同一套指令达成一致。

然而,这种不兼容性并非普遍存在,这为这一发现增添了一层细微的差别。虽然 Gemini 在处理 Kio 的规范时表现得很挣扎,但 GitHub Copilot 处理同样的“外来”文档要好得多,有时甚至在处理这些文档时的表现与其处理自身生成的文档一样出色。这表明,问题不在于外来的计划本身不好,而在于不同的模型有不同的阅读和理解文本的方式。为了解决这个问题,团队测试了几种帮助模型弥合差距的方法。他们尝试将外来规范重写为一种接收模型可能更喜欢的格式,并尝试压缩文本以使其变短。重写显著帮助了 Gemini,使其性能恢复到了可用水平,但压缩文本并没有带来实质性的好处。最有效的策略涉及一种称为“检索增强生成”(retrieval-augmented generation)的技术。研究人员并没有将整个规范一次性喂给模型,而是给了模型一个工具,让它能够搜索文档并只提取出当前任务所需的特定部分。这种方法虽然没有在每一项指标上都胜出,但它是唯一一种能为那些表现挣扎的模型和表现成功的模型提供一致且强劲的性能平衡的方法。

该研究得出结论:在一个由不同人工智能智能体组成的团队构建软件的世界里,规范不能被视为一种中立的、通用的文档。一个智能体编写的计划并不自动成为另一个智能体的有效指令集。代码的有效性在很大程度上取决于编写计划的模型与构建软件的模型之间的特定关系。如果团队更换了一个智能体,他们不能简单地假设现有的蓝图依然有效;他们可能需要调整计划的语言,或者改变新智能体获取信息的方式。这项研究表明,多智能体软件工程的未来将需要更加关注规范是如何被构建和交付的,以确保计划中所包含的知识能够真正被负责构建它的机器所理解。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →