← 最新论文
💻 computer science

Execution Grounded Multiagent Systems for Reliable Backend Code Generation with Large Language Models'

本文介绍了 ExecuGraph,这是一个可配置的框架,它证明了执行反馈是提升大语言模型代码生成准确性的主要驱动力,同时表明尽管多智能体角色分解带来了显著更高的计算成本,但其相对于单智能体重试循环并不能提供可衡量的收益。

原作者: Sai Deekshith Lekkala, Jothi Prabha Appadurai, Rohith Reddy Bellibatlu, Manpreet Singh, Rahul Joshi

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Sai Deekshith Lekkala, Jothi Prabha Appadurai, Rohith Reddy Bellibatlu, Manpreet Singh, Rahul Joshi

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个非常有天赋但有点爱做白日梦的机器人写计算机代码。这个机器人是一个“大语言模型”(LLM),它就像一个超级聪明的学生,读过了图书馆里几乎所有的书籍和代码片段。它可以写出在纸面上看起来完美无缺的代码,但有时会犯一些只有在实际运行程序时才会显现出来的细微错误。在软件世界里,这是一个大问题,因为一个微小的错误就可能导致整个网站崩溃或丢失数据。

有一段时间,人们认为修复这个问题的最佳方法是雇佣一整支机器人专家团队——一个“多智能体系统”(Multi-Agent System)。想象一下,有一个项目经理、一个严厉的编辑、一个逻辑检查员和一个代码编写者在一起协作。其理念是,如果你将工作分解,并让不同的机器人互相检查彼此的工作,那么最终的代码将是无懈可击的。但有一个挥之不去的疑问:这种进步究竟是来自于拥有一个“团队”,还是仅仅因为机器人被允许在看到自己的错误后“再试一次”?这就像是在问,一个学生成绩提高是因为有了学习小组,还是仅仅因为在看到第一次考试结果后被允许参加第二次考试。这篇论文旨在通过构建一个特殊的测试机器来解决这个谜团,从而隔离这两个因素。

研究人员构建了一个名为 ExecuGraph 的巧妙框架,它就像是一把用于测试代码编写机器人的瑞士军刀。他们设计了这个框架,使其可以瞬间在三种模式之间切换:一个写完代码就停止的“独狼”机器人;一个在失败后可以重试的“独狼”;以及由五个不同机器人智能体组成的完整“梦之队”。通过让这三种模式运行相同的 164 个困难编程谜题,他们发现了一些令人惊讶的事情。

主要发现是:让机器人在看到错误后再次尝试才是真正的魔术技巧,而不是拥有一个专家团队。当他们给单个机器人机会去观察其错误并重试(这个过程被称为“执行反馈”)时,其成功率大幅跃升了 25.6 个百分点。它的正确率从大约 56% 提高到了 80% 以上。这是一个巨大的胜利!

然而,当他们在这种重试系统之上又增加了由五个额外智能体(一个规划者、一个评审员、一个优化器等)组成的完整团队时,结果并没有变得更好。事实上,团队版本与仅能重试的单个机器人相比,在统计学上是无法区分的。团队版本消耗了大约 3.6 倍 的计算能力和时间,却没能多产生出一个正确的答案。研究人员还排除了这样一种可能性,即团队之所以获胜是因为他们得到了更多次“掷骰子”的机会;他们证明了仅仅生成五次随机猜测而不提供任何反馈,并不会有什么帮助。

不过,故事中还有一个转折。研究人员发现他们自己的测试机器(运行代码的“沙盒”)中存在一个漏洞,该漏洞会误判并拒绝正确的代码。一旦他们修复了这个漏洞,数据发生了变化,但主要结论保持不变:重试循环才是英雄,而额外的智能体大多只是昂贵的装饰。

论文还研究了这在不同类型的机器人上是如何运作的。在一种特定的机器人类型(一个 160 亿参数的模型)上,团队方法对于一种被称为“图论问题”的特定类型谜题确实有所帮助,将其成功率从 70% 提升到了 90%。但在其他类型的谜题上,团队的表现实际上更差,且总分保持不变。这表明,增加更多的智能体并不一定会让机器人变得更聪明,它只是改变了机器人能够解决哪些问题

最后,论文建议,如果你想要一个可靠的代码编写机器人,你不需要建立一个由五个不同智能体组成的复杂组织。你只需要给你的机器人一个单一且聪明的循环:编写代码,运行它,看看哪里坏了,然后尝试修复它。这比聘请一个委员会要便宜得多、快得多,而且同样有效。对于编写正确代码的实际工作而言,“尝试、失败、重试”这一简单的策略显然是赢家,而“团队”方法可能仍然对生成额外的报告或解释有用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →