← 最新论文
💬 NLP

MASPO: Joint Prompt Optimization for LLM-based Multi-Agent Systems

MASPO 是一个新颖的框架,它通过采用联合评估机制和进化束搜索,将局部智能体目标与全局系统目标对齐,从而自动优化基于大语言模型的多智能体系统的提示,进而在多种协作任务中超越现有方法。

原作者: Zhexuan Wang, Xuebo Liu, Li Wang, Zifei Shan, Yutong Wang, Zhenxi Song, Min Zhang

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhexuan Wang, Xuebo Liu, Li Wang, Zifei Shan, Yutong Wang, Zhenxi Song, Min Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一支由专家机器人组成的团队,它们协同工作以解决一个极其复杂的谜题。每个机器人都有特定的职责:一个负责解读线索,另一个负责计算,第三个负责检查错误,第四个负责撰写最终答案。

在过去,如果团队失败了,很难确定该责怪谁。是计算机器人不擅长数学?还是解读机器人提供了错误的线索?这正是论文 MASPO 所要解决的问题。

以下是 MASPO 的工作原理,通过简单的类比进行解释:

1. 问题:团队中的“推诿游戏”

通常,当我们训练这些机器人团队时,我们只关注最终答案。如果答案错误,我们就不知道是哪个机器人搞砸了。

  • 类比:想象一场接力赛。如果团队输了,你不能只责骂最后一位跑者。也许是第一位跑者掉了接力棒,或者是第二位跑者跑错了路线。如果你只训练最后一位跑者跑得更快,团队仍然会输,因为交接棒环节出了问题。
  • 论文的洞察:作者们意识到,在多智能体系统中,一个机器人可以完美地完成自己的工作(局部成功),但仍然向下一个机器人提供导致整体失败的信息(全局失败)。这被称为**“局部 - 全局不对齐”**。

2. 解决方案:MASPO(团队教练)

MASPO 是一个新框架,它像一位聪明的教练,不仅关注终点线,还关注接力赛中的每一次交接。它自动重写每个机器人的“操作手册”(提示词),以使整个团队更好地协同工作。

它通过三个主要技巧来实现这一点:

A. “面向未来”的记分卡(联合评估)

MASPO 不只是问:“这个机器人做好了自己的工作吗?”而是问:“这个机器人的工作是否帮助了下一个机器人成功?”

  • 类比:想象一位厨师正在准备一顿饭。标准的评委可能只是尝一口汤,然后说:“太咸了。”但 MASPO 就像一位还会问“这汤的咸度是否足以与下一位厨师正在烤的面包搭配得恰到好处?”的评委。
  • 工作原理:MASPO 根据以下三点为每个机器人打分:
    1. 它们是否遵守了自己的规则?(局部有效性)
    2. 它们的输出是否让下一个机器人的工作更容易?(前瞻潜力)
    3. 它是否帮助团队赢得了最终比赛?(全局对齐)

B. 从“差点”灾难中学习(不对齐挖掘)

大多数系统只从最终答案错误的错误中学习。MASPO 寻找一种特定且隐蔽的错误类型:当一个机器人完美地完成了工作,但团队仍然失败时。

  • 类比:想象一位司机完美地遵守了每一条交通法规(局部成功),但因为地图令人困惑,却意外地开进了死胡同(全局失败)。普通的教练会说:“干得好,司机!”MASPO 却说:“等等,你遵守了规则,但我们还是迷路了。让我们修改你的指令,这样下次你就不会开进死胡同了。”
  • 工作原理:系统保存这些“局部成功、全局失败”的案例,并迫使机器人研究它们,确保它们不再重复同样的协调错误。

C. “再对齐”训练(束刷新)

随着机器人学习并改变其行为,下一个机器人的指令可能会突然变得过时。

  • 类比:想象一个舞蹈团队。如果第一位舞者加快了速度,第二位舞者的节奏现在就错了。如果你继续练习旧的套路,他们就会一直踩到彼此的脚。
  • 工作原理:MASPO 不断检查团队。如果第一个机器人改变了风格,MASPO 会立即更新第二个机器人指令的“分数”,确保它们是在与当前的现实进行练习,而不是与团队的旧版本进行练习。

3. 结果:更优秀的团队

作者在 6 种不同类型的困难任务上测试了这种方法,包括复杂的数学、逻辑谜题和编写计算机代码。

  • 结果:经过 MASPO 训练的团队始终优于其他方法。与现有最佳方法相比,它们的准确率平均提高了 2.9%
  • 意义:这证明了通过教导机器人关注其工作如何影响队友(而不仅仅是其自身任务),整个系统会变得更加智能。

总结

将 MASPO 想象成一位实时重写战术手册的团队教练。它不只是告诉球员“尽力而为”,而是分析球员 A 的传球如何影响球员 B 的接球,并据此重写两者的指令,以确保整个团队获胜,而不仅仅是个别球员。它通过确保每个人的工作设计都是为了帮助团队获胜,从而解决了“我完成了我的工作,但我们还是输了”的问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →