← 最新论文
🤖 AI

SRPO: Setwise Relative Policy Optimization for Multi-Agent LLMs

本文介绍了 SRPO(集合相对策略优化),这是一种针对多智能体大语言模型的新型强化学习框架,它通过将单个状态转移中消耗的最少输出集合视为一个统一动作,从而实现了分工与协同演化的统一,进而能够在多样化的工作流和模型规模下实现稳定且有效的训练。

原作者: Shengtian Yang, Ziyu Xiong, Yu Li, Yewen Li, Qingpeng Cai, Lei Feng

发布于 2026-09-09✓ Author reviewed
📖 1 分钟阅读☕ 轻松阅读

原作者: Shengtian Yang, Ziyu Xiong, Yu Li, Yewen Li, Qingpeng Cai, Lei Feng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能飞速发展的世界中,大型语言模型已经学会了扮演智能体(agents)的角色,能够进行推理、搜索信息并使用工具来解决复杂问题。当这些模型独立工作时,它们遵循单一的思考路径。然而,为了应对更难的挑战,研究人员经常部署多个智能体进行协作,就像一个专家团队一样。有时,这些团队会划分任务,让每个成员负责特定的角色;而有时,他们会同时生成几种不同的想法,以共同完善解决方案。训练这类团队的核心难点在于如何给予奖励。传统方法通常将每个智能体的输出视为一个独立的事件,即使有多个智能体正共同协作以产生一个结果。这造成了一种错位:系统是从拼图的单个碎片中学习,而不是从它们共同构成的完整画面中学习,这使得训练那些能在独立工作与协同工作之间切换的团队变得十分困难。

一个研究小组通过提出一种名为集合相对策略优化(Setwise Relative Policy Optimization,简称 SRPO)的新型训练方法,解决了这一错位问题。这种方法不再关注单个响应,而是将导致环境发生变化的整组输出视为一个单一的动作单元。想象一下,一支探险队走到一个分叉路口;无论是一个人选择了一条路径,还是整个团队经过讨论后共同选定了一条路线,推动他们前进的决定都是集体的结果。研究人员发现,通过将这些输出归类为他们所谓的“活跃集”(active set),他们可以训练系统理解团队的共同努力才是真正的动作。这种方法使得同一套训练规则既可以适用于严格的分工模式(即一个人做一件事),也可以适用于共同演化模式(即多个人同时为一个共同的想法做出贡献)。

研究人员在两种截然不同的任务类型上测试了这个想法:解决困难的数学问题和进行多轮搜索以寻找特定事实。在数学实验中,系统必须生成候选解并随后验证它们,这个过程有时需要一个智能体求解而另一个智能体进行检查,有时则需要多个智能体同时提出不同的推导过程。在搜索实验中,系统必须决定何时请求更多信息,多个智能体可能会在聚合器组合结果之前同时发出搜索查询。在四种不同规模的语言模型中,新方法一致地优于现有方法。在数学基准测试中,该系统达到了平均准确率,即大约 61 到 62% 的生成解是正确的,并且对于大约 78% 的问题找到了至少一个正确答案。在搜索任务中,改进更为显著,新方法平均能为超过 60% 的查询找到正确答案,这比以往的方法有了显著提升。

这项发现的一个关键部分在于理解如何平衡多个智能体的贡献。如果系统只是简单地累加每个智能体所做的改变,那么一个较大的团队看起来会比较小的团队影响力大得多,仅仅是因为声音更多。研究人员通过对团队的贡献进行归一化处理解决了这个问题,确保五人团队不会仅仅因为规模较大,就在权重上被不公平地置于单人智能体之上。他们还证明了系统可以学习动态地在这些模式之间切换。在某些情况下,系统学会了单名专业智能体是最佳选择,而在其他情况下,它则激活一小组智能体共同协作。这种灵活性意味着训练过程不需要针对不同的团队结构进行重写;相同的底层逻辑可以无缝处理这两种场景。

该研究还仔细考察了这些改进带来的成本。研究人员谨慎地确保,更好的结果并非仅仅因为新方法生成了更多的文本或使用了更多的计算能力。他们测量了生成的 token 数量和工具调用次数,发现改进源于更好的协调,而非蛮力。事实上,训练过程往往随着时间的推移导致了更短、更高效的响应。研究人员指出,虽然结果很强,但这些是基于特定的基准测试以及与其他已发表方法的比较,未来的工作需要探索这些收益在现实世界长期部署中的表现。尽管如此,核心结论依然成立:通过将团队的集体输出定义为基本的动作单元,可以训练出更稳定、更高效且更擅长解决复杂问题的多智能体系统,无论它们是在独立工作还是协同工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →