← 最新论文
🤖 machine learning

Stronger-MAS: Multi-Agent Reinforcement Learning for Collaborative LLMs

该论文提出了 AT-GRPO,一种新颖的多智能体强化学习框架,该框架引入了一种基于智能体和轮次的组优化算法以及一个灵活的训练系统,旨在克服标准在策略强化学习在协作式大语言模型中的局限性,并在规划、编程和数学任务中实现了显著的性能提升。

原作者: Yujie Zhao, Lanxiang Hu, Yang Wang, Minmin Hou, Hao Zhang, Ke Ding, Jishen Zhao

发布于 2026-02-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Yujie Zhao, Lanxiang Hu, Yang Wang, Minmin Hou, Hao Zhang, Ke Ding, Jishen Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于 STRONGER-MAS 论文的解释,采用了通俗易懂的语言和创意类比。

核心理念:教导一个团队如何协作

想象你有一个非常聪明但有点笨拙的机器人(大语言模型,简称 LLM)。你想让它解决复杂的谜题、编写代码或玩游戏。

通常人们有两种主要方式来让这个机器人变得更好:

  1. “专家”团队(多智能体系统): 你给机器人分配了一个朋友团队。一位朋友是“程序员”,另一位是“测试员”,第三位是“规划师”。他们通过互相交流来解决问题。这之所以有效,是因为他们都有特定的职责。
  2. “熟能生巧”法(强化学习): 你让机器人尝试、失败、获得分数,然后再次尝试。随着时间的推移,它会从错误中学习,从而成为该任务的高手。

问题所在: 直到目前,这两种方法很难融合在一起。

  • 如果你试图使用“练习”法来教导整个团队,训练过程会变得混乱。因为“程序员”和“测试员”在互相交流,所以他们的提示词(指令)是在不断变化的。标准的训练方法会感到困惑,因为它们期望每个人都在同一时间回答完全相同的问题。
  • 如果你只是让他们单独练习,他们就无法学会如何有效地协作。

解决方案: 作者创建了 STRONGER-MAS(具体来说是一种名为 AT-GRPO 的算法)。你可以把它想象成一位全新的、超级聪明的教练,它知道如何同时训练一整个专家团队。


它是如何工作的:“树”类比

1. 旧方法(并行采样)

想象一位教练要求 4 名不同的学生解决一道数学题。

  • 学生 A 写出了一个解法。
  • 学生 B 写出了一个解法。
  • 学生 C 写出了一个解法。
  • 学生 D 写出了一个解法。

教练查看所有四个答案并说:“好吧,学生 A 做得最好。”
缺陷: 在团队设置中,下一步不仅仅是“再次解决问题”。下一步应该是:“学生 A,这是学生 B 写的内容;现在请修正你的答案。” 上下文每次都在变化。如果你只是让他们再次解决原始问题,你就没有在训练他们如何协作

2. 新方法(树状结构采样)

STRONGER-MAS 教练使用了一种树状方法。

  • 第 1 步: 团队从一个问题开始。
  • 第 2 步: “程序员”尝试用 4 种不同的方式编写代码。教练立即对这 4 种方式进行评分。
  • 第 3 步: 教练挑选出这 4 个代码中最好的那一个
  • 第 4 步: 现在,“测试员”看到了那个特定的最佳代码,并尝试用 4 种不同的方式对其进行测试。教练对这 4 个测试进行评分。
  • 第 5 步: 教练挑选出最好的测试,循环往复。

为什么这很重要: 这确保了当教练比较“程序员”的 4 次尝试时,他们都是在针对完全相同的情况做出反应。这使得学习过程既公平又高效。这就像一位教练在说:“好了,大家看,这是这份特定的草稿。这里有 4 种改进它的方法。让我们看看哪一种效果最好。”


“专业化 vs. 共享”之争

论文还测试了两种不同的团队结构:

  1. “共享大脑”(角色共享): 团队中的每个人都使用完全相同的“大脑”(同一个 AI 模型)。他们只是通过阅读不同的指令卡(提示词)来假装自己是不同的人。
    • 结果: 在简单的游戏和规划任务中表现出色。
  2. “专业化大脑”(角色专业化): “程序员”拥有专门为编程训练的大脑,“测试员”拥有专门为测试训练的大脑。他们永远不会交换工作。
    • 结果: 这在编程数学方面取得了巨大的成功。“程序员”变得非常擅长写代码,因为它只练习编程;而“测试员”变得非常擅长发现漏洞。

总结: 论文发现,你并不总是需要为每个工作配备一个专门的大脑。对于某些任务(如简单游戏),一个由所有人共享的聪明大脑就足够了。但对于困难的任务(如编写复杂的软件),为每个角色配备专门的专家要好得多。


结果:从“还可以”到“超越人类”

论文在四类任务上测试了这个系统:游戏、规划、编程和数学。

  • 长程规划(重大突破): 想象一个你需要提前规划 10 步的游戏。

    • 之前: 单个机器人独自尝试完成此任务的正确率仅为 14% 到 47%。它很容易迷失方向。
    • 之后: 借助 STRONGER-MAS 团队,他们的正确率达到了 96% 到 99.5%
    • 类比: 这就像是从一个拿着皱巴巴地图、迷失方向的游客,变成了一个每个人都清楚该往哪走的导游团。
  • 编程与数学: 团队在编写无 Bug 代码和解决难题方面也取得了显著进步(比之前的最佳方法提高了约 4% 到 18%)。

总结

这篇论文介绍了一种训练 AI 团队的新方法。他们不再将 AI 作为个体或混乱的群体进行训练,而是使用一种树状结构的方法,使团队的对话保持专注且公平。这使得 AI 能够学会如何协作,从而在解决复杂的多步问题(如规划路线、编写软件和解决数学谜题)方面取得了巨大的进步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →