Who Deserves the Reward? SHARP: Shapley Credit-based Optimization for Multi-Agent System
本文介绍了 SHARP,这是一个通过利用基于 Shapley 的边际信用奖励来精确归因贡献,从而在训练稳定性和性能方面显著超越现有最先进方法的创新框架,旨在解决大语言模型多智能体系统中的信用分配挑战。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一位高风险研究团队的经理。你的目标是解决一个复杂的谜题,比如寻找一款新电脑芯片的确切规格。你拥有一位规划者(Planner)(负责将大问题分解为小任务的首领)和若干名执行者(Workers)(专门负责外出执行任务的专家,比如搜索网页或进行计算)。
在过去,当这个团队成功或失败时,奖励机制非常粗放。如果团队得到了正确答案,所有人都会得到一颗金星;如果失败了,所有人都会得到一张红牌。
这产生了一个大问题:究竟谁才值得这份荣誉?
- 是规划者给出了出色的路线图吗?
- 是执行者 A 找到了那篇完美的文章吗?
- 是执行者 B 在死胡同式的搜索中浪费了时间吗?
- 是执行者 C 犯了计算错误吗?
由于无论个人表现如何,整个团队获得的奖励都一样,因此“学习”过程变得非常混乱。规划者不知道自己的策略是否优秀,执行者也不知道他们的具体行为是有益还是有害。这就像一支运动队,即使其中一名球员一直在绊倒球,全队也会因为胜利而共同分享奖杯。
隆重推出 SHARP:“公平份额”系统
论文介绍了一种名为 SHARP(基于 Shapley 信用的强化策略优化)的新方法。你可以将 SHARP 想象成一个精密的会计系统,它能算出每位成员对最终结果的具体贡献度。
以下是 SHARP 的运作方式,我们使用一个简单的类比:
1. 三部分评分卡
SHARP 不再发放单一的大额奖励,而是将分数细分为三个特定部分,分发给每一位团队成员:
- “我们赢了吗?”奖金(全局准确性): 如果团队解开了谜题,每个人都会获得基础奖金。这能让所有人与最终目标保持一致。
- “如果……会怎样?”奖金(Shapley 信用值): 这是最神奇的部分。SHARP 会提出一个反事实问题:“如果我们把这个特定的人从团队中移除,会发生什么?”
- 如果没有执行者 A 团队就会失败,但有了他就能成功,那么执行者 A 就会获得巨大的“边际信用”分数。他是不可或缺的!
- 如果没有执行者 B,或者没有他反而更好,或者表现几乎一样,那么执行者 B 获得的得分就会很低(甚至是负分)。他并没有提供帮助。
- 这基于一个数学概念叫做 Shapley 值,这就像是一种公平分配披萨的方式——根据每个人实际有多饿来分配,而不是仅仅进行平均分配。
- “你尽责了吗?”奖金(工具流程): 这用于检查执行者是否正确使用了他们的工具。如果一名执行者试图使用计算器,却输入了错误的公式,即使最终答案因运气好而正确,他们也会在这里丢分。
2. “规划者与执行者”的舞蹈
在这个系统中,规划者和执行者通过一个共享的大脑(单个大语言模型)进行协同训练。
- 规划者根据他们分配的任务执行者的表现获得信用。如果规划者将任务分配给了一名失败的执行者,规划者就会学习在下次选择更好的执行者。
- 执行者则根据他们的具体行动是否推动了进度来获得信用。
3. 结果:更优秀的团队
论文在现实世界的谜题(如复杂的数学问题和网页搜索)上测试了这个系统。以下是他们的发现:
- 性能提升: 使用 SHARP 训练的团队比使用旧方法的团队能更正确地解决问题。他们的表现提升了约 23%(相比单人团队)以及 14%(相比其他多智能体团队)。
- 减少浪费: 该系统学会了停止“错误”行为。它通过过滤掉无效或有害的任务(例如搜索错误的内容),减少了执行者进行无用或有害任务的次数。
- 稳定性: 训练过程更加平滑。因为每个人都清楚自己的对错,团队不会感到困惑或陷入错误习惯的循环中。
核心结论
SHARP 是一种训练 AI 团队的新方法。它不再将团队视为一个获得通用奖励的单一整体,而是像一位公正的裁判,观察着每一个动作。它会追问:“到底是谁创造了差异?”并据此奖励(或纠正)每个智能体。这造就了更聪明、更高效的团队,使它们能够解决更难的问题,而不会在无用的行动上浪费时间。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。