← 最新论文
🤖 AI

Who Deserves the Reward? SHARP: Shapley Credit-based Optimization for Multi-Agent System

本文介绍了 SHARP,这是一个通过利用基于 Shapley 的边际信用奖励来精确归因贡献,从而在训练稳定性和性能方面显著超越现有最先进方法的创新框架,旨在解决大语言模型多智能体系统中的信用分配挑战。

原作者: Yanming Li, Xuelin Zhang, WenJie Lu, Ziye Tang, Maodong Wu, Haotian Luo, Tongtong Wu, Zijie Peng, Hongze Mi, Yibo Feng, Naiqiang Tan, Chao Huang, Lian Peng, Li Shen

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Yanming Li, Xuelin Zhang, WenJie Lu, Ziye Tang, Maodong Wu, Haotian Luo, Tongtong Wu, Zijie Peng, Hongze Mi, Yibo Feng, Naiqiang Tan, Chao Huang, Lian Peng, Li Shen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一位高风险研究团队的经理。你的目标是解决一个复杂的谜题,比如寻找一款新电脑芯片的确切规格。你拥有一位规划者(Planner)(负责将大问题分解为小任务的首领)和若干名执行者(Workers)(专门负责外出执行任务的专家,比如搜索网页或进行计算)。

在过去,当这个团队成功或失败时,奖励机制非常粗放。如果团队得到了正确答案,所有人都会得到一颗金星;如果失败了,所有人都会得到一张红牌。

这产生了一个大问题:究竟谁才值得这份荣誉?

  • 是规划者给出了出色的路线图吗?
  • 是执行者 A 找到了那篇完美的文章吗?
  • 是执行者 B 在死胡同式的搜索中浪费了时间吗?
  • 是执行者 C 犯了计算错误吗?

由于无论个人表现如何,整个团队获得的奖励都一样,因此“学习”过程变得非常混乱。规划者不知道自己的策略是否优秀,执行者也不知道他们的具体行为是有益还是有害。这就像一支运动队,即使其中一名球员一直在绊倒球,全队也会因为胜利而共同分享奖杯。

隆重推出 SHARP:“公平份额”系统

论文介绍了一种名为 SHARP(基于 Shapley 信用的强化策略优化)的新方法。你可以将 SHARP 想象成一个精密的会计系统,它能算出每位成员对最终结果的具体贡献度。

以下是 SHARP 的运作方式,我们使用一个简单的类比:

1. 三部分评分卡

SHARP 不再发放单一的大额奖励,而是将分数细分为三个特定部分,分发给每一位团队成员:

  • “我们赢了吗?”奖金(全局准确性): 如果团队解开了谜题,每个人都会获得基础奖金。这能让所有人与最终目标保持一致。
  • “如果……会怎样?”奖金(Shapley 信用值): 这是最神奇的部分。SHARP 会提出一个反事实问题:“如果我们把这个特定的人从团队中移除,会发生什么?”
    • 如果没有执行者 A 团队就会失败,但有了他就能成功,那么执行者 A 就会获得巨大的“边际信用”分数。他是不可或缺的!
    • 如果没有执行者 B,或者没有他反而更好,或者表现几乎一样,那么执行者 B 获得的得分就会很低(甚至是负分)。他并没有提供帮助。
    • 这基于一个数学概念叫做 Shapley 值,这就像是一种公平分配披萨的方式——根据每个人实际有多饿来分配,而不是仅仅进行平均分配。
  • “你尽责了吗?”奖金(工具流程): 这用于检查执行者是否正确使用了他们的工具。如果一名执行者试图使用计算器,却输入了错误的公式,即使最终答案因运气好而正确,他们也会在这里丢分。

2. “规划者与执行者”的舞蹈

在这个系统中,规划者和执行者通过一个共享的大脑(单个大语言模型)进行协同训练。

  • 规划者根据他们分配的任务执行者的表现获得信用。如果规划者将任务分配给了一名失败的执行者,规划者就会学习在下次选择更好的执行者。
  • 执行者则根据他们的具体行动是否推动了进度来获得信用。

3. 结果:更优秀的团队

论文在现实世界的谜题(如复杂的数学问题和网页搜索)上测试了这个系统。以下是他们的发现:

  • 性能提升: 使用 SHARP 训练的团队比使用旧方法的团队能更正确地解决问题。他们的表现提升了约 23%(相比单人团队)以及 14%(相比其他多智能体团队)。
  • 减少浪费: 该系统学会了停止“错误”行为。它通过过滤掉无效或有害的任务(例如搜索错误的内容),减少了执行者进行无用或有害任务的次数。
  • 稳定性: 训练过程更加平滑。因为每个人都清楚自己的对错,团队不会感到困惑或陷入错误习惯的循环中。

核心结论

SHARP 是一种训练 AI 团队的新方法。它不再将团队视为一个获得通用奖励的单一整体,而是像一位公正的裁判,观察着每一个动作。它会追问:“到底是谁创造了差异?”并据此奖励(或纠正)每个智能体。这造就了更聪明、更高效的团队,使它们能够解决更难的问题,而不会在无用的行动上浪费时间。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →