← 最新论文
💬 NLP

CANTANTE: Optimizing Agentic Systems via Contrastive Credit Attribution

CANTANTE 是一种新颖的框架,它通过将系统级奖励对比性地归因于各个智能体来解决信用分配问题,从而优化基于大语言模型的多智能体系统,在多样化的基准测试中实现了提示优化的最先进性能,同时降低了推理成本。

原作者: Tom Zehle

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Tom Zehle

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个由三位专家组成的团队,他们共同解决一个难题:一位负责规划步骤的“规划者(Planner)”,一位负责编写解决方案的“编码者(Coder)”,以及一位负责检查方案是否有效的“验证者(Validator)”。这就是论文中所称的“多智能体系统(Multi-Agent System)”。

由 Tom Zehle 带领的作者们指出的问题是:当团队失败时,你只会得到整个团队的一个单一评分(例如,“你们得了 C")。但你不知道搞砸了。是规划者给出了错误的指令?是编码者犯了拼写错误?还是验证者漏掉了某个错误?

在传统的机器学习中,整个团队获得相同的评分,每个人都试图根据这个单一分数来改变自己的行为。这就像一位老师告诉一支足球队:“你们输了比赛”,然后要求守门员、前锋和裁判都根据这一句话来改变各自的策略。这种做法既低效又令人困惑。

解决方案:CANTANTE

作者们介绍了一个名为CANTANTE的新框架。你可以将 CANTANTE 想象成一位超级聪明的体育分析师,他观察团队用略微不同的策略多次进行同一场比赛,然后精确地分析出谁对胜利或失败做出了贡献。

以下是其工作原理,使用一个简单的类比:

1. “如果”游戏(对比归因)

CANTANTE 不是只给团队评一次分,而是让团队连续三到四次解决同一个难题。

  • 运行 A:规划者使用严肃的语气,编码者使用快速风格。
  • 运行 B:规划者使用友好的语气,编码者使用相同的快速风格。
  • 运行 C:规划者使用严肃的语气,编码者使用慢速风格。

在这些运行之后,团队会获得每次运行的评分。现在,归因器(Attributor)(即分析师)介入。它观察差异:

  • “在运行 A 和运行 B 中,编码者保持不变,但规划者改变了。分数上升了。因此,规划者的新语气是有帮助的!”
  • “在运行 A 和运行 C 中,规划者保持不变,但编码者改变了。分数下降了。因此,编码者的新风格是有害的。”

这被称为对比归因(Contrastive Attribution)。它通过相互比较来隔离每个人的贡献,而不是仅仅看最终分数。

2. 每个智能体的“信用评分”

一旦分析师弄清楚谁帮助了团队、谁损害了团队,它就会为每个智能体分配一个具体的信用评分(范围从 -1 到 +1)。

  • 如果规划者得到 +0.8,系统就知道要调整规划者的指令,使其更接近那个成功的版本。
  • 如果编码者得到 -0.5,系统就知道要引导编码者远离那种特定的风格。

关键在于,论文声称这比仅仅复制全局评分要好。在旧方法中,如果团队失败,即使规划者做得很好而问题出在编码者身上,规划者也可能受到指责。CANTANTE 通过指出“规划者做得不错;编码者需要改变”来解决这个问题。

3. 结果:更聪明的团队,更少的浪费

作者在三种截然不同的“难题”上测试了这种方法:

  1. 编程(MBPP):编写计算机程序。
  2. 数学(GSM8K):解决文字应用题。
  3. 研究(HotpotQA):回答需要从多个地方查找信息的复杂问题。

研究发现:

  • 更高的分数:CANTANTE 始终优于其他方法。在编程任务中,与次优方法相比,其准确率提高了近 19%。在数学任务中,提高了 12.5%
  • 运行成本更低:令人惊讶的是,经 CANTANTE 优化的团队不需要“思考”更长时间或使用更多计算资源来获得正确答案。事实上,在编程和数学任务中,它们使用的资源(token)比未优化的团队更少
  • 稳定性:该方法并非偶然成功一次;它在不同的随机起点下都能稳定发挥作用。

为什么这很重要(根据论文)

论文认为,构建这些 AI 团队不应是“猜测和检查”的游戏,即由人类手动调整提示词。相反,它应该是一门**信用分配(Credit Assignment)**的科学。

就像教练不会在一名球员射失球时向整个团队大喊大叫一样,CANTANTE 确保 AI 系统确切地学习到团队的哪一部分需要改进。它将多智能体系统的“黑箱”转变为一个透明的机器,让每个智能体都确切知道如何变得更好。

简而言之:CANTANTE 是一种让 AI 团队从错误中学习方法,它通过询问“具体是谁导致了这个结果?”来取代仅仅说“我们失败了,再努力点”。这带来了更智能、更高效、更准确的 AI 系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →