← 最新论文
🤖 AI

Unifying Temporal and Structural Credit Assignment in LLM-Based Multi-Agent Prompt Optimization

本文提出了一种基于大语言模型的多智能体系统优化新框架,通过引入时序与结构信用分配机制,解决了不可微分性和稀疏监督的挑战,从而引导一种离散的、基于语言描述的块坐标下降算法,实现针对提示词的高效、精准优化。

原作者: Wenwu Li, Yuran Song, Mingze Zhao, Bo Jin, Wenhao Li

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenwu Li, Yuran Song, Mingze Zhao, Bo Jin, Wenhao Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个由人工智能助手组成的团队,它们协同工作以解决一个棘手的难题,比如规划一次复杂的旅行或解决一道困难的数学题。它们会进行多轮对话:一人提出想法,另一人加以批判,第三人则尝试将一切整合起来。

问题在于,当团队最终给出错误答案时,这成了一个谜团。是第一个人提出了糟糕的想法?是第二个人误解了批判意见?还是负责总结的人搞砸了最后一步?由于 AI 团队在一个“黑盒”中运作,我们通常无法判断究竟是谁该受责备。最终我们只能猜测,并一次性修改所有人的指令,这种做法效率低下,且往往适得其反。

本文提出了一种更聪明的方法来修复这些 AI 团队。作者将他们的这种方法称为“时间与结构责任分配”。以下是其工作原理,辅以简单的类比:

1. 问题:“蒙眼的教练”

想象一位教练试图提升一支接力赛队伍的表现。队伍跑完比赛后,教练在终点发现他们输了。教练完全不知道队伍是在哪里失利的。

  • 旧方法:教练对所有人吼叫“跑得更快”,或者给整个队伍更换跑鞋,希望某种改变能奏效。这就是当前 AI 优化器所做的:它们随机地微调整个系统。
  • 本文的洞见:要修复这支队伍,教练需要确切知道是哪位选手掉了棒,以及在比赛的哪一棒发生的。

2. 解决方案:两种类型的“责任”

作者引入了两种方法来厘清谁做了什么,将问题分解为时间结构两个维度。

A. 时间责任(“何时”)

将 AI 团队的对话想象成一部包含多个场景的电影(第 1 轮、第 2 轮等)。

  • 瓶颈:作者强制团队在每一轮结束后暂停,并让一个“总结者”撰写一份关于迄今为止发生情况的简短报告。这创造了一个清晰的检查点。
  • 修复:如果最终答案是错误的,系统会回溯这些检查点。它会问:“第 2 轮的报告看起来是否不稳?第 4 轮的总结是否遗漏了关键事实?”
  • 结果:系统不再责怪整部电影,而是识别出故事偏离正轨的具体“场景”。

B. 结构责任(“谁”)

现在,想象团队有特定的角色:一名规划者、一名求解者和一名批判者

  • 固定策略:作者确保“规划者”在每一轮中都使用同一套指令,“批判者”也是如此。它们不会在比赛中途改变自己的“性格”。
  • 修复:由于角色保持一致,系统可以纵观整场比赛并指出:“规划者在第 1 轮和第 3 轮表现很棒,但批判者在每一轮中都 consistently 表现薄弱。”
  • 结果:系统识别出批判者是薄弱环节,而非规划者。

3. 策略:“靶向手术”

一旦系统知道了何时(哪一轮)和(哪个角色)表现不佳,它就不再猜测。它使用一种称为块坐标下降的方法,这就像外科医生进行靶向手术,而不是进行全面的体检。

  • 步骤 1:冻结团队中“好”的部分。如果规划者表现优异,其指令就保持原样。
  • 步骤 2:仅重写“坏”部分的指令。如果批判者表现薄弱,系统会要求一个智能 AI 专门为批判者编写一条新的、更好的指令。
  • 步骤 3:对“坏”的轮次也做同样的处理。如果第 2 轮是灾难,它仅重写第 2 轮中总结步骤的指令。

4. 结果

本文在各种推理任务(如医疗问题和旅行规划)上测试了这种方法。

  • 效率:他们发现,通过仅修复特定的薄弱环节,他们需要的尝试次数大大减少,从而使团队能够良好运作。
  • 性能:与那些随机修改所有人指令的团队相比,这些团队在解决问题方面有了显著提升。
  • 清晰度:该系统实际上可以告诉你它为何做出改变(例如:“我们更新了批判者的指令,因为它在第 2 轮中持续遗漏逻辑错误”)。

总结

简而言之,本文教导我们如何停止将 AI 团队视为一个神秘的黑盒。通过建立清晰的检查点(时间)和一致的角色(结构),我们可以精确定位对话中究竟是哪一部分出了问题。我们不再盲目地重写整个剧本,而是可以像手术刀一样精准地编辑那些薄弱的句子和困惑的角色,从而打造出更智能、更快速、更可靠的 AI 团队。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →