← 最新论文
🤖 AI

MAR:Multi-Agent Reflexion Improves Reasoning Abilities in LLMs

该论文提出了 MAR(多智能体反思),这是一种采用多角色辩论者来生成多样化反思的方法,旨在克服单智能体自我反思中出现的思维退化问题,从而显著提升在 HotPot QA 和 HumanEval 等任务上的推理性能。

原作者: Onat Ozer, Yuchen Wang, Grace Wu, Daniel Dosti, Honghao Zhang, Vivi De La Rue

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Onat Ozer, Yuchen Wang, Grace Wu, Daniel Dosti, Honghao Zhang, Vivi De La Rue

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:AI 的“回声壁效应”

想象一下,你正在尝试解开一个非常困难的谜题。你犯了一个错误,但你无法向朋友寻求帮助,而是被迫观察自己的错误,写一段笔记告诉自己哪里错了,然后再次尝试。

这就是原始 Reflexion 系统的工作方式。它就像一个独自在房间里考试的学生。如果他们答错了,他们会写下一条笔记说:“我之所以错是因为我忽略了一个细节”,然后再次尝试。

研究人员发现这种方法存在一个重大缺陷:这个学生太固执于自己的思维方式了。

  • 如果学生是因为误解了规则而犯错,那么他们的自我笔记往往只是重复了同样的误解。
  • 他们最终陷入了一个“回声壁”中,不断重复同一个错误,并用略微不同的措辞来为自己辩解。
  • 在论文的技术术语中,这被称为**“思维退化”(degeneration of thought)**。AI 会陷入一种错误的推理循环中。

解决方案:“专家小组”

为了解决这个问题,作者创建了 多智能体反思(Multi-Agent Reflexion, MAR)

不再是一个学生在自言自语,而是想象 AI 现在是一支围坐在桌旁解决问题的专家团队。当团队犯错时,他们不仅仅是写下一条笔记,而是进行一场结构化的辩论

以下是新系统的运作步骤:

  1. 执行者(The Actor/做事的角色): 一个 AI 首先尝试解决问题。
  2. 失败(The Failure): 如果答案错误,系统并不仅仅是要求“执行者”去修复它。
  3. 辩论(The Debate/评论家们): 系统会召集一组不同的“人格”(专门化的 AI 角色)。把他们想象成:
    • 怀疑论者(The Skeptic): 一个怀疑一切并寻找隐藏陷阱的人。
    • 逻辑学家(The Logician): 一个检查步骤在数学上是否真正合理的人。
    • 创意家(The Creative): 一个提出大胆、替代性想法的人。
    • 验证者(The Verifier): 一个检查答案是否符合精确规则的人。
  4. 评判者(The Judge): 一个“评判者”AI 倾听所有这些不同专家的争论。它不只是选出一个赢家;它将这些论点综合成一条清晰、高质量的教训。
  5. 重试(The Retry): “执行者”AI 获得这条全新的、丰富的教训并再次尝试。因为教训来自于一个多元化的群体,它更有可能发现真正的错误,而不是仅仅重复旧的错误。

结果:有效吗?

研究人员在两种截然不同的挑战上测试了它:

  • “侦探”测试 (HotPotQA): 这涉及回答需要连接来自多个不同文档线索的问题。

    • 结果: 单一 AI 系统 (Reflexion) 的正确率约为 44%。新的“专家小组”系统 (MAR) 的正确率为 47%
    • 注: 作者承认这一进步比预期的要小,部分原因是这些问题的评分系统对微小的格式细节(如缺少句号)非常严格,有时会因此惩罚正确的推理。
  • “程序员”测试 (HumanEval): 这涉及编写必须通过隐藏测试的计算机代码。

    • 结果: 单一 AI 系统让 76.4% 的代码正常运行。新的“专家小组”系统让 82.6% 的代码正常运行。
    • 为什么效果更好: 编程错误通常是逻辑循环或“差一错误”(off-by-one mistakes)。“怀疑论者”和“逻辑学家”这些人格非常擅长发现这些特定类型的错误,而这些错误是单一 AI 一直忽略掉的。

代价:成本更高

论文诚实地说明了缺点。

  • 辩论的代价: 让一整个团队进行辩论比让一个人独自思考需要消耗更多的能量和时间。
  • 成本: 新系统使用了大约 3 倍的计算能力(并且在 API 费用上花费了 3 倍的钱),因为它必须运行多个 AI 模型来进行辩论。

总结

论文认为,虽然 AI 正在变得越来越聪明,但它仍然难以从自身的错误中学习,因为它容易陷入自己的习惯中。通过迫使 AI 与不同版本的自己进行辩论,它打破了这些坏习惯,找到了更好的解决方案,并变得更加可靠——尽管这需要更高的成本。

这就像是单人艺术家试图独自修改画作,与一整个艺术评论团队指出究竟哪里错了以及如何修复之间的区别。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →