← 最新论文
💬 NLP

Empirical-MCTS: Continuous Agent Evolution via Dual-Experience Monte Carlo Tree Search

Empirical-MCTS 引入了一种双环框架,通过将局部搜索与全局记忆系统相结合来增强大语言模型的推理能力,利用成对经验演化元提示(Pairwise-Experience-Evolutionary Meta-Prompting)和记忆优化智能体(Memory Optimization Agent)来持续演化自适应元提示并跨问题提炼见解,从而在复杂推理基准测试中显著优于无状态 MCTS 策略。

原作者: Hao Lu, Haoyuan Huang, Yulin Zhou, Chen Li, Ningxin Zhu

发布于 2026-02-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Hao Lu, Haoyuan Huang, Yulin Zhou, Chen Li, Ningxin Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在尝试解决一个非常困难的谜题,比如一个复杂的数学问题或逻辑谜题。

旧方式:“失忆症”天才
目前的先进 AI 模型大多表现得像是一个拥有过目不忘之能却患有严重失忆症的天才。它们可能会尝试 100 种不同的方法来解决一个问题,找到那一种奏效的方法,并为此庆祝。但一旦它们转向下一个谜题,它们就会忘掉之前学到的一切。它们从零开始,把新问题当作从未见过的谜题一样对待。它们不会“记得”上次哪个技巧奏效了,因此会浪费时间在重新发现这些技巧上。

新方式:Empirical-MCTS(“收集智慧”的侦探)
这篇论文介绍了一种名为 Empirical-MCTS 的新系统。不要把这个 AI 仅仅看作是一个失忆者,而要把它看作是一个不断构建、有条理的案件档案库的侦探。每当他们破解一个线索或犯下一个错误时,他们不仅仅是把纸扔掉。他们会分析它,写下哪些做法奏效了,并将其添加到他们的永久“智慧库”中。

这个系统通过两个主要的“循环”或习惯来运作:

1. 本地循环:“辩论俱乐部”(PE-EMP)

在 AI 的大脑内部,当它试图解决一个特定问题时,它并不只是在瞎猜。它扮演着一个辩论俱乐部的角色。

  • 它生成两个不同的可能答案(我们称之为候选方案 A 和候选方案 B)。
  • 它让这两个方案进行“辩论”,而它自己充当裁判。
  • 裁判不仅仅是选出一个胜者,还会询问:“为什么 A 赢了?它遵循了哪个 B 错过的具体规则?”
  • 基于这场辩论,AI 会实时重写自己的指令手册(称为“元提示词”/ meta-prompt)。这就像一个学生意识到:“噢,我在写最终答案之前需要先检查我的数学计算,”并立即为下一步更新他们的学习指南。

2. 全局循环:“图书管理员”(记忆优化)

当“辩论俱乐部”处理当前问题时,一个独立的“图书管理员”代理正在观察。

  • 如果辩论俱乐部发现了一个精妙的新技巧或一个需要避免的常见错误,图书管理员并不仅仅是保存原始文本。
  • 图书管理员扮演着一名聪明的编辑。它可能会添加一条新规则到库中,将两条相似的规则合并为一条以节省空间,修改一条略有偏差的旧规则,或者删除一条不再有用的规则。
  • 这创造了一个“活的”智慧库,随着 AI 解决每一个问题,这个库变得越来越聪明、越来越精确。

结果:无需“学习”也能变得更聪明

通常,要让 AI 变得更聪明,你需要对其进行“训练”,这就像强迫人类回到学校重新学习几个月一样。这种方式既昂贵又缓慢。

Empirical-MCTS 则不同。它并不改变 AI 的“大脑”(其权重)。相反,它改变的是 AI 的上下文

  • 它采用一个标准的 AI 模型(就像一个聪明但缺乏经验的学生)。
  • 它给这个学生一份不断更新的“小抄”,上面记录着他们过去成功与失败的经验。
  • 因为学生拥有这份小抄,他们可以比以前更好地解决极其困难的问题(如高级数学竞赛或抽象推理任务),即便这个学生的底层大脑并没有发生任何变化。

该论文的发现

作者在一些最难的逻辑和数学测试(如 AIME 数学竞赛和抽象推理任务)上对该系统进行了测试。

  • “失忆症”AI(标准方法)在面对最难的问题时经常卡住或放弃。
  • “收集智慧”的 AI(Empirical-MCTS)解决了显著更多的题目。
  • 成本效率: 他们发现,使用这种方法配合一个更小、更便宜的 AI 模型,实际上可以击败许多更大、更昂贵的模型。这就像是一支拥有完美共享战术手册的小型团队,击败了一支庞大但对过去比赛毫无记忆的巨型球队。

简而言之: 这篇论文表明,如果你教会 AI “记住”自己的推理模式,并在过程中不断更新自己的指令,它就能成为一名大师级的解题者,而无需从头开始重新训练。它将一种“无状态”的搜索转变为一段持续的学习旅程。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →