← 最新论文
💬 NLP

Recursive Agent Optimization

本文介绍了递归代理优化(RAO),这是一种强化学习框架,它训练智能体将子任务递归地委派给自身,从而提升训练效率、突破上下文限制实现可扩展性,并通过分治策略增强对复杂问题的泛化能力。

原作者: Apurva Gandhi, Satyaki Chakraborty, Xiangjun Wang, Aviral Kumar, Graham Neubig

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Apurva Gandhi, Satyaki Chakraborty, Xiangjun Wang, Aviral Kumar, Graham Neubig

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位非常聪明但略显健忘的私人助理。你交给他们一项庞大而复杂的工作,比如为一个四口之家策划为期三天的京都之旅,或者在一百万本书的图书馆中寻找某个隐藏的具体事实。

如果你将这项任务交给一位单独的助理,可能会出现两种问题:

  1. 他们不堪重负:指令太长,导致他们在执行到计划末尾时,已经忘记了开头的部分。
  2. 他们陷入停滞:任务太大,无法一次完成,因此他们要么放弃,要么犯错。

本文介绍了一种训练这些助理的新方法,称为递归代理优化(Recursive Agent Optimization, RAO)。RAO 并非仅仅训练一位助理独自完成所有工作,而是赋予他们一项超能力:克隆自己的能力

以下是其工作原理,通过简单的类比来说明:

1. “克隆军团”策略

在旧方法中,如果助理需要研究某个主题,他们会按顺序阅读所有内容。如果文本过长,他们就会遗漏细节。

而在 RAO 中,主助理(我们称她为经理)审视一项大任务后说道:“这太庞大了,我无法一次性记在脑海里。我要把它拆分。”

随后,她生成子代理(即她的克隆体)。

  • 经理:“你,子代理 A,去找出最佳赏樱地点。”
  • 经理:“你,子代理 B,去找出一个安静的寺庙和一个适合孩子的活动。”
  • 子代理 B:“等等,我无法同时做这两件事。我也要生成自己的克隆体!子代理 B1,去找寺庙。子代理 B2,去找适合孩子的活动。”

这就形成了一个树状的工作网络。每位工作者只需专注于拼图中一小块、可管理的部分。他们无需记住整个项目的历史,只需记住自己特定的小任务。

2. “团队奖金”系统(他们如何学习)

本文的重大突破不仅在于使用克隆体,更在于如何训练他们使用这些克隆体。

想象一款视频游戏,你会获得积分。

  • 旧方法:只有当你赢得整个游戏时才能获得积分。如果你在关卡通关时做出了精彩的举动,但最终输给了最终 Boss,你依然得零分。这使得很难学会如何打好早期关卡。
  • RAO 方法:你因两件事获得积分:
    1. 是否解决了自己的特定小任务?(例如:你找到寺庙了吗?)
    2. 你雇佣的人(你的子克隆体)是否解决了他们的任务?

如果经理雇佣了一位失败的子代理,经理会受到“委托惩罚”。如果经理雇佣了一位成功的子代理,经理则会获得“委托奖励”。

这教会了经理两个关键教训:

  • 何时克隆:不要为微小任务克隆(那是浪费时间)。当任务过大时才进行克隆。
  • 如何克隆:给出清晰的指令,以便你的克隆体能成功。

3. 结果:论文发现了什么

研究人员在三种类型的“高难度工作”上测试了这种方法:

  • “制作”游戏(TextCraft-Synth):想象一款类似《我的世界》的游戏,你需要通过组合许多小物品来构建一个复杂物品(如蜂巢)。

    • 结果:经过 RAO 训练的代理能够构建出单个代理无法处理的极其复杂的物品。他们甚至能解决“困难”级别的谜题,而单代理版本则完全失败。
    • 速度:由于克隆体可以同时处理制作的不同部分(就像一个人切木头,另一个人涂漆),尽管总步数更多,但在现实时间中他们完成工作的速度快得多。
  • “长书”测试(Oolong-Real):想象要求助理在一本 55,000 字长的书中找到特定句子,但助理一次只能“阅读”32,000 字。

    • 结果:单个助理不得不猜测或使用技巧,因为它无法读完整本书。而 RAO 代理将书分成块,将每一块分配给不同的克隆体,然后合并答案。它完美地解决了问题,而单个代理则失败了。
  • “深度研究”测试(DeepDive):想象要求助理寻找一个特定的历史事实,这需要搜索互联网、阅读五个不同的网站并串联线索。

    • 结果:RAO 代理学会了将研究分解为步骤(搜索、验证、综合)并进行委托。虽然由于步骤必须按顺序完成(如果两个事实相互依赖,你无法在同一时刻搜索两个不同的事实)导致耗时更长,但其准确性远高于单个代理。

核心结论

论文认为,我们不应仅仅构建花哨的工具(如克隆),然后指望 AI 自行摸索如何使用它们。相反,我们应该专门训练 AI 使用这些工具

通过教导 AI 将大问题分解为小问题,将其委托给自己的克隆体,并奖励克隆体做好工作,AI 变得:

  1. 更擅长解决难题:它能够应对超出其记忆容量的庞大任务。
  2. 更擅长并行任务:它可以同时处理多件事。
  3. 更擅长学习:因为它在每个小步骤都能获得反馈,而不仅仅是在最终结果上。

简而言之,RAO 将一位不堪重负的单兵,转变为一个组织良好、自我管理的团队,能够解决任何单兵都无法独自处理的问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →