← 最新论文
💬 NLP

Recursive Agent Harnesses

本文介绍了递归智能体框架(Recursive Agent Harness, RAH),这是一个以代码为核心的框架,其中父级智能体会生成带有文件系统和执行工具的并行子智能体框架,在通过固定且更强的骨干模型进行评估时,该框架在长上下文推理和编程任务方面较传统的模型递归基准表现出了显著的提升。

原作者: Elias Lumer, Sahil Sen, Kevin Paul, Vamse Kumar Subbiah

发布于 2026-06-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Elias Lumer, Sahil Sen, Kevin Paul, Vamse Kumar Subbiah

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个包含数百万本书籍的巨大图书馆,而你需要从每一本书中寻找一个特定的事实。

旧方法:过度劳累的图书管理员
以前,如果你要求一个聪明的 AI(一个“编程智能体”)去做这件事,它会试图扮演一个超快速的图书管理员。它会使用简单的规则(比如寻找特定的关键词)来扫描书籍以寻找答案。但由于图书馆规模如此庞大,图书管理员一次只能手里拿着几本书。他们不得不跳过阅读大部分书籍的实际文本,转而依赖这些简单的规则。如果答案需要对特定页面进行深度思考,图书管理员就会错过它。

“模型递归”法:思维链
另一种方法叫做“递归语言模型”(RLMs),它试图通过将图书馆分成更小的堆来进行解决。AI 会思考一堆书,然后是下一堆,再下一堆,形成一个长长的思维链。然而,这个 AI 就像一个被禁止触摸书籍的图书管理员。他们只能思考被给予的文本,但无法打开文件、运行工具或使用放大镜。他们很聪明,但在没有实际工具与文档交互时却显得无能为力。

新方法:“递归智能体护套”(RAH)
这篇论文介绍了一种名为**递归智能体护套(Recursive Agent Harness, RAH)**的新策略。

请不要将 RAH 视为一个图书管理员,而要将其视为一个为这项工作组建整个团队的总承包商

  1. 总体计划: 主 AI(父级)观察着这个巨大的图书馆,并意识到:“我无法独自完成这项工作,我也不能仅仅靠思考来完成。”
  2. 编写脚本: 主 AI 并没有尝试亲自去做这项工作,而是编写了一个计算机程序(脚本)。这个脚本就像是一套指令,上面写着:“对于图书馆中的每一本书,都要雇佣一名全副武装的新助手。”
  3. 子团队: 脚本运行并瞬间生成了数百个子智能体。至关重要的是,每一个子智能体都是一个完整的劳动者。他们拥有自己的办公桌、自己的工具(如文件打开器、搜索引擎和代码执行器)以及自己的上下文窗口(他们各自的精神空间)。
  4. 并行工作: 旧的图书管理员一次只能看一本书,而思维链 AI 一次只能思考一堆书,但 RAH 派出成千上万名装备精良的助手,让他们同时在各自负责的书籍上并行工作
  5. 结果: 每位助手阅读他们特定的书籍,使用他们的工具找到答案,并将结果记录下来。随后,父级 AI 收集所有的答案。

“工具箱”的比喻
核心区别在于工具箱

  • 编程智能体拥有工具箱,但一次只能看几本书。
  • RLM 有一个巨大的大脑但没有工具箱;它无法打开文件。
  • RAH 给每一位劳动者都配备了完整的工具箱,并让他们并行开展工作。

论文的研究发现
研究人员在名为“Oolong”的高难度测试上对该方法进行了测试,该测试涉及在长达 400 万词的文档(大约相当于一本小说的规模,但包含数千条条目)中寻找答案。

  • 为了确保公平比较,他们在所有测试中都使用了相同的“大脑”(GPT-5)。
  • 旧的“编程智能体”得分约为 72%
  • “模型递归”(无工具)得分约为 64%
  • 新的 RAH 方法得分约为 81%

核心结论
论文声称,性能的提升并非源于使用了更聪明的 AI 模型,而是完全源于组织工作的方式发生了改变。通过将“递归单元”(即重复工作的单元)从一个简单的“想法”转变为一个“拥有工具的完整劳动者”,系统在解决复杂、大规模问题时变得更加出色。

作者指出,这不仅仅是一个理论;它类似于现实世界中一些生产系统(如 Anthropic 的动态工作流)已经开始采用的方式。他们只是为这种模式命名,并证明了它比旧方法更有效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →