IterResearch: Rethinking Long-Horizon Agents with Interaction Scaling
IterResearch 引入了一种基于交互缩放(Interaction Scaling)和受 MDP 启发的工作空间重构(MDP-inspired workspace reconstruction)的迭代深度研究范式,该范式克服了现有智能体在上下文方面的限制,从而在作为训练模型以及作为前沿系统的提示策略时,均在长程任务上实现了显著的性能提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是 IterResearch 论文的解释,已将其翻译为中文。
核心问题: “无尽滚动”陷阱
想象一下,你正在试图解决一个非常困难的谜题,比如在互联网深处寻找一个特定的事实。
目前大多数 AI 智能体的工作方式就像是一个永远不会翻页的人在读一本书。他们开始读第 1 页,然后是第 2 页,接着是第 3 页。但他们并没有在读完旧页面后将其关闭并重新开始,而是不断地将新页面添加到同一个巨大堆栈的底部。
- 结果: 读到第 50 页时,这个堆栈变得如此之高,以至于这个人看不见顶端了。他们被所有的旧文本“窒息”了。
- 噪音: 如果他们在第 5 页不小心读到了一个错误的事实,这个错误的事实会永远卡在堆栈中,让他在第 5 0 页时依然感到困惑。
论文称之为 “单上下文范式” (Mono-contextual Paradigm)。这就像是在跑马拉松时拖着一个随着每一步都在变重的沉重背包。最终,你会崩溃倒地。
解决方案:“智能笔记本” (IterResearch)
作者引入了 IterResearch,这是一种让 AI 进行思考的新方式。AI 不再拖着一叠巨大的纸张,而是使用一本每次学习新知识时都会被重写的 “智能笔记本”。
以下是它的工作步骤:
“重置”按钮:
想象你是一名侦探。你收集了一段时间的线索。你并没有保留所有接触过的碎纸片,而是坐下来,在一个干净的笔记本上写下你目前所知的摘要,然后扔掉那些凌乱的碎片。- 论文术语: 迭代式工作空间重构 (Iterative Workspace Reconstruction)。
- 类比: AI 清理了它的桌面,只保留核心的“案件档案”(报告),然后以一个全新的、干净的状态开始下一轮调查。这防止了因拥有过多旧文本而导致的“窒息”。
“进化型”报告:
AI 不仅仅是记住事实;它还在编写一份“活的”报告。每当它发现新信息时,它都会更新这份报告,过滤掉垃圾信息,只保留精华。- 论文术语: 进化报告记忆 (Evolving Report Memory)。
- 类比: 这就像一个 AI 实时编辑的维基百科页面。旧的、错误的或无关的信息会被删除;新的、正确的信息会被添加。无论调查持续多久,“记忆”始终保持精简和干净。
“效率”教练:
AI 需要学习如何高效地搜索。论文引入了一种名为 EAPO(效率感知策略优化)的训练方法。- 类比: 想象一位教练,如果你用 5 步解开了谜题,他会给你一颗金星;但如果你用了 50 步才解开,他只会给你一颗微弱的、暗淡的星星。即使你得到了正确答案,教练也会教你如何更快、更聪明地解决问题,而不是仅仅靠不断挖掘直到碰巧成功。
惊人的结果
论文将这种新的“智能笔记本”方法与旧的“无尽滚动”方法进行了对比测试。结果如下:
- 击败竞争对手: 新的 AI (IterResearch) 在六项不同的困难测试中,得分显著高于其他任何开源 AI 智能体。它缩小了与最昂贵的专有系统(如来自 Google 或 OpenAI 的系统)之间的差距。
- “超长”马拉松: 最令人震惊的结果是 交互规模化 (Interaction Scaling)。
- 类比: 旧的智能体通常在 20 或 30 步之后就会放弃或感到困惑,因为它们的“背包”太重了。而 IterResearch 能够连续运行 2,048 步而不显疲态。
- 结果: 当允许它进行更多步数(高达 2,048 步)时,它的表现从糟糕的 3.5% 跃升到了惊人的 42.5%。这证明了问题不在于 AI “太笨”无法解决任务,而在于旧的方法无法让它观察得足够久。
- 通用技巧: 作者发现,你甚至不需要重新训练 AI 来使用这种方法。如果你只是将“智能笔记本”的指令(提示词)交给另一个强大的 AI,那个 AI 会立刻在长任务处理上变得更出色。这就像是给一把标准的电筒换上了一个新透镜,让它能看得更远。
总结
IterResearch 是一种让 AI 进行深度研究的新方式。它不再囤积它发现的每一条信息(这最终会使 AI 窒息),而是定期总结已知信息、丢弃噪音并重新开始。
这使得 AI 能够:
- 进行更长时间的清晰思考(长达 2,048 步)。
- 更高效地寻找答案。
- 比目前几乎所有其他的开源智能体表现得更好。
它将 AI 从一个溺于纸堆的人,转变为一名拥有完美组织、不断更新的案件档案的侦探。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。