← 最新论文
💬 NLP

IterResearch: Rethinking Long-Horizon Agents with Interaction Scaling

IterResearch 引入了一种基于交互缩放(Interaction Scaling)和受 MDP 启发的工作空间重构(MDP-inspired workspace reconstruction)的迭代深度研究范式,该范式克服了现有智能体在上下文方面的限制,从而在作为训练模型以及作为前沿系统的提示策略时,均在长程任务上实现了显著的性能提升。

原作者: Guoxin Chen, Zile Qiao, Xuanzhong Chen, Donglei Yu, Haotian Xu, Wayne Xin Zhao, Ruihua Song, Wenbiao Yin, Huifeng Yin, Liwen Zhang, Kuan Li, Minpeng Liao, Yong Jiang, Pengjun Xie, Fei Huang, Jingren Z
发布于 2026-02-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Guoxin Chen, Zile Qiao, Xuanzhong Chen, Donglei Yu, Haotian Xu, Wayne Xin Zhao, Ruihua Song, Wenbiao Yin, Huifeng Yin, Liwen Zhang, Kuan Li, Minpeng Liao, Yong Jiang, Pengjun Xie, Fei Huang, Jingren Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是 IterResearch 论文的解释,已将其翻译为中文。

核心问题: “无尽滚动”陷阱

想象一下,你正在试图解决一个非常困难的谜题,比如在互联网深处寻找一个特定的事实。

目前大多数 AI 智能体的工作方式就像是一个永远不会翻页的人在读一本书。他们开始读第 1 页,然后是第 2 页,接着是第 3 页。但他们并没有在读完旧页面后将其关闭并重新开始,而是不断地将新页面添加到同一个巨大堆栈的底部。

  • 结果: 读到第 50 页时,这个堆栈变得如此之高,以至于这个人看不见顶端了。他们被所有的旧文本“窒息”了。
  • 噪音: 如果他们在第 5 页不小心读到了一个错误的事实,这个错误的事实会永远卡在堆栈中,让他在第 5 0 页时依然感到困惑。

论文称之为 “单上下文范式” (Mono-contextual Paradigm)。这就像是在跑马拉松时拖着一个随着每一步都在变重的沉重背包。最终,你会崩溃倒地。

解决方案:“智能笔记本” (IterResearch)

作者引入了 IterResearch,这是一种让 AI 进行思考的新方式。AI 不再拖着一叠巨大的纸张,而是使用一本每次学习新知识时都会被重写的 “智能笔记本”

以下是它的工作步骤:

  1. “重置”按钮:
    想象你是一名侦探。你收集了一段时间的线索。你并没有保留所有接触过的碎纸片,而是坐下来,在一个干净的笔记本上写下你目前所知的摘要,然后扔掉那些凌乱的碎片

    • 论文术语: 迭代式工作空间重构 (Iterative Workspace Reconstruction)
    • 类比: AI 清理了它的桌面,只保留核心的“案件档案”(报告),然后以一个全新的、干净的状态开始下一轮调查。这防止了因拥有过多旧文本而导致的“窒息”。
  2. “进化型”报告:
    AI 不仅仅是记住事实;它还在编写一份“活的”报告。每当它发现新信息时,它都会更新这份报告,过滤掉垃圾信息,只保留精华。

    • 论文术语: 进化报告记忆 (Evolving Report Memory)
    • 类比: 这就像一个 AI 实时编辑的维基百科页面。旧的、错误的或无关的信息会被删除;新的、正确的信息会被添加。无论调查持续多久,“记忆”始终保持精简和干净。
  3. “效率”教练:
    AI 需要学习如何高效地搜索。论文引入了一种名为 EAPO(效率感知策略优化)的训练方法。

    • 类比: 想象一位教练,如果你用 5 步解开了谜题,他会给你一颗金星;但如果你用了 50 步才解开,他只会给你一颗微弱的、暗淡的星星。即使你得到了正确答案,教练也会教你如何更快、更聪明地解决问题,而不是仅仅靠不断挖掘直到碰巧成功。

惊人的结果

论文将这种新的“智能笔记本”方法与旧的“无尽滚动”方法进行了对比测试。结果如下:

  • 击败竞争对手: 新的 AI (IterResearch) 在六项不同的困难测试中,得分显著高于其他任何开源 AI 智能体。它缩小了与最昂贵的专有系统(如来自 Google 或 OpenAI 的系统)之间的差距。
  • “超长”马拉松: 最令人震惊的结果是 交互规模化 (Interaction Scaling)
    • 类比: 旧的智能体通常在 20 或 30 步之后就会放弃或感到困惑,因为它们的“背包”太重了。而 IterResearch 能够连续运行 2,048 步而不显疲态。
    • 结果: 当允许它进行更多步数(高达 2,048 步)时,它的表现从糟糕的 3.5% 跃升到了惊人的 42.5%。这证明了问题不在于 AI “太笨”无法解决任务,而在于旧的方法无法让它观察得足够久。
  • 通用技巧: 作者发现,你甚至不需要重新训练 AI 来使用这种方法。如果你只是将“智能笔记本”的指令(提示词)交给另一个强大的 AI,那个 AI 会立刻在长任务处理上变得更出色。这就像是给一把标准的电筒换上了一个新透镜,让它能看得更远。

总结

IterResearch 是一种让 AI 进行深度研究的新方式。它不再囤积它发现的每一条信息(这最终会使 AI 窒息),而是定期总结已知信息、丢弃噪音并重新开始

这使得 AI 能够:

  1. 进行更长时间的清晰思考(长达 2,048 步)。
  2. 更高效地寻找答案。
  3. 比目前几乎所有其他的开源智能体表现得更好。

它将 AI 从一个溺于纸堆的人,转变为一名拥有完美组织、不断更新的案件档案的侦探。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →