← 最新论文
🤖 machine learning

ECHO: Prune to act, trace to learn with selective turn memory in agentic RL

该论文介绍了 ECHO,一种针对长程语言智能体的选择性轮次记忆框架,它通过将环境轮次压缩为源索引记录,以实现可追溯的强化学习和细粒度的证据复用,从而在 BrowseComp-Plus 等基准测试中,相比现有的上下文管理方法实现了更优越的性能和泛化能力。

原作者: Zijun Xie, Binbin Zheng, Enlei Gong, Jihua Liu, Yuyang You, Lingfeng Liu, Jiayao Tang, Guanqun Zhao, Aoqi Hu, Zeyu Chen

发布于 2026-07-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Zijun Xie, Binbin Zheng, Enlei Gong, Jihua Liu, Yuyang You, Lingfeng Liu, Jiayao Tang, Guanqun Zhao, Aoqi Hu, Zeyu Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名正在试图破解复杂谜团的侦探。你的笔记本(即你的“上下文窗口”)空间有限,你需要用它来记录线索、询问证人并形成理论。如果案件持续数日,你的笔记本就会写满。

问题:“黑洞”笔记本
目前的 AI 侦探也面临类似的问题。当他们进行长时间调查时,必须丢弃旧笔记以腾出空间。

  • 旧方法(总结法): 一些侦探试图通过为上周发生的所有事情写一段一句话的总结来解决这个问题。“我们查看了银行,然后去了公园,最后去了图书馆。”
    • 缺陷: 如果侦探后来意识到关于银行监控摄像头的那个特定细节才是破案的关键,他们再也找不回它了。总结得太笼统了。
    • 学习缺陷: 如果侦探破了案,老师(AI 训练师)并不知道究竟是哪个特定的线索导致了解决方案。是因为银行的笔记?公园的笔记?还是仅仅因为侦探猜对了?老师最终会奖励整个混乱的笔记本,包括其中无用的部分。

解决方案:ECHO(“索引卡”系统)
这篇论文介绍了一种新方法——ECHO。ECHO 不再是将旧笔记扔掉或将其总结成一片模糊的文字,而是将调查中的每一个步骤都视为一张独立的、带有编号的索引卡。

以下是 ECHO 的运作方式,使用简单的比喻:

1. 修剪以行动(智能文件柜)

当侦探的笔记本变满时,ECHO 不仅仅是删除旧页面。相反,它会为每一个完成的步骤创建一个紧凑的索引卡

  • 卡片内容: 它包含一个极其简短的事件摘要(例如:“在公园发现了一只红鞋”)以及一个永久地址(指针)指向原始的完整报告。
  • 筛选过程: 当侦探需要开始调查的新阶段时,他们不需要阅读整个历史记录。他们向自己的 AI 助手提问:“这些索引卡中,哪些对于解决接下来的谜团实际上是有用的?”
  • 结果: 侦探只提取他们当前笔记本中需要的特定且相关的卡片。他们不需要随身携带整个历史,只需携带最重要的碎片。

2. 溯源以学习(“金线”)

这是最聪明的部分。当侦探最终破案并获得“成功!”奖励时,ECHO 会利用这些索引卡来追踪究竟该把功劳归于哪里。

  • 旧方法: 老师说:“做得好!”并给侦探写的每一个字都给予奖励,包括那些搜错了街道或写了无用总结的时候。这会让侦探感到困惑。
  • ECHO 方法: 老师观察侦探在最终方案中选择带入的索引卡
    • “最后的答案做得很好。”
    • “挑选那张‘红鞋’卡做得很好。”
    • “做出‘决定查看那张卡’这个动作做得很好。”
    • “忽略你搜错街道的那些时刻;我们不会奖励那些。”

通过将奖励直接与特定的证据以及选择该证据的行为联系起来,AI 学习得更快、更准确。

为什么这很重要(结果)

论文在“BrowseComp-Plus”基准测试上对该方法进行了测试,这是一个类似于极难的多步互联网搜索挑战。

  • 竞争对手: 其他方法(如 GRPO 和 SUPO)要么过早放弃,要么不停地搜索,迷失在冗余步骤的海洋中。
  • ECHO 的表现: ECHO 解决了更多的题目(准确率 43.4%)。至关重要的是,它在没有陷入无休止循环的情况下完成了任务。它使用的轮次更少,产生的“垃圾”数据也比总结法更少。

核心要点
ECHO 教会了 AI 智能体成为精明的档案管理员。它说:“不要只是总结你的过去;要保留一份关于过去的带标签的地图。当你成功时,观察那张地图,看看你挑选了哪些线索,并为自己能成为一名聪明的挑选者,而不仅仅是一个幸运的猜谜者而奖励自己。”

这种方法帮助 AI 智能体在处理长期、复杂的任务时,既不会被自己的历史所淹没,也不会在无用的搜索上浪费时间。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →