← 最新论文
💬 NLP

Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents

本文介绍了一种主动式记忆智能体,它通过主动管理并注入与决策相关的信息,以防止长程任务中的“行为状态衰减”,并通过选择性干预和开放权重策略训练,显著提升了在各种基准测试中的性能。

原作者: Yifan Wu, Lizhu Zhang, Yuhang Zhou, Mingyi Wang, Bo Peng, Serena Li, Xiangjun Fan, Zhuokai Zhao

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Yifan Wu, Lizhu Zhang, Yuhang Zhou, Mingyi Wang, Bo Peng, Serena Li, Xiangjun Fan, Zhuokai Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在玩一款持续数小时、极其复杂的电子游戏。你开始时有一个明确的任务:“建造一座城堡,但不能使用红砖,并且要确保护城河里注满了水。”你在第一个小时里收集了蓝砖并挖掘了水沟。接着,你被一只突然出现的酷炫巨龙吸引了注意力。你花了接下来的一个小时与它战斗,把造城堡的事忘得一干二净。突然,你记起了城堡,但你的大脑里全是打败巨龙的细节,结果你不小心抓起了一块红砖并开始建造。你忘记了你一个小时前明明记得的规则。

这正是 AI 智能体在尝试解决长期复杂任务时发生的情况。研究人员称之为**“行为状态衰减”(behavioral state decay)**。这并不是说 AI 完全忘记了信息;数据仍然存在于它的“记忆”(对话历史)中,但它不再对它接下来做出的决策产生影响。AI 在它自己漫长对话产生的噪音中迷失了方向。

解决方案:“主动侧写手”(The Proactive Sidekick)

为了解决这个问题,作者并没有仅仅给 AI 一个更大的笔记本。相反,他们引入了一个主动记忆智能体(Proactive Memory Agent)。你可以把它想象成一个超级组织化、甚至有点爱指挥的“侧写手”,站在主 AI 玩家旁边。

这个侧写手是如何工作的:

  1. 观察者(The Watcher): 当主 AI 忙于玩游戏(或编写代码、调试程序)时,侧写手会在一旁静静地观察整个场景。
  2. 组织者(The Organizer): 每隔几步,侧写手就会停下来整理一份“小抄”。它不仅仅是复制粘贴所有内容;它会将事实分类到三个桶中:
    • 状态(Status): “我们目前正在尝试修复引擎。”(私密信息,绝不展示给主玩家)。
    • 知识(Knowledge): “城堡不能有红砖。”(硬性规则)。
    • 流程(Procedures): “我们尝试过用锤子,但它砸坏了墙。别再那样做了。”(哪些行得通,哪些行不通)。
  3. 决策者(The Decider): 这是神奇之处。侧写手必须决定:我现在应该打断主玩家吗?
    • 如果主玩家正处于状态极佳且进展顺利,侧写手保持沉默
    • 如果主玩家即将犯错(比如抓起一块红砖),侧写手会大喊:“嘿!记得不能用红砖的规则!”并将这个提醒注入到主玩家的思想中。

他们排除了哪些方案(“不要做的事”)

研究人员测试了几种其他想法,发现它们的效果并不理想

  • 直接倾倒整个笔记本: 他们尝试每次都向主 AI 展示整份小抄。这不起作用,因为信息量太大了,就像是在开车时试图阅读整部百科全书一样。AI 会因此分心。
  • 总是大声提醒: 他们尝试让侧写手在每一步都打断主玩家,即使在没有必要的时候也是如此。这降低了速度,并让主玩家感到厌烦,导致结果变差。
  • 仅仅是一个“智者顾问”: 他们尝试了一个系统,其中第二个 AI 只是给出一般性的建议,而不维护一份结构化的事实列表。这种方式不太可靠,因为建议缺乏基于实际发生情况的具体事实支撑。

论文指出,秘诀在于选择性干预。侧写手需要足够聪明,知道何时开口以及说什么,而不是仅仅作为一个被动的存储单元或一个喋喋不休的唠叨者。

结果:真的有帮助吗?

团队在两个非常困难的测试集上测试了这个“侧写手”:Terminal-Bench 2.0(AI 需要修复计算机代码并使用命令行)和 τ 2-Bench(AI 需要与用户交流并使用工具,如航空公司代理或零售助手)。

结果非常明确:

  • 对于“较弱”的 AI(Claude Sonnet 4.5): 侧写手帮助它在 Terminal-Bench 上多解决了 8.3% 的任务,并在 τ 2-Bench 测试的平均水平上提升了 6.8%。这是一个巨大的飞跃!
  • 对于“较强”的 AI(Claude Opus 4.6): 即使是超智能的 AI 也变得更强了,在 Terminal-Bench 上多解决了 2.4% 的任务,在 τ 2-Bench 上多解决了 2.5%。这证明了侧写手不仅仅是弱 AI 的拐杖;它能帮助专业选手避免分心。

我们可以教一个更便宜的 AI 来担任侧写手吗?

研究人员还想看看他们是否可以训练一个更小的开源 AI(Qwen3.5-27B)来担任侧写手,而不是使用一个庞大且昂贵的 AI。

  • 起初,未经训练的小型 AI 实际上让情况变得更糟了。
  • 但在通过 SFT(监督微调)和随后通过 GRPO(一种强化学习类型)进行教学后,它开始做得越来越对。
  • 在一个它从未见过的测试集上,这个经过训练的小型侧写手帮助主 AI 将成功率从 37.6% 提高到了 41.1%

核心结论

论文表明,对于 AI 要想在长期复杂任务中表现出色,它不能仅仅依赖自身的记忆。它需要一个独立的、主动的系统来充当警觉的教练。这位教练负责组织好规则和过去的错误,并在玩家即将忘记这些内容的确切时刻介入。这不在于记住更多;而在于在正确的时间记住。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →