← 最新论文
🤖 AI

Memory as Action: Autonomous Context Curation for Long-Horizon Agentic Tasks

本文介绍了“记忆即行动”(MemAct)框架,该框架将工作记忆管理视为可学习的策略动作,并通过强化学习进行优化,从而为长程智能体任务实现高效、自适应的上下文管理,在显著缩短上下文长度的同时达到了更大规模模型的精度。

原作者: Yuxiang Zhang, Jiangming Shu, Ye Ma, Xueyuan Lin, Shangxi Wu, Jitao Sang

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuxiang Zhang, Jiangming Shu, Ye Ma, Xueyuan Lin, Shangxi Wu, Jitao Sang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试解决一个庞大、多步骤的谜题,比如规划一次复杂的旅行或调试一个庞大的软件程序。你有一块巨大的白板(即计算机的内存),你在上面写下每一个想法、搜索结果和发现的线索。

问题:
随着任务变长,你的白板变得杂乱无章。你开始记下所有事情:“我查了天气”、“我查看了列车时刻表”、“我阅读了这座城市的历史”、“我又查了一次天气”。最终,板上写满了潦草的字迹,以至于你再也找不到重要的线索了。你迷失在自己笔记的“中间”。

当前的 AI 助手也会做同样的事情。它们只是不断在页面底部添加笔记,从不擦除任何内容,直到页面变得过于混乱而无法有效阅读。

解决方案:“记忆即行动”(MemAct)
这篇论文提出了一种 AI 思考的新方式。AI 不再只是被动地做笔记,而是被教导去主动操作它自己的记忆。这就像给 AI 配备了一把剪刀和一支荧光笔。

作者将这一框架称为MemAct。简单来说,其工作原理如下:

1. “编辑”按钮

在旧方法中,AI 只是不停地说话。而在 MemAct 中,AI 拥有一个名为**剪枝与写入(Prune & Write)**的特殊工具。

  • 剪枝(剪刀): AI 审视其历史记录并决定:“我不再需要那 10 条旧的搜索结果了;我已经知道了那部分的答案。”于是它将它们剪掉。
  • 写入(荧光笔): 在剪掉之前,AI 会将从那些旧笔记中学到的内容写成一个简短、整洁的摘要。
  • 结果: 杂乱冗长的历史被一个干净、简短的摘要所取代。AI 保留了含义,但去除了杂乱

2. “明智”的决策

棘手之处在于知道何时进行剪枝。如果剪得太早,你会丢失重要事实;如果剪得太晚,白板就会过于混乱。

  • 旧方法: 人类程序员设定一条规则,例如“每 5 分钟删除最旧的笔记”。这很僵化,且经常删除错误的东西。
  • MemAct 方法: AI 学会自己做出决定。这就像一个学生学会了“当我解完数学题的第一部分时,我可以擦掉草稿,以便为下一部分腾出空间”。AI 通过试错(强化学习)来掌握这种策略。

3. “铁轨”挑战(DCPO)

存在一个巨大的技术障碍。想象一列火车在铁轨上向前行驶。如果 AI 突然删除了它身后的某段铁轨,火车(AI 的思维过程)可能会撞毁,因为它的构建基于一个假设:铁轨只会增加,永远不会被移除。

作者发明了一种巧妙的修复方法,称为DCPO(动态上下文策略优化)

  • 类比: 想象你在拍摄一部电影。如果演员忘词,导演喊“卡!重拍那个场景”,你不会只是继续拍摄覆盖那个错误。你会回到过去,重拍那个场景,并将新的、正确的镜头剪辑进电影胶卷中。
  • 修复: DCPO 为 AI 的训练做了同样的事情。当 AI 编辑其记忆时,系统会在逻辑上“倒带”,并将训练数据重新组织成干净、独立的片段。这使得 AI 能够学习如何编辑其记忆,而不会因自身的更改而感到困惑。

结果:更小、更快、更智能

这篇论文使用了一个 140 亿参数的 AI 模型(这很大,但不是最大的)对此进行了测试。

  • 对比: 他们将其与一个拥有巨大内存但不知道如何清理的“巨型”AI 模型(2350 亿参数)进行了比较。
  • 结果: 较小的 MemAct AI 表现与巨型模型一样好,但它使用的内存空间减少了 51%
  • 优势: 因为它保持了“白板”的整洁,所以速度更快,且不会被无关信息搞糊涂。它学会成为一名“外科医生”式的编辑,仅移除必要的部分以保持其专注力敏锐。

总结

该论文声称,通过教导 AI 主动管理其短期记忆——决定保留什么、总结什么以及删除什么——它可以更高效地解决复杂、长期的问题。它将记忆管理从一个被动的存储问题转变为一种主动的、习得的技能,从而使较小的模型能够发挥出超越其体量的实力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →