← 最新论文
💬 NLP

Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents

本文介绍了 MemCon,这是一个将记忆操作视为可学习马尔可夫决策过程的框架,通过轻量级上下文多臂老虎机动态调整检索、注入和巩固策略,从而在多种基准测试中,与基于启发式的静态记忆系统相比,显著提升了大语言模型智能体的性能与效率。

原作者: Eric Hanchen Jiang, Zhi Zhang, Yuchen Wu, Levina Li, Dong Liu, Xiao Liang, Rui Sun, Yubei Li, Edward Sun, Haozheng Luo, Zhaolu Kang, Aylin Caliskan, Kai-Wei Chang, Ying Nian Wu

发布于 2026-07-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Eric Hanchen Jiang, Zhi Zhang, Yuchen Wu, Levina Li, Dong Liu, Xiao Liang, Rui Sun, Yubei Li, Edward Sun, Haozheng Luo, Zhaolu Kang, Aylin Caliskan, Kai-Wei Chang, Ying Nian Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个超级聪明的机器人玩一款新游戏。为了让机器人每次玩游戏都能变得更好,你给了它一个笔记本,让它可以在上面记录下哪些做法奏效了,哪些没效。这就是大语言模型(LLM)智能体的世界:这些 AI 程序可以聊天、规划并使用工具来解决问题。让它们真正变得聪明的关键不仅仅在于机器人的大脑,还在于这个笔记本,即记忆。如果机器人能记住过去的错误,它就不会重蹈覆辙;如果它记住了昨天奏效的一个巧妙技巧,它今天就能再次使用。

长期以来,科学家们一直将这种笔记本视为一个静态的图书馆。他们制定了规则,比如“始终查看最后三页”或“始终搜索最相似的故事”。这就像有一个无论你问什么书都遵循固定、不变剧本的图书管理员。但现实生活是混乱的。有时你需要快速浏览一下索引;有时你需要阅读整个章节。有时你需要丢弃旧笔记以腾出空间存放新笔记。这篇论文探讨的核心问题是:我们能否教会机器人管理自己的笔记本,让它能够精确决定何时阅读、何时书写以及何时遗忘,而不是遵循僵化的剧本?

问题所在:带着“破碎图书管理员”的机器人

见见我们的机器人智能体。它正试图解决谜题、在虚拟房屋中导航或回答棘手的问题。它有一个记忆系统,但直到现在,那个系统还有点笨拙。大多数现有系统使用“固定流水线”。想象一个图书管理员,无论你问什么,总是从书架上抽出前五本书递给你。

如果你问一个简单的问题,比如“天气怎么样?”,图书管理员可能会把五本厚重的百科全书堆在你的桌上。这干扰太多了!但如果你问一个复杂的问题,比如“如何仅使用 1990 年代的工具修理一台坏掉的引擎?”,同一个图书管理员可能只会递给你一份无关紧要的小册子,因为他们不敢深入寻找。机器人因此陷入困境,要么被过多的信息搞糊涂,要么缺少它所需的关键线索。

本文作者认为,这种“一刀切”的方法是机器人学习不够快的核心原因。他们认为,最佳的记忆行为应该根据情况而变化:

  • 在游戏早期: 机器人还没有经验,所以它不应该浪费时间去翻找一个空笔记本。
  • 当陷入困境时: 如果机器人反复执行同一个错误的动作,它需要一种不同类型的搜索,而不是老一套。
  • 当它掌握窍门时: 如果机器人已经解决了一个类似的谜题,它就不应该再去寻找线索,而应该直接调出它之前写下的“小抄”(计划)。

解决方案:MEMCON,聪明的图书管理员

于是有了 MEMCON(作为受控过程的记忆)。作者并没有构建一种新型笔记本;相反,他们构建了一个可以置于任何现有记忆系统之上的智能、自适应的图书管理员

把 MEMCON 想象成一个微小的、超快速的决策者,在机器人打开笔记本之前,它会先问自己三个问题:

  1. 何时该看?
  2. 看什么
  3. 拿多少

MEMCON 没有使用硬编码的规则,而是将记忆管理视为一场策略游戏。它使用了一种称为马尔可夫决策过程(Markov Decision Process)的数学方法(想象一个每种选择都会导致新状态的流程图)。这个游戏中的“玩家”是记忆控制器,它的“动作”包括:

  • 检索(Retrieving): 提取旧笔记。
  • 注入计划(Injecting a Plan): 将预先写好的“小抄”滑入机器人的脑海。
  • 重新检索(Re-retrieving): 因为第一次搜索失败,尝试新的搜索查询。
  • 整合(Consolidating): 将凌乱的笔记合并成简洁的摘要。
  • 遗忘(Forgetting): 扔掉旧的、无用的垃圾以腾出空间。

MEMCON 的魔力在于它是如何学习的。它不需要在海量数据上进行预训练。相反,它在机器人玩游戏的过程中即时学习。每当机器人完成一项任务,MEMCON 都会得到一个评分:“成功!”或“失败”。如果机器人成功了,导致成功的记忆选择就会得到一个“击掌”(奖励);如果失败了,这些选择就会得到一个“大拇指朝下”(惩罚)。

仅仅通过几十个任务,MEMCON 就能摸索出完美的策略。它学会了对于“早期阶段”的任务,浅层搜索是最好的;它学会了当机器人“卡住”时,需要尝试完全不同的搜索角度;它学会了对于复杂的数学问题,注入一个通用计划比搜索特定案例更好。

结果:更聪明、更快、更便宜

团队在六个不同的基准测试上测试了 MEMCON,涵盖了从虚拟房屋导航(ALFWorld)到解决科学谜题(ScienceWorld)以及回答棘手常识问题(GAIA)。他们尝试将其应用于三种不同的机器人框架和三种不同的“大脑”(底层 AI 模型)。

结果令人印象深刻。MEMCON 始终优于现有的最佳记忆系统。

  • 更高的分数: 在某些测试中,MEMCON 将机器人的成功率提高了多达 15.2 个百分点。例如,在 ALFWorld 基准测试中,它达到了 67.9% 的成功率,是所有测试过的记忆系统中得分最高的。
  • 更少的浪费: 通常情况下,当你让系统变得更聪明时,它会消耗更多的计算资源。但 MEMCON 恰恰相反。通过精确知道要检索什么,它避免了引入无用信息。这减少了机器人需要处理的数据量 5% 到 20%
  • 零额外成本: 不同于其他一些要求 AI “思考”要记住什么的系统(这会产生额外的成本和时间),MEMCON 使用简单的查找表在毫秒内做出决策。它对 AI 模型的使用次数增加了

为什么这很重要

这篇论文表明,智能机器人的未来不仅仅在于构建更大的大脑或更大的笔记本,而在于为这些笔记本构建更好的管理者

作者证明了,记忆不应该是一个你只需把数据丢进去并祈祷它能正确出来的静态流水线。相反,记忆应该是一个受控的过程。通过让智能体学习如何访问自己的经验,我们可以创造出不仅更聪明,而且更高效的机器人。它们学习得更快,犯错更少,也不会被自己的历史记录所困扰。

简而言之,MEMCON 教会了机器人成为自己记忆的主人,确保当它需要线索时,能在正确的时间找到正确的线索,而不会迷失在无关笔记的汪洋大海中。这虽然只是管理记忆方式的一个微小改变,但它似乎极大地提升了这些数字智能体学习和成长的方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →