← 最新论文
💬 NLP

Learning What Not to Forget: Long-Horizon Agent Memory from a Few Kilobytes of Learning

本文介绍了 LRE(学习相关性驱逐),这是一种轻量级、仅限 CPU 且无需语言模型的评分器,它通过学习识别并保留长时运行智能体的关键交互历史,在以极低计算成本和无需标注的训练方式运行时,实现了比现有基准模型更优越的准确率与效率。

原作者: Nusrat Jahan Lia, Aritra Mazumder

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Nusrat Jahan Lia, Aritra Mazumder

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一个超级聪明的助手(就像一个高度先进的 AI)正在试图解决一个复杂的谜题或与一位朋友进行长谈。问题在于,你的大脑有一个严格的大小限制。你一次只能持有一定量的信息在你的“活跃记忆”中。

当你工作时,你会积累大量的笔记、行动和对话历史。最终,你的历史记录会变得太大,无法容纳在你的大脑中。你必须丢弃一些东西来腾出空间以容纳新的想法。这被称为驱逐(Eviction)

该论文介绍了一种名为 LRE(学习相关性驱逐,Learned Relevance Eviction)的新方法来解决这个问题。以下是它的工作原理,使用简单的类比:

问题:“容量过载”的大脑

想象一下你正在为旅行打包,但你的行李箱有一个很小的拉链,只能打开一半。你有数百件物品(你的对话历史或任务步骤)。

  • 旧方法(FIFO/最近原则): 你只是把堆叠在底部的旧物品扔掉,为新物品腾出空间。
    • 风险: 你可能会扔掉那个“承重”物品,比如你的护照或登录所需的特定代码令牌。如果你丢了它,你的旅行(或任务)就会失败,即使你还有很多剩余空间。
  • 昂贵的方法(LLM 压缩): 你雇佣了一位专业的编辑(另一个 AI)来阅读你的笔记,并将它们总结成一段简短的文字。
    • 风险: 编辑在试图保持简洁的同时,可能会不小心漏掉关键细节。此外,每次添加笔记时都雇佣一名编辑既慢又费钱(计算能力成本)。

解决方案:LRE(聪明、微小的图书管理员)

LRE 是一个住在标准计算机芯片(CPU)上的微小、超快的“图书管理员”。它不需要超级计算机或第二个 AI 来完成工作。

1. 它微小且快速
将 LRE 想象成一个口袋大小的清单(只有几千字节大小)。它不会重写你的笔记;它只是决定保留哪些笔记。它运行得非常快,每秒可以检查 1,000 多个笔记,而“专业编辑”(密集编码器)可能每秒只能处理 36 个。

2. 它学习什么才是重要的(“承重”概念)
LRE 查看你的历史记录并询问:“我稍后会需要这个特定的信息吗?”

  • 类比: 想象你正在盖房子。你有一堆砖块、木头和随机垃圾。
    • “最近原则”会保留你最后接触的几个物品。
    • LRE 查看这堆东西并说:“那个来自第 3 步的特定砖块是我们在第 17 步建造屋顶的基础。请原封不动地保留它。”
    • 它保留的是精确的原文(verbatim),所以如果以后需要密码或特定的 ID 号码,它依然在那里,未曾改变。

3. 它不需要老师(自监督)
通常,要教计算机学会保留什么,你需要人类对成千上万的例子进行标注(“保留这个”、“扔掉那个”)。

  • LRE 的窍门: 它通过观察自身来学习。它观察自己过去的行为。
    • 在对话中: 如果 AI 提到一个事实(例如“我是跨性别者”),然后在 400 轮对话后,它利用这个事实来回答问题,LRE 就会学习:“啊,那个事实很重要!我之前应该保留它的。”
    • 在任务中: 如果 AI 生成了一个登录令牌并在随后的三次中使用它,LRE 会学习:“那个令牌是承重的。保留它。”
    • 这意味着它可以在没有任何人类付费标注数据的情况下进行学习。

结果:为什么它能胜出

论文在两个主要场景中测试了 LRE:

1. 智能体(机器人工作者)

  • 场景: 一个试图预订机票或管理电子邮件账户的 AI,正在执行一系列步骤。
  • 结果: 当内存限制很紧时,其他方法失败了,因为它们扔掉了登录令牌或完成工作所需的特定 ID 号码。LRE 保留了这些精确的细节。
  • 类比: 当其他方法因为反复尝试登录而原地打转(浪费时间)时,LRE 一直把钥匙揣在兜里,完成了任务,步骤减少了 37%。它与保留所有内容一样准确,但节省了 52% 的空间。

2. 对话者(聊天伙伴)

  • 场景: 记住很久以前(几周前)的一段长谈中的细节。
  • 结果: 与那些试图总结对话的复杂、昂贵的 AI 模型相比,LRE 在寻找正确信息来回答问题方面表现更好。
  • 类比: 如果你问:“卡罗琳在 400 条消息前是怎么说她的家人的?”,LRE 能瞬间找到那条精确的消息。其他方法要么忘记了它,要么由于总结得太差导致答案丢失。

核心结论

LRE 是一种廉价、快速且精准的管理内存的方式。

  • 它不会进行总结或重写(这会导致错误)。
  • 它不需要昂贵的超级计算机来决定保留什么。
  • 它通过自身的成功与失败进行学习。

论文认为,对于 AI 智能体和聊天机器人来说,我们不需要丢弃信息,也不需要雇佣昂贵的编辑来总结信息。我们只需要一个微小的、聪明的过滤器,知道如何保留我们历史中的“承重”砖块,从而使结构不至于坍塌。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →