← 最新论文
🤖 AI

The Retriever Should Remember: Experience-Amortized Reranking for Long-Term Agent Memory

本文介绍了 EARM,一种经验摊销重排序框架,该框架通过因果矩阵补全学习复用先前获取的 LLM 相关性评分,旨在显著提高智能体长期记忆检索的准确性,同时大幅降低推理开销。

原作者: Qi Feng, Chris Ding, Jicong Fan

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Qi Feng, Chris Ding, Jicong Fan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一段跨越数月或数年的对话,其中一个人会询问很久以前发生的事件,或者将散落在数十次先前交流中的事实拼凑在一起。对于一个旨在充当得力助手的计算机程序来说,追踪这样庞大的历史是一项艰巨的任务。这些程序通常被称为“智能体”(agents),它们将过去的交互存储在一个外部记忆库中。然而,拥有一个图书馆并不等同于知道如何找到对的那本书。当一个新的问题到来时,系统必须快速筛选数千条存储的记忆,以找到真正有用的那几条。传统上,系统使用一种基于词汇相似性的快速、广泛搜索;如果需要更精确,它会要求一个强大的语言模型阅读问题和候选记忆,以判断其相关性。但这里存在一个令人沮挫的低效问题:每当有一个新问题被提出时,系统都会从头开始。它会忘记上次搜索时学到的教训,丢弃它计算出的评分和观察到的模式,仿佛是一个为了考试而学习的学生,考完试后立刻忘掉所有东西,然后为了下一次考试不得不重新学习同样的材料。

来自香港中文大学(深圳)的研究人员提出了一种打破这种遗忘循环的方法。他们引入了一个名为 EARM 的新框架,全称是“经验摊销记忆重排序”(Experience-Amortized Reranking for Memory)。其核心理念简单而深刻:系统不仅应该记住过去对话的内容,还应该记住过去是如何成功找到信息的。研究人员并没有将相关性判断视为一次性的成本,而是设计了一个系统,将这些判断视为一种在智能体整个生命周期中不断积累的“经验”。通过记录哪些记忆对于哪类问题是有用的,系统学会了一张关于自身记忆的地图。这张地图允许系统在无需要求强大的语言模型去阅读每一条记忆的情况下,预测新记忆的相关性。

在实验中,研究人员在一个包含复杂问题的长对话数据集上测试了这种方法,这些问题需要智能体连接不同时间点的各种信息。他们将这种新方法与两种标准方法进行了对比:一种是仅依赖词汇相似性的基础系统,另一种是要求语言模型为每一个候选记忆进行评分的更强大的系统。结果显示,这种结合了直接评分和学习预测的新方法显著优于基础系统。它将回答的准确率提高了高达 6.62%,在这一追求微小进步都极其困难的领域中,这是一个实质性的提升。或许更重要的一点是,即使在仅被允许对极小比例(具体为 17.5%)的候选对象进行直接评分的稀疏设置下,该系统依然保持了高效。在这种情况下,系统利用其积累的经验来填补空白,根据从先前交互中学习到的模式来估算剩余记忆的相关性。

这种成功的机制依赖于这样一个观点:相关性并非随机的。某些记忆往往会对特定类型的问题有用,而某些问题又倾向于在不同的记忆中触发相似的相关性模式。研究人员构建了一个系统,以结构化的方式记录这些联系。当一个新问题到来时,系统会选择一小部分具有战略意义的记忆样本,让语言模型进行直接评分。然后,它利用过去评分的历史来估算其余记忆的相关性。这个过程类似于一位经验丰富的图书管理员,即便读者尚未提及,他也可能预见到询问特定历史事件的读者很可能需要某一组特定的文献。该系统并非盲目猜测;它利用过去检索的“经验”来引导搜索,从而有效地学会了如何访问自己的知识库。

其中一个最引人注目的发现是,该系统可以在仅使用四分之一计算量的情况下,恢复大部分全量搜索带来的收益。当系统处理了足够多的问题以建立起稳健的历史记录后,它可以用极少的输入做出高度准确的决策。研究人员发现,通过这些学习后的估算所选出的记忆不仅仅是填充物;它们带来了可衡ся量的价值,在直接评分的记忆所提供的基础上,使最终答案质量额外提升了 0.78% 到 2.79%。这表明,系统通过识别自身记忆的底层结构,成功识别出了初始快速搜索所遗漏的有用信息。

这项研究也强调了我们思考人工智能记忆方式的一种转变。传统上,关注点在于存储更多信息或更好地表示信息。而这项工作则表明,一个真正的长寿智能体还必须学会如何高效地检索这些信息。研究人员认为,智能体不应仅仅积累内容,还应积累关于这些内容如何被证明有用的“经验”。通过将检索评分视为一种持久的状态而非一次性的副产品,该系统将搜索行为从一种重复性的开支转变为一种习得的能力。这种方法使得智能体随着时间的推移变得更加聪明,不仅是因为它知道得更多,还因为它是通过变得更擅长寻找已知事物来实现的。

研究人员承认,这种方法之所以能有效运作,依赖于某些特定条件。它假设随着时间的推移,提出的问题会共享一些共同的主题或结构,并且存储的记忆本身保持稳定。如果每个问题都与上一个问题完全无关,或者存储的记忆含义变化剧烈,系统将难以找到可以学习的模式。然而,在用户经常回到相似话题或在原有想法基础上进行扩展的长时对话语境下,该方法表现出了鲁棒性。即使在直接评分的数量下降时,系统仍能保持其优势,这表明积累的经验是一个可靠的指南。

最终,这项研究为人工智能的效率提供了一个全新的视角。它证明了让系统变得更聪明所付出的成本,并不一定会随着其持有的信息量增加而呈线性增长。通过让系统记住自己的搜索历史,研究人员展示了构建既博学又高效的智能体是可能的。系统不需要每次都从头开始重新评估一切;它可以站在过去决策的肩膀上。这种方法使该领域离创造出能够真正长期运行、并在与世界互动过程中不断适应和完善自身行为的智能体又近了一步,就像人类不仅能从经历中学习,也能从如何驾驭自己的历史中学习一样。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →