← 最新论文
🤖 machine learning

Long Context Modeling with Ranked Memory-Augmented Retrieval

本文介绍了增强型排序记忆增强检索(ERMAR)框架,该框架利用新颖的相关性评分机制以及对键值嵌入的逐点重排序来动态管理长期记忆,在长上下文语言建模任务中实现了最先进的性能与可扩展性。

原作者: Ghadir Alselwi, Hao Xue, Shoaib Jameel, Basem Suleiman, Flora D. Salim, Imran Razzak

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Ghadir Alselwi, Hao Xue, Shoaib Jameel, Basem Suleiman, Flora D. Salim, Imran Razzak

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图与一位非常聪明但略显健忘的朋友交谈。你们已经聊了好几个小时,突然,你提到了聊天刚开始时的一个细节。你的朋友被你们所说的海量内容压得不知所措,可能会感到困惑。他们可能会说:“我不记得那个了”,或者更糟的是,他们可能会给你一个笼统的回答,忽略你的具体问题,因为他们正试图同时处理你所说的“一切”。

这正是大型计算机语言模型在处理长对话或长文档时面临的问题。本文介绍了一种名为ERMAR(增强型排序记忆增强检索)的新系统来解决这一问题。

以下是 ERMAR 的工作原理,通过简单的类比进行解释:

1. 问题:“嘈杂的图书馆”

当前试图记住长对话的模型,就像一位每次你提问时都必须从书架上取下每一本书的图书管理员。

  • 旧方法(MemLong): 想象一个图书馆,其中每本书都被视为同等重要。如果你询问某个特定主题,图书管理员会抓起一大堆书,包括关于烹饪、太空和历史的书,即使你只问了关于太空的问题。这会创建一个“杂乱”的记忆,使模型感到困惑并降低其速度。
  • 结果: 模型遭遇“信息过载”。它看到了太多的噪音,而错过了你需要的特定信号(重要细节)。

2. 解决方案:“智能排序系统”

ERMAR 改变了图书管理员的工作方式。它不再抓取所有内容,而是使用智能排序系统

  • 步骤 1:搜索(检索): 当你提出问题时,系统会快速扫描其记忆,找出一份可能相关的“候选”书籍(或记忆块)列表。
  • 步骤 2:重排序(魔法): 这是本文的重大创新。在模型阅读书籍之前,一位特殊的“法官”会查看列表并对其进行评分。
    • 类比: 想象你正在食谱书中寻找特定的食谱。旧方法是阅读每一页。而 ERMAR 的方法是让一位智能助手先阅读标题和摘要,然后重新排列页面,使最相关的食谱位于顶部,不相关的则被推到底部或直接丢弃。
  • 步骤 3:聚焦: 模型随后只关注排名靠前的项目。它忽略了噪音。

3. 如何处理“历史”

本文指出,ERMAR 不仅查看你现在说了什么;它还查看某些信息在过去被使用的频率。

  • 类比: 想象一家受欢迎的咖啡店。如果某张桌子总是人们坐下来讨论生意的地方,经理(模型)就会知道要优先处理该桌子的历史记录。ERMAR 会记住对话的哪些部分以前是“有用”的,并给予它们更高的评分,确保它们保持在列表的顶部。

4. 结果:更快、更智能、更精简

作者使用标准的“长对话”测试将该系统与其他模型进行了比较。以下是他们的发现:

  • 更好的记忆: 在回答长文本末尾的问题时,ERMAR 在记住开头细节方面表现要好得多。它不会被对话中间的内容搞糊涂。
  • 更少的杂乱(内存效率): 因为它会丢弃“垃圾”信息(排名靠后的书籍),所以它使用的计算机内存更少。本文声称,与之前的最佳方法相比,在非常长的对话中,它可以节省高达30% 的内存
  • 速度: 虽然进行“排序”(就像法官给书籍评分)需要多花一点点时间,但整体过程更加稳定。当对话变得非常长时,它不像旧模型那样容易变得不稳定或缓慢。

5. 它做不到什么(局限性)

本文诚实地说明了 ERMAR 目前无法做到的事情:

  • 它不是魔法: 与标准模型相比,它进行排序仍然需要更多的计算能力。如果对话极长(例如 32,000 字),“排序”步骤有时会成为一个轻微的负担,尽管模型的表现仍然良好。
  • 它需要调整: 它在经过训练的数据类型(如干净的文本)上效果最好。作者指出,要处理充满错误或噪音的混乱现实世界数据,它可能需要额外的工作。

一句话总结

ERMAR 就像是给计算机配备了一个智能文件柜,而不是一大堆散乱的文件。当你提出问题时,它不会把整堆文件倒在你的桌子上;它会整理文件,突出显示最重要的部分,并只递给你所需的内容。这使得计算机更聪明、更快速,并且在长对话中不太容易感到不知所措。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →