← 最新论文
🤖 machine learning

Sparse Delta Memory: Scaling the State of Linear RNNs through Sparsity

本文介绍了稀疏增量记忆(Sparse Delta Memory, SDM),这是一种通过稀疏寻址来扩展门控线性循环神经网络(gated linear RNNs)隐藏状态容量的新型架构,旨在显著提升长上下文召回与上下文学习性能,同时保持固定的计算成本与参数量。

原作者: Loïc Cabannes, Pierre-Emmanuel Mazaré, Gergely Szilvasy, Matthijs Douze, Maria Lomeli, Ilze Amanda Auzina, Justin Carpentier, Gabriel Synnaeve, Hervé Jégou

发布于 2026-07-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Loïc Cabannes, Pierre-Emmanuel Mazaré, Gergely Szilvasy, Matthijs Douze, Maria Lomeli, Ilze Amanda Auzina, Justin Carpentier, Gabriel Synnaeve, Hervé Jégou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图记住一个长达 100 万字的完整故事。

旧问题: “文件柜” vs. “背包”
目前的 AI 模型(Transformer)工作起来就像一个文件柜。每当它们读到一个新词,就会在柜子里增加一个新的文件夹。如果故事很短,文件柜就很小,容易管理。但如果这个故事长达 100 万字,文件柜就会变得极其庞大、沉重且难以检索。计算机必须在故事的每一步都带着这整个文件柜。这就是为什么目前的 AI 在处理超长上下文时会遇到困难;它们要么空间不够,要么运行速度过慢。

其他模型(如 GDN 或 Mamba 等线性 RNN)尝试变得更聪明。它们使用一个背包。与其携带所有的文件夹,不如将故事总结成几条笔记,然后把剩下的东西扔掉。这让背包无论故事多长都能保持轻便和快速。然而,问题在于这个背包太小了。它只能装下极少的总结信息,因此当 AI 读到故事结尾时,它会忘记开头的重要细节。

新解决方案:稀疏增量记忆 (Sparse Delta Memory, SDM)
论文作者引入了一种名为稀疏增量记忆 (SDM) 的新系统。你可以把它想象成一个 AI 可以即时访问的巨大的、神奇的图书馆,但它在任何特定时刻只会取出它当前需要的特定书籍。

它是如何工作的,这里使用简单的类比:

  1. 巨大的图书馆(记忆):
    与其使用一个小背包,SDM 拥有一个拥有数百万个书架(记忆槽)的巨大图书馆。与旧的背包相比,这规模巨大,它可以容纳关于这个故事的海量信息。

  2. 聪明的图书管理员(稀疏访问):
    你可能会想:“如果图书馆这么大,找对书会不会花很长时间?”
    论文指出:不会。SDM 使用了一个“稀疏”系统。想象一下,图书管理员并不需要走遍每一个过道。相反,他们有一个特殊的索引卡系统。当 AI 需要信息时,它只查看与当前单词最相关的极少数特定书架(例如在数百万个书架中只看 64 个)。它会忽略其余的部分。

  • 结果: AI 获得了庞大记忆(整个图书馆)带来的好处,但仅支付了检查少量书架的能量成本。这就像拥有一个超级计算机大脑,能够记住一切,但在每一瞬间只“思考”最重要的东西。
  1. “增量”更新(便利贴):
    当 AI 学到新知识时,它并不会重写整个图书馆。它使用一种“增量 (Delta)”规则。这就像是在特定书的特定页面上贴一张便利贴。它只更新记忆中需要改变的部分,让其余部分保持原样。这防止了 AI 产生混乱或“覆盖”掉旧的、有用的记忆。

  2. “预加载”的起点(预装的大脑):
    论文还提到,SDM 可以在开始阅读故事之前进行“预加载”知识。想象一下,在开始工作前,先给图书管理员一套关于常识(如历史、科学或常识)的百科全书。这使得 AI 从一开始就能更好地理解世界,而不仅仅是死记硬背它正在阅读的故事。

论文的研究发现
研究人员将这种新的“图书馆”与旧的“背包”(GDN)以及沉重的“文件柜”(全注意力机制/Full Attention)进行了对比测试。

  • 记忆 vs. 速度: 他们证明了你可以将记忆扩大数千倍,而不会让计算机变慢或消耗更多电力。
  • 长篇故事: 在进行长任务测试(如阅读整本书或长代码项目)时,SDM 对细节的记忆能力远优于旧的背包模型。它的表现几乎与沉重的“文件柜”一样好,却没有任何速度上的惩罚。
  • 更聪明的思考: 由于记忆容量巨大,AI 也可以在其中存储通用知识。这使得它不仅擅长记忆故事,还能更好地进行推理和回答问题。

不足之处
论文承认了一个局限性:虽然速度很快,但这个巨大图书馆所需的存储空间仍然很大。它占用大量的计算机内存 (RAM),其大小与模型本身相当。然而,作者认为这仍然优于另一种选择,因为当故事变得非常长时,“文件柜”(当前的 AI)最终会彻底耗尽内存。

总结
SDM 就像是给了 AI 一个巨大的、无限的笔记本,它可以记录下所有内容,但每次只需要翻阅几页就能找到所需的信息。这使得 AI 能够完美地记住长篇故事,而不会感到疲劳或变慢。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →