← 最新论文
🤖 machine learning

Maglev: Sliding Recurrent Memory

本文介绍了 Maglev,这是一种循环 Transformer 架构,它通过结合全注意力预填充器与通过记忆一致性损失进行训练的滑动窗口解码器,实现了固定大小的内存、可并行化的训练以及优于现有滑动窗口和潜在循环基准模型的性能。

原作者: Bo Liu, Qiang Liu

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Bo Liu, Qiang Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

记忆问题:为什么 AI 需要一个更好的笔记本

想象一下,你正在尝试写一个故事,但每当你写完一句话,你就必须忘掉之前写下的所有内容。这就是许多现代人工智能模型面临的基本困境。这些被称为 Transformer 的模型在理解语言方面极其出色,但它们的记忆策略却很棘手。它们“完美”的记忆方式是把看过的每一个字都呈现在面前,就像一本巨大的、敞开的笔记本。这能让它们将书开头的想法与结尾联系起来,但随着故事变得太长,这会让计算机变得沉重且缓慢,最终耗尽能量和时间。

为了解决这个问题,工程师经常使用“滑动窗口”方法。想象一下,AI 的笔记本里只保留最后几句话,然后扔掉其余的部分。这让计算机运行得既快又高效,但也意味着 AI 会失去记住故事早期重要细节的能力。另一方面,旧类型的 AI 模型试图将整个历史压缩成一个微小的、单一的总结笔记。这种方式很快,但总结往往会变得混乱,丢失理解复杂情节所需的丰富细节。计算机科学领域的重大课题在于:我们能否构建出一种既拥有滑动窗口的速度,又拥有完整笔记本那般深厚、丰富记忆,且不会陷入泥潭的 AI?

Maglev:无需携带行李的高速列车

本论文介绍了一种名为 Maglev(磁悬浮的缩写)的新型架构,它就像一列在高架轨道上滑行的快速列车,无需携带沉重的行李车厢。来自德克萨斯大学奥斯汀分校的研究人员 Bo Liu 和 Qiang Liu 提出了一种巧妙的两步训练过程,使 AI 即使在实际使用时只保留极少量的固定信息,也能学会如何完美地记忆。

可以将这个训练过程想象成一场由导演和演员进行的排练:

  1. 导演 (Prefiller Q): 首先,一个强大的“导演”模型从头到尾阅读整个故事。因为它可以获取全文,所以它能为每一句话写下完美的“记忆笔记”。它准确地知道演员需要记住什么,才能让下一句台词显得合理。
  2. 演员 (Decoder P): 接下来,一个“滑动窗口”演员尝试表演这个故事。这个演员只能观察最后几句话以及导演刚刚交给他们的记忆笔记。演员尝试预测下一个词,并且至关重要的是,尝试为下一步写下他们自己的记忆笔记。

这里有一个魔术技巧:研究人员教导演员,使其编写的笔记与导演写的完美笔记相匹配。他们使用了一种“一致性损失”(consistency loss),这本质上是一种评分系统,它会说:“如果你的记忆笔记看起来不像导演的完美笔记,你就会丢分。”随着时间的推移,演员学会了写出如此优秀的笔记,以至于他们实际上不再需要导演了。

最后发生了什么?
一旦训练完成,导演就被解雇了。演员独自留在舞台上。现在,演员通过阅读最后几句话并利用他们为前一句话编写的记忆笔记来理解当前的一句,从而掌控全场。这创造了一个循环,使 AI 既拥有即时上下文的“滑动窗口”,又能携带之前所有内容的丰富、压缩后的记忆,同时保持其记忆容量固定且微小。

结果:速度与智慧的结合

作者在包含 4352 亿个 token(海量文本)的大规模数据集上测试了这个 Maglev 系统。他们将该模型与标准的滑动窗口模型以及其他先进的记忆模型进行了对比。

结果表明,Maglev 是一个强有力的竞争者。在实验中:

  • Maglev 模型将 FineWeb-Edu 验证集每字节比特数 (BPB)0.7413(标准滑动窗口基准)降低到了 0.7251。在 AI 领域,较低的 BPB 分数意味着模型犯错更少,对文本的理解更好。
  • 它还将各种下游任务(如回答问题或补全句子)的平均准确率从 54.1% 提升到了 56.4%

一个最令人惊讶的发现是,“导演”和“演员”实际上可以共享大部分脑力(参数)。研究人员发现,即使这两个模型共享了大部分内部权重,Maglev 系统仍然保持了大部分的性能增益。这意味着,与两个完全独立的模型相比,该系统运行起来会更小、更便宜。

为什么这很重要

论文指出,Maglev 提供了一种为 AI 模型提供“非线性”记忆的实用方法——这种记忆可以像人类思考一样,随着每一个词的出现而不断被重写和更新——而无需每次都承担巨大的计算成本。不同于其他一些强迫 AI 在大块内容中停顿思考或使用僵化数学公式来更新记忆的方法,Maglev 让模型能够持续且富有创造力地更新其记忆。

虽然作者指出,这仍是一项初步研究,将规模扩大到更大的模型还需要更多工作,但其核心理念是稳固的:通过使用一个平行的“老师”在训练期间引导“学生”,我们可以教会 AI 既快速又具备深度记忆力。这有点像教学生在课堂上做完美的笔记,以便当他们稍后独自在图书馆时,只需看一眼自己的速记,就能回忆起整场讲座的内容。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →