← 最新论文
🤖 machine learning

Proteus: Incremental Memory Activation for Long-Context Sequence Modeling

本文介绍了 Proteus,一种增量式记忆激活的新范式,它通过逐步扩展有效记忆容量来减轻早期 Token 干扰并提高保留能力,在各种最先进的长上下文模型中展示了持续的性能提升。

原作者: Reza Bayat, Ali Behrouz, Vahab Mirrokni, Aaron Courville

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Reza Bayat, Ali Behrouz, Vahab Mirrokni, Aaron Courville

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能的广袤领域中,一个长久以来定义了机器记忆极限的挑战一直存在。多年来,最强大的系统依赖于一种将遇到的每一条信息都以同等权重对待的机制,即存储一份关于其所读过之所有内容的完整且不变的记录。虽然这种方法在召回特定细节方面具有惊人的精确度,但它也付出了沉重的代价:系统处理的信息越多,计算成本就越高,在面对长篇故事或复杂文档时,最终会变得极其缓慢。为了解决这个问题,研究人员转向了另一种策略,设计出能够将历史记录压缩为单一、固定大小摘要的模型。这使它们变得快速且高效,但也引入了一个新问题。由于记忆空间从一开始就是完全开放的,系统往往会被最早看到的细节填满,导致后续到达的新信息几乎没有留存空间。其结果是,机器能完美记住对话的开头,却难以把握结尾。

一支研究团队现在提出了一种解决这种失衡的方法,引入了一种他们称之为“增量记忆激活”(incremental memory activation)的方法。该方法并非从一开始就保持整个记忆库处于开启和可用状态,而是随着信息序列的增长逐渐解锁记忆。想象一座图书馆,书架最初是锁定的,迫使管理员将前几本书压缩进一个狭小、紧凑的空间中。随着更多书籍的到来,新的书架被解锁,为后来的故事提供新鲜的空间,而无需抹除早期故事的摘要。这种对时机的简单转变迫使系统有效地压缩早期上下文,同时确保后来的信息有空间进行存储,而不至于干扰先前的资料。研究人员在目前现有的几种最先进的基于记忆的模型上测试了这一想法,发现它一致地提高了这些模型理解长文本以及检索其中深层特定细节的能力。

这项工作的核心解决了这些机器学习过程中的一种特定失效模式。当允许模型立即使用其全部记忆容量时,模型首先遇到的信息片段由于面临着空间的竞争,反而不会受到限制。它们可能会占据不成比例的注意力,从而有效地“污染”记忆状态。等到后续信息到达时,记忆已经饱和,新的细节必须挤进来,这往往会覆盖或扭曲早期的数据。研究人员认为,这种静态方法并非最优。他们提出的名为 Proteus 的新范式引入了一种动态调度方案,其中有效记忆容量不是固定的,而是随着输入长度的增加而增长。在序列开始时,系统被迫使用受限的记忆子集,这作为一个瓶ing颈,鼓励它对初始上下文进行总结和压缩,而不是进行详细记忆。随着序列的推进,额外的记忆块被逐步解锁,提供了新鲜的容量用于存储新信息。这确保了后来的标记(tokens)不必为了空间而与早期的标记争斗,从而减少了干扰并提高了对最新上下文的保留能力。

为了测试这一概念,团队将 Proteus 机制应用于包括 SWLA、Comba、Titans 和 Hope-Attention 在内的多种最先进架构模型。这些模型在包含数十亿词汇的海量数据集上进行了训练,研究人员对比了使用和不使用这种新门控系统的性能表现。结果显示出一个清晰且一致的模式:添加 Proteus 显著提升了模型的整体性能。在标准语言任务中,模型产生了更准确的预测和更好的推理得分。这种改进在长上下文场景中尤为明显。当被要求从非常长的文档中检索特定信息时——这一任务通常被称为“大海捞针”——使用 Proteus 的模型在文本长度增加时,仍能比其标准版本更好地保持准确性。例如,在处理长达 16,000 字的文档任务时,使用增量激活方案的模型在寻找正确信息方面表现出显著的增益,而基准模型的效果则出现了剧烈下降。

研究还探讨了这一原则如何超越模型的记忆状态,进而扩展到模型自身的内部参数。通过将模型内部层的学习过程视为一种形式的记忆,研究人员将同样的调度逻辑应用于模型更新自身知识的方式。这种扩展使得该方法可以应用于不依赖传统循环记忆状态的架构,进一步证明了该方法的灵活性。在所有实验中,该方法不需要额外的存储空间或额外的计算成本;它仅仅改变了不同部分参与学习和检索的时机。研究结果表明,容量随时间分配的方式与架构本身同样重要。通过将记忆视为一个随上下文演进的调度程序,而非静态资源,研究人员提供了一个简单且具有广泛适用性的工具,帮助机器更有效地管理长序列,并证明了有时,最好的记忆方式就是慢慢打开大门。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →