← 最新论文
💬 NLP

BCMT: Blockwise Causal Memory Transformer

BCMT(块状因果记忆 Transformer)引入了一种新颖的架构,通过对块摘要进行指数级因果记忆,将局部标记交互与全局上下文传播解耦,在实现与稠密 Transformer 相当的长文本建模性能的同时,显著提高了训练吞吐量并降低了内存消耗。

原作者: Rachid Arezki

发布于 2026-08-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Rachid Arezki

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图向一位朋友讲述一个故事,但这个故事长达一百万字。在人工智能的世界里,编写故事的计算机(被称为语言模型)通常使用一种叫做“Transformer”的工具来理解情节。你可以把 Transformer 想象成一位超级组织有序的图书管理员,为了理解当前的句子,他会回顾整本书中出现过的每一个单词。这对于短篇故事来说效果惊人,但随着书变得越来越长,这位图书管理员就会感到不堪重负。如果书有 1,000 个单词,图书管理员需要建立 1,000 个连接;如果书有 10,000 个单词,他需要建立 100,000 个连接。这就像试图同时与体育场里的每一个人握手一样;这种努力增长得太快,导致计算机耗尽内存和时间,使得阅读非常长的书籍变得不可能。

多年来,科学家们一直试图解决这个“长书问题”。有些人尝试让图书管理员只看最后几页(但这会错过大局),而另一些人则试图建立一个特殊的记忆库,让图书管理员通过写笔记来记录过去。但这些解决方案往往会让过程变得复杂,或者以不同的方式降低计算机的速度。核心问题在于:我们能否构建一台既能像那位“超级图书管理员”一样理解长篇故事,又不会因为要检查每一个单词与其它所有单词之间的关系而产生巨大头痛的计算机?

这就是由研究员 Rachid Arezki 提出的一个新想法——BCMT(块状因果记忆 Transformer)登场的地方。BCMT 不再强迫计算机一次性观察整本书,而是将故事分解成小的、易于处理的“块”(blocks)。想象一下你在读一部小说,但你不是试图记住从第 1 页到第 500 页的每一个单词,而是读完一个章节,写一个简短且聪明的摘要,然后把这个摘要放进你的口袋里。接着你读下一个章节,写下另一个摘要,并把它也放进口袋。

这里最巧妙的部分在于:BCMT 并不会仅仅忘记旧的章节。它使用了一种特殊的“指数级记忆”系统。你可以把它想象成一种逐渐消逝的回声。你最近写的摘要在脑海中清晰响亮,但早期章节的摘要仍然存在,只是随着时间的推移,它们变得越来越微弱。这使得计算机能够在不需要在活跃内存中保留过去每一个细节的情况下,记住故事的总体流向。

该论文在名为 WikiText-103 的标准语言任务数据集上测试了这个想法。研究人员发现,即使在上下文长达 1,024 个 token 的情况下,BCMT 在预测句子中下一个单词方面的表现几乎与传统的“超级图书管理员”方法不相上下。然而,真正的魔力在于速度和效率。因为 BCMT 不需要检查每个单词与其它所有单词之间的关系,它的训练速度要快得多。在一台配备标准显卡的计算机上,新方法每秒可以处理约 204,200 个 token,而旧方法仅为 119,900 个 token——这是一个巨大的飞跃。它使用的计算机内存也显著减少了(约 10.48 GB,而旧方法为 14.37 GB)。

研究人员还进行了一项专门的测试,以确保这种速度提升不仅仅是因为他们把故事拆分成了较小的部分。他们创建了一个不使用特殊“记忆口袋”的拆分版本模型。那个版本的表现较差。这表明,“消逝的回声”记忆系统才是真正的英雄,而不仅仅是拆分文本这一行为本身。

简而言之,BCMT 提供了一种构建能够处理长篇故事的 AI 的新方法。它将“理解即时邻域”(当前的文本块)的任务与“记住历史”(记忆口袋)的任务分离开来。虽然它不能完美精确地记住遥远过去的每一个细节——因为较旧的摘要会变得越来越微弱——但它提供了一种非常高效的方式来保持对大局的把握。作者总结道,这种方法是让 AI 更快、更具阅读长文本能力的一种极具前景的替代方案,尽管他们也指出,对于需要完美回忆古代细节的任务,传统的“检查一切”的方法可能仍然是必要的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →