← 最新论文
📊 statistics

Express Language Modeling

本文介绍了 Express,这是一个将非因果注意力近似转换为因果注意力的工具,它具有改进的理论保证和高效的 Triton 实现,能够在克服长文本语言建模中关键资源瓶颈的同时,实现相对于 FlashAttention 2 的显著加速。

原作者: Albert Gong, Annabelle Michael Carrell, Raaz Dwivedi, Lester Mackey

发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Albert Gong, Annabelle Michael Carrell, Raaz Dwivedi, Lester Mackey

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图通过阅读一本非常长的书来回答一个问题。在阅读过程中,你需要记住之前遇到的每一个重要细节,才能理解当前的句子。在人工智能语言模型的世界里,这种“记忆”过程被称为注意力(Attention)

问题在于,随着书变得越来越长,记忆所有内容的精力需求会呈爆炸式增长。这就像是在一个挤满了人的房间里进行对话,每当你开口说一个新词,你都必须向房间里的每一个人重新介绍自己,并重新阅读你们之前的整个对话历史。这会让过程变得极其缓慢且耗费内存,以至于无法处理非常长的故事或复杂的推理任务。

这篇论文介绍了一个名为 Express(以及一个特定版本 Thinformer Express)的新工具,它充当了这些 AI 模型的超级高效图书管理员。以下是它的工作原理,我们使用简单的类比来解释:

1. 问题所在:“二次方”瓶颈

通常情况下,为了理解一个新句子,AI 会查看之前所有的单词。如果你有 1,000 个单词,它要做 1,000 次检查。如果你有 100 万个单词,它就必须做 1 万亿次检查。这就是论文中提到的“二次方(quadratic)”成本。这就像是在干草堆里寻找一根特定的针,你必须一遍又一遍地逐一检查每一根干草。

2. 解决方案:智能总结者(稀疏化/Thinning)

作者意识到,你并不需要完美地记住每一个单词。你只需要一个关于整个故事的、高质量的“摘要”或“核心集”,来代表全文。

他们构建了一个名为 Express 的工具,它能将一个“非因果(non-causal)”总结器(一种可以先读完一整本书然后挑选出最精彩的 100 页的工具)转化为一个“因果(causal)”总结器。

  • 非因果 就像是先读完一整本书,然后再挑选精华。
  • 因果 就像是实时地逐页阅读书籍,在阅读过程中立即决定哪些精华值得放入口袋,而永远不会向前看(预知未来)。

Express 是一个神奇的技巧,它允许 AI 在不损失准确性的情况下实现这种实时总结。它确保了即使 AI 只关注过去极小的一部分内容(一个“稀疏化/thinned”后的版本),它仍然能得到正确的答案。

3. “膨胀”技巧

论文描述了一种巧妙的机制,让 AI 的记忆像气球一样“膨胀”和“收缩”。

  • 精确阶段(Exact Phase): 在最开始,AI 会完美地记住一切。
  • 稀疏阶段(Thin Phase): 随着更多单词的到来,AI 将它们分组。它不再保留所有单词,而是使用一种特殊的算法将这一组单词“压缩”成一个更小的、带有权重的摘要。
  • 减半阶段(HALVE Phase): 当摘要变得太大时,AI 会执行“减半”操作,在仔细保留最重要的信息的同时,将大小减半。

这个过程确保了无论故事有多长,内存大小都能保持在较小且恒定的水平。这就像是一个会自动缩小体积以适应空间的背包,只保留最核心的物品,这样你就永远不会耗尽空间。

4. 现实世界的结果:加速 AI

作者不仅做了数学推导,还使用了一种名为 Triton 的编程语言(类似于计算机芯片的高速引擎)构建了一个快速版本的工具。他们在四个特定场景下进行了测试:

  • 长上下文预填充(阅读书籍): 当给 AI 一个巨大的文档进行阅读前进行处理时,对于超长文本(512,000 个单词),Express 比当前最优秀的方法(FlashAttention 2)快了 82 倍
  • 压缩内存(KV 缓存): AI 模型会将过去的单词存储在“缓存”中。Express 帮助它使用其他流行的方法压缩此缓存,在不损失准确性的情况下使整个过程更快。
  • 内存高效解码(逐步思考): 在解决需要长链推理的难题时,Express 让 AI 仅使用标准方法所需内存的 61%,却能得到同样的正确答案。
  • 计算高效解码(加速思考): 对于同样的数学问题,Express 让 AI 完成任务的时间仅为通常时间的 56%,同时仍能得到正确答案。

总结

简而言之,Express 是一种让 AI 处理长对话和复杂任务的新方法。它充当了一个智能过滤器,不断总结过去的内容,使 AI 的记忆保持精简、思考速度保持高效,同时不会让 AI “忘记”重要的细节。它解决了 AI 在处理长文本或复杂推理时变得过慢或内存耗尽的问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →