← 最新论文
🤖 machine learning

Multipole Semantic Attention: A Fast Approximation of Softmax Attention for Pretraining

本文介绍了多极语义注意力(Multipole Semantic Attention, MuSe),这是一种快速、即插即用的 Softmax 注意力近似方法,通过对查询(queries)和键(keys)进行聚类,在保持基准性能的同时,将 64k 上下文预训练速度提升了 36%,并实现了与 Llama 等现有预训练模型的即时兼容。

原作者: Rupert Mitchell, Kristian Kersting

发布于 2026-07-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Rupert Mitchell, Kristian Kersting

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图阅读一座巨大的图书馆以寻找某条特定的信息。在 AI 的世界里,这座图书馆就是“上下文”(比如一篇长文档或整个代码仓库),而 AI 就是那个读者。

问题在于,标准的 AI 读者(Transformer)虽然极其细致,但速度慢得令人痛苦。为了理解一个句子,它们传统上会尝试将当前句子的每一个词与整个图书馆中的每一个词进行对比。如果图书馆有 64,000 个词,AI 就必须进行数十亿次比较。这就像是在试图通过将那根针与每一根稻草逐一对比,来在一堆稻草中寻找那根特定的针。这种“二次方”级的成本使得阅读长篇著作变得极其昂贵且缓慢。

这篇论文介绍了一种名为**多极语义注意力机制(Multipole Semantic Attention,简称 MuSe)**的新方法。你可以把 MuSe 想象成一位聪明的图书管理员,她不会逐一阅读每个单词,而是使用一种“聚类”策略来提高速度,同时又不损失准确性。

以下是 MuSe 的工作原理,通过简单的类比进行拆解:

1. “分组”策略(语义聚类)

MuSe 不再将每个词视为独特的个体,而是将含义相似的词组合在一起形成“簇”(Clusters)。

  • 旧方法: 你问 AI,“‘苹果’这个词与什么相关?”于是它检查书中的每一个词。
  • MuSe 的方法: AI 首先按意义对单词进行分组。所有与“水果”相关的词归入一个桶,所有关于“编程”的词归入另一个桶。
  • 神奇的技巧: 最重要的是,MuSe 分别对问题(查询/Queries)和答案(键/Keys)进行分组。想象你有一份问题清单和一份答案清单。MuSe 为每组问题创建一个“摘要”,并为每组答案也创建一个“摘要”。

2. “两阶段”搜索

MuSe 使用两步过程来寻找它需要的东西,非常类似于在字典中查词:

  • 第一步:粗略草图(近似): AI 不直接阅读整本书,而是观察各个簇的“摘要”。它会问:“‘水果’这个桶是否与我关于‘派’的问题相关?”如果是,它就会保留这个桶。因为处理的是摘要而非数百万个单词,这一步非常快。
  • 第二步:深度挖掘(检索): 一旦 AI 知道哪些桶是重要的,它就会回到这些特定桶中去阅读实际的单词,以获取精确的细节。它会忽略图书馆中的其余部分。

3. “倾斜”的镜头(指数倾斜)

这是一个关键细节。当 AI 创建这些摘要时,它不仅仅是做一个简单的平均值。它会根据当前提出的特定问题来“倾斜”摘要。

  • 类比: 想象你在观察人群。一个简单的平均值只会告诉你“平均身高”。但如果你正在寻找一名篮球运动员,你会“倾斜”你的视角,将注意力集中在那些高个子身上。MuSe 在数学上也是如此。它通过当前的特定问题,将关注点转向摘要中特定类型的信息。这确保了摘要不仅仅是一个通用的平均值,而是一个高度相关的摘要。这保证了摘要不是一个普通的平均值,而是一个极具相关性的结果。

4. 为什么这很重要(结果)

作者在一个 10 亿参数的 AI 模型(一个非常聪明但尚未达到“超智能”水平的模型)上进行了测试,让它每次阅读 64,000 个词。

  • 速度: MuSe 使训练过程提速了 36%。这就像图书管理员在 2 小时内找到了信息,而不是传统的 3 小时。
  • 质量: 尽管跳过了大部分单词,但 AI 的学习效果与缓慢的传统方法一样好。事实上,在某些任务上,它的学习效果甚至更好,这可能是因为“跳过”的过程起到了有益的过滤作用,防止了 AI 被噪声干扰。
  • 兼容性: 你可以将这种方法直接替换到现有的 AI 模型(如 Llama 3)中,而无需从头开始重建模型。它是一种“即插即用”式的升级。

核心总结

MuSe 是一个聪明的捷径。它意识到,要理解一段长文本,你并不需要将每一个词与每一个其他的词进行对比。通过按意义对单词进行分组、创建智能摘要,并仅对最重要的部分进行繁重的计算,它使阅读长文档变得快速且高效,同时保持了 AI 的智能水平。

论文证实,这种方法适用于在代码和科学文档上训练模型,并且通过这种方式训练的模型在实际回答问题时仍然可以切换回“缓慢、完美”模式,从而确保在最终产品中不会损失任何质量。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →