← 最新论文
💬 NLP

Sparser Block-Sparse Attention via Token Permutation

本文提出了一种即插即用的置换块稀疏注意力(PBS-Attn)方法,该方法利用 token 置换来优化长上下文大语言模型中的块级稀疏性,在保持与全注意力机制相当精度的同时,实现了高达 2.75 倍的预填充加速。

原作者: Xinghao Wang, Pengyu Wang, Dong Zhang, Chenkun Tan, Shaojun Zhou, Zhaoxiang Liu, Shiguo Lian, Fangxu Liu, Kai Song, Xipeng Qiu

发布于 2026-05-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinghao Wang, Pengyu Wang, Dong Zhang, Chenkun Tan, Shaojun Zhou, Zhaoxiang Liu, Shiguo Lian, Fangxu Liu, Kai Song, Xipeng Qiu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试阅读一本长达 10 万页的巨著,只为回答一个问题。在标准的语言大模型(LLM)中,计算机就像一位极其详尽但缓慢的图书管理员。为了找到答案,这位管理员必须查看每一页,并将每一页与其他所有页面进行比对,以判断它们是否相关。如果书籍变得更长,管理员所需完成的工作量并非只是略微增加,而是会呈爆炸式增长。这就是为什么计算机阅读长文档既缓慢又昂贵。

为了加快速度,研究人员尝试了一种“块稀疏”方法。他们不再阅读每一页,而是将书籍切分为章节(块),仅阅读他们认为重要的章节,而跳过其余部分。

问题所在:
该论文指出,这种“跳过章节”的方法存在一个缺陷。想象一下,你侦探小说中最重要的线索随机散布在整个书中——第一章有一个线索,第五十章有一个线索,第九十九章又有一个线索。即使你知道哪些章节包含线索,由于它们分布如此分散,你仍然不得不打开几乎所有章节才能找到它们。最终,你为了寻找寥寥无几的分散信息而做了大量工作。论文将这种现象称为“信息碎片化”。

解决方案:“令牌置换”技巧
作者提出了一种名为**置换块稀疏注意力(Permuted Block-Sparse Attention, PBS-Attn)**的巧妙新方法。

不妨将这本书想象成一副扑克牌,而非一个固定的故事:

  1. 旧方法:你试图按顺序检查牌堆中的每一张牌,以找到“黑桃 A"(即最重要的信息)。
  2. PBS-Attn 方法:在开始搜索之前,你快速洗牌。但你并非随机洗牌,而是将洗牌后的结果调整为:所有 A 和 K(即最重要的牌)都整齐地聚集在顶部的同一堆中。

现在,当你去寻找重要信息时,你无需打开 99 个不同的章节。你只需打开前几个章节,因为你知道所有重要线索都集中在那里。你可以完全跳过书中的其余部分。

如何实现(“分段”魔法)
这里有一个限制:你不能随意打乱故事的顺序,否则情节将不再连贯(结局不能发生在开头之前)。这被称为“因果性”。

为解决这一问题,作者采用了一种**“分段置换”**策略:

  • 他们将书籍划分为多个小型、易于管理的部分(段)。
  • 在每个部分内部,他们打乱页面顺序,使重要页面聚集在一起。
  • 他们保持各部分原有的顺序不变。

这样一来,故事依然能从第 1 段逻辑顺畅地过渡到第 2 段,但在每个部分内部,计算机可以忽略枯燥的页面,仅专注于那些已被聚集在一起的“重磅人物”(即重要的令牌)。

结果
论文声称,这种简单的重排技巧效果显著:

  • 速度:它使计算机阅读长文档的速度比当前最佳方法快2.75 倍
  • 准确性:它不会让模型变得“愚蠢”。其答案质量与计算机通读全书、未跳过任何内容时一样出色。
  • 效率:它减少了所需的计算机内存,降低了运行这些模型的成本。

总结
该论文并未发明新型计算机或新的语言理解方式,而是发明了一种更好的数据组织方式,在计算机开始工作之前进行优化。通过将重要信息重新排列为整齐、密集的簇,计算机可以跳过大量工作而不会遗漏任何内容,从而使长对话和文档分析变得更加快速且经济。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →