← 最新论文
💬 NLP

BLASST: Dynamic BLocked Attention Sparsity via Softmax Thresholding

BLASST 是一种无需训练、即插即用的动态稀疏注意力机制,它通过利用在线 Softmax 统计信息设定固定阈值来跳过无关注意力块,从而在保持精度的同时显著加速大语言模型在预填充和解码阶段的推理速度。

原作者: Jiayi Yuan, Cameron Shinn, Kai Xu, Jingze Cui, George Klimiashvili, Guangxuan Xiao, Perkz Zheng, Bo Li, Yuxin Zhou, Zhouhai Ye, Weijie You, Tian Zheng, Dominic Brown, Pengbo Wang, Markus Hoehnerbach
发布于 2026-04-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiayi Yuan, Cameron Shinn, Kai Xu, Jingze Cui, George Klimiashvili, Guangxuan Xiao, Perkz Zheng, Bo Li, Yuxin Zhou, Zhouhai Ye, Weijie You, Tian Zheng, Dominic Brown, Pengbo Wang, Markus Hoehnerbach, Richard Cai, Julien Demouth, John D. Owens, Xia Hu, Song Han, Timmy Liu, Huizi Mao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 BLASST 的新方法,它就像是大语言模型(LLM)的“智能过滤器”,能让模型在处理超长文本时变得更快、更省内存,而且几乎不会损失智能。

为了让你轻松理解,我们可以把大语言模型想象成一位正在阅读一本超级厚书(比如整个互联网或几百万字的代码库)的超级天才

1. 核心痛点:为什么现在的模型“读”得慢?

想象一下,这位天才每读到一个新词(Token),他都要回头去翻整本书,把之前读过的每一个词都重新看一遍,思考它们之间有没有关系。

  • 问题:如果书只有 10 页,这很快。但如果书有 100 万页,他每读一个新词都要翻 100 万次,这简直累死人(计算量呈指数级爆炸)。
  • 现状:现有的技术(如 FlashAttention)虽然优化了“翻书”的动作,让他翻得更快,但他依然试图去翻每一页,并没有真正减少工作量。

2. BLASST 的解决方案:聪明的“略读”策略

BLASST 的核心思想非常直观:并不是每一页都值得你仔细读。

  • 传统做法:不管内容多无关紧要,都强行计算一遍。
  • BLASST 的做法:它给这位天才装了一个“智能眼镜”。
    • 当天才快速浏览时,如果发现某几页的内容(比如“的”、“了”、“啊”这种词,或者完全无关的段落)对当前句子的理解贡献微乎其微,他的“智能眼镜”会立刻告诉他:“跳过!别读了!”
    • 跳过什么? 跳过计算、跳过从内存里读取数据、跳过乘法运算。
    • 怎么判断? 它不需要重新计算,而是利用正在进行的“注意力分数”(可以理解为“重要程度打分”)。如果某一块内容的分数远低于当前已知的最高分,那就直接忽略。

3. 三大亮点:为什么它这么厉害?

A. 无需“预习”或“特训” (Drop-in, Training-free)

  • 比喻:以前的很多加速方法,就像要求这位天才在读书前,先花几个小时写一份“重点摘要”,或者让他重新上几年学来适应新的阅读方式。这太麻烦了,而且容易出错。
  • BLASST:就像给他递了一副现成的眼镜。他不需要重新学习,也不需要提前做功课。戴上眼镜就能立刻开始用,直接插入现有的系统里就能跑。

B. 自动调节的“灵敏度” (Dynamic Calibration)

  • 比喻:如果书很短(比如 100 页),眼镜的灵敏度可以调低一点,多读几页;如果书很长(比如 100 万页),眼镜就要调得更灵敏,只读最关键的几页。
  • BLASST:它发现了一个简单的数学规律:书越长,阈值就要越严格。它有一个自动校准程序,能根据书的长度自动设定“跳过多少”的标准。你不需要手动去调参数,它自己会搞定。

C. 两头通吃:既加速“读前”也加速“读中”

  • 比喻
    • Prefill(预填充/读前):就像在开始写文章前,快速浏览整本书找灵感。BLASST 在这里能跳过大量无关计算,让“找灵感”的速度快 1.5 倍。
    • Decode(解码/读中):就像在写文章时,每写一个字都要回头看。BLASST 在这里能跳过从内存里搬运数据的步骤,让“写字”的速度快 1.5 倍。
  • 大多数旧方法只能加速其中一步,而 BLASST 是两头一起加速

4. 实际效果:快了多少?

在最新的顶级显卡(如 NVIDIA Blackwell 和 Hopper)上测试:

  • 速度提升:在保持 99% 以上准确度的情况下,处理速度提升了 1.5 倍 左右。
  • 跳过率:它成功跳掉了 70% 以上 的无用计算和内存读取。
  • 结果:原本需要几分钟才能处理完的超长文档,现在可能只需要几十秒。

5. 总结:它意味着什么?

BLASST 就像是给大语言模型装上了**“自动驾驶”和“智能节油”系统**。

  • 以前,让 AI 读一本 100 万字的书,既慢又贵,甚至跑不动。
  • 现在,有了 BLASST,AI 可以忽略那些废话,只关注核心内容,从而跑得飞快,而且不费油(省显存)

这让那些需要处理超长上下文(比如分析整个公司的代码库、阅读整本小说、进行超长对话)的应用变得真正可行和实用。它不需要你改变模型结构,也不需要你重新训练,就像给旧车换上了新引擎,直接就能跑。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →