← 最新论文
🤖 machine learning

Accelerating Sparse Transformer Inference on GPU

本文提出了 STOF,这是一个 GPU 框架,通过利用分析建模实现高效的多头注意力映射,并采用两阶段搜索策略动态优化算子融合,从而加速稀疏 Transformer 推理,在多头注意力计算和端到端推理中分别实现了高达 1.6 倍和 1.4 倍的加速。

原作者: Wenhao Dai, Haodong Deng, Mengfei Rong, Xinyu Yang, Hongyu Liu, Fangxin Liu, Hailong Yang, Qianwen Cao, Qingxiao Sun

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenhao Dai, Haodong Deng, Mengfei Rong, Xinyu Yang, Hongyu Liu, Fangxin Liu, Hailong Yang, Qianwen Cao, Qingxiao Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图阅读一个庞大的图书馆(即大型语言模型)以回答一个问题。这个图书馆被组织成一个个名为Transformer的房间,每个房间里都有一位图书管理员(即多头注意力机制),他必须扫描成千上万页内容,以找到与你问题相关的具体句子。

问题在于,对于许多问题而言,大多数页面都是无关的。图书管理员浪费时间在翻阅空白页面或无关页面上。这正是稀疏性发挥作用的地方:它就像在无关页面上贴上“请勿阅读”的标签。

然而,当前的图书管理员(现有软件)并不擅长使用这些标签。他们仍然会走过标有“请勿阅读”的页面,或者当标签以奇怪、随机的模式放置时感到困惑。此外,图书馆还有其他任务(如摘要或格式化),这些任务通常单独执行,从而在不同任务之间增加了额外的往返时间。

现在,STOF登场了,这是研究人员提出的一种新系统。可以将 STOF 想象为一个专为这些“稀疏”图书馆设计的超高效、智能的图书馆管理系统。以下是其工作原理,分解为简单部分:

1. 智能图书管理员(统一的多头注意力内核)

研究人员意识到,不同的“请勿阅读”模式需要不同的策略。

  • 问题:有些模式是整齐的标签行(如滑动窗口),而另一些则是随机散布的(如彩票)。旧系统试图使用一种“一刀切”的方法,导致速度缓慢。
  • STOF 解决方案:STOF 扮演一位智能图书管理员的角色,为每项工作选择最佳工具。
    • 如果标签位于整齐的小簇中,图书管理员会使用**“逐行”**方法:一次性抓取一整行书籍并快速扫描。
    • 如果标签分散或图书馆规模巨大,他们则采用**“分块”**方法:将书籍划分为小块、易于管理的部分,仅打开那些带有有效标签的特定块。
  • 结果:通过完全跳过“请勿阅读”的页面,而不仅仅是忽略它们,图书管理员的工作速度大大提升。

2. 流水线(算子融合)

在普通图书馆中,图书管理员可能读完书后,走到另一张桌子进行文本摘要,然后再走到另一张桌子对答案进行格式化。这种走动(在内存和处理器之间移动数据)非常缓慢。

  • 问题:现有系统通常只组合简单的任务。它们将繁重的任务(如复杂数学运算)留给单独的步骤,导致交通拥堵。
  • STOF 解决方案:STOF 构建了一条定制的流水线。它审视整个流程并问道:“我们能否将这些步骤合并?”
    • 它不仅仅是将两个简单任务粘合在一起,而是找出将复杂数学任务与格式化任务结合的完美方式。
    • 它使用一个“搜索引擎”来尝试不同的任务组合方式(如同尝试不同的流水线布局),以找到最适合你所阅读图书馆规模的最快方案。

3. 自动驾驶(分层搜索)

你无法为每一种书籍大小和问题类型手动设计完美的流水线;组合方式太多了。

  • STOF 解决方案:STOF 拥有一个自动驾驶系统,能够即时学习。
    • 第一阶段(地图):它查看图书馆结构,并绘制出“请勿阅读”标签大致位置的粗略地图。
    • 第二阶段(优化):它执行两步搜索。首先,它扩展流水线边界,以查看其能延伸多远。其次,它根据先前尝试的效果,微调工人(参数)的速度。
    • 它会记住哪些方法有效(缓存),从而避免浪费时间重新测试相同的缓慢想法。

结果:快了多少?

研究人员在强大的图形处理器(GPU)上使用流行的 AI 模型(如 BERT、GPT 和 LLaMA)对 STOF 进行了测试。

  • 速度:与现有最佳方法相比,STOF 使核心阅读任务(多头注意力)的速度提高了高达1.6 倍
  • 整体速度:当着眼于回答问题的整个流程(端到端)时,速度提高了高达1.4 倍
  • 大型图书馆:图书馆越大(文本序列越长),STOF 的表现就越出色,因为它跳过了大量无用工作。

总结

可以将STOF视为一个系统,它阻止 AI 浪费时间阅读不需要的页面,并阻止其在桌子之间来回走动。它采用一种智能、自适应的策略来跳过垃圾内容,并将有用的步骤合并为一个流畅、快速的动作。这使得 AI 模型运行速度显著加快,尤其是在处理长文本或复杂文本时。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →