← 最新论文
🤖 machine learning

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices

本文提出了一种新型三层矩阵存储格式和一个混合 SpMM 内核,通过共同利用稀疏核心和 CUDA 核心,使现代 GPU 能够实现中度非结构化稀疏的大语言模型(LLM)推理,实现了首次在内核层面超越密集矩阵乘法,并优于 SpInfer 和 FlashLLM 等最先进的方法。

原作者: Tao Lu, Haoyu Wang, Zonghui Wang, Keshen Xiang, Jiaheng Zhang, Wenzhi Chen

发布于 2026-07-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Tao Lu, Haoyu Wang, Zonghui Wang, Keshen Xiang, Jiaheng Zhang, Wenzhi Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你拥有一个巨大的图书库(大型语言模型),它能写故事、回答问题和编写代码。为了让这些书发挥作用,一个超级快速的机器人(GPU)必须阅读数百万页数字(权重),以确定下一个词是什么。问题在于?机器人因为忙于阅读而变得疲惫不堪,运行成本也非常高昂。

科学家们尝试了一个聪明的技巧:他们扔掉了那些无聊、不重要的页面,使图书库变得更轻量。这被称为“剪枝”(Pruning)。但问题在于,如果你扔掉的页面太多,故事就会变得古怪且毫无逻辑。理想的平衡点是保留大约一半的页面(50% 的稀疏度)。

大问题
你会认为一个更轻量的图书库阅读起来会更快,对吧?并不完全如此。机器人的阅读机器(GPU)是为阅读密集的、完整的页面而设计的。当页面零散且缺失部分内容时(非结构化稀疏性),机器人会感到困惑。它花费在寻找缺失页面和整理碎片上的时间,实际上比直接阅读那个沉重、完整的图书库还要多。现有的处理这种“零散”阅读的工具要么太慢,要么需要机器人进行额外的数学计算,从而抵消了速度上的提升。

新解决方案:三层归档系统
作者们构建了一个全新的归档系统,来帮助机器人高效地阅读这些零散的页面。他们称之为“三层”格式,它的运作方式就像一位组织极其有序的图书管理员:

  1. “Sparse-TC”层(VIP 区): 管理员首先抓取那些正好符合整齐、预设模式的页面(例如,每 4 页中就有 2 个重要的笔记)。这些页面直接进入机器人最快、最专门的阅读臂(Sparse Tensor Cores)。无需搜索!
  2. “插槽填充”(Slot-Filling)层(拼图碎片): 那么那些不符合 VIP 模式的额外笔记怎么办呢?与其把它们扔掉或做成一份混乱的清单,不如将它们塞进 VIP 页面留下的空隙中。为了在不编写庞大地址簿的情况下追踪它们的位置,他们使用了一种“并行差分距离”(Parallel Differential Distance)编码。这就像一张藏宝图,上面只写着“下一个线索在右边 3 步处”,而不是每次都写下完整的地址。这节省了大量空间,并且解码非常快。
  3. “残差”(Residual)层(杂物抽屉): 极少数(不到 1%)过于奇特的笔记无法放入任何地方。它们会被放入一个标准的、传统的档案柜(CSR 格式)。由于这些笔记非常少,机器人并不介意检查一下这个抽屉。

超级流水线
真正的魔力不仅在于归档系统,还在于机器人如何工作。作者设计了一个工作流,让机器人在阅读的同时能同时做三件事:

  • 它从巨大的内存架(全局内存/Global Memory)上抓取下一块页面。
  • 它解码“向右 3 步”的藏宝图线索(使用标准核心)。
  • 它计算 VIP 页面的数字(使用快速专用核心)。

通过将这些任务重叠执行,机器人永远不会因为等待数据而闲置。这就像一位厨师在切菜、搅拌锅里的汤以及摆放餐具的同时,能同时进行这些工作,而不是一次只做一件事。

结果:比以前更快
当他们在现代、高速的机器人(一台拥有 80 GB 显存的 NVIDIA H100 GPU)上进行测试时,结果令人印象深刻。

  • 速度: 他们的这种方法是第一个在内核层面真正超越了阅读沉重完整图书库速度的方法。在内核级别,它比之前的最佳工具(SpInfer)快了高达 1.64 倍
  • 端到端: 对于整个文本生成过程,它比 FlashLLM 快了高达 1.41 倍
  • 内存: 与阅读完整的图书库相比,它还节省了约 21.4% 的内存空间。

它不做什么
作者们谨慎地指出这不是什么。当图书库几乎完全为空时(90% 以上的高稀疏度),这种方法并不是效果最好的;在这种情况下,旧方法仍然更优。此外,该方法针对的是“解码”(decode)阶段(即机器人一次写出一个词的阶段),这是最常见的任务。当机器人需要一次性阅读一大块文本(“预填充/prefill”阶段)时,这种新方法可能比标准的重型阅读工具稍微慢一些,但那是他们目前并不打算解决的特定场景。

简而言之,通过将零散的页面组织成一个智能的三层系统,并让机器人保持持续忙碌的状态,他们成功地让 AI 聊天机器人运行得更快、更便宜,且没有变笨。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →