SpenseGPT: Practical One-shot Pruning Enabling Sparse and Dense GEMMs for LLM Inference
SpenseGPT 引入了一种实用的单次剪枝方法,该方法利用混合稀疏-稠密权重格式,在无需自定义编译器支持的情况下,克服了严格半结构化稀疏性的局限性,在保持模型准确度的同时,在 B200 GPU 上实现了高达 1.2 倍的端到端 LLM 解码加速。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个庞大且极其聪明的图书馆(即大型语言模型,或称 LLM),它能帮助计算机编写代码、解决数学问题并遵循指令。为了让这个图书馆在现代计算机上运行得更快,工程师们一直试图对其进行“剪枝”——即移除不必要的书籍,使其变得更轻量、更快速。
然而,这里有一个陷阱:要在新型计算机芯片(如 NVIDIA 的 B200)上实现最快的阅读速度,需要遵循一个非常严格的规则:每四个书架上的位置,必须恰好有两个是空的。 这被称为“2:4 稀疏性”。
问题所在:严格的规则
这个严格规则的问题在于,它就像是在尝试打包一个行李箱,而你必须留下正好一半的空间是空的。如果你只是随机扔掉一半的书以符合规则,你会丢失重要的信息,导致图书馆无法正常工作。计算机虽然变快了,但它给出的答案会变得荒谬或错误。
其他研究人员曾尝试通过放宽规则来解决这个问题,但他们的解决方案要么像是在建造一个只能使用特定燃料的定制昂贵引擎,要么增加了过多的额外工作量(开销),导致速度提升的效果消失殆用。
解决方案:Spense(混合书架)
该论文的作者提出了一种名为 Spense 的新方法。他们并没有强迫整个图书馆都遵循严格的“两个空位、两个满位”规则,而是将书架分为两个区域:
- 稀疏区(The Sparse Zone): 在这里,他们遵循严格的规则(移除 4 本书中的 2 本)。这个区域可以获得来自计算机特殊硬件的速度提升。
- 稠密区(The Dense Zone): 在这里,他们保留了所有的书籍。没有任何书籍被移除。这个区域保留了最重要的信息。
把这想象成一辆混合动力汽车。“稀疏区”就像是电动机(巡航时效率极高),而“稠密区”就像是燃油发动机(在需要爬坡时提供强大动力)。通过将两者结合,你得到了两者的优点:既保证了速度,又没有损失动力。
核心秘诀:选择保留哪些书
难点在于决定哪些书应该进入“稠密区”,哪些应该被扔掉。作者发现,这种选择至关重要。如果选错了要保留的书,图书馆仍然会失效。
他们开发了两种策略来进行这种选择:
- SpenseGPT(简单策略): 想象书是按顺序排列的。这种方法说:“让我们把书架上最后 25% 的书保持原样(稠密),并对前 75% 的书进行剪枝(稀疏)。”事实证明,这种简单的“末尾截断”方法效果出奇地好,因为其背后的剪枝数学逻辑如此。
- SpenseGPT+(智能策略): 这就像聘请了一位图书管理员,通过阅读每一本书来判断哪些书最重要。它会根据每本书对最终答案的贡献度计算一个“分数”。它将得分最高的书籍保留在“稠密区”,确保最关键的知识永远不会丢失。
结果:快速且准确
团队在两个非常庞大且聪明的模型(Qwen3-32B 和 Seed-OSS-36B)上,使用最新的超快速计算机芯片(B200 GPU)进行了测试。
- 速度: 他们实现了 1.2 倍的实际使用加速。这意味着计算机生成答案的速度比以前明显更快。
- 准确性: 与其他会让模型变“笨”的方法不同,Spense 保持了模型的聪明才智。在处理数学推理、编程和遵循指令等困难任务时,它的表现与原始未剪枝的模型一样出色。
- 实用性: 至关重要的是,这种方法不需要构建新的、定制的计算机软件(编译器)。它可以使用这些芯片上现有的、高度优化的标准工具。
总结
简而言之,这篇论文介绍了一种在不降低模型智能水平的前提下,让 AI 模型变得更快的方法。他们没有强迫整个模型都变成“半空”状态(这会破坏模型),而是创建了一个混合系统:模型的一部分被精简以追求速度,而最核心的部分则保持完整以确保准确性。这使得现代计算机能够以前所未有的速度运行这些庞大的 AI 大脑,并且使用的是现有的工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。