← 最新论文
🤖 machine learning

PATCH: Learnable Tile-level Hybrid Sparsity for LLMs

PATCH 是一种混合稀疏性框架,它将大语言模型的权重矩阵划分为图块,并采用可学习的稠密或 2:4 稀疏分配方案,从而支持 0% 至 50% 之间的连续稀疏率,相较于现有的非结构化或僵化的半结构化剪枝方法,能够实现更高的精度和实用的 GPU 加速。

原作者: Younes Hourri, Mohammad Mozaffari, Maryam Mehri Dehnavi

发布于 2026-04-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Younes Hourri, Mohammad Mozaffari, Maryam Mehri Dehnavi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个大型语言模型(LLM)是一座拥有数十亿本书籍(参数)的庞大且高度有序的图书馆。为了让这座图书馆在标准计算机上快速运行,你需要移除一些书籍。然而,你面临着一个棘手的两难困境:

  1. “混乱”的方法(非结构化稀疏性): 你从书架的任何地方随机扔掉书籍。这种方法能保持图书馆知识的极高准确性,因为你可以进行非常精细的选择,但这会造成混乱。一位图书管理员(计算机的 GPU)在寻找书籍时不得不四处跳跃,导致过程缓慢且低效。
  2. “僵化”的方法(2:4 稀疏性): 你决定遵循一条严格的规则:“在每四本书中,必须恰好移除两本。”这使得图书管理员的工作变得轻松快捷,因为模式是可预测的。然而,这条规则过于僵化。有时,你必须移除的那两本书实际上是最重要的,导致图书馆失去其智能和准确性。

引入 PATCH:一位“智能瓷砖”图书管理员

这篇论文介绍了一种名为 PATCH(用于混合稀疏性的可学习瓷砖级配置剪枝)的新方法。PATCH 不像是在“混乱”和“僵化”的方法之间做选择,而是扮演一位智能图书管理员的角色,将图书馆划分为瓷砖(小块、可管理的书架区域)。

以下是其工作原理,使用一个简单的类比:

  • 瓷砖系统: 想象图书馆被划分为方形瓷砖,就像马赛克一样。
  • 决策: 对于每一块瓷砖,PATCH 系统学习做出选择:
    • 选项 A(稠密): 保持这块瓷砖完全装满书籍。这是针对图书馆中准确性至关重要的“关键”区域。
    • 选项 B(2:4 稀疏): 对这块瓷砖应用严格的“每四本移除两本”规则。这是针对图书馆拥有额外、冗余书籍的区域,可以安全地移除以节省空间并加快速度。
  • 学习过程: 系统不会猜测。它通过“训练”自己来确定哪些瓷砖应该保持满员,哪些应该稀疏。它学会保持重要部分稠密,冗余部分稀疏,同时遵循对硬件友好的规则。

为什么这很重要?

  • 兼得鱼与熊掌: PATCH 弥合了差距。它既保持了图书馆的准确性(像“混乱”的方法),又以计算机能够快速读取的方式组织它(像“僵化”的方法)。
  • 灵活的速度: 你可以告诉 PATCH:“我希望图书馆缩小 25%",或者“缩小 50%"。它会调整“满员瓷砖”与“稀疏瓷砖”的数量,以完美达到该目标,而不是被困在固定的 50% 缩减率上。
  • 现实世界的结果: 作者在从小型到超大型(高达 130 亿参数)的模型上测试了这种方法。
    • 速度: 在标准消费级显卡(A6000 GPU)上,PATCH 使模型的运行速度比原始未剪枝模型快了 1.18 到 1.38 倍
    • 智能: 与其他在加速时使模型“变笨”的方法不同,PATCH 实际上使模型比当前最先进的刚性方法(MaskLLM)更准确(提高了 0.37% 到 2.96%)。

总结

将 PATCH 视为清理巨型仓库的一种方式。与其随机扔掉东西(这会减慢叉车的速度),要么遵循一条会扔掉重要物品的愚蠢规则,PATCH 智能地指定特定区域保持满员,而其他区域则按照叉车喜欢的模式进行清理。其结果是,仓库的导航速度更快,同时仍保留所有关键知识。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →