← 最新论文
🤖 machine learning

Compressing LLMs with MoP: Mixture of Pruners

该论文介绍了 MoP(Mixture of Pruners),这是一个将深度和宽度剪枝统一起来的迭代框架,在 LLaMA 和 LLaVA 模型上的准确率和延迟降低方面均优于现有的单维度方法。

原作者: Bruno Lopes Yamamoto, Lucas Lauton de Alcantara, Victor Zacarias, Leandro Giusti Mugnaini, Keith Ando Ogawa, Lucas Pellicer, Rosimeire Pereira Costa, Edson Bollis, Anna Helena Reali Costa, Artur Jorda
发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Bruno Lopes Yamamoto, Lucas Lauton de Alcantara, Victor Zacarias, Leandro Giusti Mugnaini, Keith Ando Ogawa, Lucas Pellicer, Rosimeire Pereira Costa, Edson Bollis, Anna Helena Reali Costa, Artur Jordao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图用一个背包背负起一座巨大、沉重的图书馆。这座图书馆包含了人类知识的总和,并以一种只有最聪明的计算机才能阅读的复杂语言编写而成。这些“图书馆”被称为大语言模型(LLMs)。它们非常擅长写故事、解数学题,甚至能像朋友一样聊天。但问题在于:它们如此庞大且沉重,以至于仅仅为了打开书并读出一个句子,就需要消耗大量的电力和超高速的计算机。如果你想在普通的笔记本电脑或手机上使用它们,它们往往会显得太慢、太重,难以携带。

为了解决这个问题,科学家们一直试图在不丢弃重要书籍的前提下,让这些图书馆变得更小。其中一种方法叫做“剪枝”(pruning)。把剪枝想象成园艺工作。你有一株巨大的、过度生长的灌木丛(这个大型计算机模型),你想把它修剪成一个整洁、更小的形状。你可以剪掉整根枝干(让灌木变短),或者你可以修剪掉枝干上的叶子(让灌木变薄)。很长一段时间以来,园丁们必须做出选择:要么剪掉整根枝干,要么修剪叶子,但不能同时进行这两种操作。问题在于,哪种方式能在保持灌木健康并能结果的同时,让它变得更小呢?

这篇论文介绍了一种新的园艺工具,叫做 MoP,即混合剪枝器(Mixture of Pruners)。MoP 不仅仅是选择一种修剪方式,它是一个聪明的迭代园丁,会在每一步都尝试这两种方法。想象一下你在修剪你的灌木。在每一次修剪时,MoP 都会问两个问题:“如果我剪掉这整根枝干,灌木看起来怎么样?”以及“如果我改为修剪这根枝干上的叶子,它看起来又如何?”然后,它会选择那个让灌木看起来最接近原始、健康的植物的版本。它重复这个过程,在剪掉枝干和修剪叶子之间不断切换,直到灌木小到可以装进你的背包里。

研究人员在世界上一些最聪明的计算机大脑(如 LLaMA-2 和 LLaMA-3 模型)上测试了这种方法。他们发现,MoP 在缩小这些模型方面比仅使用单一方法要出色得多。当他们将模型缩小 40%(即减小 40% 的体积)时,MoP 保持了模型与竞争对手相当的智能水平,同时还显著提高了它们的运行速度。事实上,这些模型回答问题的速度提升了 39%。更令人惊讶的是,他们将这种方法应用于一个既能看图又能读文本的模型(称为 LLaVA-1.5)。他们发现,尽管他们只用文本来“教导”这个经过修剪的模型(没有使用图片),该模型仍然能几乎像以前一样理解图像。这表明,混合这两种修剪策略创造了一个更小、更快且更聪明的计算机大脑,使其在变得非常小时也不会迷失方向。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →