✨ 要点🔬 技术摘要
想象一下,你正试图用一个背包背负起一座巨大、沉重的图书馆。这座图书馆包含了人类知识的总和,并以一种只有最聪明的计算机才能阅读的复杂语言编写而成。这些“图书馆”被称为大语言模型(LLMs)。它们非常擅长写故事、解数学题,甚至能像朋友一样聊天。但问题在于:它们如此庞大且沉重,以至于仅仅为了打开书并读出一个句子,就需要消耗大量的电力和超高速的计算机。如果你想在普通的笔记本电脑或手机上使用它们,它们往往会显得太慢、太重,难以携带。
为了解决这个问题,科学家们一直试图在不丢弃重要书籍的前提下,让这些图书馆变得更小。其中一种方法叫做“剪枝”(pruning)。把剪枝想象成园艺工作。你有一株巨大的、过度生长的灌木丛(这个大型计算机模型),你想把它修剪成一个整洁、更小的形状。你可以剪掉整根枝干(让灌木变短),或者你可以修剪掉枝干上的叶子(让灌木变薄)。很长一段时间以来,园丁们必须做出选择:要么剪掉整根枝干,要么修剪叶子,但不能同时进行这两种操作。问题在于,哪种方式能在保持灌木健康并能结果的同时,让它变得更小呢?
这篇论文介绍了一种新的园艺工具,叫做 MoP ,即混合剪枝器(Mixture of Pruners) 。MoP 不仅仅是选择一种修剪方式,它是一个聪明的迭代园丁,会在每一步都尝试这两种方法。想象一下你在修剪你的灌木。在每一次修剪时,MoP 都会问两个问题:“如果我剪掉这整根枝干,灌木看起来怎么样?”以及“如果我改为修剪这根枝干上的叶子,它看起来又如何?”然后,它会选择那个让灌木看起来最接近原始、健康的植物的版本。它重复这个过程,在剪掉枝干和修剪叶子之间不断切换,直到灌木小到可以装进你的背包里。
研究人员在世界上一些最聪明的计算机大脑(如 LLaMA-2 和 LLaMA-3 模型)上测试了这种方法。他们发现,MoP 在缩小这些模型方面比仅使用单一方法要出色得多。当他们将模型缩小 40%(即减小 40% 的体积)时,MoP 保持了模型与竞争对手相当的智能水平,同时还显著提高了它们的运行速度。事实上,这些模型回答问题的速度提升了 39% 。更令人惊讶的是,他们将这种方法应用于一个既能看图又能读文本的模型(称为 LLaVA-1.5)。他们发现,尽管他们只用文本来“教导”这个经过修剪的模型(没有使用图片),该模型仍然能几乎像以前一样理解图像。这表明,混合这两种修剪策略创造了一个更小、更快且更聪明的计算机大脑,使其在变得非常小时也不会迷失方向。
技术摘要:使用 MoP(Mixture of Pruners)压缩大语言模型
问题陈述 大语言模型(LLMs)面临着巨大的计算需求,因此需要能够减少参数量并在不牺牲性能的前提下加速推理的方法。虽然模型剪枝是一种有效的策略,但现有方法通常侧重于单一维度:要么是深度剪枝 (移除整个 Transformer 层),要么是宽度剪枝 (移除内部组件,如注意力头或 MLP 神经元)。深度剪枝通过减少顺序计算提供卓越的推理加速,而宽度剪枝则允许对冗余结构进行更细粒度的选择,通常能更好地保持下游任务的性能。本文指出,现有文献中存在一种二分法,即这两者互补的优势很少被统一起来,导致在压缩率、准确性和延迟之间的权衡往往并非最优。
方法论:混合剪枝器(Mixture of Pruners, MoP) 作者提出了 MoP ,这是一个将深度和宽度剪枝统一为凝聚策略的迭代框架。其核心机制如下:
迭代路径选择: 在每次迭代中,MoP 生成两个候选模型以推进剪枝路径:
深度候选模型: 移除一个完整的 Transformer 层(具体为倒数第三层,根据文献中关于冗余性的发现,保留最后两层)。
宽度候选模型: 通过剪枝各层的注意力头和 MLP 神经元,移除等量的参数。
参数匹配: 为了确保公平比较,宽度剪枝步骤经过校准,以移除与深度步骤中移除的单层参数量完全相等的参数。这需要精细的控制,作者通过使用 AMP(激活幅度剪枝)准则实现了这一点。
评估与选择: 两个候选模型都会在训练数据的子集上进行简短的恢复性微调。随后,一个路径准则 (P P P )通过余弦相似度、KL 散度、困惑度(PPL)甚至随机选择等指标对候选模型与原始未剪枝模型进行评分。得分最接近原始模型(偏差最小)的候选模型将被选中,作为下一次迭代的基础。
最终恢复: 一旦达到目标压缩率,最终的剪枝模型将在完整的训练数据集上进行全面的恢复性微调。
该框架具有模块化设计,允许集成不同的宽度和深度剪枝准则,以及不同的路径选择策略。
核心贡献 论文强调了五个主要贡献:
统一框架: MoP 有效地结合了深度和宽度剪枝,捕捉了移除层带来的延迟收益和移除组件带来的细粒度选择性。
模块化: 其设计容纳了各种剪枝准则的组合,允许未来集成最先进的方法。
多样化剪枝方案: 通过在两个维度上分布移除操作,MoP 在不耗尽单一维度的情况下实现了更高的压缩率。
多模态扩展: 不同于大多数仅关注文本的剪枝文献,作者在纯语言(LLaMA)和多模态(LLaVA)架构上均测试了 MoP。
针对视觉任务的仅文本恢复: 作者观察到,使用纯文本数据集(Alpaca)进行的恢复性微调可以出人意料地恢复剪枝后的视觉语言模型的性能。
结果 作者在 LLaMA-2 7B、LLaMA-3 8B 和 LLaVA-1.5 7B 上评估了 MoP:
准确性: 在 LLaMA-2 和 LLaMA-3 上,MoP 在 20%、30% 和 40% 的压缩率下,表现始终优于竞争性的结构化剪枝方法(如 SliceGPT、AmoebaLLM、PruneNet)。值得注意的是,MoP 的“最差种子”性能(使用随机路径选择时)通常超过了最佳竞争基准模型的平均性能,这表明其对路径选择变化的鲁棒性。
延迟: MoP 将结构化剪枝转化为实际的加速。在 40% 压缩时,该方法在 NVIDIA RTX 4090 上将端到端延迟降低了 39%(1.63 倍加速)。在 30% 压缩时,它实现了 1.38 倍的加速,其表现优于那些需要更激进压缩(如 50%)才能获得类似增益的其他方法。
多模态性能: 在 LLaVA-1.5 上,MoP 保持了显著的推理能力。在 40% 压缩下,模型保留了约 78% 的平均预测能力。至关重要的是,研究表明使用纯文本数据(Alpaca)进行微调可以有效恢复视觉任务(ScienceQA、VizWiz)的性能,作者认为这是一个新颖的观察结果。
意义与主张 论文声称,MoP 通过克服单轴方法的结构僵化,开辟了结构化剪枝的新前沿。这种混合策略提供了卓越的韧性,确保即使在不利的路径选择下,该方法也能提供顶尖的准确性。作者强调,这种方法不仅推动了高效 LLM 的发展,还验证了混合宽度-深度剪枝在多模态领域的可行性。此外,对于剪枝后的视觉语言模型,仅靠文本恢复微调即可满足视觉任务的需求,这一发现表明,在部署压缩后的多模态系统时,存在一条更高效的路径,减少了对昂贵的多模态恢复数据集的需求。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。