Efficient LLMs with AMP: Attention Heads and MLP Pruning
本文介绍了 AMP,一种新颖的结构化剪枝方法,通过移除不太重要的注意力头(Attention Heads)和 MLP 结构来高效压缩大语言模型,在实现高达 30% 参数缩减的同时,仅造成极小的性能损失,并在各种模型族中提升了推理速度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个计算机可以写诗、解谜并像人类一样聊天的世界。这就是大语言模型(LLMs)的领域,它们是当今最先进人工智能背后的数字大脑。可以将这些模型想象成包含人类写过的每一本书的海量图书馆,但它们不仅仅是在阅读,还能即兴创作新的故事。然而,这里有一个问题:这些图书馆规模如此庞大,以至于需要巨大的、耗电量极高的服务器来运行,这使得它们使用起来既慢又贵。为了解决这个问题,科学家们一直试图在不损失智能的前提下缩小这些模型的规模。一种流行的方法叫做“剪枝”(pruning)。想象一下园丁修剪灌木丛;他们不是随机剪掉叶子,而是仔细修剪掉那些没什么作用的分支,留下一个更小、生长更快且依然开得灿烂的植物。研究人员提出的重大问题是:我们如何找到剪掉正确分支的方法,让植物既保持健康,又能生长得更快?
这正是这篇论文的作者所解决的问题,他们提出了一种名为 AMP 的新方法,全称是 注意力头与 MLP 剪枝(Attention Heads and MLP Prforming)。他们意识到,虽然其他方法也试图修剪这些数字灌木丛,但它们往往剪得太多,或者使用了需要特殊、昂贵硬件的复杂工具。AMP 就像一把聪明且轻便的剪刀,可以快速识别出模型的哪些部分是在真正出力,而哪些部分只是在凑数。
论文介绍了一个用于判断剪掉什么的巧妙技巧。AMP 不仅仅观察静态权重(模型的内部“肌肉记忆”),它还将实际的输入数据(例如一个句子)投影到这些权重上,以观察模型究竟在多大程度上使用了它们。这就像是检查工具箱里的哪些工具实际上正被用来盖房子,而不是仅仅根据工具的重量来猜测。如果某个特定的“注意力头”(模型中负责关注不同单词的部分)或中间层的某个“神经元”对最终答案的贡献不大,AMP 就会将其标记为待删除。
结果非常令人振奋。作者在包括 LLaMA 和 Phi 在内的几种流行模型上测试了 AMP。他们发现,通过移除约 30% 不重要的部分,模型变得显著更快——在某些情况下甚至快了 1.25 倍——且不需要任何特殊的计算机芯片。在准确度方面,AMP 的表现优于目前的最佳“结构化剪枝”(structured pruning)方法。例如,在 LLaMA 7B 模型上,它在平均任务准确度上超过了现有的结构化剪枝技术高达 4.81 个百分点。更令人印象深刻的是,在 LLaMA-2 7B 模型上,它比这些相同的结构化基准高出了多达 9.52 个百分点。
研究人员还通过实验谨慎地证明了他们的方法确实有效。他们进行了一项“连贯性检查”,这就像是一个反向实验:他们故意剪掉了模型中最重要的部分,而不是最不重要的部分。正如预期的那样,模型崩溃了,表现极差。这证实了 AMP 确实擅长分辨本质部分与非本质部分。他们还发现,仅剪掉一种类型的部件(比如只剪掉注意力头)是不够的;你需要同时修剪注意力头和中间层神经元才能获得最佳效果。
最令人兴奋的发现之一是整个过程的高效性。整个剪枝和微调过程在标准的消费级显卡(NVIDIA RTX 3090)上仅耗时约 4 小时,而实际的剪枝步骤仅需几分钟。这使得该方法非常易于获取,并符合“绿色 AI”的原则,因为它能减少模型运行所需的能量近 20%,从而节省了资金并减少了碳排放。
简而言之,论文表明 AMP 是一种高效、灵活且快速的方法,可以让大型 AI 模型变得更小、更快。它不需要昂贵的硬件或复杂的重新训练,并且在保持模型智能的同时,在速度提升方面始终优于现有的“结构化剪枝”方法。虽然作者指出较小的模型(如 Phi-1.5)对剪枝更为敏感,但整体信息是明确的:通过正确的剪枝策略,我们可以让强大的 AI 在日常使用中变得更加实用。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。