LEAP: Learnable End-to-End Adaptive Pruning of Large Language Models
本文介绍了 LEAP,一种可学习的端到端自适应剪枝方法,该方法利用基于每个权重的伯努利分布并通过 Gumbel-Sigmoid 松弛来实现大语言模型中可处理的非结构化稀疏性学习,在高稀疏度下在零样本准确率方面显著优于现有的逐层基线方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一座庞大且极其聪明的图书馆(即大型语言模型),它几乎知晓一切。但这座图书馆过于巨大,占据整个仓库,需要一座巨型发电厂来驱动,而且运行速度太慢,以至于任何人都无法在普通计算机上常规使用。
为了解决这个问题,你想要扔掉 50% 到 60% 的书籍(即模型中的“权重”或连接),使其变得更小、更快。目标是在书籍减少一半的情况下,依然让图书馆保持同样的聪明程度。
这正是论文LEAP登场之处。以下是他们如何解决问题的故事,以简单的方式阐述:
问题:“选择过多”的陷阱
长期以来,科学家们尝试通过两种主要策略来剔除书籍:
“逐层”方法(旧方式): 想象一位图书管理员一次只看一个书架,并决定:“这本书看起来没用,扔掉它。”他们为每个书架这样做,却不与其他书架交流。
- 缺陷: 有时一本书在单独的书架上看起来无用,但实际上对于贯穿整个图书馆的故事至关重要。通过孤立地看待书架,这种方法会意外地丢弃重要的连接,使图书馆变得不那么聪明。
“模式”方法(较新但已失效的方式): 最近,一些研究人员尝试一次性审视整座图书馆。他们说:“让我们精确地学习应该保留哪些书。”但他们试图通过将书籍分组为小集合(例如一次 4 本书)并询问:“我们应该保留这 4 本书中的哪种模式?”来实现这一点。
- 缺陷: 这对小群体效果很好。但如果你尝试对一整行 4,000 本书这样做(现代 AI 模型正是如此),可能的“模式”数量会变得如此巨大,以至于无法写下来。这就像试图列出十亿张彩票的所有可能号码组合。计算机会卡死;数学会崩溃。
解决方案:LEAP(“个人投票”系统)
这篇论文的作者LEAP意识到,他们需要一种新的投票方式来决定保留哪些书,而不会被数学难题压垮。
他们不再问:“我们应该保留哪种群体模式?”(这对庞大的群体来说是不可能的),而是为每一本书提出了一个更简单的问题:“这本特定的书应该保留还是丢弃?”
- 类比: 想象一场大规模选举,每位选民(模型中的每个权重)都获得一张小选票。他们不是投票支持复杂的“团队策略”,而是简单地投“是”(保留)或“否”(丢弃)。
- 魔法技巧: 为了使这种方法可行,他们使用了一种数学技巧(称为"Gumbel-sigmoid"),让计算机最初能够平滑地“猜测”投票结果,然后逐渐使这些猜测变得更生硬、更尖锐,直到每张投票都变成清晰的“是”或“否”。
他们是如何做到的(配方)
他们并非从零开始。他们使用了一个聪明的起点:
- 预热启动: 他们首先使用一种快速、简单的方法(称为 Wanda)来大致了解哪些书籍可能无用。他们以此作为“先手优势”,这样计算机就不必盲目猜测。
- 训练: 他们让计算机通过阅读少量文本(校准流)来“学习”最佳的投票组合,并调整“是/否”投票,以保持图书馆的智力水平。
- 冻结书籍: 关键的是,他们没有改变书中的文字(即模型权重)。他们只改变了决定保留哪些书。这保持了图书馆原有的“个性”和知识完整,只是包装得更小。
结果:更聪明、更快、更精简
他们在五个不同的著名 AI 模型(从小型到超大型)上测试了这种方法,并将其削减了 50% 和 60%。
- 成绩单: 他们将 LEAP 与现有的最佳方法进行了比较。
- 胜利: LEAP 始终表现更优。平均而言,它比之前的最佳方法将模型的准确率提高了2.59 分。在某些情况下,提升幅度高达5.40 分。
- 速度: 由于他们以完美契合专为该任务设计的新型快速计算机芯片(GPU)的方式削减了模型,生成的模型运行速度更快,且不会损失其智能。
为什么这很重要
在此之前,如果你想让一个巨大的 AI 模型变得更小、更快,你必须在以下选项中选择:
- 选项 A: 保持准确,但体积庞大且运行缓慢。
- 选项 B: 使其小巧快速,但变得愚蠢。
LEAP表明你可以鱼与熊掌兼得。它提供了一种实用的方法,将这些巨大的 AI 大脑缩小一半,同时保持其同样聪明,从而使它们能够在普通计算机上运行,而无需超级计算机。
简而言之: LEAP 是一种新的、更聪明的编辑巨型 AI 模型的方法,它让每个连接投票决定自己是否应该保留,从而产生一个更小、更快且依然非常智能的 AI。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。