PALS: Percentile-Aware Layerwise Sparsity for LLM Pruning
该论文提出了 PALS,一种基于激活量动态调整 Transformer 各层稀疏率的一次性剪枝方法,在 LLaMA-2-7B 上实现了相对于均匀剪枝的显著困惑度提升,并证明了基于梯度的分配对于离散权重移除是无效的。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你拥有一个巨大的、极其聪明的图书馆(大语言模型),里面有数十亿本书(参数)。为了让这个图书馆能装进一个小背包,以便你能随身带到手机上,你需要扔掉一半的书。这被称为“剪枝”(Pruning)。
问题在于,并非所有的书都同样重要。有些书只是填充物,而另一些则包含了理解世界的关键地图和钥匙。
旧的方法:“一刀切”法
以往的方法(如 Wanda 和 SparseGPT)就像一位严厉的图书管理员,他会说:“我们需要减掉 50% 的书。所以,无论如何,我们都要从每一层书架上扔掉正好一半的书。”
本文的作者认为这是愚蠢的。有些书架堆满了至关重要且独特的信息,而另一些书架则充满了重复性的笔记。如果你从那些至关重要的书架上减掉 50%,图书馆就会变得无法理解。如果你从那些重复性的书架上减掉 50%,没人会注意到。
新的方法:PALS(“聪明的图书管理员”)
作者提出了一种名为 PALS(百分位数感知层级稀疏性)的新方法。PALS 不会对每个书架进行同样的切割,而是像一位聪明的图书管理员一样,先观察书架。
它是如何工作的:
- “离群值”检查: 管理员会观察每个书架上的书,并问道:“这里是否有任何书籍是非常不同或非常‘大声’的?”在技术术语中,他们在寻找激活离群值(activation outliers)——即特定部分变得非常“兴奋”或活跃的时刻。
- 规则:
- 如果一个书架有这些“大声”或“兴奋”的时刻,这意味着该书架正在进行关键的工作。不要在这里减太多。 保留更多的书。
- 如果一个书架很安静且均匀,它可能是在做重复性的工作。在这里多剪一些。 扔掉更多的书。
- 安全网: 为了确保他们不会做得太过火,管理员设定了一个规则:“你只能改变切割量的一丁点程度(正负 5%)。”这可以防止他们意外地清空一个至关重要的书架,或者留下一个完全没用的满载书架。
大惊喜:“梯度”陷阱
在确定以书籍的“响度”作为标准之前,研究人员尝试了另一种想法。他们想:“也许我们应该观察梯度(gradients)。”
在 AI 世界中,“梯度”就像是一张地图,显示了如何微调一本书来让它变得更好一点。通常,这是一种决定保留什么的聪明方式。
但令人震惊的是: 当他们使用梯度来决定剪掉什么时,图书馆崩溃了。结果甚至比随机扔掉书还要差。
为什么? 作者猜测,梯度就像是一张用于迈出极小步子的地图。但剪枝就像是迈出一个巨大的、宏大的步伐(一次移除 50% 的书)。一张适用于微小步子的地图,并不能告诉你在移除一半地形后会发生什么。这就像知道一座山是如何倾斜的,并不代表你知道如果把半座山都推平了会发生什么。
结果
- 在旧模型上(LLaMA-2): “聪明的图书管理员”(PALS)表现得非常出色。图书馆的体积减小了一半,但理解语言的能力几乎与完整版本一样好。它比“一刀切”的方法要聪明得多。
- 在新模型上(Mistral, LLaMA-3): “聪明的图书管理员”并没有起到什么作用。作者认为这是因为这些更新的模型训练得太好了,以至于每个书架都同样重要。没有“冗余”的书架可以多剪,因此智能策略无法找到优势。
核心结论
PALS 是一个简单、廉价的技巧,可以让 AI 模型在不损失智能的情况下变得更小。它通过倾听模型的哪些部分在“呐喊”(高活跃度)并保护它们,同时修剪掉安静的部分来实现。
它还教会了我们一个宝贵的教训:仅仅因为一种方法(如梯度)适用于微小的调整,并不意味着它适用于大规模的切割。 有时候,最简单的信号(观察一个部分当前有多活跃)比最复杂的数学要有效得多。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。