F-WANDA: Fisher-Reweighted Post-Training Pruning for Sustainable Deployment of Large Language Models
F-WANDA 是一种高效能、单次训练后剪枝方法,它通过基于经验费舍尔信息(empirical Fisher information)重新分配神经元保留预算来改进 WANDA,在实现优于 SPARSEGPT 的语言模型性能的同时,显著降低了计算成本。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个巨大的、极其聪明的机器人,它能写故事、解数学题,还能像人类一样聊天。这个机器人就是一个“大语言模型”(LLM)。但问题在于:这个机器人太庞大了。运行它需要庞大的计算机和大量的电力,就像试图用一块电池来为一座城市供电一样。科学家们一直在寻找方法,试图把这些机器人缩小,让它们能在更小的设备上运行,同时又不丢失聪明才智。
缩小它们的一种流行方法叫做“剪枝”(Pruning)。把剪枝想象成去整理机器人的大脑——那是一个由神经元连接组成的巨大图书馆。剪枝就像是走进这个图书馆,把那些看起来不太重要的书扔掉。目标是让图书馆小到可以装进背包,但仍然足够聪明,能够回答问题。然而,这其中有一个棘手的平衡:如果你不小心扔掉了太多“重要”的书,机器人就会开始犯错或听起来像个机器人。如果你试图过于小心地挑选要留下的书,那么分类的过程就会耗时极长,并消耗掉你所有的能量。这篇论文解决的正是一个这样的问题:如何快速、廉价且不损失机器人的天才智慧地进行分类。
问题所在:“一刀切”的错误
研究人员首先观察了一种流行的算法,叫做 WANDA。想象一下,WANDA 是一个图书管理员,负责决定扔掉哪些书。WADA 会观察两件事:一本书有多“响亮”(它的权重),以及人们阅读它的频率(输入激活值)。如果一本书很安静且很少被阅读,WANDA 就会把它扔掉。
问题在于,WANDA 采用的是一种统一的方法。它对待图书馆里的每一个书架都完全一样。它会决定:“好吧,我要把每一架上 50% 的书都扔掉。”但问题是:有些书架上装满了机器人最关键的事实(比如“巴黎是法国的首都”),而另一些书架上则装满了无聊、重复的内容。仅仅因为它是某个书架,WANDA 就扔掉了“巴黎”书架上 50% 的书,这无意中删除了机器人的知识。
另一种方法叫做 SPARSEGPT,它试图做得非常小心。它会观察每一本书,精确计算如果移除这本书会对机器人的大脑造成多大的伤害,然后仔细修改剩余的书籍以修复损伤。这种方法在保持机器人聪明方面效果很好,但就像雇佣了一支博士团队来整理图书馆一样。它需要耗费大量的时间和能量——多到往往得不偿失。
解决方案:F-WANDA(聪明的图书管理员)
本文作者介绍了一种名为 F-WANDA 的巧妙升级版。他们意识到,与其仅仅观察一本书有多“响亮”,不如还要问一句:“机器人对这个特定书架有多‘在意’?”
为了找出答案,F-WANDA 进行了一次额外的快速检查。它让机器人的大脑通过一个小测试(“反向传播”过程),以观察哪些书架实际上在驱动机器人的答案。如果一个书架对于得到正确答案至关重要,机器人的大脑就会显示出强烈的信号(称为 费舍尔信息量/Fisher information)。如果一个书架只是噪音,信号就会很弱。
这就是神奇之处:F-WANDA 利用这个信号来改变规则。
- 在“巴黎”书架上(高信号): 机器人非常在意。F-WANDA 会说:“不要扔掉这些书里的 50%!只扔掉 20%。我们需要保留大部分书籍。”
- 在“无聊”书架上(低信号): 机器人并不在意。F-WADA 会说:“尽管把这些书扔掉 80% 吧。我们不需要它们。”
通过这种方式,机器人既保护了最重要的事实,又变得更小了。而且最棒的是?F-WANDA 不需要重新训练机器人或更新任何权重。它只需要进行一次快速检查,然后就开始剪枝。
研究发现
团队在 LLAMA-2 上进行了测试,这是一个著名的超大规模语言模型家族(具体包括 70 亿和 130 亿参数的版本)。他们想看看 F-WANDA 是否能击败竞争对手。
- 智力: 当他们将模型缩减至 50% 非结构化稀疏度(即一半的连接被移除)时,F-WANDA 让机器人比原始的 WANDA 聪明得多。在一项衡量通用知识的测试 MMLU 中,F-WANDA 在 7B 模型上比 WANDA 提高了 1.6 个百分点,在 13B 模型上提高了 1.4 个百分点。它甚至击败了极其谨慎的 SPARSEGPT 方法。
- 流畅度: 机器人听起来依然自然。在一项名为 WikiText-2 的测试中,F-WANDA 对 7B 模型的困惑度(perplexity)得分为 6.85,与原始的 WANDA 几乎完全相同。这意味着机器人并没有开始变得机械化或语无伦次。
- 能量与速度: 这是 F-WANDA 真正闪耀的地方。极其谨慎的 SPARSEGPT 方法在剪枝模型时耗时很长且使用了大量能量。F-WANDA 则快得多,也更便宜。事实上,F-WANDA 使用的能量和时间仅为 SPARSEGPT 的 三分之一。在强大的 H100 GPU 上,剪枝 7B 模型大约耗时 12 分钟,消耗 4.3 kJ 的能量,而 SPARSEGPT 则需要 35 分钟 和 12.6 kJ。
权衡与限制
作者谨慎地指出,F-WANDA 并非适用于所有情况的“万灵药”。
- 硬件规则: 如果计算机芯片要求严格的连接保留与移除模式(例如在每个块中精确保留 2 个出 4 个连接),F-WANDA 就无法进行其智能预算。在这些特定情况下,它表现得就像原始的 WANDA 一样。
- 内存: 由于 F-WANDA 需要进行那次额外的检查,它在工作期间需要更多的计算机内存(大约是 WANDA 的两倍)。对于非常巨大的模型(如 700 亿参数的模型),这可能需要特殊的技巧才能放入内存。
- 泛化能力: 他们仅在 LLAMA-2 家族上进行了测试。他们目前还不确定这是否以同样的方式适用于其他类型的机器人大脑(如 LLaMA-3 或 Mistral),尽管他们怀疑是可以的。
为什么这很重要
核心结论是,F-WANDA 处于“帕累托前沿”(Pareto frontier)。这是一个高级说法,意思是它提供了你能获得的最好交易:你以最低的成本(最少的能量和时间)获得了最高的质量(最聪明的机器人)。
通过仅仅增加一次快速检查,以查看哪些部分正在努力工作,研究人员成功地节省了大量的能量,同时让机器人变得更聪明。这提醒我们,有时你不需要重建整个图书馆来使其变得更好;你只需要更聪明地决定哪些书该扔掉。这使得在现实世界中运行这些强大的 AI 模型变得更加容易且更便宜,有助于让 AI 变得更可持续,造福每个人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。