SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training
本文系统研究了在预训练阶段压缩大规模混合专家(MoE)模型的结构化剪枝与知识蒸馏方法,结果表明剪枝能提供更优的初始化,渐进式压缩策略优于一次性压缩方法,且将语言建模与多 token 预测蒸馏相结合可在显著更小的模型中实现具有竞争力的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一座庞大且知识密度极高的图书馆(一个巨大的 AI 模型),运行成本极高且读取速度缓慢。你希望将其压缩成一个口袋大小的版本,使其几乎保留所有知识,而无需从头重建这座图书馆。
这篇题为 "SlimQwen" 的论文,正是关于如何针对一种名为 混合专家模型(Mixture-of-Experts, MoE) 的特定 AI 架构实现这一目标的指南。不要将 MoE 模型视为单一的大脑,而应将其想象成一个由众多专家组成的庞大团队。其中有些是数学天才,有些是编程巫师,还有些是语言专家。通常,针对任何给定的问题,只需调用其中少数几位专家即可。
研究人员提出了这样一个问题:我们如何将这个庞大的专家团队压缩成一个更小、更快速的团队,同时不损失其集体智慧?
以下是他们研究发现的拆解,辅以简单的类比:
1. “二手车”与“从零建造”类比
问题: 是购买一辆经过轻微改装的二手车(剪枝一个大模型)更好,还是用同样的资金从零开始建造一辆新车更好?
发现: 购买“二手车”每次都胜出。
论文表明,如果你将一个预先训练好的巨型模型剪枝(cut down)成更小的规模,这个较小的模型将获得巨大的先发优势。这就像给一位经验丰富的厨师换了一个更小的厨房;他们可以立即烹制出美味的菜肴。如果你试图在那个从小厨房从零开始训练一位新厨师,他们需要更长的时间才能学会,即使给予相同的练习时间,也永远无法赶上那位经验丰富的厨师。
2. “文件柜”类比(专家压缩)
问题: 当你压缩专家团队时,如何决定解雇谁、保留谁?是否应该仅仅解雇那些说话最少的人?
发现: 初始裁剪时选择谁并不太重要,只要随后让团队进行“再训练”即可。
研究人员尝试了不同的方法来挑选保留哪些专家(例如解雇说话最少的人,或得分最低的人)。他们发现,在较小的团队获得大量新练习(持续预训练)之后,所有人的表现最终几乎相同。
秘诀: 然而,他们发现了一个名为 “部分保留”(Partial Preservation) 的技巧。想象你有 100 位专家,需要保留 50 位。与其只挑选前 50 位并解雇其余的人,不如将前 25 位原封不动地保留,然后将剩余的 25 个名额通过将被解雇的专家合并到被保留的专家中来填补。这就像保持你的明星球员完整无损,同时让替补球员将他们的技能融合到首发阵容中。这种特定策略使得最终团队比随机挑选前 50 位略为聪明。
3. “导师”类比(蒸馏)
问题: 我们如何教导小团队像大团队那样思考?
发现: 不要只告诉他们正确答案;让他们在从教科书学习的同时,也能聆听大团队的“思考过程”。
通常,在压缩模型时,会使用一种称为 知识蒸馏(Knowledge Distillation) 的技术,即让小模型尝试模仿大模型的答案。论文发现,最佳方法是一种混合方法:
- 教科书: 让小模型从实际正确答案中学习(标准语言建模)。
- 导师: 让它同时聆听大模型的“软”猜测(蒸馏)。
将两者结合的效果优于仅仅模仿大模型。
新技巧(MTP 蒸馏): 他们还引入了一种名为 多 Token 预测(Multi-Token Prediction) 的新教学方法。
- 正常教学: “这里有一个句子。下一个词是什么?”
- MTP 教学: “这里有一个句子。下一个词是什么,以及再下一个词,以及再再下一个词?”
这有助于小模型学会提前规划,使其在后续实际生成文本时更快、更准确。
4. “楼梯”与“悬崖”类比(渐进式剪枝)
问题: 我们应该一次性将模型剪枝(一次性剪枝),还是应该分步骤缓慢剪枝?
发现: 楼梯更好。
如果你将一个巨型模型瞬间砍掉 75% 的规模,那就像从悬崖上跳下。模型会感到困惑并丢失知识。
相反,研究人员发现 渐进式剪枝(Progressive Pruning) 效果最佳。想象走下楼梯:
- 稍微剪枝模型(例如,移除一些层)。
- 让它练习并稳定下来。
- 再稍微剪枝一点。
- 再次让它练习。
这种渐进式的过渡允许模型在每个新的、更小的规模下“重新学习”如何运作,从而产生比“跳崖”方法更聪明的最终产品。
最终成果:SlimQwen
通过结合所有这些技巧——从剪枝后的模型开始,对专家使用智能的“部分保留”策略,混合教科书学习与导师指导,以及像走楼梯而非跳悬崖那样缩小模型——他们成功将一个庞大的 800 亿参数 模型压缩成了一个微小的 230 亿参数 模型。
尽管体积缩小了近 4 倍,但这个"SlimQwen"模型在数学、编程和通用知识等困难任务上仍表现出竞争力,证明如果你知道如何正确地缩小它,就不需要巨大的大脑也能完成聪明的事情。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。