Depth-Aware Sensitivity Analysis of Mixture-of-Experts Models via Magnitude-Based Expert Masking
本文对 Qwen3.6-35B-A3B 混合专家模型(Mixture-of-Experts)进行了系统的敏感性分析,揭示了层敏感性具有强烈的深度依赖性,并证明了在后期层中对低幅度专家进行激进掩码处理,在保持输出质量的同时,能显著优于均匀掩码处理,从而实现高效的模型压缩。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个巨大的、超级聪明的机器人大脑,它被用来解决谜题、编写代码和翻译语言。这个大脑并不是由一整块沉重的金属构成的;相反,它的构造就像一个巨大的工厂,拥有数百个专门的工作站。这就是**大语言模型(LLMs)的世界,它们是驱动从聊天机器人到编程助手等一切事物的 AI 引擎。为了让这些大脑既快速又高效,工程师们使用了一种叫做混合专家模型(Mixture-of-Experts, MoE)**的技巧。把它想象成每个房间里都有 256 个不同的“专家”组成的庞大团队。当一个问题进来时,一个聪明的经理(称为“路由”)会决定需要哪几个专家来解决这个特定的问题,而剩下的团队则可以去喝杯咖啡。这让机器人保持了高速运转,因为它只唤醒它真正需要的工人。
但这里有一个大问题:所有这些工人都是同样重要的吗?如果你必须缩小工厂以节省空间和电力,你能直接随机解雇每个房间里 30% 的工人吗?还是说其中隐藏着某种规律?科学家们一直在猜测,但他们一直没有一张清晰的地图来标明大脑的哪些部分是脆弱的,哪些部分是坚固的。理解这一点至关重要,因为这些模型正变得越来越庞大,如果我们能够安全地“修剪”(移除)不必要的部件,我们就能让它们在更便宜的计算机上运行得更快,在不损失智能的情况下节省能源和资金。
大工厂审计:我们可以放谁走?
在这篇论文中,来自 Persistent Systems 的一个研究小组决定对一个特定的、庞大的 AI 模型——Qwen3.6-35B-A3B——进行一场高风险的“切断电缆”游戏。这个模型是一个巨兽:它有 40 层(把它们想象成摩天大楼工厂中的 40 层楼),每一层楼都有 256 个专家。每当模型处理一个词时,它会挑选前 8 个专家来干活。
研究人员想知道:如果我们强迫模型忽略某些层中“最弱”的专家(即那些大脑中数值最小的专家),模型会崩溃,还是能继续工作?他们在一项棘手的任务上测试了这一点:将代码从一种编程语言翻译成另一种(例如将 C++ 转换为 Python),使用的是名为 XLCoST 的基准测试。
发现:关键在于在哪里切割
该团队尝试了以不同的模式进行切割,就像外科医生测试不同的切口位置一样。他们提出了三个主要理论:
- “平坦切割”理论(The "Flat Cut" Theory): 在每一层、每一个地方都切掉 30% 最弱的专家。
- “早期切割”理论(The "Early Cut" Theory): 也许底层楼层是最重要的?
- “后期切割”理论(The "Late Cut" Theory): 也许顶层楼层只是在重复底层楼层已经做过的工作?
结果让“平谈切割”的想法完全破灭了。
当他们尝试平坦切割(从 40 层楼中每一层都移除 30% 的专家)时,模型基本上忘记了如何履行职责。在 300 个编程谜题中,它只答对了 150 个(或称“良好/相似”)。它开始产生幻觉,将其内部思考过程泄露到最终代码中,并出现语法错误。这就像是同时解雇了地基、中间办公室和顶层的所有员工——整个建筑开始摇晃。
但随后,他们发现了“魔法区”。
研究人员发现,模型的敏感度会根据所在的楼层发生剧烈变化:
- 第 0–9 层(地基): 这些层极其脆弱。如果你在这里切割,模型会立即崩溃。
- 第 10–29 层(中间层): 同样非常脆弱。
- 第 30–39 层(顶层公寓): 这些顶层楼层出人意料地坚韧!这里的专家似乎在做很多重复性的工作。“路由”(经理)在这里已经有些困惑了,它挑选的专家置信度很低,这意味着这些专家在某种程度上是可以互换的。
获胜策略:“自上而下”修剪
团队通过 300 个提示词 进行了一次大规模实验,以寻找完美的修剪方案。他们发现,如果将切割重点放在顶层楼层,模型就能保持健康。
- “后期递增”策略(The "Late Ramp" Strategy): 他们在第 30–34 层切掉了 35% 的专家,并在最顶层(35–39 层)切掉了 55%。
- 结果: 在 300 个提示词中,这一策略让 255 个输出保持正常工作!这比平坦切割要好得多,并且它移除了超过 1,100 个专家。
等等,他们并没有止步于此。他们想确保这不仅仅是一个幸运的巧合,因此他们在另一组全新的、未见过的 500 个提示词 上测试了他们最好的想法。这就是故事变得更有趣的地方。
在更大的测试中,“后期递增”仍然表现良好,但一种更精准的策略赢得了桂冠:
- “仅限极后期”策略(The "Very-Late Only" Strategy): 他们只动了最顶端的 5 层楼(35–39 层),并切掉了那里的 50% 的专家。
- 结果: 这次微创手术让 500 个输出中的 419 个 完美运行!更棒的是,它总共只移除了 640 个专家(在整个模型总计 10,240 个专家中)。
这意味着研究人员发现了一种方法,可以从模型的最顶端移除很大一部分“肌肉”,而模型几乎察觉不到。这就像意识到摩天大楼的顶层大多只是装饰性的阳台;你可以拆掉一半的栏杆,建筑依然屹立不倒。
侧边任务:“思考”与“回答”之谜
团队还尝试观察模型在“思考”(推理问题)与“回答”(编写最终代码)时是否使用不同的专家。他们观察了一个稍旧版本的模型(Qwen3.5),以查看是否能发现差异。
他们发现,在“思考”阶段,模型使用一群广泛且杂乱的专家。但在需要“回答”时,它变得更加专注,使用的专家更少。这表明,如果我们未来想要修剪模型,我们可能需要小心不要切掉那些“思考型”专家,即使它们在纸面上看起来很弱。然而,作者谨慎地指出,这只是对未来的一个暗示,而非已证实的规则。
关于速度如何?
他们还尝试了另一种技巧:与其切割专家,不如告诉模型对于每个词只挑选 6 个专家 而不是通常的 8 个。在 100 个提示词的小规模测试中,这使得模型运行得更快(更短的“墙钟时间”),且没有损失任何质量。但是,当他们尝试将这种加速与激进的专家切割结合在一起时,模型变得混乱了。看来,你不能在没有仔细测试的情况下,直接叠加使用这些捷径。
核心结论
这篇论文的主要启示是:对均匀修剪说“不要做”,对智能修剪说“这样做”。
- 不要仅仅从每一层平均地切掉 30% 的专家;这会摧毁模型的思考能力。
- 要将切割重点放在最顶层(第 35–39 层)。模型对于失去一半的顶层专家具有惊人的耐受力。
作者谨慎地指出,他们还没有真正从计算机内存中删除权重(他们只是告诉路由忽略它们)。因此,虽然模型的表现看起来更小、更高效,但它在硬盘上占用的空间仍然相同。他们建议下一步的研究方向是进行真正的“物理权重手术”,以永久删除那些不再使用的专家,从而节省真实的存储空间。
简而言之,研究人员发现这个 AI 模型的“大脑”有一个非常具体的弱点:顶层的冗余程度远高于底层。通过修剪顶层,我们或许能够构建出更小、更快、更便宜的 AI 模型,而不会破坏它们。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。