← 最新论文
💬 NLP

Post-Trained MoE Can Skip Half Experts via Self-Distillation

本文介绍了零专家自蒸馏适配(ZEDA),这是一种低成本框架,通过注入无参数的零输出专家并应用两阶段自蒸馏,将后训练静态混合专家模型转换为高效的动态模型,从而在仅造成微小精度损失的情况下将专家浮点运算量降低超过 50%,并显著提升推理速度。

原作者: Xingtai Lv, Li Sheng, Kaiyan Zhang, Yichen You, Siyan Gao, Xueheng Luo, Yuxin Zuo, Yuchen Fan, Junlin Yang, Ganqu Cui, Bingning Wang, Fan Yang, Youbang Sun, Ning Ding, Bowen Zhou

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Xingtai Lv, Li Sheng, Kaiyan Zhang, Yichen You, Siyan Gao, Xueheng Luo, Yuxin Zuo, Yuchen Fan, Junlin Yang, Ganqu Cui, Bingning Wang, Fan Yang, Youbang Sun, Ning Ding, Bowen Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和日常类比对 ZEDA 论文的解释。

核心问题:过度劳累的厨房

想象一家高端餐厅(即大型语言模型),它拥有一个巨大的厨房,里面有128 位专家厨师(这些是 MoE 架构中的“专家”)。

在标准设置下,无论来的是什么订单——无论是简单的“你好”,还是复杂的“写一首交响乐”请求——厨房总是将订单派发给相同的 8 位厨师。这能确保食物始终完美,但成本极高且速度极慢,因为你为了切一根胡萝卜而雇佣了 8 位厨师,其实一位就足够了。

本文的目标是让厨房变得更聪明:让订单决定需要多少位厨师。 如果是简单订单,就少用几位厨师;如果是困难订单,就多用几位。这被称为“动态”厨房。

挑战:先别解雇任何人!

通常,要建立一个智能的动态厨房,你必须雇佣一支全新的团队,并从零开始培训他们。这需要数年时间,耗资巨大。

但本文提出了一个问题:我们能否利用一个现有的、已完全训练好的厨房(它已经知道如何完美烹饪),在不解雇任何人或从零重新培训的情况下,将其转变为动态厨房?

答案就是ZEDA(零专家自蒸馏适应)。

ZEDA 解决方案:“幽灵厨师”

ZEDA 使用了一个巧妙的技巧,涉及幽灵厨师(零专家)。

  1. 注入幽灵:研究人员在现有厨房中秘密添加了一群新的“厨师”,他们没有手,也不拿刀。他们是零专家。他们什么都不做,输出始终为零。
  2. 新规则:厨房经理(即路由器)现在被告知:“你仍然必须为每个订单挑选8 个人,但现在你可以从 128 位真实厨师加上这些新幽灵厨师中进行挑选。”
  3. 魔法时刻:如果订单很简单(比如“今天天气怎么样?”),经理学会挑选 4 位真实厨师和 4 位幽灵厨师。由于幽灵不工作,厨房实际上只做了 4 位厨师的工作量。如果订单很难(比如“解这道数学题”),经理则挑选 8 位真实厨师和 0 位幽灵厨师。

我们如何教导经理?(自蒸馏)

问题在于,经理还不知道何时该挑选幽灵厨师。如果他们在处理困难的数学问题时挑选了幽灵,食物就会烧焦。

为了解决这个问题,ZEDA 使用了自蒸馏,这就像是一个“影子训练”项目:

  • 教师:原始、完全训练好的厨房(拥有 128 位真实厨师)充当严格的教师。它确切知道完美的答案应该是什么样子。
  • 学生:新的厨房(带有幽灵)试图模仿教师。
  • 过程
    1. 阶段 1(SFT):学生观察教师烹饪。教师说:“对于这个简单订单,我本会使用 8 位厨师,但你可以尝试使用 4 位真实厨师和 4 位幽灵厨师。只要确保味道相同即可。”
    2. 阶段 2(OPD):学生开始独立烹饪。如果它犯了错,教师就会介入说:“你在处理困难数学问题时挑选了幽灵!这就是答案错误的原因。下次遇到这类问题,请挑选更多真实厨师。”

秘密武器:“组平衡”

存在一种风险,即经理可能会变得懒惰,只挑选幽灵以节省能量,或者完全不挑选幽灵而浪费能量。

为了防止这种情况,研究人员添加了一条组平衡规则。他们告诉经理:“你必须保持健康的比例。每使用 2 位真实厨师,你就应该尝试使用 1 位幽灵厨师,但绝不能破坏真实厨师彼此之间的平衡。”

这确保了厨房保持高效(在可能时使用幽灵),但不会降低食物质量。

结果:更快、更便宜、味道不变

经过这次训练(在强大的计算机上耗时不到 2 天,而原始训练需要数年):

  • 速度:厨房变得快了 20%,因为它停止为不必要的工作付费。
  • 效率:它跳过了50% 的专家工作(约一半的 token 使用了幽灵)。
  • 质量:食物的味道几乎和以前一模一样。在某些测试中,它甚至略有提升,因为经理学会了更好地集中精力。

总结

ZEDA 是一种将“静态”AI 模型(总是执行相同工作量的模型)转变为“动态”模型(对简单任务执行更少工作)的方法,具体通过:

  1. 添加看不见的“幽灵”专家,它们什么都不做。
  2. 通过模仿自身的“教师”版本,教导模型在简单任务中使用这些幽灵。
  3. 使用特殊规则,确保幽灵的使用量恰到好处以节省成本,但又不会多到导致答案变差。

这就像将一辆总是搭载 50 名乘客的巴士(即使只有 5 人上车)变成一辆当只有 5 人上车时会自动缩小为面包车的巴士,在节省燃料的同时不落下任何人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →