← 最新论文
💬 NLP

UMoE:Unlocking Every Expert in Domain-Specific Training

UMoE 是一个保持预算的流水线,它通过在微调前剪枝低显著性专家并利用扰动重新生长专家池,来增强混合专家模型(Mixture-of-Experts models)的特定领域训练,从而在不增加推理成本的情况下,在各种架构和领域中一致地优于标准的监督微调。

原作者: Xuefeng Li, Pengfei Liu

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Xuefeng Li, Pengfei Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你拥有一个巨大的、超级聪明的机器人大脑,叫做“混合专家”(Mixture-of-Experts,简称 MoE)。不要把这个大脑想象成一块单一的巨大肌肉,而要把它想象成一个由 128 或 256 个微型专家组成的团队,每个专家擅长不同的领域。当机器人收到问题时,一个聪明的“路由”(router)会决定哪几个专家(比如 8 个)应该出声帮忙解决问题。

这里有一个问题:这个团队在训练时学习了一切——数学、编程、科学、烹饪等等。但现在,你想把这个机器人培养成一名数学奇才。论文指出,如果你只是开始教整个团队数学(这个过程被称为“直接监督微调”,即 Direct SFT),你就是在浪费时间。为什么?因为那 256 个专家中的一些并不擅长数学。他们可能精通诗歌或历史,但在数学课上他们只是“噪音”。然而,路由却仍然会错误地调用他们,导致机器人试图强迫他们去学习数学,这非常低效。

核心理念:UMoE(解锁 MoE 的潜力)
作者 Xuefeng Li 和 Pengfei Liu 提出了一个巧妙的技巧,叫做 UMoE。他们并没有直接教整个团队,而是先进行了一场快速的“试镜”。

  1. 修剪(The Prune/切割): 他们取一小部分数学题,并问道:“谁真正擅长这个?”他们找到了在数学方面最没帮助的底部的 50% 的专家,并将他们请出了房间。
  2. 再生(The Regrow/克隆): 现在团队规模太小了!机器人需要保持其完整的 256 个专家预算,以维持其速度和成本不变。因此,他们把剩下的那些具备数学能力的专家拿出来,并制造了他们的克隆体。但这里的诀窍是,他们不只是简单的复制粘贴。他们给原始专家和克隆体都施加了一个微小的、随机的“抖动”(数学上的扰动)。这使得克隆体与原始专家略有不同,从而使他们两者都能学习并实现专业化,而不会互相干扰。
  3. 微调(The SFT/训练): 现在,面对一个充满数学就绪(或具备数学潜力)专家的房间,他们开始教授整个团队数学。

结果:它奏效了吗?
论文显示,这种“试镜与再生”的方法效果惊人地好,而且作者非常确定这一点,因为他们在真实的基准测试上进行了测试,而不仅仅是在模拟环境中。

  • 数学: 在一组高难度数学竞赛中,UMoE 让一个模型的平均分提高了 3.4 分,让一个更新、更大的模型提高了 1.67 分。即使在使用了一个高质量数学数据集(在这种情况下,标准方法已经击败了许多著名模型)时,UMoE 依然榨出了额外的 1.36 分
  • 编程与科学: 它不仅仅局限于数学。当他们尝试在编程、科学甚至“智能体”(agentic)任务(即 AI 使用工具的任务)上进行测试时,它始终保持领先。例如,在名为 SWE-bench Verified 的困难编程基准测试中,分数从 16.2% 跳升到了 22.2%,涨幅达 6.0 个百分点
  • 数据规模: 论文检查了这是否仅在小规模数据下有效。他们测试了从 0.5 亿到 41 亿个 token 的各种数据规模。在每一种情况下,UMoE 都表现得更好。

论文明确指出哪些并不是答案
作者非常清楚哪些做法无效,或者不是重点:

  • 仅仅增加数据是不够的: 他们展示了即使使用海量数据,标准方法(直接 SFT)仍然会在混合物中留下许多“无用”的专家。
  • 单向“抖动”不起作用: 当他们尝试只对新克隆体进行“抖动”而让原始专家保持不动时,性能反而比标准方法更差。论文表明,你必须同时“抖动”原始专家和克隆体,才能保持它们的平衡。
  • 简单的计数并非最优: 他们测试了不同的方式来决定踢掉谁。仅仅计算一个专家被使用的频率(frequency)还可以,但使用一个更复杂的评分指标 REAP(它综合考虑了专家的回答强度以及被使用的频率)才是最好的。

为什么它有效(“顿悟时刻”)
论文深入研究了其背后的原因。他们发现,在标准方法中,机器人大约将 42% 的计算能力浪费在了实际上对任务毫无用处的专家身上。如果你在一个标准训练好的模型之后,手动切掉底部的 50% 专家,得分几乎没有下降(仅下降了 0.12 分)。这证明了标准方法确实背负着“死重”。

但有了 UMoE 呢?如果你切掉他们训练好的团队中的下半部分,得分会暴跌 5.0 分。这表明 UMoE 成功地将那些“死重”转化为了解决数学问题的能力。

一个小例子
论文给出了一个具体的数学题(AIME 2026,第 25 题)来展示差异。

  • 标准模型: 它尝试简化一个分数(200/225),但算错了(说是 4/5),从而导致最终答案错误(得出 405)。
  • UMoE: 它正确地简化了分数(变为 8/9),并得到了正确答案(850)。

总结
这篇论文表明,通过在繁重的训练开始之前重新组织团队——剔除错误的专家并克隆正确的专家——你可以在不增加成本或时间的情况下让模型变得更聪明。这就像意识到你不需要教你的整个足球队如何下国际象棋;你只需要换入国际象棋选手,然后让他们一起练习。作者在 12 个不同的基准测试中衡量了这一点,并发现它始终有效,这表明这是一种让 AI 专家在特定任务中做得更好的可靠方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →