← 最新论文
🤖 machine learning

Expert-Choice Routing Enables Adaptive Computation in Diffusion Language Models

该论文提出专家选择(EC)路由是扩散语言模型(DLM)中优于令牌选择(TC)路由的混合专家架构方案,通过引入基于去噪步数的自适应专家容量分配机制,实现了负载平衡优化、收敛加速及性能提升,并证明了现有 TC 模型仅需替换路由模块即可无缝迁移至 EC 范式。

原作者: Shuibai Zhang, Caspian Zhuang, Chihan Cui, Zhihan Yang, Fred Zhangzhi Peng, Yanxin Zhang, Haoyue Bai, Zack Jia, Yang Zhou, Guanhua Chen, Ming Liu

发布于 2026-04-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Shuibai Zhang, Caspian Zhuang, Chihan Cui, Zhihan Yang, Fred Zhangzhi Peng, Yanxin Zhang, Haoyue Bai, Zack Jia, Yang Zhou, Guanhua Chen, Ming Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文主要讲的是如何给一种新型的人工智能语言模型(叫做“扩散语言模型”)装上更聪明的“大脑调度系统”,让它学得更快、跑得更快、还更省电。

为了让你轻松理解,我们可以把训练这个 AI 模型想象成指挥一个超级庞大的交响乐团排练一首复杂的曲子

1. 背景:旧模式 vs. 新模式

旧模式(Token-Choice,令牌选择):
想象一下,乐团里有几百种不同的乐器(专家),还有成千上万个乐谱片段(Token/单词)。
在旧模式下,每个乐谱片段自己决定找哪个乐器来演奏

  • 问题: 大家都喜欢找小提琴手,结果小提琴手累得半死,而大提琴手却在那儿发呆。
  • 后果: 指挥(系统)必须停下来等最忙的小提琴手,导致整个乐团排练效率极低,而且为了平衡大家的工作量,还得额外搞一些复杂的“纪律惩罚”(辅助损失函数),既费时间又容易出错。

新模式(Expert-Choice,专家选择):
这篇论文提出,不如反过来:让乐器(专家)自己来挑乐谱片段

  • 做法: 每个乐器手规定:“我只接 10 个片段,谁先来我挑谁,满了就停。”
  • 好处: 这样每个乐器手的工作量是绝对平均的。没有人会累死,也没有人会闲着。整个乐团可以齐步走,效率直接翻倍。

2. 核心发现:什么时候该“用力”?

既然每个乐器手的工作量固定了,那能不能更聪明一点?比如,在曲子最难的部分多派点人手,简单的部分少派点?

作者发现,在 AI 学习的过程中,有一个叫“去噪步数”(Timestep)的概念。

  • 高噪点(Mask Ratio 高): 就像乐谱全是乱码,几乎看不清字。这时候派再多专家,大家也是瞎猜,效率很低。
  • 低噪点(Mask Ratio 低): 就像乐谱已经写好了 90%,只剩下几个词没填。这时候专家只要稍微动脑筋,就能精准补全,学习效率极高

作者的策略(线性反向调度):
作者设计了一个聪明的调度员:

  • 当乐谱还很乱(高噪点)时,只派少量专家去“扫盲”。
  • 当乐谱快写好了(低噪点)时,派大量专家去“精修”。

比喻: 这就像你写论文。

  • 刚开始头脑一片空白(高噪点),你花 1 小时可能只能写出 1 句话。
  • 快写完时,思路很清晰(低噪点),你花 1 小时能写出 10 页。
  • 这篇论文建议:把大部分精力(算力)都花在快写完的那段黄金时间,而不是死磕开头。结果发现,这样不仅写得快,质量还更高。

3. 三大成果

  1. 速度快得惊人:
    用新系统(专家选择)训练模型,比旧系统快 2 倍。就像把原本需要 20 小时的排练,缩短到了 10 小时。
  2. 不浪费资源:
    旧系统经常因为“木桶效应”(最慢的那个专家拖慢所有人)而卡顿。新系统让所有人步调一致,GPU 显卡的内存使用像切蛋糕一样均匀,没有浪费。
  3. 旧模型也能“换芯”:
    最棒的是,对于那些已经训练好的、用旧系统的模型,不需要重新训练,只要把“调度员”(路由器)换掉,就能立刻获得速度提升和效果优化。这就像给老式汽车换了一个更聪明的变速箱,车还是那辆车,但跑起来更顺了。

总结

这篇论文的核心思想就是:别让 AI 像无头苍蝇一样乱撞(旧模式),要让它像精明的指挥官一样,在关键时刻(低噪点)集中火力,平时(高噪点)保持节奏。

通过这种“专家选择”和“动态分配”的策略,未来的 AI 模型不仅能变得更聪明,还能在训练和使用时更省钱、更快速

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →