← 最新论文
💬 NLP

dMoE: dLLMs with Learnable Block Experts

该论文提出了 dMoE,一种用于扩散大语言模型的块级混合专家(Mixture-of-Experts)框架,通过聚合标记级专家分布,在保持竞争力的性能的同时,通过最小化唯一激活的专家数量来显著降低显存占用和推理延迟。

原作者: Sicheng Feng, Zigeng Chen, Gongfan Fang, Xinyin Ma, Xinchao Wang

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Sicheng Feng, Zigeng Chen, Gongfan Fang, Xinyin Ma, Xinchao Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你拥有一个庞大且超级智能的图书馆(即 扩散大语言模型,或 dLLM),它能够编写故事、解决数学问题并回答各种问题。为了在不增加重量的情况下让这个图书馆变得更聪明,架构师们添加了一个特殊功能,叫做 混合专家模型 (Mixture-of-Experts, MoE)

把这些“专家”想象成一支由 100 名专业图书管理员组成的团队。当你提出一个问题时,图书馆并不会询问所有 100 名管理员。相反,它有一个“路由”(即管理员经理),负责挑选出最适合你这个特定问题的 8 名专家。这使得工作既快速又高效。

问题所在:“集体远足” vs. “独自远足”

这就是麻烦开始的地方。

  • 旧方法(自回归模型): 想象一名独自远足的徒步旅行者,一次只走一步。在每一步,徒步旅行者都会询问经理:“我现在该找谁帮忙?”经理挑选出 8 名专家,他们提供帮助,然后徒步旅行者迈出下一步。
  • 新方法(dLLMs): 新型的 dLLMs 就像是在进行 紧密结队的集体远足。它们不是一个接一个移动,而是以 32 人的大块(block)为单位同时移动。它们可以观察前方的整个路径,并同时修复多个步骤。这要快得多!

不匹配之处:
问题在于,“经理”(路由)仍然表现得像是正在处理一名独自远足的旅行者。尽管这群人以 32 人为一个块进行移动,但经理却把这个块中的每一个人都当作了独立的、单独的徒步旅行者来对待。

  • 块中的第 1 个人请求帮助:经理挑选了 8 名专家。
  • 第 2 个人请求:经理挑选了另外不同的 8 名专家。
  • ……
  • 块中的第 32 个人请求:经理又挑选了另外 8 名专家。

因为这群人是作为一个整体移动的,经理最终为了处理这一个单一的移动块,竟然调用了 数十个不同的专家。这就像一名巴士司机为了给 32 辆不同的车加油,竟然要在行驶过程中停下 32 个不同的加油站,尽管他们都在同一辆巴士上。巴士被卡住了,内存(燃料)耗尽了,整个过程变得缓慢,因为系统试图同时加载太多不同的专家。

解决方案:dMoE(“块管理器”)

论文作者提出了一个名为 dMoE 的新系统。他们意识到,既然这群人是作为一个整体移动的,那么在选择专家时,就应该将他们视为 一个统一的单元

以下是 dMoE 的工作原理,使用一个简单的类比:

  1. 集体投票: dMoE 不再逐一询问块中的 32 个人各自需要谁,而是让 整个小组 集体投票。“嘿,这一块的人,你们集体需要什么样的帮助?”
  2. 统一清单: 经理获取所有个人的投票,并将它们合并为一个“块得分(Block Score)”。如果块中有 20 个人需要“数学专家 E1”,而 10 个人需要“数学专家 E2”,经理就会看到 整个块 确实需要 E1 和 E2。
  3. 智能短名单: 经理查看这个合并后的清单,然后说:“好吧,对于这整个块,我们其实只需要覆盖该小组 90% 需求的顶尖专家即可。” 他们为整个块创建了一个精简且固定的专家列表(“核心集/coreset”)。
  4. 结果: 现在,与其为一个块加载 60 多个不同的专家,系统只需加载大约 14 个。这就像巴士司机意识到:“哦,这辆车上的每个人其实都只需要从同样的 3 个加油站加油,”所以他们只会在那里停靠。

为什么这很重要(研究结果)

论文在一种名为 LLaDA2.0-mini 的最先进模型上测试了这种新的“块管理器”,并使用了高难度的数学和逻辑测试(如 MATH500 和 GSM8K)。

  • 更少的内存占用: 因为他们不再加载一个庞大且混乱的专家列表,计算机的内存使用量下降了约 77% 到 80%。这就像是从搬运 100 种不同工具的大卡车,切换到了只携带 14 件必需品的背包。
  • 更快的速度: 模型运行速度提升了 1.14 倍至 1.66 倍。巴士不再需要频繁停靠那么多加油站。
  • 智力无损: 最令人印象深刻的部分是?模型并没有变笨。它保持了 99.11% 的原始智能。它能同样正确地解决数学问题,只是效率更高了。

总结

论文指出:“我们发现,当这些新型快速 AI 模型以小组形式工作时,将它们视为个体对待会导致交通拥堵。通过让小组共同投票决定需求,我们可以将调用的工作人员数量减少近 5 倍,节省大量内存,并让 AI 运行得更快——而且完全不会损失任何脑力。”

这是一种“可学习”的策略,意味着 AI 在训练过程中会学习如何对这些投票进行分组,从而实现一种智能且自动化的修复。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →