← 最新论文
💬 NLP

Plan for Speed: Dilated Scheduling for Masked Diffusion Language Models

本文提出了一种仅用于推理的膨胀去掩码调度器(DUS),该方法将序列位置划分为非相邻组以进行并行去掩码,从而最小化联合熵增益,进而在不降低质量或修改底层去噪器的情况下,使掩码扩散语言模型的文本生成速度提升高达 5.8 倍。

原作者: Omer Luxembourg, Haim Permuter, Eliya Nachmani

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Omer Luxembourg, Haim Permuter, Eliya Nachmani

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试拼一幅巨大的拼图,但你不是先看到图案,而是从一个盒子开始,盒子里的每一块拼图都被黑色贴纸覆盖。你的目标是撕掉贴纸,揭示出图案。

在 AI 文本生成的世界里,掩码扩散语言模型(MDLMs) 就是这样工作的。它们从一个每个词都被隐藏(掩码)的句子开始,尝试逐个“解掩码”以重建答案。

问题:“自信”的方法很慢

传统上,这些 AI 模型表现得像一个非常谨慎、自信的人。它们观察拼图,猜测哪一块最有可能是正确的,然后只撕掉那个位置的贴纸。接着它们再次观察,猜测下一个最自信的位置,再撕掉另一张贴纸。

虽然这种方法准确,但极其缓慢。如果你需要揭示 100 个词,你就必须向“猜测机器”(AI 模型)进行 100 次单独的访问。这就像试图用一把小刷子蘸一下油漆罐,刷一平方英寸,再蘸一下刷子,如此反复来粉刷一面墙。

一些研究人员试图通过说:“好吧,让我们直接挑选最自信的 10 个位置,一次性全部解掩码!”来加速这个过程。但这往往适得其反。因为这些 10 个位置是基于置信度选择的,它们通常彼此相邻。同时解掩码相邻的词,就像在不知道它们如何连接的情况下试图粉刷 10 个相邻的方块;AI 往往会感到困惑,犯下错误,不得不回退或产生无意义的结果。

解决方案:“膨胀”策略

本文的作者提出了一种名为膨胀解掩码调度器(DUS) 的新玩法。

将 DUS 想象成不是一个在猜测最佳位置的人,而是一位拥有固定计划的聪明的施工工头。工头不是问 AI“你认为哪个词是对的?”,而是说:“我们将按位置 1、5、9、13……的顺序解掩码单词。”

这里的类比是:
想象你在用灯泡照亮一条长长的黑暗走廊。

  • 旧方法(逐个令牌): 你打开一个灯泡,等待房间适应,再打开下一个,再等待,依此类推。这花费了太长时间。
  • “自信”的并行方法: 你观察走廊,发现前 5 个灯泡很容易猜测,所以一次性全部打开。但因为它们都挤在一起,光线不均匀,你错过了更远处的黑暗区域。
  • DUS 方法: 你使用膨胀调度
    1. 第一轮: 你打开位置 1、5、9、13、17……的灯泡(留下大间隙)。
    2. 第二轮: 你填补它们之间的空隙:3、7、11、15……
    3. 第三轮: 你填补剩下的小空隙。

为什么这有效

DUS 的魔力在于间距。通过迫使 AI 在早期轮次中揭示彼此相距较远的单词,你避免了“聚集”问题。

  • 独立性: 相距较远的单词彼此依赖程度较低。独立猜测句子的第一个词和最后一个词,比一起猜测第 5 和第 6 个词要容易得多。
  • 构建上下文: 一旦这些广泛分布的单词被揭示,它们就充当了锚点。当 AI 在第二轮回去填补空隙时,它拥有了更丰富的句子“地图”作为参考,使得猜测更加准确。

结果:既快又准

该论文在解决数学问题(GSM8K)、编写代码(HumanEval)和回答常识性问题等困难任务上测试了这种方法。

  • 速度: DUS 允许 AI 在短短几轮(对数时间)内解掩码整个文本块,而不是每个词一轮。这使得速度比旧的缓慢方法提高了高达5.8 倍
  • 质量: 令人惊讶的是,通过每次解掩码较少的单词但拉开它们的间距,AI 实际上比“自信”的并行方法犯了更少的错误。它不仅变得更快,同时也变得更聪明了。
  • 无需重新训练: 这是一个“即插即用”的升级。你不需要重新训练 AI 模型或改变其“大脑”。你只需要改变它在游戏过程中揭示单词的规则手册。

总结

这篇论文介绍了一个简单的调度技巧:不要先猜最容易的词;先猜分布最分散的词。

通过将文本生成视为一个建设项目,即先搭建远处的支柱,再填充墙壁,AI 可以在不丧失推理、解决数学问题或编写代码能力的情况下,以快得多的速度生成文本。它将一个缓慢的、逐步的过程转变为一个快速的、并行的过程,而无需任何新硬件或模型训练。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →