← 最新论文
💬 NLP

Efficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in Speed

本文介绍了 Efficient-DLM,这是一个通过采用分块注意力模式和位置相关令牌掩码,将预训练自回归模型转化为高效扩散语言模型的框架,从而在准确性和吞吐量方面优于最先进模型。

原作者: Yonggan Fu, Lexington Whalen, Zhifan Ye, Xin Dong, Shizhe Diao, Jingyu Liu, Chengyue Wu, Hao Zhang, Enze Xie, Song Han, Maksim Khadkevich, Jan Kautz, Yingyan Celine Lin, Pavlo Molchanov

发布于 2026-05-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Yonggan Fu, Lexington Whalen, Zhifan Ye, Xin Dong, Shizhe Diao, Jingyu Liu, Chengyue Wu, Hao Zhang, Enze Xie, Song Han, Maksim Khadkevich, Jan Kautz, Yingyan Celine Lin, Pavlo Molchanov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《Efficient-DLM:从自回归到扩散语言模型,以及在速度上的超越》的通俗解释,辅以日常类比。

全景概览:交通拥堵与高速公路

想象两种写故事的方式:

  1. 旧方法(自回归/AR): 这就像一条单行道。你写一个词,然后写下一个,再写下一个。在第一个词完成之前,你无法写第二个词。这种方式非常准确,但速度很慢,因为你必须为每一个词排队等待。
  2. 新方法(扩散/DLM): 这就像一条多车道高速公路。你可以同时(并行)写很多词。它应该快得多。然而,过去这些“高速公路”颠簸不平、令人困惑,且产出的故事质量往往不如单行道。而且,建造它们(训练)的成本也非常高昂。

问题所在: 科学家们想要高速公路的速度,同时拥有单行道的质量,但他们无法在不从零开始(这需要巨额资金)的情况下构建出这样的系统。

解决方案: 这篇论文的作者发现,如何将现有的高质量“单行道”模型转化为既快速又准确的“高速公路”模型。他们将这个新的模型家族称为Efficient-DLM


他们是如何做到的:三个关键技巧

该论文确定了实现这一转化必须遵循的三条主要“规则”。

1. “干净上下文”规则(分块法)

  • 旧错误: 之前的尝试试图让模型一次性查看整个句子,甚至包括那些仍然混乱或缺失的部分。这就像试图解决一个拼图,其中一半的拼图块缺失,而你却被允许将空白处视为已填充。这会让模型感到困惑,并使其忘记之前学到的内容。
  • 修正: 作者决定将句子拆分成小的(就像书中的章节)。
    • 模型查看之前的章节,这些章节已经完成且干净。
    • 它只尝试修复当前的章节,即混乱的部分。
    • 类比: 想象一个施工队。他们不会试图一次性修复整栋建筑。他们会先完成地基和一楼(干净上下文),然后再向上移动去修复二楼(混乱的块)。这保持了结构的稳定性,并允许他们使用“捷径”(称为 KV 缓存)来记住他们已经建造的内容,从而使过程快得多。

2. “无 Token 移位”规则(停止猜测下一步)

  • 旧错误: 在转换旧模型时,研究人员曾让模型去猜测下一个词,就像旧的单行道模型那样。
  • 修正: 作者发现,模型不需要猜测“下一个”词。它只需要修复眼前缺失的词
  • 类比: 想象你在编辑一份文档。
    • 旧方式: 你读一个句子,然后试图预测下一个句子,甚至在你完成当前句子的编辑之前。
    • 新方式: 你只需专注于填补当前段落中的空白。事实证明,修复空白比试图预测未来更容易、更准确。

3. “位置相关掩码”规则(从左到右的偏差)

  • 问题: 在模型训练时,它过去是随机隐藏单词(就像抽取彩票号码)。但在模型实际使用(推理)时,它自然地倾向于从左到右完成单词,就像人类阅读一样。这造成了不匹配:训练看起来不像真实的测试。
  • 修正: 作者改变了训练方式,使模型更有可能隐藏块末尾的单词,而不是开头的单词。
  • 类比: 想象一位老师在批改试卷。
    • 旧训练: 老师遮盖页面上的随机问题。
    • 新训练: 老师意识到学生通常会在某个部分的最后几个问题上卡住。因此,老师专门练习遮盖该部分的末尾。这使模型为现实世界做好了准备,在那里它必须从左到右完成句子。

结果:速度与智慧

遵循这些规则,作者创建了Efficient-DLM家族(规模分别为 15 亿、40 亿和 80 亿参数)。

  • 速度: 它们比现有的最佳模型快得多。例如,他们的 80 亿参数模型比竞争对手"Dream"快4.5 倍,比"Qwen3 4B"快2.7 倍
  • 准确性: 尽管速度更快,但在数学、编程和推理任务上,它们实际上比被击败的模型更准确
  • 灵活性: 因为它们可以一次生成多个单词,所以你可以调整它们。如果你需要速度,就一次生成更多单词;如果你需要极高的精度,就一次生成较少单词。这就像拥有一辆可以瞬间在“赛车模式”和“巡航模式”之间切换的汽车。

总结

该论文指出:“我们让一个缓慢但准确的模型学会了在高速公路上奔跑。我们通过将工作组织成干净的块、停止其猜测未来、以及训练其关注句子末尾来实现这一点。结果是一个既比当前最先进模型更快、又更聪明的模型家族。”

他们还指出,由于这些模型可以从两个方向查看文本(双向),它们在理解和搜索及嵌入任务的文本“含义”方面表现出色,超越了旧的单向模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →