← 最新论文
💬 NLP

A Survey on Diffusion Language Models

本综述全面概述了扩散语言模型(DLMs),详细阐述了其演进历程、基础原理、最先进技术、推理优化、多模态扩展及实际应用,同时探讨了当前面临的挑战,并概述了其作为自回归范式极具前景的替代方案的未来研究方向。

原作者: Tianyi Li, Mingda Chen, Bowei Guo, Zhiqiang Shen

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Tianyi Li, Mingda Chen, Bowei Guo, Zhiqiang Shen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:两种写故事的方式

想象一下你需要写一个故事。目前最流行的一种方式(被 GPT 等模型使用)是自回归(Autoregressive, AR)。你可以把它想象成一场接力赛。一名跑者(模型)将接力棒传给下一位。他们写下一个词,然后是下一个,再下一个。这种方式快速且可靠,但它有一个瓶颈:你不能一次写完整个句子;你必须等待每个词完成后才能开始下一个。

这篇论文介绍了一个新的竞争者:扩散语言模型(Diffusion Language Models, DLMs)。你可以把 DLM 想象成一位正在雕刻雕像的雕塑家,或者一位正在清理模糊油画的修复师

  1. 过程: DLM 不是逐字写作,而是从文本的“混乱”版本开始(就像一张布满噪点或泥泞的画布)。
  2. 清理: 它同时观察整个混乱的画面,并尝试进行“去噪”。它猜测单词应该是什么,清理掉模糊的部分,并重复这个过程几次,直到文本变得清晰。
  3. 结果: 因为它能同时观察全局,它可以并行地编写许多单词,这可能使其速度大大提升。

主要角色:连续型 vs 离散型

论文解释了这些“雕塑家”工作的两种主要方式:

  1. 连续型 DLM(平滑的画家):

    • 工作原理: 想象单词是以平滑、连续的色彩渐变形式呈现的。模型涂抹这些颜色,然后尝试将它们重新融合回清晰的图像。
    • 难点: 由于人类语言是由离散的单词(如“猫”或“狗”)组成的,而不是平滑的色彩,模型在最后必须执行额外的步骤,将这些“颜色”“舍入”回具体的单词。这有时会很棘手。
  2. 离散型 DLM(拼图大师):

    • 工作原理: 这是更新、更流行的方法(例如文中提到的 LLaDA 模型)。想象一个填字游戏,其中一些方格是空白的。模型观察整个拼图,猜测缺失的单词,填补它们,然后检查自己的工作。如果它对某个词不确定,它会将其擦除(掩码化/masking)并重试。
    • 优势: 这种方法能更好地处理真实的单词,并且最近在速度和质量上已经赶上了传统的“接力赛”模型。

为什么要切换?DLM 的超能力

论文强调了为什么这种新方法令人兴奋的四个主要原因:

  • 并行超能力: 当“接力赛”模型只能一次写一个词时,“雕塑家”可以同时修复整个句子。这意味着更快的速度和更好的计算芯片利用率。
  • “向后看”的超能力: “接力赛”模型只能看到当前词之前的内容。而“雕塑家”能同时看到整个句子(包括前面和后面)。这有助于它更好地理解上下文,例如根据整个句子而非仅仅是前面的词来理解一个词的含义。
  • “第二次思考”的超能力: 如果“雕塑家”犯了错,它可以在下一轮清理中回头修正。这就像拥有一个内置的编辑,逐步精炼文本。
  • “填空”的超能力: 因为它能看到全局,所以它非常擅长处理诸如填充故事缺失部分,或编写需要通过前后文来确定中间部分的代码等任务。

挑战:为什么大家还没开始广泛使用它?

尽管拥有这些酷炫的特性,论文指出 DLM 尚未完美:

  • “自由度过高”的问题: 当模型试图同时猜测许多单词时,它有时会对这些词如何衔接感到困惑。它可能会完美地写出“猫坐在垫子上”,但如果它同时猜测两个词,它可能会意外地写出“狗坐在垫子上”接着又写出“猫坐在地毯上”,从而创造出一个逻辑混乱的混合体。论文称之为并行解码诅咒(Parallel Decoding Curse)
  • 工具链差距: “接力赛”模型拥有庞大的生态系统和软件工具来帮助它们快速运行。DLM 就像是一款新车型,目前还没有配套的修理厂或零配件。开发者很难高效地使用它们。
  • 长篇故事问题: 写一本很长的书对“雕塑家”来说很难。随着文本变长,数学计算会变得复杂且缓慢。论文指出,虽然这些模型正在进步,但在处理极长上下文方面仍比顶尖的“接力赛”模型吃力。

未来:下一步是什么?

论文总结道,DLM 是一个非常有前景的替代方案。它们已经展示出能够进行数学运算、编写代码,甚至同时理解图像和文本(多模态)的能力。

作者建议,为了让 DLM 真正占据主导地位,研究人员需要:

  1. 解决“自由度过高”的问题,使模型在快速写作时保持一致性。
  2. 构建更好的软件工具,使其运行得像现有模型一样流畅。
  3. 研究如何让它们在处理海量文本时不会变慢。

简而言之,论文认为虽然“接力赛”(自回归)目前是冠军,但“雕塑家”(扩散)是一个强有力的挑战者,它提供了一种不同、且潜力更大、更灵活的语言生成方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →