← 最新论文
🤖 machine learning

Adaptive Block Diffusion: Resolving Training-Inference Mismatch in Diffusion Language Models

本文引入了自适应块扩散(Adaptive Block Diffusion, ABD),这是一种通过在多种前缀窗口配置的分布上优化去噪,从而解决扩散语言模型中训练与推理不匹配问题的方法,进而使单个模型能够在无需改变架构的情况下,稳健地泛化至各种任意解码策略。

原作者: Gagan Jain

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Gagan Jain

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于“自适应块扩散”(Adaptive Block Diffusion)论文的解释,使用了简单的语言和日常类比。

问题所在:“僵化的蓝图” vs. “现实世界”

想象你正在教一个机器人写故事。

  • 自回归模型(Autoregressive models)(旧方法)就像一个学生,一次只写一个词,必须等前一个词写完才能写下一个。这种方式非常准确,但速度很慢。
  • 扩散模型(Diffusion models)(新方法)则像是一个学生,他从满篇乱码的页面开始,通过慢慢擦除错误的部分来展现故事。这种方式快得多,因为他们可以同时修正许多个词。

具体问题:
近期的“块扩散”(Block Diffusion)模型试图结合两者的优点。它们决定以(即词组块)为单位来修正故事。例如,它们可能会说:“我们先只修正第 1–10 个词,然后是 11–20 个,接着是 21–30 个。”

陷阱:
研究人员发现,这些模型仅针对那种特定的、僵化的模式(如 1–10,11–20)进行训练。

  • 类比: 想象你只在一条车道间距完美、笔直且空旷的高速公路上练习开车。你成了这条特定赛道的专家。但到了考试那天,你却被要求在一条充满弯道、坑洼不平且车道宽度不断变化的山路上驾驶。因为你只练习过“笔直高速公路”的模式,结果你撞车了。
  • 在论文中: 当这些模型尝试使用不同的块大小(例如一次修正 5 个词而不是 10 个词)来生成文本时,它们的性能会崩溃。它们无法处理那些未曾练习过的“非网格化”情况。

解决方案:“自适应块扩散”(ABD)

作者提出了一种名为**自适应块扩散(Adaptive Block Diffusion, ABD)**的新训练方法。

类比:
与其教机器人只在笔直的高速公路上开车,不如带它去一所会抛出随机场景的驾驶学校。

  • 有时,它练习一次修正 1 个词。
  • 有时,它练习一次修正 10 个词。
  • 有时,它练习一次修正 50 个词。
  • 有时,“块”的起始位置也会发生变化。

通过在所有可能的块大小的随机组合上进行训练,机器人学习的是修正文本的通用技能,而不是死记硬背某种特定模式。

它是如何工作的(机制)

  1. 随机变量: 论文将“块大小”(即我们一次修正多少个词)视为一个随机变量。在训练期间,模型不知道下一个会得到多大的块。它必须随时做好应对任何情况的准备。
  2. 无需新硬件: 你不需要制造一个新的机器人。你只需要改变课程内容(训练数据分布)。模型的架构保持不变;它只是学会了变得更加灵活。
  3. 保证: 论文从数学上证明了,如果你在足够多样化的块大小上训练模型,只要该大小包含在训练组合中,它在以后使用任何块大小时都能完美运行。

结果:为什么这很重要

论文在两个主要的语言数据集(LM1B 和 OpenWebText)上进行了测试,并发现:

  1. 不再崩溃: 与那些在测试不同块大小时会失败的旧有“固定块”模型不同,ABD 模型在所有尺寸下都能平稳运行。
  2. “单调”关系: 在理想情况下,如果你减小块的大小(即一次修正更少的词),质量应该会略微提升(趋向于那种缓慢但完美的自回归风格)。旧模型打破了这一规则;当改变大小时,它们的表现反而变差了。ABD 则完美遵循了这一规则:块越小 = 质量越高,块越大 = 速度越快。
  3. 一模通用: 你不需要为一个“快速模式”训练一个模型,再为另一个“高质量模式”训练另一个模型。一个单一的 ABD 模型就可以兼顾两者,并且在各自的任务中都能达到专门化模型的水平。

简而言之

  • 旧方法: 训练一个只能针对特定块大小工作的模型。它是一个专家,但一旦规则改变就会失败。
  • 新方法 (ABD): 在所有块大小的随机混合中训练模型。它变成了一个通才,能够处理你抛给它的任何情况,且不会损失质量。

该论文声称,这解决了模型训练方式与实际使用方式之间的不匹配问题,使扩散语言模型在无需复杂架构改动的情况下,变得更加鲁棒且多功能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →