Rethinking the Generation Order of Block Diffusion Language Models
本文介绍了并行自回归解码(PARD),这是一种无需训练的采样方法,它利用块扩散语言模型固有的从左至右对齐特性,在与纯自回归解码相比质量损失极小的情况下,实现了更快的生成速度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在试图教一个机器人如何写故事。长期以来,教它写故事最好的方法是让机器人像人类读书一样,从左到右一次写一个词。这种被称为“自回归”(autoregressive)生成的方法非常可靠,但速度很慢,就像一个人在用打字机打小说一样。最近,科学家们发现了一种新的方法叫做“扩散”(diffusion),这更像是画家从一张布满了静态噪声的空白画布开始,逐渐清理掉噪声,直到出现一幅清晰的画作。这种新方法允许机器人一次性猜测许多个词,从而可能更快地写作。然而,这里有一个陷阱:虽然这种“清理噪声”的方法非常灵活,但它有时会对词序感到困惑,导致产生乱码。研究人员面临的大问题是:我们如何在获得画家的速度的同时,又不丢失打字机的逻辑流?
这篇论文正是针对这个难题展开研究的,它关注了一种更先进的“噪声清理”模型,称为块扩散语言模型(Block Diffusion Language Models, BDLMs)。作者 Kai Syun Hou 和 James Kwok 发现了一些令人惊讶的事实:尽管这些模型的设计初衷是具备高度灵活性、可以按任何顺序进行猜测,但它们的“思考”方式实际上比任何人预想的都要更像那种传统的从左到右的打字机。他们发现,如果强制要求这些模型遵循严格的从左到右的顺序,同时又允许它们一次猜测几个词,就能创造出一个完美的平衡点。他们将这种新方法称为 PARD(并行自回归解码,Parallel Autoregressive Decoding)。你可以把它想象成一支作家团队,他们同意按顺序写作,但并不需要等一个人完成整个句子后下一个人才开始,而是如果他们足够自信,所有人都可以同时动手完成接下来的几个词。其结果是,机器人的写作速度明显快于旧的慢速方法,但故事的逻辑性和质量依然保持不变。
“噪声清理”机器人的故事
为了理解为什么这很重要,让我们想象两种机器人尝试写句子的不同方式。
旧方法(自回归): 想象一个机器人一次写一个字母来写故事。它先写“T”,然后是“h”,然后是“e”,然后是“ ”。在完成当前词之前,它无法写下一个词。它非常谨慎,很少出错,但速度很慢。这就像一个人在打小说;在完成第一页之前,他们无法打完最后一页。
新方法(扩散): 现在想象一个机器人,它开始写句子时,每个单词都被替换成了一个问号(或“掩码”)。它的任务是观察整个句子并猜测缺失的单词应该是什。它不必按顺序猜测。它可以先猜最后一个词,再猜第一个词,然后再猜中间的词。这就像画家看着一张模糊混乱的画布,试图弄清楚最终的图像是什么。这种方法的优势在于速度:机器人可以同时修复句子的许多部分。缺点是,如果它在句子开头之前就猜出了结尾,它可能会搞错语境,从而产生毫无意义的内容。
有一段时间,科学家们尝试让“噪声清理”机器人通过以任何顺序进行猜测来工作,希望它能找到最佳路径。但本文的作者注意到了一些奇怪的现象。他们测试了一种新型机器人,称为块扩散语言模型(BDL模型)。这些机器人很特别,因为它们被训练成以文本块(blocks)的形式进行工作,利用前一个块的清晰文本来帮助猜测下一个块。
重大发现:机器人更偏好顺序
作者进行了一系列实验,以观察这些机器人的实际行为。他们对比了一个标准的“噪声清理”机器人(LLaDA)和一个较新的“块”机器人(SDAR)。
他们发现,标准的机器人确实喜欢以随机顺序进行猜测。但新的块机器人表现得完全不同。尽管它可以按任何顺序进行猜测,但它天生更倾向于从左到右进行猜测,就像旧式的打字机机器人一样。
为了证明这一点,他们观察了机器人的“置信度”。如果你要求机器人猜测下一个词,它通常会对每种可能性都有一个“置信度得分”。作者发现,对于块机器人来说,置信度最高的猜测几乎总是剩余句子中最开头的单词。这就像机器人有一个潜意识的习惯:“我知道我可以跳着来,但我真的觉得从左边开始最舒服。”
他们甚至使用了数学方法来解释为什么会发生这种情况。他们意识到,在训练期间,块机器人看到的例子中,句子的左侧部分已经是写好的,它只需要猜测右侧部分。这正是旧式“打字机”机器人的学习方式。而标准的“噪声清理”机器人,其训练数据中单词在各处都是缺失的,所以它从未真正学会依赖左侧优先。正因为块机器人是以这种方式训练的,所以它“想要”从左向右进行。
解决方案:PARD(作家团队)
那么,如果块机器人天生就想从左向右走,为什么不直接让它从左向右走呢?问题在于,如果它严格地从左向右走,它就会失去一次猜测多个单词的加速优势。它会再次变慢。
作者提出了一个聪明的解决方案,称为 PARD(并行自回归解码)。
想象一群作家正在共同创作一个故事。
- 规则: 他们必须按顺序写作,从左到右。
- 转折: 他们并不需要等待一个人完成一个词后下一个人才开始,而是所有人都会观察接下来的几个词。如果他们对下一个词非常有信心,他们就会写下它。如果他们对紧接着的那个词也很有信心,他们也会把那个也写下来。
- 安全网: 如果他们对第二个词不确定,他们就会停下来。他们不会为了追求速度而盲目猜测第二个词;他们会等到确信为止。
这就是 PARD 所做的。它观察机器人的置信度得分。如果机器人对第一个被遮盖的词有信心,它就写下它。然后,它会立即检查机器人对下一个词是否也有信心。如果是,它也会写下那个词。它会沿着这条线一直进行下去,写下一个“前缀”形式的自信词组,直到遇到一个机器人不确定的词为止。
结果:快速且准确
作者在三种不同的块机器人和六个不同的任务(包括编写代码和解决数学问题)上测试了这种新方法。
- 速度: PARD 比旧的“打字机”方法快得多。在某些情况下,它在其中一个模型上的速度提升了 3.64 倍。它生成标记(文本块)的速度高达每秒 152 个标记,而慢速方法仅为每秒 70 个。
- 质量: 尽管速度更快,但它编写的故事和代码与那些尝试以随机顺序猜测单词的快速方法相比,质量同样出色,甚至往往更好。事实上,在 SDAR 模型上,PARD 的表现实际上优于随机顺序方法,在编码测试中得分为 81.1%,而随机顺序方法为 75.0%。
- 对比: 他们将 PARD 与其他使用复杂规则来决定猜测哪些单词的先进“快速”方法进行了比较。PARD 始终胜过它们。那些复杂的方法就像是在通过随机跳跃来解开谜题;而 PARD 则像是通过先寻找边缘碎片来解决问题,事实证明,对于这些特定的机器人来说,这才是最高效的路径。
为什么这很重要
论文指出,对于这些新型的“块”机器人来说,传统的“以任何顺序猜测”的想法其实并不是最好的方法。由于训练方式的原因,这些机器人天生就存在向左向右思考的偏差。通过尊重这种偏差,并在机器人确信时才加入并行加速,我们就能获得两全其美:既有作家团队的速度,又有细心打字员的准确性。
作者特别指出,这是一种“无需重新训练”(training-free)的方法。他们不需要重新训练机器人或改变机器人的“大脑”,他们只是改变了要求机器人写作的方式。这使得它成为一个非常实用的工具,可以立即应用于现有的模型中。
简而言之,这篇论文表明,有时,前进最快的方式是记住要直线前进,但在你确定方向时,迈出更大的步伐。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。