UNIFUSION: Adapting Autoregressive Language Models into Discrete Diffusion under a Unified Reverse-Rate Objective
该论文提出了 UNIFUSION,这是一个将各种离散扩散目标建立联系的统一框架,旨在实现预训练自回归模型向均匀噪声扩散的直接适配,从而在生成质量和下游任务准确率方面均达到了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在试图教一个机器人写故事。长期以来,教机器人写故事最好的方法是让它一次写一个词,从左到右,就像人类打字输入句子一样。这种被称为“自回归”(autoregressive)的学习方法非常出色,因为它很快,而且机器人能从中学习大量的语言规则。但它有一个大缺陷:一旦机器人写下一个词,它就永远无法回头去修改它。如果机器人在第一句话时犯了错,整个故事都可能毁掉,因为它无法编辑过去。
最近,科学家们尝试了一种不同的方法,叫做“离散扩散”(discrete diffusion)。这种方法不再是一个词一个词地书写,而是从一个被乱序或被“噪声”破坏(corrupted)的完整句子开始,然后机器人学习如何对其进行清理,通过一次修复一个词,直到句子变得完美。这就像是在整理一个凌乱的房间。问题在于,大多数这类新的“清理型”机器人都是从零开始训练的,这浪费了旧有的“逐词书写型”机器人已经掌握的语言知识。此外,许多这类新机器人使用一种特定的噪声类型,即用一个“掩码”(像一个黑盒子一样)将单词隐藏起来。这意味着机器人只能修复被隐藏的部分,而不能修复那些已经可见的单词。大的疑问是:我们能否将一个聪明的、经过预训练的“逐词书写型”机器人,瞬间转化为一个强大的“清理型”机器人,使其能够修复句子中的任何单词,甚至是那些并未被隐藏的单词?
这篇题为《Unifusion》的论文说:可以,并且展示了如何实现。研究人员发现,尽管各种“清理型”机器人使用的数学公式不同,但它们实际上都在试图解决同一个潜在问题:预测一个单词从一种状态跳转到另一种状态的速度有多快。他们称之为“反向速率”(reverse rate)。通过意识到所有这些不同的方法其实只是同一种语言的不同方言,他们创造了一个通用翻译器。这个翻译器允许他们提取标准“逐词书写型”模型(如 GPT-2)的知识,并将其直接适配到一种“均匀噪声”(uniform-noise)扩散模型中。
其核心创新在于,这个新模型 Unifusion 不需要用掩码来隐藏单词。相反,它将句子中的每一个单词都视为可编辑的,就像你可以编辑 Google 文档中的任何单词一样。研究人员通过测试两个版本的预训练模型(一个拥有 1.24 亿参数,另一个拥有 3.55 亿参数)并训练它们成为“清理艺术家”来进行验证。他们发现,随着给予模型更多思考的时间(将步骤数从 16 步增加到 256 步),文本质量稳步提升。
在 256 步的最大值处,较小的模型(Unifusion-S)实现了 97.783 的“生成困惑度”(衡量模型对所创建文本感到困惑程度的指标),而较大的模型(Unifusion-M)达到了 71.516。更重要的是,这些模型不仅能写出流畅的文本,还能保持极高的“一元熵”(unigram entropy),这是一种高级说法,意指文本具有多样性,不会陷入重复相同的短语或模式。事实上,在 256 步时,没有其他同等规模的模型能在流畅度和多样性上同时超越 Unifusion。
论文还表明,这种直接转换比旧的方法(即先从“逐词书写型”转为“掩码扩散型”,再转为“均匀扩散型”)效果更好。通过跳过中间环节,Unifusion 更高效地达到了同样的高质量。当在现实世界的逻辑谜题和常识问题(如 WinoGrande 和 SIQA)上进行测试时,这些新的扩散模型表现优于所有同等规模的扩散模型,证明了它们不仅学会了清理噪声,还实际保留了原始“逐词书写型”训练中的智能推理能力。
简而言之,Unifusion 就像是把一位习惯于一次添加一种食材来烹饪的顶级大厨,教会了一种新技巧:他可以同时品尝并调整整锅汤的味道,而无需丢弃他多年的烹饪经验。其结果是,该模型可以通过学习同时编辑整个句子,生成既流畅又具有创造性多样性的文本。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。