← 最新论文
💬 NLP

Discrete Diffusion Models: A Unified Framework from Tokenization to Generation

本文提出了一个以离散状态空间构建为核心的离散扩散模型统一概念框架,从而统一了现有公式、明确了设计权衡,并为未来的研究方向提供了指导。

原作者: Ye Yuan, Weien Li, Rui Song, Zeyu Li, Haochen Liu, Xiangyu Kong, Zixuan Dong, Linfeng Du, Zipeng Sun, Weixu Zhang, Jiaxin Huang, Changjiang Han, Yonghan Yang, Zichen Zhao, Xiuyuan Hu, Haolun Wu, Yanka
发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Ye Yuan, Weien Li, Rui Song, Zeyu Li, Haochen Liu, Xiangyu Kong, Zixuan Dong, Linfeng Du, Zipeng Sun, Weixu Zhang, Jiaxin Huang, Changjiang Han, Yonghan Yang, Zichen Zhao, Xiuyuan Hu, Haolun Wu, Yankai Chen, Fengran Mo, Jikun Kang, Bowei He, Dawn Song, Philip S. Yu, Xue Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你试图通过一个接一个地放置单词来写故事,且永远不允许回头查看或修改已经写下的内容。这正是目前大多数现代文本生成计算机程序的工作方式。它们从左到右构建句子,在每个单词出现的那一刻就对其做出承诺。虽然这种方法快速且可靠,但它有一个根本性的缺陷:如果作者在早期犯了错误,或者故事需要一个需要改变开头的转折,系统无法在不重新开始的情况下进行修正。这是一条单行道,没有转向车道。

长期以来,科学家们一直在寻找一种不同的数据生成方式,一种允许全局规划并能在整体图景清晰时修正决策的方式。在图像和声音领域,一种被称为“扩散”(diffusion)的技术已经解决了这个问题。它的工作原理是从一个完全混乱的状态开始,通过逐步清理,直到出现清晰的图像或声音。因为这个过程在每一个阶段都会观察整个画面,所以它可以修复错误并随着进程调整构图。然而,将这种相同的“清理”方法应用于文本、代码和其他离散数据——其中构建块是像字母或单词这样截然不同的符号,而不是平滑的色彩色调——已被证明是极其困难的。适用于图像的规则并不能直接转化为适用于单词的规则,以往强行使其奏效的尝试往往会导致乱码或质量低劣。

由包括麦吉尔大学、穆罕默德·本·扎耶德人工智能大学在内的机构组成的大型研究团队的一项最新综合研究,为理解和改进这些离散扩散模型提供了一种统一的方法。研究人员认为,使这些模型发挥良好作用的关键不仅在于清理算法本身,还在于如何首先将原始数据分解为那些基础构建块,即“标记”(tokens)。他们提出,我们选择如何切割句子、蛋白质链或分子结构,是最关键的设计选择,它塑造了随后发生的一切。通过将这种初始分解视为设计的核心部分,而非仅仅是一个简单的设置步骤,该团队创建了一个单一的框架,解释了这些模型如何在从编写代码到设计新药等许多不同领域中运作。

这一新框架的核心是一个简单而强大的想法:数据的标记化(tokenization)方式决定了破坏它的“噪声”的性质,以及计算机解决该任务以进行修复的难度。在熟悉的文本世界中,单词通常根据其出现的频率被分解成更小的部分。但对于离散扩散,研究人员发现这些部分的规模和结构至关重要。如果部分太小,计算机必须解决一个拥有过多微小零件的巨大谜题;如果部分太大,模型则难以预测正确的组合。该研究描绘了不同类型的数据如何需要不同的处理方法。例如,在语言中,最好的方法通常涉及掩盖(masking)部分单词并要求模型填补空白,这种方法发挥了现代计算机架构的长处。相比之下,对于蛋白质或 DNA 等科学数据,分子本身的自然结构提供了引导。研究人员表明,利用氨基酸或化学键之间的已知关系来引导“清理”过程,比将所有错误视为同等对待的效果要好得多。

该论文将此前看似互不关联的大量现有方法整合在了一起。它表明,无论模型是使用转换矩阵来描述标记的变化,还是使用掩码策略来隐藏数据的一部分,亦或是使用基于评分的方法来衡量概率,它们都是同一种底层结构的变体。研究人员将每个离型扩散模型分解为四个基本部分:用于破坏数据的方法、用于学习修复数据的神经网络、用于训练该网络的数学目标,以及用于生成最终输出的算法。通过这些共同的视角,团队揭示了许多成功与失败模型之间的差异,归根结底在于如何将这四个部分与特定类型的数据进行匹配。

最重要的发现之一是,这些模型擅长处理需要观察全局的任务。与那些无法改变主意的从左向右的编写者不同,这些模型可以迭代地完善其输出。它们可以从一个草稿开始,识别薄弱环节,并在随后的轮次中进行改进。这使得它们在处理诸如填充文档缺失部分、在保留周围上下文的同时编辑文本,或生成像化学分子这样每个部分都必须完美契合的复杂结构等任务时,具有特别强大的能力。研究强调,对于这些特定任务,这种进行全局规划和修正的能力是一种明显的优势,是目前的标准模型难以轻易复制的。

然而,研究人员也谨慎地指出,这并不意味着旧的从左向右的方法已经过时。由于新模型必须多次处理整个序列,因此通常比旧方法慢,而旧方法可以非常快速地逐个单词生成文本。研究表明,未来的方向很可能是混合系统,即将旧方法的速度与新方法的规划和修正能力相结合。例如,一个系统可以使用快速模型起草一个计划,然后使用扩散模型来完善细节并确保一致性。

论文还讨论了使这些模型在大规模应用中的实际挑战。它讨论了如何高效地训练它们,如何在不损失质量的情况下提高生成速度,以及如何评估结果是否真正优秀。研究人员指出,旨在为旧模型设计的标准衡量成功的方法,往往无法捕捉到这些新系统的独特优势和弱点。他们提出了新的性能衡量方法,这些方法考虑到了过程的迭代性质,例如追踪模型在每次精炼步骤中的改进程度。

最终,这项工作为下一代人工智能提供了路线图。通过阐明数据的表示方式与用于生成数据的算法同样重要,研究人员为改进开辟了新的途径。他们表明,通过精心设计与特定领域需求相匹配的标记化过程——无论是语言的语法、代码的句法,还是分子的化学结构——这些模型可以变得更加有效。该研究并不声称已经解决了所有问题;它承认在这些模型如何扩展规模以及如何像旧方法那样学习上下文方面,仍存在开放性问题。但通过提供一个统一的框架,它为科学界提供了一种清晰的语言和共同的结构来加以构建,推动该领域从孤立实验的集合转向一种连贯且强大的生成式人工智能新方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →