← 最新论文
💬 NLP

Beyond Masks: Efficient, Flexible Diffusion Language Models via Deletion-Insertion Processes

本文提出了删除 - 插入扩散语言模型(DID),通过用离散扩散过程替代传统的掩码机制,在无需超参数调整的情况下显著提升了训练与推理效率,并原生支持变长序列生成及动态自校正功能。

原作者: Fangyu Ding, Ding Ding, Sijin Chen, Kaibo Wang, Peng Xu, Zijin Feng, Haoli Bai, Kai Han, Youliang Yan, Binhang Yuan, Jiacheng Sun

发布于 2026-03-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Fangyu Ding, Ding Ding, Sijin Chen, Kaibo Wang, Peng Xu, Zijin Feng, Haoli Bai, Kai Han, Youliang Yan, Binhang Yuan, Jiacheng Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 DID (Deletion-Insertion Diffusion,删除 - 插入扩散) 的新型语言模型。为了让你轻松理解,我们可以把现有的语言模型生成文字的过程,想象成两种不同的“修补衣服”或“拼图”游戏。

1. 旧方法:戴着“面具”的修补工 (MDLMs)

以前的扩散语言模型(MDLMs)就像是一个戴着面具的修补工

  • 怎么工作? 想象你有一件完整的衣服(一句话)。修补工先把衣服上的所有扣子都扣上,或者把整块布都盖上一块写着“未知”的****(面具)布。
  • 怎么生成? 然后,修补工开始一块一块地揭开这些面具,猜出下面应该是什么扣子或布料,直到衣服恢复原样。
  • 有什么缺点?
    1. 浪费体力: 即使衣服已经修好了,修补工还得盯着那些还没揭开的“面具”看,或者为了凑齐衣服的长度,不得不硬塞进很多没用的****(填充)布料。这就像为了做一件小衣服,却必须用一块巨大的桌布来垫着,非常浪费时间和算力。
    2. 死板: 一旦修补工揭开了一块面具,那块布料的位置就固定了。如果后来发现这块布料放错了位置(比如把“苹果”放到了“香蕉”后面),他就很难调整,只能硬着头皮继续,导致错误越积越多。

2. 新方法:灵活的“剪贴”大师 (DID)

这篇论文提出的 DID 模型,则像是一个灵活的“剪贴”大师。他不再使用面具,而是直接对布料进行**“剪掉”“插入”**的操作。

核心玩法:

  • 正向过程(剪掉): 想象你有一篇完整的文章。DID 的第一步不是盖面具,而是把文章里的字一个个剪掉,直到文章变成空白的(只剩一个开始标记)。这就像把衣服拆成零散的线头。
  • 反向过程(插入): 生成时,DID 从一张白纸开始,把字一个个“插”进去
    • 它不是按顺序从左到右写,而是像玩积木一样,可以在句子的开头、中间、结尾任何地方插入新词。
    • 比喻: 就像你在写故事时,先写了一个开头,发现中间缺了个形容词,就插进去;后来发现结尾太短,又在后面加了一句。

DID 的三大绝招:

  1. 拒绝浪费(高效):

    • 旧方法要处理那些没用的“面具”和“填充布”,DID 直接把它们扔掉了。
    • 比喻: 旧方法像是在大桌子上拼小拼图,周围全是空地;DID 则是直接把拼图放在手里拼,没有空地浪费。这使得训练和生成速度快了很多(论文数据显示快了近 2 倍到 4 倍)。
  2. 天生灵活(可变长度):

    • 旧方法必须把句子强行凑成一样长(比如都凑成 100 个字,不够的补空格)。
    • DID 不需要。它想写多长就写多长,想写短就写短。
    • 比喻: 旧方法像是要把不同长度的面条都切成一样长再煮;DID 则是想煮多长就煮多长,想加多少根面条就加多少根。
  3. 自我纠错(动态调整):

    • 这是最酷的一点。因为 DID 是“插入”式的,如果它发现刚才插进去的词位置不对,它可以在下一步把新词插到旧词的前面或后面,从而调整整个句子的结构。
    • 比喻: 旧方法像是一列火车,一旦车头开错了方向,后面的车厢很难掉头;DID 则像是一群灵活的蜜蜂,发现花蜜位置不对,可以随时调整飞行路线,重新排列队形。

3. 论文是怎么做到的?(简单的技术解释)

为了让这个“剪贴大师”学会怎么插字,作者设计了一套特殊的**“计分系统”**:

  • 模型会计算:如果在句子的第 3 个词后面插入“苹果”,这个动作的“得分”是多少?
  • 为了算出这个得分,作者发明了一种**“动态规划”**算法(一种聪明的数学计算方法),能飞快地算出各种插入可能性的概率,而不需要笨拙地一个个试。

总结

这篇论文的核心思想就是:别再用“遮遮掩掩”(Mask)的方式做语言模型了,直接“剪剪贴贴”(Delete-Insert)更聪明、更快速、更灵活。

  • 对普通用户意味着什么? 未来的 AI 写文章会更快,而且能更自然地处理长短不一的内容,甚至能像人一样在写作过程中灵活调整语序,而不是死板地按顺序堆砌文字。
  • 对开发者意味着什么? 省下了大量的计算资源(省钱、省电),同时生成的文本质量更高。

简单来说,DID 让 AI 从“填字游戏”玩家,进化成了真正的“创意作家”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →