← 最新论文
🤖 AI

PreDiff-LM: Pretrained Discrete Masked Diffusion Language Modeling with Hybrid Attention

PreDiff-LM 引入了一种混合注意力机制,该机制在保留已观测提示词的因果注意力(causal attention)的同时,为掩码目标(masked targets)启用双向注意力,从而有效地将预训练的自回归 Transformer 适配于离散掩码扩散语言建模,并在困惑度(perplexity)和生成质量方面较先前的扩散基准实现了显著提升,尽管在相同规模下优化的自回归模型仍然更具优势。

原作者: Zhengtao Yao, Runhao Li, Xupeng Chen, Jiayi Cheng, Chenqian Le, Michael Yue, Jesson Wang, Siheng Wang, Guang Yang, Haoyan Xu, Chenhao Wei, Zhengqing Yuan, Youran Shen, Yanfang Ye, Junhao Dong

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhengtao Yao, Runhao Li, Xupeng Chen, Jiayi Cheng, Chenqian Le, Michael Yue, Jesson Wang, Siheng Wang, Guang Yang, Haoyan Xu, Chenhao Wei, Zhengqing Yuan, Youran Shen, Yanfang Ye, Junhao Dong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

伟大的文本生成器大对决:两位作家的故事

想象一下,你正试图教一个机器人写故事。多年来,教机器人的最佳方式是让它像人类在键盘上打字一样:一次一个词,从左到右。这被称为“自回归”(autoregressive)式写作。这种方式非常擅长衔接句子,但如果你要求它填补段落中间的空白,或者修正后面的错误,它就会感到困惑,因为它看不见空白之后的词。

最近,科学家们尝试了一种不同的方法,叫做“扩散”(diffusion)。这种方法不再是一个词一个词地写,而是从满篇乱码(或“掩码”词)开始,通过观察整个页面来慢慢清理,从而确定哪些内容最合适。这就像雕塑家从一块石料开始,通过不断凿去杂质,直到雕像显现出来。这种方法非常强大,因为它可以从任何方向填补空白。然而,这些“扩散型”机器人通常写得非常糟糕,甚至不如“键盘型”机器人,听起来往往重复且毫无意义。

研究人员一直在问一个大问题:我们能否拿起那个超级聪明的“键盘型”机器人(它已经接受了海量文本的训练),并教会它使用“雕塑家”的方法,同时又不损失它的智力?答案并不简单,因为这两种方法对单词的“思考”方式完全不同。这篇名为 PreDiff-LM 的论文深入探讨了这个问题,旨在探索我们是否可以结合两者的优点。

论文的核心思想:混合掩码

PreDiff-LM 的研究人员发现,这些“雕塑型”机器人之所以失败,主要原因不仅在于它们清理文本时使用的数学方法,还在于它们观察单词的方式。

把“键盘型”机器人想象成一位严谨的图书管理员,她只从书的开头读到结尾。如果你要求她在中间猜一个缺失的词,她只能看它之前的词。然而,“雕塑型”机器人理应同时观察整个页面。问题在于,当你试图强迫这位图书管理员突然变成雕塑家时,就会出现麻烦。如果你只是告诉图书管理员:“现在,看向所有地方!”她会对已经知道的词(提示词/prompt)感到困惑,从而破坏她对故事至今为止记忆的连贯性。

作者们的解决方案是一个被称为**混合注意力(Hybrid Attention)**的巧妙技巧。想象一个教室,老师(机器人)正在给学生们朗读一个故事。

  • 提示词(已有的故事): 老师朗读已经写好的故事部分。在这里,他们表现得像一位严谨的图书管理员,只向前看。他们不会让学生窥探未来,因为那部分故事已经是既定的事实。
  • 目标(缺失的词): 当需要填补空白时,老师突然变成了雕塑家。他们会观察空白前后的词,甚至观察其他正在尝试填补的空白,以找到最完美的契合点。

这种“混合掩码”让机器人既能保持对已写故事的强大记忆,又能获得创造性填补缺失部分的自由。

他们的发现

团队使用了一个基于著名 AI 模型 GPT-2 的模型测试了这个想法。他们将这个新的“混合型”机器人与一个试图同时观察所有地方的机器人(均匀双向注意力)以及原始的“键盘型”机器人进行了对比。

  • 结果: 混合型机器人取得了巨大的成功。它将“困惑度”(称为 Perplexity)从 34.1 降低到了 28.7。这是一个巨大的飞跃!它写出的文本也比之前的尝试听起来更自然,重复性更低。
  • 速度提升: 最酷的发现之一是混合型机器人的学习速度。一个从零开始训练的机器人需要大约 350,000 步才能达到不错的水平。而使用他们聪明起点(starting point)的 PreDiff-LM 机器人,仅用 8,000 步就达到了同样的技能水平。这就像是从徒步横跨国家变成了乘坐高铁。
  • 代价: 尽管有了所有这些改进,混合型机器人仍然无法完全媲美那些专门针对该任务进行微调的原始“键盘型”机器人。键盘型机器人的困惑度为 18.9,而混合型机器人为 28.7。因此,虽然混合型机器人比旧的扩散模型好得多,但它还没有完全击败最好的“键盘型”作家。

为什么这很重要(以及它不是什么)

作者们谨慎地指出,他们并没有“解决”AI 写作问题。他们并没有制造出一个在各方面都比最好的键盘型机器人更快、更好的机器人。事实上,键盘型机器人在生成文本的速度和质量上仍然略胜一筹。

然而,这篇论文证明了你可以拿起一个聪明的预训练机器人,并教会它以一种新的、灵活的方式(填补空白、修复错误)进行写作,而不会破坏它的大脑。这种“混合注意力”技巧是解锁这一能力的钥匙。它表明,AI 写作的未来可能不在于在其中一种方法和另一种方法之间做选择,而在于知道何时该做一个严谨的图书管理员,何时该做一个富有创造力的雕塑家。

研究人员还展示了这种新机器人能更好地避免重复循环(比如不停说“the the the”),并且在处理诸如预测故事下一句的任务时,比旧的扩散模型表现更好。虽然它还不是 AI 写作的“最终 Boss”,但它是让这些灵活的、“雕塑家风格”的机器人真正变得实用的重要一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →