← 最新论文
💬 NLP

Drifting Objectives for Refining Discrete Diffusion Language Models

本文介绍了 TokenDrift,这是一种新颖的训练目标,通过将分类预测提升为软词元特征以进行反对称细化,从而将连续漂移原理适配到离散扩散语言模型中,显著提升了低采样步数下的生成质量。

原作者: Daisuke Oba, Hiroki Furuta, Naoaki Okazaki

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Daisuke Oba, Hiroki Furuta, Naoaki Okazaki

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一个写故事的机器人。这个机器人被称为离散扩散语言模型(DDLM),它不像人类那样逐字逐句地写作。相反,它从一页满是胡言乱语(或“噪声”)的内容开始,然后一步步逐步清理,直到内容变得通顺。

通常,为了获得一个非常精彩的故事,这个机器人需要经历许多微小的清理步骤。如果你强迫它提前停止(为了节省时间或金钱),故事往往会分崩离析,变得毫无意义或重复啰嗦。

这篇论文的作者提出了一个简单的问题:我们能否在不改变其清理文本的方式、也不给予更多时间的情况下,教会这个机器人更快地产出更好的故事?

他们的答案是一种名为TokenDrift的新训练方法。以下是其工作原理,借助一些日常类比来说明:

1. 问题:“硬”墙与“软”墙

在文字的世界里,单词就像独立的积木(例如“猫”或“狗”)。你不可能拥有半个“猫”和半个“狗”。

  • 问题所在: 他们希望采用的新训练方法(称为“漂移”)在平滑、连续的世界中效果最佳,在那里事物可以平滑地向目标滑动。但由于文字是由坚硬的积木构成的,机器人无法“平滑”滑动。如果机器人选择了一个特定的单词(一个“硬”选择),数学计算就会失效,机器人也就无法从错误中学习。

2. 解决方案:“模糊透镜”(软词元提升)

为了解决这个问题,作者发明了一种名为**软词元提升(Soft-Token Lift)**的技巧。

  • 类比: 想象机器人不是选择一个特定的单词,而是举着一个模糊的、半透明的透镜放在字典上方。通过这个透镜,它看到“猫”有 50% 的清晰度,“狗”有 30% 的清晰度,“老鼠”有 20% 的清晰度。
  • 为何有效: 这种“模糊”的视角是平滑的,且在数学上更友好。它允许机器人在尚未承诺单一“硬”选择之前,就能感受到正确单词的“拉力”。这搭建了一座桥梁,让训练数学能够通过系统流动。

3. 训练:“磁铁与排斥器”(漂移)

一旦机器人通过这个模糊透镜进行观察,作者就会应用一种“漂移”技术。

  • 类比: 想象机器人站在一片田野中。
    • 吸引力: 有磁铁将机器人拉向好的、真实的故事(来自互联网的数据)。
    • 排斥力: 有磁铁将机器人推离坏的、机器人生成的故事(机器人自己的错误)。
  • 目标: 机器人学会朝着拉向好故事并推离坏故事的方向移动。这种“漂移”引导机器人走向更好的结果。

4. 结果:更好的故事,相同的时间

作者在两种不同类型的文本生成机器人上测试了这种方法。

  • 设置: 他们选取了已经训练好的现有机器人。他们没有改变机器人的“大脑”或其写作方式,只是利用他们新的“漂移”方法改变了课程计划(训练目标)。
  • 结果: 当被限制在有限的步骤内写作(预算紧张)时,经过TokenDrift训练的机器人生成的文本质量显著提高。
    • 在一种类型的机器人上,与让机器人正常练习相比,文本质量提高了89%
    • 文本更加连贯,重复更少,且更有意义,尽管机器人采取的步数与之前相同。

总结

可以将TokenDrift视为一种辅导学生的新方法。这种方法不是仅仅告诉学生“更努力”(这是正常训练所做的),而是给他们一张磁性地图。它温和地将他们拉向好的范例,并将他们推离坏的范例,但它是通过一个“模糊透镜”来实现的,这使得学生能够在不陷入字母表僵化规则的情况下理解方向。

这篇论文证明,你可以通过改变训练方式,使这些文本生成机器人变得更加高效且高质量,而无需构建全新的机器人或给予它们更多的思考时间。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →