← 最新论文
🤖 machine learning

GDSD: Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language Models

本文介绍了引导去噪器自蒸馏(GDSD),这是一种针对扩散语言模型的强化学习框架,它通过将优势引导的教师模型直接蒸馏至去噪器,从而绕过基于 ELBO 的似然代理的偏差,进而在推理基准测试中实现更稳定的训练和显著的性能提升。

原作者: Xiaohang Tang, Keyue Jiang, Che Liu, Qifang Zhao, Xiaoxiao Xu, Sangwoong Yoon, Ilija Bogunovic

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaohang Tang, Keyue Jiang, Che Liu, Qifang Zhao, Xiaoxiao Xu, Sangwoong Yoon, Ilija Bogunovic

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《GDSD:强化学习作为扩散语言模型的引导去噪器自蒸馏》的通俗解释,辅以生动的类比。

宏观图景:一种教导 AI 思考的新方法

想象你有一位非常聪明的艺术家(扩散大语言模型,即 dLLM),他擅长绘画,但很难按指令画出完美的杰作。你希望借助一位老师(强化学习)来教导他变得更好。

问题在于,这位艺术家的创作方式很奇特。与从左到右逐字书写的普通作家不同,这位艺术家是从一块布满静态噪声的空白画布开始,慢慢“去噪”,一次性猜测出最终画面的样子。由于这种独特的风格,传统数学老师用来给艺术家作品打分的方法(称为似然度)根本无法计算。这就像试图通过计算一种根本不存在的笔触数量来给画作打分。

由于数学行不通,以前的老师试图使用一种“最佳猜测”的估计值(称为ELBO)来给作品打分。但这造成了一个严重问题:老师是基于一套与艺术家实际作画方式不匹配的“假规则”来打分的。这导致艺术家感到困惑,进而表现不佳,甚至导致学习过程完全崩溃。

GDSD 是一种全新的教学方法,它通过彻底改变游戏规则来解决这个问题。它不再试图给画作的“概率”打分,而是直接告诉艺术家:“看看你刚才做了什么,看看‘完美’版本的它应该是什么样子,然后试着去匹配那个完美版本。”


核心问题:“假规则书”(训练 - 推理偏差,TIM Bias)

把旧方法(基于 ELBO 的强化学习)想象成一位教你开车的教练,但他教的是用坏掉的速度表开车。

  • 训练过程:教练告诉你:“根据这个坏掉的速度表,你现在的时速是 60 英里。”
  • 现实情况:当你实际上路驾驶(推理)时,汽车真实的速度表显示你只有 40 英里。
  • 结果:你感到困惑。你试图根据错误的数学逻辑驾驶,但汽车的反应并不像数学预测的那样。这种不匹配被称为训练 - 推理不匹配(TIM)。这就像试图通过在陆地上练习游泳(使用海洋地图)来学习游泳;一旦你真正跳进水里,就会沉下去。

该论文指出,以前的方法试图用复杂的数学来修复这个坏掉的速度表,但它仍然是一本导致 AI 失败的“假规则书”。

解决方案:GDSD(“完美复刻”法)

作者提出了GDSD(引导去噪器自蒸馏)。以下是其工作原理,借用雕塑家与杰作的类比来说明。

1. “自我导师”(优势引导的去噪器)

想象 AI 艺术家创作了一座雕塑(一句话)。

  • 如果雕塑很好(高奖励),导师会说:“太棒了!让我们为这座雕塑制作一个‘完美版本’。”
  • 如果雕塑很差(低奖励),导师会说:“太糟糕了。让我们制作一个与这个完全相反的‘完美版本’。”

这个“完美版本”就是导师。它是一个数学上的理想模型,确切知道 AI 为了获得高分应该产出什么。

2. “自蒸馏”(复制导师)

AI 不再试图计算那座雕塑的“概率”(这太难了),而是直接查看导师的完美版本,并尝试复制其形状。

  • 旧方法:“计算我正确制作这座雕塑的几率。”(太难,容易导致错误)。
  • GDSD 方法:“这是完美的雕塑。让你的下一座雕塑看起来和这个一模一样。”

这被称为自蒸馏。AI 正在将其自身“完美自我”(即导师)中的知识“蒸馏”到当前的自我中。

3. “无需归一化”的窍门(去除噪声)

在数学中,复制一个“完美版本”通常需要知道所有可能雕塑的总“体积”,这是一个无法计算的数字(归一化常数)。

  • 论文的窍门:他们意识到,如果你只看形状之间的差异(即 logits),而不是绝对大小,就不需要知道总体积。
  • 类比:想象你要模仿一首歌。你不需要知道音乐厅的总音量,就能知道歌手是否唱对了音符。你只需要匹配音高即可。GDSD 匹配的是“音高”(logits),而无需进行那个不可能的“音量”计算。

为什么这更好(结果)

该论文在两个强大的 AI 模型(LLaDA-8BDream-7B)上,针对三项困难任务测试了这种新方法:

  1. 规划:解决数独和倒计时等谜题。
  2. 数学:解决复杂的数学问题。
  3. 编程:编写计算机代码。

研究发现

  • 稳定性:旧方法就像过山车;AI 会学得快,然后崩溃并遗忘一切。GDSD 则像平稳的电梯;它稳步学习,不会崩溃。
  • 性能:GDSD 显著优于之前的最佳方法。
    • Dream-7B 模型上,它在规划任务上的准确率提高了高达 19.6%(这是一个巨大的飞跃)。
    • LLaDA-8B 模型上,它在所有数学、编程和规划基准测试中 consistently 提高了分数。

一句话总结

GDSD 不再试图计算那些不可能的数学概率来教导 AI,而是直接向 AI 展示一个它“本该做到”的“完美范例”,让 AI 直接复制该范例,从而使学习过程更快、更安全,且效果显著。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →