← 最新论文
💬 NLP

Learning from the Self-future: On-policy Self-distillation for dLLMs

本文介绍了 d-OPSD,这是首个专为扩散大语言模型(dLLMs)定制的在策略(on-policy)自蒸馏框架,它通过利用自生成的后缀条件化和步级监督,实现了比现有基准模型更优越的性能和样本效率。

原作者: Yifu Luo, Zeyu Chen, Haoyu Wang, Xinhao Hu, Yuxuan Zhang, Zhizhou Sha, Shiwei Liu

发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Yifu Luo, Zeyu Chen, Haoyu Wang, Xinhao Hu, Yuxuan Zhang, Zhizhou Sha, Shiwei Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:教机器人如何“倒着思考”

想象你有一个非常聪明的机器人(一种扩散大语言模型,简称 dLLM),它正在尝试学习如何解决复杂的谜题,比如数学题或数独。

通常情况下,机器人的学习方式是读到一个问题,然后从左到右一个词一个词地猜出答案。但这个特定的机器人不同。它更像是一个从大理石块开始创作的雕塑家。它面对的是一个空白的画布(一系列“掩码”序列),然后通过慢慢凿去噪声,一次性或以大块的形式揭示出答案,而不是逐字逐句地生成。

问题在于,这个机器人还在学习阶段。研究人员希望教它变得更强,而不需要人类老师或一个超级聪明的“导师”机器人。为此,他们创造了一种名为 d-OPSD 的新方法。

旧方法的缺陷

过去,如果你想通过“自我蒸馏”(Self-Distillation,即自我教学)来教机器人,你必须使用为“逐词生成型”机器人设计的方案。

  • 旧的方法: 你给机器人一个问题,然后展示正确答案的开头部分(就像在句首给一个提示),然后对它说:“好了,现在把剩下的部分写完。”
  • 为什么在这里行不通: 我们的“雕塑家”机器人并不是从左向右工作的。它可以观察答案的末尾,从而推导出开头的逻辑。旧的方法就像是在教一个人画画时,只给他看左上角的一个角落;这并不符合这个机器人同时观察全局的独特工作方式。

解决方案:“向自我未来学习”

研究人员发明了一种新的教学方式,称为 d-OPSD。以下是它的工作原理,我们使用“时间旅行”来做类比:

1. 时间旅行老师

想象机器人是一个正在参加考试的学生。

  • 学生: 机器人尝试从零开始解决问题。它会生成一个完整的答案,但可能会犯一些错误。
  • “未来”老师: 研究人员并没有去看答案的开头,而是提取了机器人自己生成的最终答案(即使是不完美的),并将其作为来自“未来”的提示展示给机器人。
  • 神奇之处: 他们告诉机器人:“想象你已经知道答案了。现在,看着你刚刚写下的这个答案,试着搞清楚你是如何得到它的。”

这就是所谓的**“向自我未来学习”(Learning from Self-Future)**。这就像人类的白日梦:“如果我知道接下来会发生什么,我会如何开始这段对话?” 通过观察“未来”(完成后的答案)来引导“过去”(生成过程),机器人能更快地掌握自己的思维模式。

2. 循序渐进的教练

旧的教学方法是逐词检查机器人的作业(就像老师一个字母一个字母地纠正句子)。

  • 新方法: 由于我们的机器人是在“步骤”中工作的(通过凿去噪声),新方法就像一位教练,会在雕塑过程中的每一个特定步骤检查机器人的进度。
  • 教练不会说:“这个词错了”,而是会说:“在这个特定的处理阶段,你揭示下一个答案块的计划与‘未来’版本相比,稍微有些偏差。”

为什么这很重要

研究人员在四个困难的推理任务(数学、数独等)上测试了该方法,并发现了两个惊人的结论:

  1. 效率极高(样本效率):
    想象你在训练一只狗。旧的方法(RLVR)就像是扔了一千次球,然后寄希望于狗能接住。而新方法(d-OPSD)就像是展示了球的飞行路径,让狗只需经过 100 次投掷就能学会这个技巧。论文声称,在达到同等智能水平时,该方法所需的训练步骤仅为其他方法的约 10%

  2. 更聪明:
    因为机器人是在向自己的“未来”答案学习,它能发现一些仅靠盲目猜测无法发现的新思维方式。它不仅仅是在记忆,而是在理解解题的模式

注意事项

论文也提出了一个小警告。像任何高强度的训练一样,如果你过度压榨机器人,它有时会变得混乱并出现“崩溃”(即重新开始给出糟糕的答案)。这是这类学习中已知的问题,但该方法相对于以往的方法仍是一次巨大的进步。

总结

这篇论文介绍了一种用于训练“雕塑家风格”AI模型的全新方法——d-OPSD。它不再通过“过去”逐词教学,而是让模型通过观察自己完成后的“未来”答案来学习如何解决问题。这就像是给了模型一台时光机,让它通过复盘自己的作品,从而比以往更快、更深层地学习。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →