← 最新论文
💬 NLP

d-TreeRPO: Towards More Reliable Policy Optimization for Diffusion Language Models

本文介绍了 d-TreeRPO,这是一个针对扩散语言模型的可靠强化学习框架,它通过树形结构 rollout、可验证的逐步奖励以及时序调度的自蒸馏,解决了奖励稀疏性和概率估计差距问题,并在多个推理基准测试中实现了显著的性能提升。

原作者: Leyi Pan, Shuchang Tao, Yunpeng Zhai, Zheyu Fu, Liancheng Fang, Minghua He, Lingzhe Zhang, Zhaoyang Liu, Bolin Ding, Aiwei Liu, Lijie Wen

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Leyi Pan, Shuchang Tao, Yunpeng Zhai, Zheyu Fu, Liancheng Fang, Minghua He, Lingzhe Zhang, Zhaoyang Liu, Bolin Ding, Aiwei Liu, Lijie Wen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人解决复杂的谜题,比如数独或数学题。这个机器人使用一种名为**扩散大语言模型(dLLM)**的特殊“大脑”。与那些像打字一样逐字生成答案的普通机器人不同,这个机器人从一个空白且混乱的页面开始,逐渐进行“去噪”,以混乱、非线性的顺序逐步揭示正确的词语,直到完整的解决方案呈现出来。

这篇论文介绍了一种名为d-TreeRPO的新训练方法,旨在让该机器人变得更聪明、更可靠。以下是其工作原理的简单概念分解:

1. 问题:“蒙眼”的机器人

作者指出,现有的训练这些机器人的方法存在两个主要缺陷:

  • “全有或全无”的奖励: 目前,如果机器人解开了谜题,它会获得高分;如果失败,则得零分。它不知道具体哪一步是好是坏。这就像玩电子游戏,只有在结束时才出现“游戏结束”画面,没有任何提示说明是哪个操作导致了失败。这使得学习过程既缓慢又不准确。
  • “困惑”的概率: 由于机器人可以按任意顺序揭示词语,很难精确计算它对某个特定词语的置信度。现有方法会猜测这种置信度,但这种猜测往往出错,导致机器人做出糟糕的决策。

2. 解决方案:“树状探索者”(d-TreeRPO)

为了解决这个问题,作者构建了一个名为d-TreeRPO的框架。你可以把它想象成给机器人提供了一张地图和一个放大镜。

A. 树状结构(地图)

d-TreeRPO 不再让机器人只猜测一条通往答案的路径,而是让它同时探索多条路径,就像树上的分支一样。

  • 树干: 起始问题。
  • 树枝: 机器人尝试不同的方式来填充谜题。
  • 树叶: 最终答案。

如果某条分支通向死胡同(错误的答案),机器人就能确切地知道是在该分支的哪个位置出错了。然后它可以“爬回”树的上层,并说:“好吧,那个特定的步骤是错的。”这为机器人的每一个步骤提供了细粒度的反馈,而不仅仅是最终结果。

B. 自蒸馏损失(“置信度教练”)

这是第二个主要创新。作者注意到一个棘手的权衡:

  • 如果机器人太好奇(置信度低),它会探索许多想法,但会做出草率的猜测。
  • 如果机器人太固执(置信度高),它猜测得准确,但会停止尝试新事物。

d-TreeRPO 使用时间调度的自蒸馏损失来管理这一平衡。想象一位教练,根据训练营的不同日期以不同的方式与机器人交谈:

  • 早期阶段: 教练说:“保持好奇!尝试一切!不要担心完美。”这鼓励机器人去探索。
  • 后期阶段: 教练说:“既然你已经看到了各种选项,现在要果断!坚持最佳行动并相信你的直觉。”这迫使机器人变得更加自信和精确。

通过缓慢地将机器人从“好奇的探索者”转变为“自信的专家”,该方法确保了机器人的内部数学(概率估计)随时间推移变得更加准确。

3. 结果:更智能的求解

作者在四种不同类型的谜题上测试了这种新方法:

  1. 数独(逻辑网格)
  2. 倒计时(通过数学运算组合数字)
  3. GSM8K(小学数学应用题)
  4. Math500(较难的数学问题)

结果:
使用 d-TreeRPO 训练的机器人相比之前的版本有了巨大的提升。

  • 数独上,它提升了86%(成功率几乎翻倍)。
  • 倒计时上,它提升了51%
  • 在数学基准测试中也取得了稳固的进步。

核心结论

该论文声称,通过将机器人的学习过程组织成树状结构(以获取对每一步更好的反馈),并利用基于时间的教练系统(以平衡好奇心与置信度),他们创造了一种更可靠的方法来教导扩散语言模型如何进行推理。其结果是一个在解决逻辑和数学谜题方面显著优于以往的机器人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →