← 最新论文
🤖 machine learning

LaDi-RL: Latent Diffusion Reasoning Prevents Entropy Collapse in Reinforcement Learning

本文提出了LaDi-RL,这是一种利用潜在扩散模型生成结构化推理轨迹、并采用分层潜在 - 文本 rollout 将潜在规划质量与文本解码错误解耦的强化学习框架,从而防止熵崩溃,并在代码和数学推理任务上显著优于传统的 token 级强化学习。

原作者: Haoqiang Kang, Yizhe Zhang, Nikki Lijing Kuang, Yi-An Ma, Lianhui Qin

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Haoqiang Kang, Yizhe Zhang, Nikki Lijing Kuang, Yi-An Ma, Lianhui Qin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教导一位非常聪明但略显固执的学生(一个大语言模型)如何解决复杂的谜题,比如编写计算机代码或解答高等数学问题。

长期以来,教导这位学生的最佳方法一直是强化学习(RL)。这就像一场游戏:学生尝试解决问题,如果答对了,就会得到一颗金星;如果答错了,就会收到“再试一次”的反馈。

然而,这种旧的教学方式存在一个重大缺陷。它强迫学生一次只思考一个词。这就像要求一位主厨在规划整场宴会时,只能决定接下来要切哪一种食材。

  • 问题所在:学生陷入对细枝末节的关注(例如纠结是用“因此”还是“所以”),而忘记了大局。他们开始反复重复同样的几种策略,忽略了其他巧妙的解题方法。在论文中,这种现象被称为**“熵崩溃”**。这就像一个学生无论何时都只学会用加法来解决数学题,即使减法或乘法会更快。最终,他们停止尝试新事物,创造力随之枯竭。

新想法:LaDi-RL(“做梦”的学生)

这篇论文的作者提出了 LaDi-RL,这是一种不同的教学学生方法。他们不再让学生逐词决定,而是让学生先在隐藏的抽象空间中**“梦”**出整个解决方案,然后再将其写下来。

以下是其工作原理,使用一个简单的类比:

1. “蓝图”与“房屋”

  • 旧方法(词元级):学生一块砖一块砖地建造房屋,每走一步都要决定每一块砖的颜色。如果早期出现失误,整栋房子可能会歪斜。
  • 新方法(潜在扩散):学生首先在脑海中绘制一张蓝图(即“潜在轨迹”)。这张蓝图代表解决方案的逻辑策略,而非具体的词语。
    • 可以将这张蓝图想象为一个“思维云”。它是想法的一种连续、流动的表征。
    • 学生使用一种称为扩散模型的特殊工具。想象这个工具像一位雕塑家,从一块黏土(随机噪声)开始,慢慢剔除多余部分,直到一尊完美的雕像(解决方案策略)显现出来。这使得学生能够在承诺任何具体词语之前,探索多种不同的策略类型(例如,“让我们试试几何”与“让我们试试代数”)。

2. “翻译”问题

这里有一个陷阱。学生的“梦”(蓝图)是用他们理解的秘密语言写成的,但最终答案必须用 plain English(或代码)书写。

  • 风险:有时学生拥有绝妙的蓝图,但“翻译器”(将蓝图转化为文本的部分)搞砸了翻译。如果学生得了低分,我们如何知道是想法本身不好,还是仅仅翻译出了问题?
  • 解决方案(分层 rollout):论文引入了一种巧妙的修复方法。与其仅基于一份翻译来评判蓝图,学生会为同一张蓝图生成多份翻译
    • 类比:想象一位厨师有一份绝佳的食谱(蓝图)。与其只烹饪一次并评判这道菜,不如将其烹饪五次。如果五道菜中有四道美味可口,我们就知道食谱是好的,即使有一道菜是意外烧焦的。这为教师提供了更清晰的信号,以判断学生的策略是否真正聪明。

3. 保持多样性

为了确保学生不会偷懒而固守某一种蓝图,作者添加了一种**“排斥力”**。

  • 类比:想象一群探险者试图寻找宝藏。如果他们都跟随同一条路径,可能会错过隐藏的洞穴。“排斥力”就像一种温和的推动,说道:“嘿,你离朋友太近了!去探索不同的方向吧!”
  • 这迫使生成的蓝图在结构上彼此不同,确保他们探索各种各样的解决方案。

他们发现了什么?

论文在两项严峻的挑战上测试了这种新方法:编写代码解决数学问题

  • 更高的准确率:与旧的“逐块建造”学生相比,“做梦的学生”(LaDi-RL)在第一次尝试中就正确解决了更多问题。
    • 在编程方面,准确率提高了9.4%
    • 在数学方面,准确率提高了5.7%
  • 更强的创造力:旧的学生最终停止尝试新事物(熵崩溃)。而新学生不断发现多样且富有创意的解决方案。即使被要求生成 100 个不同的答案,新学生的答案也都是独特且正确的,而旧学生的答案开始变得雷同且质量下降。
  • 效率:新学生不需要撰写成千上万字的“大声思考”来获取答案。他们将思维压缩成简短高效的“蓝图”,节省了时间和计算资源。

总结

LaDi-RL 改变了 AI 学习推理的方式。它不再强迫 AI 以微小、僵硬的步骤(逐词)进行思考,而是让 AI 先探索思想的景观(使用扩散过程),然后将这些思想转化为文字。这防止了 AI 陷入死胡同,保持其解决方案的多样性,并帮助它更准确地解决更难的问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →