← 最新论文
💬 NLP

SPG: Sandwiched Policy Gradient for Masked Diffusion Language Models

该论文针对扩散语言模型因对数似然不可解而难以应用强化学习对齐的问题,提出了一种利用对数似然上下界构建的“夹心策略梯度”(SPG)方法,有效克服了现有单侧近似带来的偏差,并在 GSM8K、MATH500 等多个基准测试中显著提升了模型性能。

原作者: Chenyu Wang, Paria Rashidinejad, DiJia Su, Song Jiang, Sid Wang, Siyan Zhao, Cai Zhou, Shannon Zejiang Shen, Feiyu Chen, Tommi Jaakkola, Yuandong Tian, Bo Liu

发布于 2026-04-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Chenyu Wang, Paria Rashidinejad, DiJia Su, Song Jiang, Sid Wang, Siyan Zhao, Cai Zhou, Shannon Zejiang Shen, Feiyu Chen, Tommi Jaakkola, Yuandong Tian, Bo Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 SPG(夹心策略梯度) 的新方法,旨在解决“扩散语言模型”(一种新型 AI)在通过“强化学习”(让 AI 从奖励中学习)变聪明时遇到的一个核心难题。

为了让你轻松理解,我们可以把整个过程想象成教一个正在玩“填字游戏”的 AI 如何解题

1. 背景:两种不同的“填字”方式

首先,我们要了解两种 AI 写文章(或解题)的方式:

  • 传统 AI(自回归模型): 就像写日记。它必须一个字一个字地写,写完第一个才能写第二个。虽然慢,但它很清楚自己写了什么,也知道“这句话的总概率”是多少。
  • 扩散模型(Diffusion Models): 就像玩“大家来找茬”或“填字游戏”。它一开始把整篇文章都涂成黑块(全是 [mask]),然后一步步把黑块擦掉,猜出原本的字。
    • 优点: 它可以并行工作,一下子擦掉好几个黑块,速度极快。
    • 缺点: 因为它是一步步“猜”出来的,它很难算出“我最终猜出这句话的总概率”到底是多少(数学上叫“不可计算的对数似然”)。

2. 问题:当 AI 需要“奖惩”时,它迷路了

为了让 AI 更擅长做数学题或逻辑推理,我们需要用强化学习(RL)。这就好比给 AI 一个评分表

  • 如果它答对了,给奖励(+1 分)。
  • 如果它答错了,给惩罚(-1 分)。

传统的做法(ELBO):
以前的方法为了绕过“算不出总概率”的难题,只用了一个**“下限估计”**(ELBO)。

  • 比喻: 想象你在教一个学生。
    • 当他做对题时,你告诉他:“你现在的表现至少有 80 分,继续加油!”(这是下限,鼓励他)。
    • 当他做错题时,你依然用这个逻辑:“你现在的表现至少有 80 分……"
    • 问题出在哪? 这里的逻辑是错的!如果你做错了,你希望分数越低越好(比如从 80 分降到 20 分),这样你才知道要改。但“下限估计”只能告诉你“至少 80 分”,它无法有效地告诉模型“你现在的表现太糟糕了,必须大幅降低概率”。这就导致模型在犯错时学不到东西,甚至越学越偏。

3. 解决方案:SPG(夹心策略梯度)

这篇论文提出的 SPG 方法,就像给 AI 老师配了一个**“三明治”评分系统**,专门用来处理“做对”和“做错”两种情况:

  • 当 AI 做对题(奖励高)时:
    • 策略: 使用**“下限估计”**(Lower Bound)。
    • 比喻: “你做得很好,我们保证你的表现至少有这么好,请继续保持!”(最大化下限,鼓励它)。
  • 当 AI 做错题(奖励低)时:
    • 策略: 使用**“上限估计”**(Upper Bound)。
    • 比喻: “你做得太差了,我们保证你的表现至多只有这么差,必须立刻改正!”(最小化上限,强力惩罚)。

为什么叫“夹心”?
因为真实的“总概率”就像夹心面包的馅料,它被夹在“下限”和“上限”这两片面包中间。

  • 对于好答案,我们推“下限”往上走。
  • 对于坏答案,我们推“上限”往下走。
  • 这样,无论好坏,模型都能得到准确且方向正确的反馈,就像被两片面包紧紧夹住,被迫向正确的方向移动。

4. 关键技术:分块掩码(Block-wise Masking)

为了让这个“夹心”评分更准确,作者还设计了一个**“分块擦除”**的技巧。

  • 以前的做法: 随机擦除几个字。这就像在填字游戏里,随机把几个字涂黑,AI 可能会感到困惑,因为上下文不连贯。
  • SPG 的做法: 把文章分成几块(比如每 32 个字一块)。在训练时,它保留前面的块是干净的,把后面的块全涂黑,只随机擦除当前正在处理的那一块
  • 比喻: 这就像老师教学生解题时,只遮住当前正在思考的那一行,而前面的步骤都清晰可见。这样 AI 在练习“猜字”时,看到的上下文更符合它实际生成时的样子,训练起来更稳定、更高效。

5. 成果:AI 变聪明了多少?

实验结果显示,使用 SPG 方法的 AI 在数学和逻辑推理任务上表现惊人:

  • GSM8K(小学数学题): 准确率提升了 3.6%
  • MATH500(高中数学题): 提升了 2.6%
  • Countdown(数字倒计时游戏): 提升了 18.4%(这是一个巨大的飞跃!)。
  • Sudoku(数独): 提升了 27.0%(几乎翻倍!)。

总结

简单来说,这篇论文解决了一个难题:如何让那种“一边擦除黑块一边猜字”的 AI,在通过“奖惩机制”学习时,不会因为算不清总分而学偏?

作者想出了一个**“夹心”策略**:

  • 做对了,用下限鼓励它;
  • 做错了,用上限惩罚它。
  • 再配合**“分块擦除”**的练习方法,让 AI 在数学和逻辑推理上变得更强、更准。

这就好比给 AI 老师配了一副**“双向眼镜”**,既能看到它的高光时刻,也能精准地指出它的低谷时刻,从而让它进化得更快。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →