← 最新论文
💬 NLP

Mask-Aware Policy Gradients for Diffusion Language Models

本文介绍了掩码感知策略梯度(Mask-Aware Policy Gradients),这是一种将掩码扩散语言模型生成形式化为两阶段决策过程的强化学习框架,通过联合优化标记选择与位置掩码,从而克服了对数似然不可解的问题,并在数学推理和编程基准测试中达到了最先进的性能。

原作者: Haran Raajesh, Kulin Shah, Adam Klivans, Philipp Krähenbühl

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Haran Raajesh, Kulin Shah, Adam Klivans, Philipp Krähenbühl

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人如何写故事或解决数学题。长期以来,教机器人的最佳方式是让它像人类在键盘上打字一样,一次写一个词。这被称为“自回归”(autoregressive)生成。这种方法很可靠,但也很慢,就像蜗牛横穿高速公路一样。最近,科学家们发现了一种更快的办法,叫做“扩散”(Diffusion)。扩散模型不再是从头开始书写,而是从一页写满空白掩码(比如 [MASK])的页面开始,逐渐填补这些空格,逐一揭示单词,直到句子完整。这就像一个拼图游戏,你从一张被遮盖的图片开始,然后慢慢揭开遮盖物,露出图像。

然而,通过奖励(一种被称为“强化学习”的技术)来教这些快速的“扩散”机器人变得越来越聪明,一直是一场噩梦。在旧有的“逐词”方法中,很容易精确计算出机器人做出某个特定选择的可能性。但在“扩散”方法中,机器人在每一步都会做出两个选择:它既要决定在空白处填入什么词,也要决定下一步要揭开哪个空白处。以往的方法试图通过只关注第一个选择(单词)来教机器人,而忽略了第二个选择(揭开的顺序)。这就像是在教一位厨师烹饪完美佳肴时,只通过评价他们挑选的食材来给予批评,却完全忽略了他们切菜和搅拌的顺序。

这篇发表在 COLM 2026 会议上的论文指出,我们一直遗漏了拼图中的一个巨大部分。作者 Haran Raajesh、Kulin Shah 以及他们在德克萨斯大学奥斯汀分校的团队认为,要真正掌握扩散艺术,你必须同时奖励机器人对于“选对词”和“选对揭开顺序”的表现。他们开发了一种名为“掩码感知策略梯度”(Mask-Aware Policy Gradients)的新方法。该系统不再仅仅是猜测下一个词,而是将“下一个要揭开哪个掩码”的决策视为机器人策略中至关重要的一部分。通过在数学上将学习过程分解为这两个截然不同的部分,他们发现机器人学习得更快,且犯错更少。

实验结果非常令人印象深刻。当他们用这种新方法测试困难的数学题和编程挑战时,机器人的解题能力显著提升。在一项名为 GSM8K 的著名数学测试中,他们的方法达到了 87.1% 的准确率;而在一项编程测试 MBPP 中,达到了 53.4%。这些数字高于以往任何尝试利用奖励来训练扩散模型的方法。这篇论文表明,通过关注“掩码”决策——即机器人揭示其思路的顺序——我们可以解锁这些快速、灵活的 AI 模型的新高度,使它们不仅速度更快,而且更加聪明。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →