← 最新论文
🤖 machine learning

Predictive Divergence Masks for LLM RL

本文提出了预测散度掩码(Predictive Divergence Masks),这是一种用于大语言模型强化学习的新方法,它通过闭式预测下一个梯度步会增加还是减少用于邻近性准则的概率散度,从而取代了 PPO 基于比例的方向准则,进而提升了不同模型规模下的训练稳定性和性能。

原作者: Xiangxin Zhou, Jiarui Yao, Penghui Qi, Bowen Ping, Jiaqi Tang, Haonan Wang, Tianyu Pang

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiangxin Zhou, Jiarui Yao, Penghui Qi, Bowen Ping, Jiaqi Tang, Haonan Wang, Tianyu Pang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个超级聪明的机器人写故事。你想让它从错误中学习,但你有一个严格的规则:“不要在一次操作中过于剧烈地改变你的写作风格。”如果机器人变得过于兴奋,开始用一种完全不同的口吻写作,你就必须踩下刹车。这就是大型语言模型(LLM)中**强化学习(RL)**的工作。

长期以来,按下这些刹车的标准方法是名为 PPO 的方法。它就像一个基于单个词语的简单交通灯。每当机器人选择一个词时,系统都会检查:“这个词是否比机器人通常选择的词概率高得多?而且奖励是否在告诉我们要让它变得更频繁吗?”如果答案对两个问题都是“是”,系统就会说:“停!这太远了!”并忽略掉这个词带来的教训。

但问题在于,机器人不仅仅是挑选一个词;它是在重新调整其整个“人格”(概率分布)来挑选那个词。旧的方法只关注它所选的那个特定词,就像通过听一支小提琴来评判整个管弦乐队。它忽略了其他音乐是如何变化的。

新的想法:预测性散度掩码(Predictive Divergence Mask)

来自腾讯、伊利诺伊大学香槟分校(UIUC)和新加坡国立大学(NUS)的研究团队意识到,这种单词视角具有误导性。他们提出了一种新规则,称为预测性散度掩码

与其只看机器人选出的那一个词,这种新方法会问一个更大的问题:“如果我们采取这一步,机器人的整个‘人格’是否会进一步偏离它原本的自我?”

可以这样理解:

  • 旧的方法 (PPO): 你看到一个孩子正跑向悬崖。你检查那一步是否危险。如果是,你就大喊“停!”
  • 新的方法 (预测性散度): 你看到孩子在跑。你观察整个路径。即使这特定的一步看起来没问题,也许孩子的惯性正要把他们甩出去,导致他们滑向另一个不同的悬崖。新方法会在这一步发生之前,预判出整个“旋转”的过程。

它是如何工作的(神奇的数学)

研究人员发现了一个聪明的数学技巧,可以在不实际运行模拟的情况下预测这种“整体旋转”。

  1. 局部项(The Local Term): 这是旧方法已经掌握的部分。它是机器人所选的具体词的变化。
  2. 全局项(The Global Term): 这是新的秘密武器。它解释了改变一个词如何迫使机器人调整所有其他未被选中词的概率(因为总概率必须始终等于 100%)。

旧方法忽略了全局项。新方法将其累加。如果数学计算显示机器人的整个“人格”正在偏离得太远,掩码就会阻断这次更新。如果数学显示机器人实际上正在向安全区域“回归”,则允许更新。

“Top-K” 问题

现实世界中存在一个问题:机器人的引擎(生成引擎)为了节省时间和内存,只会展示概率最高的 20 个词(即“Top-K”)。它隐藏了数千个其他词组成的“尾部”桶。

为了让他们的预测在有限的视野下也能奏效,研究人员发明了两个轻量级的估计器:

  • 聚合尾部估计器(Aggregated-Tail Estimator): 假装所有隐藏的词都是一个巨大的整体。
  • 均匀尾部估计器(Uniform-Tail Estimator): 假装这些隐藏的词都是等概率的。

他们发现,由于前 20 个词通常占据了几乎所有的概率(超过 99%),这两种方法的效果几乎完全相同。这就像是通过观察天空来猜测天气;你不需要数清每一朵云才能知道是否会下雨。

实验结果表明

该团队在不同规模的机器人(参数量从 40 亿到 300 亿不等)上进行了测试,甚至在它们以“FP8”精度(一种超快、略低精度的数学模式,使训练和生成引擎表现不同)运行时也进行了测试。

  • 结果: 新的掩码使训练更加稳定
  • 证据: 他们运行了 61 组不同的实验(种子)。他们发现旧方法有时会保留那些实际上让机器人偏离得更远的更新(“不安全保留”率为 36.9%)。新方法将其降低到了 34.2%
  • 改进: 虽然这些数字看起来很小,但在训练巨型 AI 模型的世界里,防止哪怕几次错误的步骤也有助于机器人学得更好、更快。新方法在所有模型规模和精度设置下都表现一致。

他们明确拒绝的内容

论文非常清楚地说明了哪些方法效果不佳

  • 他们反对使用采样 Token 重要性比例(即旧的“单支小提琴”检查)来决定更新的方向。他们证明了这种单词检查经常与机器人整个人格的真实变化不一致。
  • 他们还表明,仅仅收紧“安全区”(信任区域)(例如将阈值从 0.15 降至 0.05)会让一切表现得更差,这表明仅仅变得更“受限”并不是答案;变得更“聪明”地判断方向才是关键。

他们有多确定?

作者基于实验中的测量数据对自己的发现充满信心。他们不仅仅是在真空环境下进行模拟;他们在真实的数学问题上训练了实际的模型(使用 DAPO-Math-17k 数据集),并在 AIME24 和 AIME25 等基准测试上测量了准确率。

他们认为这种方法实现了更好的规则对齐:如果你通过观察整个人格(散度)来定义安全区,你也应该通过观察整个人格来检查更新的方向,而不是只看单个词。结果表明,这会导致更稳定的训练,但他们也承认这仍然是一个“局部一阶近似”——这意味着它是一个基于即时下一步的极佳预测,而非对整个未来的完美预知。

简而言之,新方法就像是给了机器人一个 GPS,它能观察整张地图,而不仅仅是看它当前迈出的那一小步。它帮助机器人在不脱离世界边缘的情况下学得更快。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →