← 最新论文
🤖 machine learning

Off-Policy Learning to Reason Works Because It Is More Pessimistic Than You Think

本文认为,大语言模型大规模强化学习中离线策略学习的成功源于一种隐式的悲观主义,该悲观主义优化了更为保守的目标策略,并提出了一种 principled 的修正方法以稳定这种诱导分布,从而提升性能。

原作者: Otmane Sakhi, Aleksei Arzhantsev, Imad Aouali, Flavian Vasile

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Otmane Sakhi, Aleksei Arzhantsev, Imad Aouali, Flavian Vasile

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一名学生(一个 AI 模型)如何解决复杂的数学问题。你给它们一套练习题,并根据它们的表现给出一个“分数”。目标是帮助它们从这些分数中学习,以便在未来更好地解决问题。

本文解决了一个在大规模训练这名学生时会出现的具体问题:这名学生正在从过时的作业中学习。

问题:从“陈旧”的作业中学习

在大型 AI 的现实世界中,生成新的练习题需要很长时间。当 AI 完成一批问题并获得分数时,“老师”(AI 当前的大脑)已经发生了一些变化。因此,AI 是在由它自己稍早、略有不同的旧版本所收集的数据上进行训练。

在 AI 领域,这被称为离策略学习(Off-Policy Learning)。数据来自“过去的自我”,但学习却发生在“当前的自我”身上。

大多数现有方法试图通过使用复杂的数学“校正因子”(就像一个强硬的翻译)来强行修正这种不匹配,假装旧数据实际上是新的。作者认为这种做法很混乱。它会引入高噪声,使训练不稳定,并可能导致 AI“恐慌”并忘记如何发挥创造力(这种现象称为熵崩溃)。

替代方案:拥抱不匹配

与其试图强行让旧数据看起来像新数据,作者建议:直接使用旧数据,但改变我们解读分数的方法。

他们研究了一种流行的方法,称为OAPL(该方法跳过了复杂的校正因子),并问道:“这种方法实际上对 AI 的大脑做了什么?”

发现:“悲观”的老师

作者发现,当你不使用那些校正因子进行训练时,AI 不仅仅是在忽略不匹配;它实际上变得悲观了。

这里有一个类比:

  • “乐观”的老师(标准方法): 如果 AI 在某一道特定的数学题上得了满分,乐观的老师会说:“哇!这是解决它的唯一方法!忘掉其他一切,永远照做!”这很危险。如果那个满分只是一个偶然或奇怪的边缘情况,AI 就会陷入僵局,停止学习任何新东西。
  • “悲观”的老师(本文的方法): 悲观的老师看到满分时会说:“好吧,这是一个很好的解决方案。让我们尝试这样做,但不要把所有赌注都压在上面。让我们保留一些其他的想法,以防万一。”

在数学上,作者发现这种“悲观”行为遵循一条特定的曲线,称为朗伯函数(Lambert function)。当 AI 看到高分时,它的信心不会像火箭一样呈指数级爆炸,朗伯函数则像一个减震器。它允许 AI 进步,但防止它过度承诺于单个可能 flawed(有缺陷)的高分示例。

为什么旧方法“意外地”有效

本文解释了现有 OAPL 方法中一个令人困惑的怪癖。理论上,数学表明 AI 应该处于一个危险且不稳定的区域。但在实践中,工程师必须调整一个设置(改变一个“温度”数值)才能让它正常工作。

作者意识到,这种调整并非随机的修复;它意外地将 AI 推入了“悲观”区域。它是手动迫使 AI 变得不那么激进,更加稳定。

解决方案:一个简单、有原则的修复

与其依赖工程师去猜测正确的“温度”调整,作者提出了一个简单的、内置的规则:将平均分向上微调一点点。

可以这样理解:

  • 旧方法: “这是你的分数。如果它高于群体平均分,你就获得奖励。”(这可能不稳定)。
  • 新方法: “这是你的分数。我们将假装平均分实际上略高于真实值,因此你的奖励计算得更加保守。”

这种简单的偏移保证了 AI 自动保持在“悲观”(安全)区域。它不需要复杂的调整。

结果

作者将这种新方法与旧方法进行了测试:

  1. 稳定性: 当“作业”非常陈旧(数据过时)时,旧方法会崩溃,或者 AI 停止发挥创造力。而新方法则能平稳运行。
  2. 鲁棒性: 当“改变多少”的规则变得非常严格(正则化很小)时,旧方法失败了,但新方法继续进步。

核心结论

本文表明,离策略学习之所以有效,并不是因为它忽略了过去,而是因为它自然地变得“悲观”和谨慎。 通过理解这一点,作者创建了一个简单的规则,使 AI 训练更加稳定,更不易崩溃,并且更能处理旧数据,而无需复杂的数学校正。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →