← 最新论文
🤖 machine learning

β\beta-OPSD: Deriving with Policy Optimization, Training with Self-Distillation

本文介绍了 β\beta-OPSD,这是一个将 KL 惩罚权重 β\beta 视为可调参数的原则性框架,通过对 logits 进行混合来近似参考模型与教师模型之间的最优策略插值,从而实现了高效训练,并显著提升了相比于原生 OPSD 的稳定性和推理性能。

原作者: Jiawei Xu, Minghui Liu, Juzheng Zhang, Tom Goldstein, Furong Huang

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiawei Xu, Minghui Liu, Juzheng Zhang, Tom Goldstein, Furong Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人解决一道棘手的数学题。你有两种方法可以帮助它学习。第一种方法是让机器人尝试、失败,然后向它展示完美的解法,并要求它记住每一个步骤。这就像是一个学生在抄袭老师的作业。第二种方法是让机器人尝试,然后使用一位能看到答案解析的“超级教师”,对机器人写的每一个词进行即时反馈。这被称为“在策略自我蒸馏”(on-policy self-distillation)。这种方法非常强大,因为教师会针对机器人的具体错误做出反应。但问题在于,这种方法通常很脆弱。如果你过度逼迫机器人去模仿超级教师,它可能会感到困惑,忘记已有的知识,并开始胡乱猜测。这就像一个学生为了完美模仿天才而失去了自己的声音,不再独立思考。科学家们想知道:我们如何在不破坏学生自信心的前提下,获得超级教师带来的好处?

一篇新论文介绍了一个聪明的解决方法,称为 β-OPSD。研究人员意识到,使用超级教师的标准方式实际上只是一个更大范畴方法中的一个极端设置。他们发现了一个控制变量(称为 β),这个变量控制着机器人应该在多大程度上听从超级教师,以及在多大程度上坚持自己的现有风格。他们并没有强迫机器人直接跳跃到教师的水平,而是发现了一种方法,可以在机器人的现状与超级教师之间建立一条平滑的路径。他们还解决了第二个问题:当机器人在句子中间犯错时,这会影响后面所有的词。旧的方法只关注眼前的错误,但新方法则会观察整个过程,根据早期词汇如何塑造了最终结果来给予奖励(或惩罚)。通过结合平滑的学习路径和“前瞻性”信用分配系统,机器人学习得更加稳健,解决数学问题的能力也比以前更强。

问题所在:“太难”的老师

在人工智能领域,让模型变得更聪明通常涉及到一个过程,叫做在策略自我蒸馏。想象一下一个学生(AI 模型)正在写故事或解决数学题。当它书写时,一位“特权教师”(一个更聪明或者拥有答案解析的模型)会在一旁观察并说:“不,这个词应该是那个。”然后学生会尝试模仿教师的选择。

问题在于,这位老师好了。如果学生试图立即模仿教师的完美答案,这就像是在学会走路之前就尝试跑马拉松。学生会被压垮,学习过程变得不稳定,机器人可能会开始做出奇怪、随机的错误。研究人员发现,标准的方法本质上是在强迫学生从一开始就完全匹配教师,这是一种非常脆弱的学习方式。

解决方案:一条平滑的学习曲线

来自马里兰大学的 Jiawei Xu、Minghui Liu 及其团队提出了一个新的思考方式。他们意识到,标准的方法只是更广泛学习策略中的一个特定设置。他们引入了一个变量 β (beta),它就像是一个调节教师指导强度的音量旋钮。

  • 当 β 较低(或为 1)时: 学生尝试完全复制教师。这是旧的、脆弱的方式。
  • 当 β 较高时: 学生被允许更接近于自己当前的风格,只是缓慢地向教师的风格漂移。

论文表明,完美的学习方式并不是直接跳向教师。相反,最好的路径是几何插值。想象一下这就像是一个 GPS 路线。旧的方法试图将学生直接传送(teleport)到教师的位置。而新方法 β-OPSD 则在学生当前的位置和教师的位置之间画出了一条平滑的道路。

随着训练的进行,研究人员会对 β 的值进行“调度”。他们从一个非常接近学生的目标开始(安全且容易),然后逐渐将目标转向更像教师(具有挑战性且聪明)。这就像是一个视频游戏,从“简单”模式开始,然后逐渐提升到“困难”模式,而不是在第一天就把玩家扔进最高难度关卡。

秘诀:向前看

这里还有一个谜题的碎片。在旧的方法中,当学生在句子的第一个词上犯错时,系统只会责怪那个特定的词。但在语言中,第一个词会改变后续所有词的语境。如果你以“The cat”(那只猫)开头,下一个词很可能是“sat”(坐下)或“ran”(跑),而不是“pizza”(披萨)。

研究人员意识到,旧的方法是“近视”的(myopical)。它没有意识到早期的错误可能会毁掉整个句子。为了解决这个问题,他们加入了回报增量信用分配(return-to-go credit assignment)。

想象你在玩国际象棋。如果你在第 3 步走了一步烂棋,你可能直到第 20 步才会输掉比赛。旧的方法只会责怪第 20 步。而新方法会回溯并说:“嘿,第 3 步才是真正的问题,因为它导致了这场灾难。”通过根据早期词汇如何影响最终结果来给予信用(或惩罚),模型学会了从第一个词开始就更加谨慎。

研究发现

团队在数学推理基准测试(这相当于 AI 的数学奥林匹克)上测试了这种新的 β-OPSD 方法。他们使用的模型规模从小型(17 亿参数)到大型(80 亿参数)不等。

结果非常理想。在 Qwen3-1.7B 模型上,与旧方法相比,新方法在 AIME 2024 数学竞赛中的平均得分提高了 9.16 个百分点。它在 AIME 2025 和 HMMT 2025 等其他高难度测试上也看到了进步。即使在较大的模型上,新方法也始终优于旧的方法,这表明平滑的学习路径和“前瞻性”信用分配系统无论模型大小都同样有效。

研究人员指出,这种方法提供了一条从简单模仿到复杂优化的“原则性路径”。它不需要昂贵、缓慢的强化学习技巧;相反,它利用了策略优化的智能数学逻辑,创造了一种更好、更便宜且更稳定的方式,来教导 AI 模型如何进行推理。通过将一个僵化、脆弱的过程转变为一段平滑、受引导的旅程,他们让机器人成为了一个更好的学生。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →