← 最新论文
🤖 machine learning

PowerOPD: Stabilizing On-Policy Distillation with Bounded Power Transformation

PowerOPD 通过使用由 Box-Cox 幂变换导出的具有原生有界性和符号一致性的奖励族,取代了无界的对数比例奖励,从而解决了标准在策略蒸馏中严重的训练不稳定性和样本效率低下的问题,并在多个推理基准测试和模型对上实现了卓越的性能与效率。

原作者: Anhao Zhao, Junlong Tong, Yingqi Fan, Ping Nie, Wenjie Li, Xiaoyu Shen

发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Anhao Zhao, Junlong Tong, Yingqi Fan, Ping Nie, Wenjie Li, Xiaoyu Shen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图通过让一名才华横溢但缺乏经验的学徒(学生)观察一位大师级匠人(老师)的工作过程,来教他写作。

在大型语言模型(LLM)的世界里,这个过程被称为在策略蒸馏(On-Policy Distillation)。其目标是让学徒在练习自己生成的草稿时,学习老师的风格。

问题所在:“尖叫”的老师

标准的做法(称为 Vanilla OPD)是这样运作的:每当学徒写下一个词时,老师就会将其与自己会写的词进行比较。

  • 如果学徒选了一个老师喜欢的词,老师就会给高分。
  • 如果学徒选了一个老师讨厌的奇怪词汇,老师就会给低分。

缺陷: 论文指出,用于标准方法的“评分系统”是破碎的。这就像是一个老师,他不是给出温和的“0 到 10”的分数,而是使用了一个对数尺度,分数会剧烈波动,从 -50 到 +50

  • “稀有标记”陷阱: 如果学徒选了一个老师非常讨厌的极罕见词汇,分数会骤降至 -50。这一个单一的、罕见的错误会发出巨大的、尖叫般的信号,掩盖了整个教学过程。
  • 早期错误: 这些尖叫的分数主要出现在句子的开头。如果学徒在第一个词上就错了,老师的恐慌反应会毁掉整个句子,导致学徒陷入混乱的螺旋。
  • 结果: 学徒变得困惑,训练过程变得极其漫长,他们永远无法达到大师的水平。

他们曾尝试通过“裁剪”(Clipping,告诉老师冷静点)或“归一化”(Normalizing,取平均值)来修复这个问题,但这些方法就像是在断腿上贴创可贴。底层的数学逻辑依然是破碎的。

解决方案:PowerOPD(“受限”的老师)

作者提出了一种名为 PowerOPD 的新方法。它不再使用尖叫且无界的尺度,而是使用一种数学技巧(称为 Box-Cox 变换)来创建一个有界的评分系统。

可以这样理解:

  • 旧方法: 老师的声音是一个没有音量限制的麦克风。如果学生犯了一个小错,老师的尖叫声大到足以震破学生的耳朵。
  • PowerOPD: 老师的声音被限制在一个安全的最高音量内。即使学生犯了严重的错误,老师也只会说:“这很糟糕”,但音量永远不会超过一个安全的限度。

这个新系统拥有两个超能力:

  1. 有界性: 分数永远不会失控。它们保持在一个安全的范围内(例如 -1 到 +1)。
  2. 一致性: 它始终指向正确的方向。如果老师喜欢这个词,分数就是正的;如果老师不喜欢,分数就是负的。它永远不会在推向哪个方向上产生混乱。

结果:更聪明、更快、更冷静

作者在不同的 AI 模型规模上,针对数学问题测试了这种新方法。以下是发生的情况:

  • 更好的成绩: 学徒的学习速度更快,解决数学问题的能力也显著提升(相比旧方法,平均准确率提高了 6.37%)。
  • 更简洁、更干净的答案: 旧方法会让学徒喋喋不休,经常达到最大长度限制。PowerOPD 教会了学徒要言简意赅,给出更直接、更简短的答案。
  • 更廉价的训练: 由于训练过程如此稳定,它不需要运行那么久。与最昂贵的旧版本方法相比,它节省了 59% 的时间23% 的计算内存
  • “Alpha 旋钮”: 该方法有一个名为 Alpha (α) 的设置。调高这个旋钮会让老师更加专注。更高的 Alpha 值让学徒学习得更快、回答更简短,并让训练过程保持极其平滑(梯度噪声降低了 3,000 倍)。

核心结论

论文声称,旧的 AI 模型教学方式之所以失效,是因为其“奖励”(分数)过于狂野且不受控制。通过切换到这种全新的、数学上“有界”的评分系统,他们解决了不稳定性问题。这使得 AI 模型能够更高效地相互学习,以更少的时间和更少的计算资源获得更好的结果。

注:论文专门针对使用 Qwen3 模型的数学推理任务进行了测试。它并不声称这些结果适用于医疗诊断、创意写作或其他特定的现实世界应用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →