← 最新论文
📊 statistics

SR-OPSD: Self-Referenced On-Policy Self-Distillation

该论文提出了 SR-OPSD,一种新颖的自引用在策略自蒸馏框架,通过基于 Token 级的变分表征和 Rényi 散度将自适应蒸馏目标与投影几何解耦,从而稳定训练过程,并在多种大语言模型任务中实现了最先进的性能。

原作者: Zhuo Sun, Entong Li, Yanlong Zhao, Xiaoyuan Cheng, Wenxuan Yuan, Kaiyu Li, Che Liu, Huihang Liu, Harrison Bo Hua Zhu, Li Zeng

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhuo Sun, Entong Li, Yanlong Zhao, Xiaoyuan Cheng, Wenxuan Yuan, Kaiyu Li, Che Liu, Huihang Liu, Harrison Bo Hua Zhu, Li Zeng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人写故事或解数学题。你不仅希望机器人得到最终答案,更希望它学会如何一步步地思考。在人工智能的世界里,这通常是通过让机器人尝试、失败,然后在最后获得微小的“奖励”或“惩罚”来实现的。但这就像是一个学生在参加考试,结束后才发现自己得了“B”,却完全不知道是哪一句话或哪一步计算导致了失误。为了解决这个问题,研究人员使用了一种被称为“自我蒸馏”(self-distillation)的技巧。把这想象成机器人同时扮演两个角色:一个“学生”,负责尝试解决问题;以及一个“老师”(实际上是同一个机器人,但拥有额外的帮助或一个“经过验证的解决方案”),负责观察学生的每一个步骤并给出反馈。学生随后会尝试模仿老师的选择。

问题在于,这个老师并不是一个静态的、完美的向导。随着学生变得越来越聪明,老师也会随之改变,因为他们都是同一个不断进化的大脑的一部分。这就像是在试图击中一个移动的目标,而风向也在不断变化。如果学生过于僵化地模仿老师,他们可能会陷入循环,重复同样的错误,或者变得思维过于狭隘。这篇论文介绍了一种处理这种关系的新方法,称为 SR-OPSD。这种方法能帮助学生在不被移动的目标所迷惑的情况下向老师学习,它使用了一个特殊的数学“指南针”来保持学习的稳定性和有效性。

移动目标问题

在许多 AI 训练方法中,目标是通过让 AI 从自身的成功中学习来使其变得更聪明。论文首先探讨了一种名为“在策略自我蒸馏”(On-Policy Self-Distillation,简称 OPSD)的方法。想象一个学生正在考试。在 OPSD 中,学生写出一个答案,然后一个“自我老师”(即学生本身,但带着对正确答案的某种提示)会说:“嘿,这一部分你做得很好,但那个词用得有点不对。”学生随后会调整自己未来的回答,以匹配老师。

然而,这里有一个陷阱。老师不是一本固定的书;老师是学生的一个不断变化的变体。随着学生的学习,老师也在改变。如果你试图去模仿一个位置不断移动的老师,你可能会在原地摇摆不定,永远无法稳定在一个好的答案上。论文指出,仅仅使用标准的数学工具来匹配这个移动的老师,往往会导致不稳定。学生可能会过度专注于一种思维方式(失去创造力),或者被不断的改变搞得晕头转向。

新方案:固定锚点与灵活指南针

作者提出了一种名为 SR-OPSD(自我引用在策略自我蒸馏)的新方法。他们意识到,要停止这种摇摆,你需要两样东西:一个可以抓握的固定点,以及一个可以向目标移动的灵活方式。

  1. 固定锚点(参考策略): 学生不再仅仅盯着移动的老师,还会关注一个“参考”(Reference)。你可以把这想象成学生最初的、预训练时的自我——即在开始这项特定训练之前的版本。这个“参考”就像一座灯塔。即使老师(移动的目标)漂移了,学生也知道自己不应该离原本稳固的基础太远。新方法将老师的建议与这个“参考”相结合,创造出了一个既稳定又有效的“目标”。
  2. 灵活指南针(Rényi 散度): 一旦设定了目标,学生就需要一种向其移动的方式。论文使用了一种名为 Rényi 散度 的数学工具。你可以把它想象成一种特殊的“磁铁”或“指南针”,控制着学生被拉向目标的强度。
    • 如果磁铁太强,学生可能会迅速贴合目标,从而失去自己的特色。
    • 如果磁铁太弱,他们就学不到东西。
    • Rényi 工具的美妙之处在于它有一个“旋钮”(称为阶数 ρ\rho),可以让研究人员精确调节学生对自身当前答案与目标之间差异的反应程度。它允许学生根据任务需求,选择对细节保持敏感或忽略细节。

研究发现

研究人员在三种截然不同的任务上测试了这种新方法:

  • 科学问题: 回答关于化学、物理和生物的难题。
  • 数学推理: 解决那些步骤与答案同样重要的困难数学问题。
  • 编程: 编写能够实际运行的计算机程序。

他们将新方法 (SR-OPSD) 与旧方法进行了对比,例如标准的“反向 KL 散度”(Reverse KL,像是一个非常严厉的老师)和“Jensen-Shannon 散度”(一种更平衡但有时不稳定的老师)。

结果:

  • 稳定性: 在科学和数学测试中,旧方法往往起步很强,但随着时间推移表现却在变差,就像一个冲刺过快后倒下的跑步者。然而,SR-OPSD 却能持续稳步提升。例如,在物理基准测试中,新方法达到了 81.1 的准确率(使用特定的指标 Avg@16),而旧方法则在 79.4 或更低水平徘徊。
  • 数学精通: 在高难度数学竞赛(如 AIME 和 HMMT)中,新方法帮助 AI 正确解决了更多问题。例如,在 AIME 2025 测试中,与流行的基准方法 GRPO 相比,新方法将“通过率”(得到正确答案的比例)提高了 6.7 个百分点
  • 编程: 在教 AI 编写代码时,随着 AI 模型规模的增大,新方法的表现也更好。对于测试中最大的模型(Qwen3-8B),新方法达到了 50.1 的得分,超过了之前的最佳成绩 48.8

为什么这很重要

论文指出,让 AI 从自身错误中学习的秘诀不仅仅在于拥有一个更好的老师,更在于如何将学生与老师连接起来。通过将学习过程锚定在稳定的“参考”之上,并使用灵活的“指南针”(Rényi 散度),AI 可以在不感到困惑或迷失方向的情况下学习复杂技能。

作者发现,仅仅添加一个参考点是不够的;如果与错误的数学工具结合使用,反而会使情况恶化。但当他们将参考点与新的灵活指南针结合在一起时,在科学、数学和编程方面的表现始终更好。这表明,为了让 AI 真正掌握复杂的推理能力,它需要一种既能吸收新反馈的兴奋感,又能保持原始知识稳定性的训练方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →