← 最新论文
🤖 machine learning

On the Geometry of On-Policy Distillation

本文将同策略蒸馏(on-policy distillation, OPD)的训练动力学刻画为一个独特的几何机制,该机制有别于监督微调和强化学习,揭示了 OPD 的更新会迅速锁定在一个特定的低维子空间中,而该子空间在功能上足以支撑其性能。

原作者: Zhennan Shen, Yanshu Li, Qingyu Yin, Chak Tou Leong, Zhilin Wang, Yanxu Chen, Rongduo Han, Sunbowen Lee, Yi R. Fung

发布于 2026-06-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhennan Shen, Yanshu Li, Qingyu Yin, Chak Tou Leong, Zhilin Wang, Yanxu Chen, Rongduo Han, Sunbowen Lee, Yi R. Fung

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图教一个学生(一个大型人工智能模型)如何解决复杂的数学问题。你有三种主要的方法可以做到这一点,而这篇论文就像一部侦探故事,旨在弄清楚在每种方法下,学生的“大脑”究竟发生了怎样的变化。

这三种方法分别是:

  1. SFT(监督微调): 老师给学生一本包含完美答案的教科书,学生通过背诵这些答案来学习。
  2. RLVR(强化学习): 学生尝试自己解决问题,在最后得到一个简单的“正确!”或“错误!”的反馈,并根据结果进行学习。
  3. OPD(在策略蒸馏): 这是这种新颖且有趣的教学方法。学生尝试解决问题,但一位超级聪明的老师会注视着学生采取的每一个步骤,如果学生稍微偏离轨道,老师会立即进行纠正。

这篇论文探讨的是:当我们使用这种新的 OPD 方法时,学生的“大脑”(其数学权重)内部发生了什么?

以下是他们利用简单的类比得出的研究发现:

1. “放松的非主成分”区域

想象一下,学生的脑部是一个巨大的、多维的景观。

  • SFT 就像一台推土机。它横冲直撞地改变景观,以一种非常直接、可预测的路径改变几乎所有的一切。它非常强力,改变了大脑的“主干道”(主成分方向)。
  • RLVR 就像一个忍者。它只在安静、隐蔽的小巷(非主成分方向)中进行极其微小、精准的改变,让主干道保持原样。
  • OPD 则像是一个经验丰富的徒步旅行者。它不像推土机那样破坏景观,但也不像忍者那样悄无声息地潜行。它走的是一条中间道路:它改变的东西比推土机少,但比忍者更活跃。它处于一个“放松”的区域,既避开了主干道,又不像忍者那样受到严格限制。

2. “子空间锁定”(秘密隧道)

这是该论文最大的发现。

  • 当**推土机(SFT)**工作时,它会不断扩张其路径,在整个训练过程中探索更广阔、更宽阔的区域。
  • 当**忍者(RLVR)**工作时,它起初很宽广,但最终会缩减到一个极小的、特定的点。
  • 徒步旅行者(OPD)出发时,它会迅速找到一条狭窄的秘密隧道(一个低维通道),并在余下的旅程中一直停留其中。

“顿悟时刻”: 研究人员测试了这个隧道仅仅是巧合,还是它确实是必要的。他们尝试强制要求学生只能在训练早期发现的那条狭窄隧道内学习。

  • 结果: OPD 学生学得很好!这条隧道足以支撑学习。
  • 对比: 当他们对推土机(SFT)尝试这种方法时,学生表现得一败涂地。推土机需要开阔的空间;对于它来说,隧道太窄了。
  • 结论: OPD 拥有一种独特的“超能力”:它能在极早期就找到通往解决方案的最有效、最狭窄的路径,并锁定在该路径上。

3. 什么控制了“锁定”?

研究人员玩了“如果……会怎样”的游戏,以观察是什么让徒步旅行者留在隧道里。

  • 改变地形(运行时间): 他们让学生跳过一些步骤,或者从略有不同的例子中学习(离策/off-policy)。结果: 徒步旅行者仍然找到了相同的隧道。这条路径是非常稳健的。
  • 改变规则(目标函数): 他们将 OPD 方法与 RLVR 方法混合(改变奖励信号)。结果: 隧道消失了!徒步旅行者迷失了方向,开始四处游荡。

核心结论: 这种向高效隧道“锁定”的过程,并不是由学生所看的内容(数据)或其移动方式(展开/rollout)决定的。它完全是由**老师如何奖励学生(目标函数)**决定的。如果你改变了游戏的规则,学生就会停止使用这条高效的隧道。

总结

论文得出结论,OPD 不仅仅是推土机和忍者之间的某种混合体。它具有独特的几何特性。它会在大脑结构中迅速找到一条狭窄、高效的“秘密隧道”,并停留其中。这条隧道既强大又高效,但它也是脆弱的:如果你改变了训练目标函数的基本规则,这条隧道就会消失。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →