← 最新论文
🤖 machine learning

Asymmetric On-Policy Distillation: Bridging Exploitation and Imitation at the Token Level

本文提出了非对称在线策略蒸馏(AOPD),这是一种新颖的训练框架,通过以局部散度最小化替代无效的负向强化,解决了标准在线策略蒸馏的结构缺陷,从而在保持更高策略熵的同时,实现了在数学推理和工具使用适应方面的卓越性能。

原作者: Nan Jia, Haojin Yang, Xing Ma, Jiesong Lian, Shuailiang Zhang, Weipeng Zhang, Ke Zeng, Xunliang Cai, Zequn Sun

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Nan Jia, Haojin Yang, Xing Ma, Jiesong Lian, Shuailiang Zhang, Weipeng Zhang, Ke Zeng, Xunliang Cai, Zequn Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图通过观察一位大师(“教师”AI)来教导一位年轻学徒(“学生”AI)如何解决复杂的数学谜题。

长期以来,标准的做法是让学徒尝试独立解决谜题。如果学徒某一步做对了,教师就给予“击掌”鼓励;如果做错了,教师就给出严厉的“不”。这被称为同策略蒸馏(On-Policy Distillation)

然而,本文作者发现,这种“击掌或不”的体系存在三大缺陷,导致学习过程缓慢且令人沮丧:

  1. “尖叫”问题(高方差): 当学徒犯下严重错误时,教师的“不”过于响亮和严厉(从数学上讲,信号巨大且无界),这吓到了学徒。学徒无法学习具体的修正方法,反而感到困惑,在思考中做出狂野且不可预测的跳跃。
  2. “沉默”问题(梯度消失): 大多数时候,学徒的步骤只是“还行”——既不好也不坏。在旧体系中,教师会给出一个中性的“嗯”信号。由于这个信号太弱,学徒从这些时刻中学不到任何东西,尽管教师实际上有更好的做法。学习过程因此陷入停滞。
  3. “盲点”问题(探索黑洞): 如果学徒陷入死胡同,旧体系只会告诉他们不要走那条路,却不会告诉他们应该走哪条路。学徒只能原地打转,盲目猜测新路径,因为他们不知道正确的路径是否存在。

解决方案:AOPD(“智能导师”方法)

本文提出了一种新方法,称为非对称同策略蒸馏(Asymmetric On-Policy Distillation, AOPD)。这就像一位根据情况切换教学风格的导师。

AOPD 不再对所有情况使用相同的“击掌/不”规则,而是采用两种不同的模式:

  • 模式一:啦啦队(利用): 当学徒正在做教师喜欢的事情(“积极”步骤)时,系统表现得像旧方法。它说:“干得好!继续完全照这样做!”这强化了良好的行为。
  • 模式二:GPS(模仿): 当学徒陷入困境、犯错或只是做得“还行”(非积极步骤)时,系统停止严厉的“不”和微弱的“嗯”。相反,它立即调出一张地图。它说:“停止猜测。看教师的地图。这是教师从这一特定位置会采取的确切路径。”

为何效果更好

作者在 AIME 和 HMMT 等困难的数学竞赛中,使用不同规模的 AI 模型测试了这种方法。以下是他们的发现:

  • 更聪明的学习: 通过在困难时刻切换到"GPS"模式,学徒不会因为巨大的错误而受惊,也不会因为中性的反馈而厌倦。他们在最需要的时候获得了精确、有帮助的指引。
  • 更快更强: 新方法始终优于旧的“击掌/不”方法。事实上,当学徒从较弱的技能基础(“弱初始化”)开始时,新方法帮助他们更快地赶上,比旧方法多获得约 8% 的正确答案。
  • 更好的记忆: 当学徒在掌握数学后学习新技能(如使用工具)时,旧方法会导致他们忘记数学技能。而新方法(AOPD)就像一块灵活的海绵;它学习了新工具技能,同时没有冲走他们已经掌握的数学知识。

宏观视角

简而言之,本文认为你不应该以同样的方式对待每一个学习时刻。

  • 当事情进展顺利时,鼓励学生继续独立探索。
  • 当事情进展不顺或只是“还行”时,停止猜测游戏,直接向学生展示教师的更好方法。

通过在恰当的时机混合“让他们尝试”与“展示答案”,AI 能学得更快、犯错更少,并且更好地记住所学内容。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →