想象一下,你正在试图通过观察一位大师(“教师”AI)来教导一位年轻学徒(“学生”AI)如何解决复杂的数学谜题。
长期以来,标准的做法是让学徒尝试独立解决谜题。如果学徒某一步做对了,教师就给予“击掌”鼓励;如果做错了,教师就给出严厉的“不”。这被称为同策略蒸馏(On-Policy Distillation)。
然而,本文作者发现,这种“击掌或不”的体系存在三大缺陷,导致学习过程缓慢且令人沮丧:
- “尖叫”问题(高方差): 当学徒犯下严重错误时,教师的“不”过于响亮和严厉(从数学上讲,信号巨大且无界),这吓到了学徒。学徒无法学习具体的修正方法,反而感到困惑,在思考中做出狂野且不可预测的跳跃。
- “沉默”问题(梯度消失): 大多数时候,学徒的步骤只是“还行”——既不好也不坏。在旧体系中,教师会给出一个中性的“嗯”信号。由于这个信号太弱,学徒从这些时刻中学不到任何东西,尽管教师实际上有更好的做法。学习过程因此陷入停滞。
- “盲点”问题(探索黑洞): 如果学徒陷入死胡同,旧体系只会告诉他们不要走那条路,却不会告诉他们应该走哪条路。学徒只能原地打转,盲目猜测新路径,因为他们不知道正确的路径是否存在。
解决方案:AOPD(“智能导师”方法)
本文提出了一种新方法,称为非对称同策略蒸馏(Asymmetric On-Policy Distillation, AOPD)。这就像一位根据情况切换教学风格的导师。
AOPD 不再对所有情况使用相同的“击掌/不”规则,而是采用两种不同的模式:
- 模式一:啦啦队(利用): 当学徒正在做教师喜欢的事情(“积极”步骤)时,系统表现得像旧方法。它说:“干得好!继续完全照这样做!”这强化了良好的行为。
- 模式二:GPS(模仿): 当学徒陷入困境、犯错或只是做得“还行”(非积极步骤)时,系统停止严厉的“不”和微弱的“嗯”。相反,它立即调出一张地图。它说:“停止猜测。看教师的地图。这是教师从这一特定位置会采取的确切路径。”
为何效果更好
作者在 AIME 和 HMMT 等困难的数学竞赛中,使用不同规模的 AI 模型测试了这种方法。以下是他们的发现:
- 更聪明的学习: 通过在困难时刻切换到"GPS"模式,学徒不会因为巨大的错误而受惊,也不会因为中性的反馈而厌倦。他们在最需要的时候获得了精确、有帮助的指引。
- 更快更强: 新方法始终优于旧的“击掌/不”方法。事实上,当学徒从较弱的技能基础(“弱初始化”)开始时,新方法帮助他们更快地赶上,比旧方法多获得约 8% 的正确答案。
- 更好的记忆: 当学徒在掌握数学后学习新技能(如使用工具)时,旧方法会导致他们忘记数学技能。而新方法(AOPD)就像一块灵活的海绵;它学习了新工具技能,同时没有冲走他们已经掌握的数学知识。
宏观视角
简而言之,本文认为你不应该以同样的方式对待每一个学习时刻。
- 当事情进展顺利时,鼓励学生继续独立探索。
- 当事情进展不顺或只是“还行”时,停止猜测游戏,直接向学生展示教师的更好方法。
通过在恰当的时机混合“让他们尝试”与“展示答案”,AI 能学得更快、犯错更少,并且更好地记住所学内容。
技术摘要:非对称在线策略蒸馏(AOPD)
1. 问题陈述
在线策略蒸馏(OPD)已成为一种强大的技术,通过利用教师模型对学生生成轨迹的 token 级反馈来训练学生大型语言模型(LLM)。与存在暴露偏差的离线策略蒸馏不同,OPD 在推理时的 rollout 过程中使学生分布与教师分布保持一致。然而,作者指出,依赖优势加权策略梯度的标准 OPD 在非正优势区域存在三个关键的结构弱点:
- 高方差更新:在学生概率显著低于教师概率的区域(负优势),优势公式的对数性质会产生无界的标量值。这导致重尾梯度分布和不稳定的优化。
- 梯度消失:绝大多数生成的 token 往往聚集在零优势附近。在这些“中性”区域,标准的优势加权更新会消失,从而丢弃教师提供的关于替代推理路径的丰富条件分布信息。
- 探索瓶颈(黑洞):当学生犯错(负优势)时,标准更新会抑制采样的 token,但严格根据学生当前的先验重新分配概率质量。如果正确 token 在学生模型中的先验概率接近零,校正更新将微乎其微。这将模型困在“探索黑洞”中,使其在没有外部指导的情况下无法发现正确的替代方案。
2. 方法论:非对称在线策略蒸馏(AOPD)
为了解决这些局限性,作者提出了非对称在线策略蒸馏(AOPD)。该框架通过在 token 级别根据优势信号动态切换学习模式,弥合了强化学习(利用)与监督学习(模仿)之间的鸿沟。
核心机制
AOPD 将训练目标分解为两个不同的机制:
- 正优势区域(利用):当学生 token 获得正优势(At>0)时,该方法保留标准的策略梯度更新。这加强了成功的探索,即学生的推理与教师的偏好一致或超越教师偏好。
- 非正优势区域(模仿):当优势为零或负(At≤0)时,AOPD 用局部散度最小化替换无效的策略梯度。
干预目标
AOPD 不依赖标量优势,而是最小化教师分布与学生分布之间的前向 KL 散度,但限制在教师定义的支撑集内。
- 教师支撑集(St):定义为在教师分布 PT(⋅∣ct) 下概率最高的前 K 个 token。
- 损失函数:在该支撑集上,损失公式化为:
LFKLt=K1v∈St∑PT(v∣ct)(logPT(v∣ct)−logPS(v∣ct))
- 广义目标:总 AOPD 损失将正强化项(LPos)与非正区域的前向 KL 指导相结合。可以使用阈值参数 τ 来触发干预,默认设置 τ=0 旨在精确针对非正机制。
理论依据
- 有界更新:通过在有界支撑集上切换到前向 KL,更新幅度受概率单纯形(PT−PS)约束,消除了由无界对数概率差异引起的重尾方差。
- 梯度恢复:在零优势区域,前向 KL 项利用教师的完整条件分布,即使标量优势为零,也能提供有意义的校正信号。
- 逃离黑洞:通过在支撑集上显式匹配教师分布,AOPD 注入了指向教师青睐但被学生低估的 token 的方向性信号,有效打破了探索瓶颈。
3. 主要贡献
- OPD 局限性分析:本文提供了理论和实证分析,证明标准的基于优势的更新由于高方差、梯度消失和探索瓶颈,在负优势和零优势区域失效。
- AOPD 框架:提出了一种非对称训练框架,自适应地从优势加权策略梯度转变为局部教师分布匹配。该设计保留了基于 RL 的利用优势,同时在优化瓶颈处施加强力的定向监督。
- 实证验证:跨多种模型规模和初始化设置的综合实验表明,AOPD 始终优于标准 OPD 和其他基线(SeqKD, GKD, ExOPD)。
4. 实验结果
作者在竞争级别的数学推理基准(AIME 2024, AIME 2025, HMMT 2025)上评估了 AOPD,使用了不同 SFT 预热步数的 Qwen3 模型(4B 和 8B)。
- 性能提升:AOPD 始终取得了最佳的整体性能。
- 在强初始化(3K SFT 预热)下,AOPD 相比标准 OPD 将平均 Pass@1 提高了4.09%。
- 在弱初始化(1K SFT 预热)下,提升更为显著,达到8.34%,证明了 AOPD 在学生模型初始基础能力较弱时的鲁棒性。
- 训练动态:AOPD 表现出稳定的训练曲线,未出现 OPD 和 ExOPD 中观察到的初始性能下降。它在整个训练过程中保持了更高的策略熵,表明其策略空间更为分散。
- 持续学习:在顺序工具使用适应任务中,AOPD 展现了卓越的能力保持性。其他方法在学习新工具后数学推理性能下降,而 AOPD 在实现具有竞争力的工具使用成功率的同时,实际上提高了其数学能力保持率(Pass@4 从 67.43 提升至 68.04)。
5. 意义与主张
本文主张,AOPD 通过解决标准在线策略蒸馏的结构低效性,代表了蒸馏推理能力的重要进步。作者认为:
- 非对称性是关键:区别对待正优势和非正优势区域至关重要。正优势区域受益于 RL 风格的探索,而非正优势区域需要监督模仿的直接、高保真指导,以避免优化停滞。
- 对初始化的鲁棒性:该方法对于初始能力较弱的模型特别有效,在这些模型中,标准 OPD 往往无法从早期的优化退化中恢复。
- 能力保持:通过将教师干预局部化到困难位置而不是重塑整个策略,AOPD 在持续学习过程中更好地保留了先前获得的推理技能。
作者总结道,在 token 级别结合利用(RL)和模仿(监督学习)提供了一条原则性的路径,以提高学生模型的训练效率和最终能力,特别是在复杂推理任务中。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。