Weak-to-Strong Generalization via Direct On-Policy Distillation
本文提出了直接在策略蒸馏(Direct-OPD),该方法通过利用教师模型在强化学习(RLVR)过程中前后策略的对数比作为稠密隐式奖励,将较小模型在带有可验证奖励的强化学习中所学习到的策略偏移转移给更强的目标模型,从而在无需为较大的模型运行完整强化学习的高昂计算成本的情况下,实现高效的弱到强泛化。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心问题:训练巨兽成本极高
想象一下,你想教一位才华横溢但反应极其缓慢且昂贵的教授(大型 AI 模型)如何解决复杂的数学问题。目前最好的方法是强化学习 (RL)。
在强化学习中,模型尝试解决问题,如果做对了就会得到一个分数(“奖励”),并从中学习。但问题在于:为了学习,模型必须生成数以千计的练习尝试(“rollouts”)来观察哪些做法有效。
- 瓶颈: 如果你的“教授”是一个庞大的超级计算机,生成这些练习尝试将耗时极长,且会消耗巨额的电费。随着 AI 模型变得越来越大,这种训练过程对于每一个新模型来说都变得过于缓慢且昂贵,难以重复进行。
提出的解决方案:“学徒”策略
作者提出了一种被称为 Direct-OPD 的聪明捷径。与其直接训练昂贵的巨兽,不如先训练一个更小、更便宜的“学徒”模型,然后将学徒学到的知识转移给巨兽。
可以这样理解:
- 学徒(小模型): 你雇佣了一名上手快且训练成本低的初级学生。你使用昂贵的 RL 方法来教他。他可能会遇到困难,但他最终学会了如何更好地思考。
- 大师(大模型): 你有一位天才教授,他已经非常聪明了,但还没有掌握这种特定的新思维方式。
- 目标: 你希望大师能学习到学徒所取得的进步,而不需要让大师去进行那些昂贵的练习演练。
陷阱:不要只是模仿学徒
一个很自然的想法是说:“好了,学徒现在擅长数学了。让我们让大师直接模仿学徒给出的答案吧。”
论文指出:千万不要这样做。
为什么?因为学徒仍然只是个初级水平。他们是有局限性的。如果大师只是单纯模仿学徒,大师甚至可能会变得更差,因为他在模仿学徒的错误和局限性,而不仅仅是他们的进步。
- 类比: 想象一名新手棋手终于学会了一个能击败初学者的特定开局招式。如果一位特级大师试图模仿那名新手的整个棋风,大师将会输掉比赛。大师只需要学习那一个特定的新招式,而不是模仿新手的整个个性。
核心秘诀:“直接在策略蒸馏”(Direct-OPD)
作者发明了一种方法,旨在提取纯粹的进步,并抛弃局限性。
其步骤如下:
- 获取前后快照:
- 拍摄学徒大脑在训练之前的照片(我们称之为旧大脑)。
- 拍摄学徒大脑在训练之后的照片(我们称之为新大脑)。
- 寻找差异:
- 该方法对比这两个大脑。它会问:“新大脑决定做哪些事,是旧大脑原本不会做的?”
- 它忽略了学徒原本就已经擅长的所有内容。它只关注变化。
- 类比: 想象学徒以前总是吃披萨。训练后,他决定改吃沙拉。这个“变化”就是从披萨到沙拉的转变。该方法忽略了“他厨艺依然很烂”这一事实,它只关心“选择沙拉”这个决策。
- 教导大师:
- 大师(大模型)被要求解决问题。
- 大师学习的不是学徒最终的答案,而是学徒旧大脑与新大脑之间的差异。
- 大师被告知:“在这种情况下,‘新版’学徒会选择这条路径,而‘旧版’则不会。因此,你应该向这条路径倾斜。”
为什么这是一个游戏规则改变者
论文证明了这种方法在三个惊人的方面都有效:
1. 即使大师比学徒更聪明,它依然有效。
通常情况下,你无法向比你弱的人学习。但在这里,大师学习的不是学徒的答案,而是学徒移动的方向。
- 类比: 即便特级大师比新手强得多,但新手可能发现了一个大师尚未尝试过的、奇怪的新招式。大师可以采纳这个招式,而不会变成一个新手。
2. 它极其廉价且快速。
训练一个小学徒只需要在几台电脑上运行几个小时。将这种“变化”转移给大模型也只需要再花几个小时。
- 结果: 论文显示,他们仅用 8 台电脑在 4 小时内就将模型的数学得分从 48% 提升到了 58%。如果直接在大模型上进行这种训练,则需要数周时间以及 32 台电脑。
3. 你可以进行叠加。
你可以训练一个小的学徒,转移知识,然后训练另一个针对不同技能的小学徒,再进行转移。这就像是在大师模型上叠加不同的“技能补丁”。
总结
这篇论文介绍了一种名为 Direct-OPD 的方法,它不将小型 AI 模型的训练过程视为一个需要模仿的最终产品,而是将其视为一张进步的地图。
与其强迫一个巨大的 AI 去模仿一个小 AI 的最终答案(这会导致性能降级),该方法提取了“增量”——即小 AI 为了变强而做出的具体改变——并将这些改变应用到大 AI 上。这使我们能够利用微型模型快速、廉价的训练过程来升级庞大且昂贵的模型,在节省时间和金钱的同时,大幅提升性能。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。