← 最新论文
🤖 machine learning

Scaling Reasoning Efficiently via Relaxed On-Policy Distillation

本文提出了 REOPOLD 框架,通过将在线策略蒸馏重新诠释为策略优化并利用混合奖励截断、基于熵的动态采样及统一训练策略来缓解不稳定性和负迁移问题,从而在数学、视觉及智能体工具使用等任务中实现了远超基线的样本效率与推理扩展能力。

原作者: Jongwoo Ko, Sara Abdali, Young Jin Kim, Tianyi Chen, Pashmina Cameron

发布于 2026-03-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Jongwoo Ko, Sara Abdali, Young Jin Kim, Tianyi Chen, Pashmina Cameron

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 REOPOLD 的新方法,旨在解决一个核心难题:如何用最少的“学费”(训练数据),让一个小模型(学生)快速学会大模型(老师)的高超推理能力,同时避免“学歪了”或“学崩溃了”。

我们可以把整个过程想象成**“天才导师带笨徒弟学武功”**的故事。

1. 背景:小模型学大模型的困境

现在的 AI 大模型(比如 DeepSeek-R1)非常聪明,能像人一样一步步思考(推理)。但是,把它们直接“复制”到小模型(比如只有 1.5B 或 7B 参数的模型)上很难。

  • 传统方法(死记硬背/SFT): 老师把答案直接给学生抄。学生只会背题,换个题目就不会了。
  • 强化学习(RL): 让学生自己做题,做对了给奖励,做错了受罚。但这对学生来说太难了,就像让小学生直接去解奥数题,很容易因为受挫太多而“崩溃”(训练不稳定),或者因为奖励信号太弱而“学不动”(效率低)。
  • 在线蒸馏(On-Policy Distillation,旧版): 这是目前的热门方法。老师看着学生做题,学生做一步,老师就点评一步。
    • 问题出在哪? 以前的方法太“严厉”了。只要学生写的某个字跟老师不一样,老师就疯狂扣分(负奖励)。结果学生为了不被扣分,变得畏手畏脚,甚至为了迎合老师而胡乱猜测,最后连自己原本会的东西都忘了(负迁移),或者因为害怕犯错而停止思考(熵崩溃)。

2. REOPOLD 的核心理念:从“严厉教官”变成“智慧教练”

REOPOLD 提出了一种**“放松的在线蒸馏”策略。它不再强迫学生每一步都跟老师一模一样,而是像一位高明的教练**,懂得什么时候该严厉,什么时候该放手。

它用了三个“独门秘籍”:

秘籍一:混合奖励截断(给“惊吓”设个底线)

  • 比喻: 想象学生写错了一个字,老师原本想骂他“你脑子进水了!”(负无穷大的惩罚)。这种极端的惩罚会让学生的心理(梯度)瞬间崩溃,导致训练失败。
  • REOPOLD 的做法: 它给老师的批评设了一个“底线”。无论学生错得多离谱,老师的批评最多只能到“你这里需要改进”的程度,不会变成“你滚出教室”。
  • 效果: 防止学生因为一次小错误就彻底慌了神,保证了训练过程的稳定性。

秘籍二:基于熵的动态采样(只抓重点,不抓流水账)

  • 比喻: 学生做题时,有些步骤是显而易见的(比如"1+1=2"),老师和学生都知道答案,这时候老师再啰嗦一句“对,是 2",纯属浪费时间。而有些步骤是关键的转折点(比如“这里需要用到勾股定理”),学生容易卡壳,老师在这里的指点才最有价值。
  • REOPOLD 的做法: 它有一个“雷达”,专门盯着那些**“学生最不确定、最容易出错”**的步骤(高熵步骤)。
    • 对于学生很确定的步骤(低熵),老师直接跳过,不浪费算力。
    • 对于学生犹豫不决的步骤,老师集中火力进行指导。
  • 效果: 就像老师只给学生讲错题和难点,而不是从头到尾把课本念一遍,学习效率直接翻倍。

秘籍三:从“探索”到“精炼”的两阶段训练(先放手,后收网)

  • 比喻: 学骑车有两个阶段。
    • 第一阶段(探索期): 刚开始学,教练(老师)不能太严厉。学生摔倒了,教练要鼓励他“没关系,再试一次”,让他敢于尝试不同的路线,不要怕犯错。
    • 第二阶段(精炼期): 等学生骑稳了,教练就开始严格要求了。这时候要纠正细节,把那些歪歪扭扭的路线修正过来,追求完美。
  • REOPOLD 的做法:
    • 前期: 屏蔽掉那些严厉的负面惩罚,鼓励学生大胆尝试,保持思维的多样性(防止还没学会就“想死”了)。
    • 后期: 开启“高熵筛选”,只针对关键的不确定点进行精细化打磨,把思路理顺。
  • 效果: 既保证了学生敢想敢做,又保证了最后能练成绝世高手。

3. 成果:小模型也能“青出于蓝”

通过这套方法,论文展示了惊人的效果:

  1. 省料(样本效率): 以前需要老师教 1000 次学生才能学会,现在只需要教 100 次甚至更少(效率提升了 6.7 到 12 倍)。
  2. 提速(推理速度): 在视觉推理任务上,一个 7B 的小模型,经过 REOPOLD 训练后,不仅能达到 32B 大老师的水平,而且思考速度还快了 3 倍多(因为模型小,跑得快)。
  3. 更稳: 即使老师模型很大(32B),学生模型很小(3B 或 7B),学生也不会因为“压力太大”而崩溃,反而能稳稳地接住老师的知识。

总结

REOPOLD 就像给 AI 训练装上了一套**“智能减震系统”“重点辅导系统”。它不再强迫小模型去死磕大模型的每一个字,而是通过“少骂人(截断负奖励)、抓重点(动态采样)、分阶段(先放后收)”**的策略,让小模型在轻松、稳定的环境中,高效地习得大模型的推理智慧。

这就好比一个聪明的教练,不再用鞭子抽打学生,而是用智慧引导,让普通学生也能在最短的时间内,练出大师级的水平。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →