← 最新论文
🤖 AI

Reinforcement-aware Knowledge Distillation for LLM Reasoning

本文提出了一种强化学习感知蒸馏(RLAD)方法,该方法通过信任区域比例蒸馏(TRRD)目标将选择性模仿集成到强化学习中,以克服分布不匹配和目标干扰问题,从而使较小的语言模型能够有效地从较大的教师模型中继承长链式思维推理能力,同时平衡探索与利用。

原作者: Zhaoyang Zhang, Shuli Jiang, Yantao Shen, Yuting Zhang, Dhananjay Ram, Shuo Yang, Zhuowen Tu, Wei Xia, Stefano Soatto

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhaoyang Zhang, Shuli Jiang, Yantao Shen, Yuting Zhang, Dhananjay Ram, Shuo Yang, Zhuowen Tu, Wei Xia, Stefano Soatto

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一位才华横溢但极其昂贵的顶级大厨(老师),他能够进行复杂的、多道菜式的烹饪,并具备完美的推理能力。你想教一名更小、更快且更便宜的学徒大厨(学生)如何像大师一样烹饪,这样你就能在不破费巨资的情况下,为更多人提供美食。

长期以来,教导学徒的方法很简单:照抄大师的食谱书。学徒只需死记硬背大师过去采取的具体步骤即可。这效果尚可,但非常僵化。如果学徒试图尝试稍微不同的料理或遇到新食材,他们就会陷入困境,因为他们只是在盲目地遵循旧笔记,而不是在学习如何“思考”烹饪。

最近,厨师们开始使用一种新方法:带有反馈的试错法。学徒尝试烹饪,根据菜肴有多美味获得一个分数(奖励),并据此调整他们的技艺以在下次获得更高的分数。这很好,但速度慢且成本高。

问题在于,当你试图结合这两种方法时。如果你告诉学徒:“你必须既要模仿大师的步骤,又要努力获得高分,”他们往往会感到困惑。

  • 有时,大师旧有的步骤并不能在当前情况下带来最好的美味得分。
  • “模仿”指令与“获取高分”指令之间会产生冲突,导致学徒左右摇摆,学习效果不佳。

新的解决方案:“智能模仿”(RLAD)

论文作者提出了一种名为 RLAD(强化学习感知蒸馏)的新型教学方法。与其强迫学徒 100% 地复制大师,不如引入一种“智能模仿”规则。

以下是使用 GPS 类比的核心思想:

  1. 目标: 学徒想要开车前往一个能获得最高“奖励”(比如最好的风景)的目的地。
  2. 旧方法(标准蒸馏): GPS(老师)不断大喊:“左转!左转!”即使道路被封锁或存在更好的路线也是如此。学徒盲目跟随,即使这会导致死胡同。
  3. 新方法(RLAD): 只有当 GPS 的指令与学徒当前的计划一致,即有助于获得更好的风景时,它才会发出指令。
    • 如果学徒正朝着绝佳美景行驶(高奖励),而 GPS 说:“是的,那是正确的转向,”学徒就会紧跟 GPS。
    • 如果学徒正朝着绝佳美景行驶,但 GPS 说:“不,向右转,”学徒会忽略 GPS,因为“美味得分”(奖励)表明当前的路径更好。
    • 如果学徒迷路了(低奖励),GPS 会介入,引导他们回到一条安全、已知的路径上。

秘诀所在:“信任区”(TRRD)

为了让这一切在不让学徒发疯的情况下运作,论文使用了一种名为 TRRD(信任区域比例蒸馏)的技术。

你可以把它想象成系在学徒身上的安全牵引绳

  • 这根绳子的锚点位于学徒“刚才所在的位置”与“大师将会前往的位置”的混合体上。
  • 学徒被允许自由奔跑以探索新路径(探索),或者坚持他们已知的东西(利用)。
  • 然而,如果学徒试图跳出由大师智慧定义的“安全区”,牵引绳会轻轻地将他们拉回。
  • 至关重要的是,只有当大师的建议确实有助于学徒获得更高的分数时,牵引绳才会收紧。如果大师在当前情况下是错误的,牵引绳就会保持松弛,让学徒找到更好的方式。

他们发现了什么?

研究人员在两类“烹饪挑战”上测试了这些方法:

  1. 逻辑谜题: 比如解决复杂的悬案或物流问题。
  2. 数学问题: 比如解决困难的方程或竞赛数学。

结果:

  • 更高的分数: 使用这种新的“智能模仿”方法训练的学徒,比那些仅仅是模仿或仅仅是尝试猜测的学徒,获得了显著更高的分数。
  • 更难的问题: 这种进步在最难的问题上最为明显。在简单问题上,大家表现都不错,但在“不可能完成”的任务上,新方法展现出了卓越的实力。
  • 稳定性: 训练过程更加平稳。旧方法经常导致学徒左右摇摆并丢失进度(不稳定),但新方法让他们沿着通往顶峰的稳健路径前进。
  • 真正的学习 vs. 模仿: 旧方法主要让学徒记住了大师的具体答案(适合多次猜测,但不擅长寻找最佳单个答案)。新方法实际上提高了学徒在第一次尝试时就能找到最佳答案的能力。

总结

这篇论文介绍了一种更聪明的方法,来教导小型 AI 模型进行推理。它不是强迫它们盲目地复制一个强大的老师,而是教它们只在老师的建议有助于赢得比赛时才去倾听。这创造了一个既聪明(像老师一样)又具备适应能力(能够找到新的、更好的解决方案)的学生,同时还能实现更快、更稳定的训练。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →