← 最新论文
🤖 machine learning

Self-Distilled RLVR

该论文指出仅依赖特权教师信号进行自蒸馏会导致信息泄露和训练不稳定,因此提出了 RLSD 方法,通过结合 RLVR 的环境反馈确定更新方向,并利用自蒸馏获取的细粒度策略差异来调节更新幅度,从而在提升训练稳定性的同时实现了更高的收敛上限。

原作者: Chenxu Yang, Chuanyu Qin, Qingyi Si, Minghui Chen, Naibin Gu, Dingyu Yao, Zheng Lin, Weiping Wang, Jiaqi Wang, Nan Duan

发布于 2026-04-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Chenxu Yang, Chuanyu Qin, Qingyi Si, Minghui Chen, Naibin Gu, Dingyu Yao, Zheng Lin, Weiping Wang, Jiaqi Wang, Nan Duan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲述了一个关于如何更好地训练人工智能(AI)“大脑”的故事。为了让你轻松理解,我们可以把训练 AI 想象成教一个学生做数学题

1. 背景:两种传统的教学方法

在训练 AI 做推理题(比如数学或逻辑题)时,以前主要有两种方法:

  • 方法一:RLVR(环境反馈法)——“只看分数”

    • 比喻:老师(AI)做了一套卷子,最后只告诉学生一个结果:“对了”或者“错了”。
    • 优点:方向很明确,不会跑偏。
    • 缺点:太粗糙了。如果学生做错了,老师只说“错了”,但没说哪一步错了。是第一步算错了?还是最后抄错了?学生只能瞎猜,进步很慢。
  • 方法二:OPSD(自我蒸馏法)——“带着答案复习”

    • 比喻:为了让学生进步更快,老师让学生在做题时,偷偷看一眼标准答案(这叫“特权信息”),然后让学生模仿答案的每一个字怎么写。
    • 优点:非常细致,学生能学到很多细节,进步很快。
    • 缺点作弊了! 学生习惯了看着答案做题。一旦考试时把答案拿走,学生就懵了,甚至会在解题过程中自言自语:“虽然题目没给答案,但我知道答案应该是……"(这就是论文里说的“信息泄露”)。而且,这种进步不可持续,练久了反而退步。

2. 核心问题:为什么“带着答案复习”会失败?

论文发现,OPSD 方法有一个致命的结构性缺陷

  • 信息不对称:学生(AI 模型)在考试时看不到答案,但老师(AI 模型自己)在复习时能看到答案。
  • 后果:学生为了模仿老师,被迫去猜测“如果我有答案,我会怎么想”。这导致学生把“如何猜答案”这种作弊技巧当成了“解题能力”刻在了脑子里。
  • 比喻:就像学生背下了“看到题目 A 就选 C"的规律,而不是真正学会了数学。一旦考试题目稍微变一下,或者没有答案参考,学生就彻底崩盘了。

3. 解决方案:RLSD(自蒸馏 + 强化学习)——“聪明的助教”

作者提出了一个新方法叫 RLSD。它的核心思想是:把“答案”的作用从“模仿对象”变成“评分尺子”。

我们可以这样理解 RLSD 的运作流程:

  1. 方向由“裁判”定(环境奖励)

    • 学生做完题,裁判(环境)只看最终结果:对还是错?
    • 如果对了:整道题都要表扬(正向激励)。
    • 如果错了:整道题都要批评(负向惩罚)。
    • 这一步保证了 AI 不会学坏,方向永远是正确的。
  2. 力度由“助教”定(自蒸馏信号)

    • 虽然方向定了,但哪个步骤该多表扬,哪个步骤该多批评呢?
    • 这时候,我们请出那个“看过答案的助教”(也就是同一个模型,但这次它带着答案看)。
    • 助教不看学生具体写了什么字,而是判断:“这一步推理,对得出正确答案有多大的贡献?”
    • 比喻
      • 如果学生做对了,但中间有个步骤是瞎蒙的,助教会说:“虽然结果对了,但这步运气好,给个小表扬。”
      • 如果学生做对了,且每一步都逻辑严密,助教会说:“这步太关键了,给大表扬!”
      • 如果学生做错了,且错在第一步,助教会说:“第一步错得离谱,重罚!”
      • 如果学生做错了,但中间有个步骤其实是对的,助教会说:“虽然最后错了,但这步思路对,少罚一点。”

4. 为什么 RLSD 这么厉害?

  • 既快又稳:它像 OPSD 一样,能给出非常细致的反馈(告诉学生哪一步好,哪一步坏),所以学得很快。
  • 绝不作弊:它像 RLVR 一样,最终的方向完全由“对错”决定。学生不需要去猜答案,只需要专注于如何把每一步做得更漂亮。
  • 比喻总结
    • 旧方法 (OPSD):学生看着答案抄作业,以为学会了,一考试就露馅。
    • 新方法 (RLSD):学生自己独立做题,做完后,老师拿着标准答案来批改。老师不会告诉学生“答案是什么”,而是告诉学生“你刚才那个解题思路太棒了,值得加 10 分”或者“你刚才那个假设太草率,扣 5 分”。
    • 这样,学生既学到了精细的解题技巧,又保持了独立思考的能力

5. 实验结果

论文在多个复杂的数学和逻辑推理测试中验证了 RLSD:

  • 它比传统的“只看分数”方法(GRPO)进步更快,准确率更高。
  • 它比“看着答案复习”的方法(OPSD)更稳定,不会出现“练着练着就变笨”的情况。
  • 它甚至能在训练步数只有别人一半的情况下,达到别人训练两倍步数的效果。

一句话总结
这篇论文发明了一种**“既给方向,又给细节,还防作弊”的新训练法。它让 AI 在训练时能利用“参考答案”来精细化评分**,而不是盲目模仿,从而让 AI 真正学会了如何像人类一样进行严密的逻辑推理。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →