Self-Distilled Policy Gradient
本文提出了 SDPG,一种自蒸馏策略梯度框架,该框架通过结合全词表反向 KL 散度实现的在策略自蒸馏、组相对验证器优势以及参考策略正则化,来增强稀疏奖励强化学习的稳定性和性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大局观:教学生如何更好地思考
想象一下,你正在训练一名才华横溢但缺乏经验的学生(AI 模型)来解决困难的数学问题。这个学生很聪明,但他们经常在自己的推理步骤中迷失方向。
目前,训练这类学生的标准方法是具有可验证奖励的强化学习 (RLVR)。你可以把它想象成一场“及格/不及格”的考试。学生写出完整的解题过程,然后由一名严格的监考员(验证器)检查最终答案。
- 如果答案正确: 学生获得一颗金星 (+1)。
- 如果答案错误: 他们得到一个红叉 (0)。
问题在于: 这种“及格/不及格”的系统过于模糊。如果学生答错了,他们不知道究竟是哪一个具体的步骤导致了错误。是他们在第 3 步搞错了代数运算?还是在第 7 步逻辑出了问题?因为反馈非常稀疏(只在最后时刻给出),学生学习得很慢,有时甚至会感到困惑,导致训练不稳定。
解决方案:“自我蒸馏”导师
作者提出了一种名为 SDPG 的新方法。与其仅仅等待最终成绩,不如让学生在写作过程中就能获得解题思路的“小抄”或“特权视角”。
以下是 SDPG 的工作原理,分为三个部分:
1. 两顶帽子:学生与老师
在传统的教学中,你需要一位博学而昂贵的教授(老师)来教导一名小学生。这很难,因为你必须同时运行两台庞大的计算机。
在自我蒸馏中,学生戴着两顶帽子:
- 学生帽: 模型尝试仅根据问题本身来解决问题(没有提示)。
- 老师帽: 同一个模型再次尝试解决问题,但这一次它拥有“特权上下文”(由像 Gemini 这样强大的 AI 生成的提示、解题路径或推理指南)。
模型通过尝试让其“学生帽”的预测与“老师帽”的预测相匹配来进行学习。这就像音乐家练习一首歌:他们聆听完美的录音(老师),并试图让自己的演奏(学生)在每一个音符上都与之契合。这为他们提供了密集、步进式的反馈,而不仅仅是一个最终成绩。
2. 安全网:“好主意”过滤器
这里存在一个风险。如果学生完全走错了方向(例如,他们正在解决一个完全错误的问题),那么“老师帽”可能仍然会给出一个针对错误问题的完美解法。如果学生盲目模仿,他们只会变得更擅长犯错。
SDPG 通过正向优势门控 (Positive Advantage Gating) 解决了这个问题。
- 类比: 想象一位教练在观察学生。如果学生跑偏了(从验证器那里得到了低分),教练会说:“停!先不要听那个完美的解法,因为你解题的方向错了。”
- 系统只有在“学生帽”已经产生了一个验证器认为有前景的路径(正向奖励)时,才会允许学生向“老师帽”学习。这确保了学生只会内化正确的推理,而不是仅仅学会对错误问题的完美回答。
3. 热身与冷却
作者还意识到,你不能强迫学生立即或者永远听从老师。
- 热身阶段: 在开始阶段,学生由于太困惑而无法从老师那里学习。因此,他们从单纯的“及格/不及格”考试开始。一旦他们开始能答对一些问题,系统就会慢慢开启“老师帽”的指导。
- 冷却阶段: 在训练接近尾声时,学生已经内化了这些教训。如果他们一直过度听从老师,他们可能会停止独立思考(这被称为“模式崩溃”问题)。因此,系统会逐渐关掉老师的声音,让学生依靠自己的技能进行测试。
结果
通过将最终成绩(来自验证器)与步进式指导(来自自我老师)相结合,并利用过滤器确保学生只从正确的路径中学习,AI 变得:
- 更稳定: 它在训练过程中不会崩溃或感到困惑。
- 更聪明: 它学会了更好的推理,因为它能获得每一步的反馈,而不只是终点。
- 更快: 与之前的方法相比,它能在更少的训练步骤内达到极高的性能水平。
简而言之,SDPG 就像是给学生配备了一位导师,这位导师只在学生走在正确轨道上时才会开口说话,并在学生掌握知识后,逐渐让他们独立完成测试。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。