On-Policy Delta Distillation
本文介绍了一种名为在策略增量蒸馏(On-Policy Delta Distillation, OPD)的新型强化学习后训练方法,该方法利用一个“增量信号”(代表教师模型与其推理微调前的基础模型之间的差异)来更有效地迁移推理能力,并在极少的后训练量下,在数学、科学和代码基准测试中实现了强劲的性能表现。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个世界,那里的计算机就像一座座巨大的、饥肠辘辘的图书馆,读遍了几乎所有被写下的书籍。这些被称为“大语言模型”(LLM)的图书馆极其擅长猜测句子中的下一个词。但仅仅知道如何完成一个句子并不足以解决棘手的数学问题或调试损坏的计算机程序。为了让它们精通这些任务,我们需要教会它们如何“思考”。
把这个过程想象成训练一名学生。首先,学生阅读海量图书馆(预训练)以学习语言基础。然后,一位老师进来进行专门的课程指导,教他们如何解开谜题(后训练)。通常,老师使用两种主要方法:要么向学生展示完美答案并说,“模仿这个”(监督微调);要么让学生尝试,给他们评分,并说,“再试一次,但下次做得更好一点”(强化学习)。最近,一种名为“在策略蒸馏”(On-Policy Distillation)的方法变得流行起来。这就像一位老师在实时观察学生解题,并根据老师原本会怎么说,在旁边低声耳语:“是的,这个词用得好,”或者“不,这个词错了。”这种方法非常高效,且避免了设计复杂评分系统的繁琐过程。
但问题在于:即使是这种聪明的方法也有缺陷。当老师在耳边低语时,他们可能会不小心说出一些学生已经知道的东西,比如如何礼貌待人或如何讲故事,而不是那些让老师成为逻辑天才的特定“顿悟”时刻。你即将阅读的这篇论文提出了一个简单的问题:如果我们能过滤掉噪音,只教给学生老师学到的“新招式”,会怎样呢?
这篇论文介绍了一种聪明的全新技术,称为在策略增量蒸馏(On-Policy Delta Distillation,简称 OPD2)。研究人员意识到,“推理老师”实际上是两个模型的结合体:原始的“基础”(Base)模型(在学习推理之前)和“推理”(Reasoning)模型(学习推理之后)。如果你从推理模型的想法中减去基础模型的想法,你就会得到一个“增量信号”(Delta Signal)。这个信号就像是一部精彩的集锦,展示了当老师学会思考时究竟发生了什么变化。学生学习的不再仅仅是老师的最终答案,而是学习这个“增量信号”——即代表推理能力飞跃的具体差异。
作者通过混合数学、科学和编程问题测试了这一想法。他们发现,使用这个“增量信号”作为主要的奖励,可以帮助学生学得更快、更好。事实上,他们的 OPD2 方法在不同规模的模型上(从 17 亿参数的小模型到 80 亿参数的大模型)都一致地击败了之前的最佳技术。它的效果如此之好,以至于用 OPD2 训练的小型模型有时能超越使用旧方法训练的更大型模型。论文表明,通过专注于思考的“变化”,而不是老师的整个个性,我们可以更有效地教会 AI 进行推理,而不必在它已经掌握的知识上浪费时间。
“增量”信号的故事
让我们用一个简单的类比来深入探讨这一发现的机制。想象你正在学习玩一款复杂的电子游戏。你有一个“基础版”角色,它知道如何行走、跳跃和说话。然后,你得到了一个“专业版”角色,它已经掌握了游戏中最难的关卡。
旧的教学方法(标准在策略蒸馏)就像是专业版角色站在你身边说:“完全照我做。”问题在于,专业版角色在行走和说话方面仍然和基础版角色一模一样。所以,当专业版角色说“向前走”时,他们只是在重复你已经知道的事情。你是在练习走路,而不是在学习让成为职业选手的秘密招式。
本文的作者——来自 NAVER AI Lab 的 Byeongho Heo, Jaehui Hwang, Sangdoo Yun 和 Dongyoon Han——提出了另一种方法。他们问道:“如果我们只教给学生专业版和基础版之间的‘差异’会怎样呢?”
这就是增量信号(Delta Signal)。
- 基础模型: 知道如何说话和写作,但在处理复杂逻辑时可能会跌跌撞撞。
- 推理老师: 知道如何说话、写作,并且能解决难题。
- 增量(Delta): 老师为了解决谜题而学到的那份特定的“魔力”。
在论文中,他们通过词云展示了这一点。当他们观察旧方法教授的内容时,里面充满了像“看”、“尝试”和“验证”这类泛泛的词汇。但当他们观察增量信号时,脱颖而出的词汇是逻辑连接词,如“因此”、“然而”、“注意”和“取而代之”。这些词汇是构建逻辑论证的粘合剂。增量信号有效地过滤掉了学生已经知道的“无聊”内容,并突出了推理的“秘方”。
他们是如何构建 OPD2 的
为了使这项工作奏效,研究人员必须解决几个棘手的问题。如果你直接给学生一个增量信号,他们可能会感到困惑,因为该信号没有考虑到学生自身正在做什么。这就像教练在不观察球员当前位置的情况下大声喊出指令。
因此,他们在配方中加入了两个特殊的成分:
- 中心化(Centering): 他们调整了信号,使其围绕零点平衡。这有助于学生理解某个动作是“优于平均水平”还是“劣于平均水平”,而不是仅仅得到一个可能具有误导性的原始分数。
- 联合调节(Joint Conditioning): 他们确保新的增量信号只有在与旧的标准方法达成一致时才会生效。这起到了安全网的作用。如果增量信号试图引导学生走向一个与老师的一般风格相矛盾的奇怪方向,系统会说“等等”,并停止更新。这防止了学生在试图学习如何思考时,感到困惑或忘记如何正常说话。
结果:新的冠军
团队使用包含数学、科学和编程数据集的 10 万个问题,对新方法 OPD2 与旧标准(OPD)以及一种更新、更先进的方法 ExOPD 进行了对比测试。他们在包括 Qwen3 系列(尺寸为 1.7B、4B 和 8B)和 Gemma4 模型在内的各种模型上进行了测试。
结果令人印象深刻。在“非思考”模式下(即模型快速回答而不展示其推导过程),OPD2 始终优于其他方法。
- 对于数学领域的 Qwen3-1.7B 模型,OPD2 将平均分从 34.8 提升到了 54.6。这是一个巨大的飞跃,超过了第二名的方法 3 个多点。
- 对于 Qwen3-4B 模型,OPD2 达到了 70.3 的平均分,而之前的最佳方法(ExOPD)为 66.4。
- 更令人惊讶的是,用 OPD2 训练的 4B 模型表现优于用旧方法训练的 8B 模型。这表明,训练的“方式”与模型的大小同样重要。
他们还在“思考”模式下测试了模型,在这种模式下,模型已经非常聪明并会展示其推理步骤。由于模型已经很优秀了,提高难度很大。然而,OPD2 仍然设法挤出了额外的性能。例如,在 HMMT25 数学基准测试中,Qwen3-8B 模型在使用 OPD2 时,得分从 44.3 提升到了 52.3,而其他方法实际上让得分变差了或者几乎没有变化。
该方法也在不同的模型家族 Gemma4 上奏效。当其他方法挣扎甚至让模型表现变差时,OPD2 将数学成绩从 60.6 提升到了 67.8。这表明,使用“增量信号”的想法不仅仅是针对某一特定模型的偶然现象;它似乎是一个通用的原理,能帮助 AI 更好地学习思考。
为什么这很重要
论文指出,教 AI 进行推理的关键不在于喂给它更多的数据或把老师做得更大。关键在于精确地定义我们在教什么。通过分离出模型在学习推理时发生的具体变化(即增量),我们可以更高效地转移这种能力。
作者指出,这种方法在计算上是非常高效的。与标准方法相比,它的训练时间大约增加了 24-28%,因为计算机需要在后台运行“基础”模型来计算差异。然而,由于这些训练阶段通常很短(通常不到完整的数据遍历),这点额外的成本换取巨大的性能提升是非常值得的。
简而言之,OPD2 就像一位大师级厨师,他意识到要教徒弟制作完美的汤,不应该只说“加盐”,而应该说:“比你平时多加这么多盐,因为这就是好汤与顶级汤之间的区别。”通过专注于差异,学生能更快、更好地掌握秘诀。论文总结道,这种方法是让 AI 变得更聪明、更快、更擅长解决未来复杂问题的重大进步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。