← 最新论文
🤖 machine learning

Trust-Region Behavior Blending for On-Policy Distillation

本文提出了信任区域行为混合(Trust-Region Behavior Blending, TRB),这是一种用于在策略蒸馏中的预热方法,通过在 KL 信任区域内将学生策略与教师策略进行混合,随后逐渐退火回纯学生采样,从而在训练早期稳定过程,进而提升在数学推理任务中的表现。

原作者: Daniil Plyusov, Alexey Gorbatovski, Alexey Malakhov, Nikita Balagansky, Boris Shaposhnikov, Daria Korotyshova, Daniil Gavrilov

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Daniil Plyusov, Alexey Gorbatovski, Alexey Malakhov, Nikita Balagansky, Boris Shaposhnikov, Daria Korotyshova, Daniil Gavrilov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:教导学生如何思考

想象一下,你正在试图通过让一名年轻学生(学生 AI)学习一位博学教授(教师 AI)来教导他们如何解决复杂的数学问题。

在旧的方法中(离线蒸馏/Offline Distillation),你会给学生一本写满了教授完美答案的教科书。学生记住了这些答案。但问题在于:当学生参加真正的考试时,他们必须从头开始生成自己的答案。由于他们从未练习过生成自己的步骤,他们在初期会感到困惑并犯错。

为了解决这个问题,研究人员开发了在策略蒸馏(On-Policy Distillation, OPD)。与其使用教科书,不如让学生逐步生成自己的答案,并由教授进行实时纠正。这种方式更好,因为它匹配了实际测试的条件。

然而,OPD 有一个缺陷: 在最开始阶段,学生非常弱。如果你让他们立即生成自己的答案,他们可能会写出一段极其糟糕、毫无意义的第一句话。如果教授试图去纠正一个糟糕的句子,这就像是在试图修理一座还没盖好的房子。此时的“信号”太弱,根本无法发挥作用。

解决方案:置信区域行为混合(Trust-Region Behavior Blending, TRB)

作者提出了一种名为 置信区域行为混合(TRB) 的新方法。你可以将其理解为一种**“带有智能向导的辅助轮”**教学法。

1. “置信区域”(安全气泡)

想象学生正在田野中行走。**学生策略(Student Policy)**是学生自然想走的路径。**教师策略(Teacher Policy)**是教授会走的路径。

如果学生偏离航线太远,教授的建议就失去了意义。TRB 创建了一个**“置信区域”**——即围绕学生当前路径的一个安全气泡。

  • 规则: 允许学生向教授的路径迈进一小步,但不能离自己的自然风格太远。
  • 目标: 找到一个既尽可能接近教授路径,又仍保持在学生安全气泡内的“最接近版本”。

2. “混合”(平滑融合)

TRB 并没有强迫学生完美复制教授(这太难了),也没有让他们漫无目的地游荡(这太乱了),而是将两者进行混合

  • 它创造了一条“混合型”路径,这条路径看起来大部分像学生,但又包含了足够的教授智慧,使学生能够保持在一条可以被学习的轨道上。
  • 这就像舞蹈教练指导初学者:“脚往这里迈(像我一样),但保持重心在那里(像你一样)。”

3. “预热”(撤掉辅助轮)

TRB 最重要的部分是它是暂时的

  • 初期阶段: “置信区域”较宽。学生会得到教授的大量帮助,以确保最初的几步是高质量的。
  • 淡出过程: 随着训练的进行,“置信区域”逐渐缩小。教授开始退后。
  • 结束阶段: 最终,该区域完全消失。学生现在可以独立行走,但他们在起步阶段已经学会了正确的习惯。

为什么这种方法效果更好(实验结果)

论文在数学推理任务(如解决代数或几何问题)上测试了这种方法,并使用了不同规模的 AI 模型。

  • 对比对象: 他们将 TRB 与以下方法进行了比较:
    • Vanilla OPD(基础 OPD): 让学生立即独自游荡。
    • SKD: 让教授偶尔接管并强迫学生说出特定的词汇。
    • SFT Warmup(监督微调预热): 在开始之前进行一段标准的监督学习。
  • 结果: TRB 平均表现胜出。
    • 它帮助学生在初始阶段拥有比“Vanilla OPD”更高质量的步骤。
    • 它不依赖于教授完全接管(像 SKD 那样),因为完全接管有时会让学生对自己的身份产生困惑。
    • 它比仅仅“预热”温度或进行一段短时间的标准课程效果更好。

权衡(代价)

这其中存在一个小代价。因为 TRB 要求教授在训练初期与学生同时处于“在线”状态(同时进行思考和解码),所以它在运行训练时需要更多的计算能力和时间。然而,由于这只发生在短期的“预热”阶段,这种额外的成本是暂时的,而最终的结果是一个更聪明的学生。

总结类比

  • 旧方法(离线): 给一个从未去过的城市的学生一张地图。他们背下了街道,但在自己开车时却迷路了。
  • OPD(在策略): 让学生开车,同时有一个副驾驶进行纠正。但如果学生开始把车开进湖里,副驾驶的纠正也就毫无意义了。
  • TRB: 副驾驶在最初的几分钟内轻轻引导方向盘,以确保车辆保持在道路上(在置信区域内),从而确保学生学会正确的驾驶“感觉”。一旦学生稳住了,副驾驶就会放手,让学生能够完美地独立驾驶。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →