DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models
本文介绍了 DASH(发散自适应监督时界),这是一种通过根据教师-学生发散性的时间演化自适应调整标记级监督权重,从而在无需额外前向传播的情况下提升推理模型在线策略自我蒸馏性能的方法,进而提高了在数学基准测试中的表现。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个计算机正在学习解决复杂谜题(如高级数学问题或编写计算机代码)的世界,它们通过一遍又一遍地练习来完成。这个领域被称为强化学习(Reinforcement Learning),在这里,计算机(“学生”)尝试不同的答案,并在最后得到一个简单的“是”或“否”来判断自己是否正确。问题在于,如果学生走了一条漫长且曲折的路径,那么最后那个单一的“是”或“否”并不能告诉他们哪些具体的步骤是好的,哪些是坏的。这就像是在期末考试中得到一个“B”,却不知道自己错在了哪些题目上。为了解决这个问题,研究人员使用了一种被称为“在策略自我蒸馏”(On-Policy Self-Distillation)的技巧。你可以把它想象成学生向一位“特权教师”(掌握着秘密答案集的老师)请教,请求老师在学生前进的每一步都进行评分。这为学生提供了密集的反馈流,而不仅仅是最后的一个结果。但问题在于,使用这种老师的标准方式会将每一个步骤的反馈视为完全相同,仿佛在开始阶段犯的错误与在结束阶段犯的错误一样重要,而忽略了学生的表现是如何随时间变化的。
这篇论文介绍了一种名为 DASH(差异自适应监督时界,Divergence-Adaptive Supervision Horizons)的新方法来修复这个盲点。研究人员发现,标准的方法过于僵化;它没有注意到学生错误的“故事”。有时,早期的一个小错误可能会导致后期的彻底灾难,而类似的错误在后期发生则可能无关痛痒。DASH 就像一个聪明的编辑,观察整个反馈序列。如果学生的表现偏离了老师的建议,并显示出问题正在扩大,DASH 会放大这些信号的权重以纠正航向。如果学生表现良好,它则会降低这些信号的强度。论文表明,通过进行这些调整,DASH 帮助学生比以前更快、更好地学习,在不需要任何额外计算能力或更聪明老师的情况下,提升了不同规模模型的数学推理得分。
问题所在: “一刀切”式的评分者
在训练 AI 进行推理的世界里,我们有一个学生模型和一个老师模型。学生生成一段长长的思考链(“生成过程”)来解决问题。拥有正确解法的老师则观察学生,并说:“嘿,在这个特定的词处,你应该选择另外这个词。”这被称为标记级监督(token-level supervision)。
标准方法被称为 OPSD(在策略自我蒸馏),它收集老师提供的所有这些微小的“你错了”信号,并将它们平均化。这就像老师给学生一份成绩单,无论错误发生在何时,每一个错误都被计入相同的权重。
作者意识到这有点愚蠢。想象一个学生正在解一道数学题:
- 场景 A: 学生在第 1 步犯了一个微小的计算错误,但在第 2 步及时发现了并纠正了它。虽然“差异”(学生与老师之间的差距)曾一度升高,但随后消失了。
- 场景 B: 学生在第 1 步犯了完全相同的微小错误,但随后错误不断扩大,在第 10 步时陷入了完全错误的泥潭。
在标准的 OPSD 中,这两个场景对于第 1 步的惩罚是完全一样的。系统没有意识到在场景 B 中,那个最初的错误是一个灾难的开端,而在场景 A 中,它只是一个轻微的踉跄。标准方法孤立地看待局部错误,忽略了导致该错误发生的历史背景以及该错误可能导致的未来走向。
解决方案: DASH,一位自适应教练
作者提出了 DASH,旨在赋予评分系统记忆和上下文意识。DASH 不仅仅是平均错误,它还会询问:“这个特定的错误如何融入整个答案的故事之中?”
以下是 DASH 的工作原理,使用一个简单的类比:
想象学生正在行走,而老师手里牵着一根绳子,系在学生的腰间。“差异”就是学生偏离老师理想路径的程度。
- 测量差距: DASH 在每一步都会观察学生与老师之间的差距。
- “门控”机制: DASH 不再是用同样的力气每次都将学生拉回,而是使用了一个特殊的“门”。
- 如果学生的表现比平均水平更差(差距正在扩大),门就会敞开。这意味着老师对未来步骤的反馈会获得更强的信号,以强力将学生拉回。它在说:“嘿,这是一个坏趋势!我们需要格外注意修正这条路径。”
- 如果学生的表现比平均水平更好(差距很小),门就会稍微关闭。老师的反馈依然存在,但它不会叫得那么大声,因为学生已经在正确的轨道上了。
- 向后看: DASH 使用了一个被称为“后向聚合”(backward aggregation)的巧妙技巧。它从答案的结尾开始,向开头回溯。它会问:“如果我观察这条路径的终点,这个特定的步骤对最终的混乱(或成功)贡献了多少?”然后,它根据该步骤之后发生的情况来调整该步骤反馈的权重。
这创造了一个动态系统,其中“错误的重要性”不再是固定的。一个导致长串错误的错误会被赋予重权重。一个能被快速纠正的错误则会被赋予轻权重。
研究发现
研究人员在三种不同规模的 AI 模型(17 亿、40 亿和 80 亿参数)上测试了这个想法,并使用了三个高难度的数学基准测试(AIME 2024、AIME 2025 和 HMMT February 2025)。
- 结果: DASH 在所有测试中都一致地击败了标准方法(OPSD)。对于最小的模型(1.7B),平均准确率从 41.87% 跃升至 45.07%。对于较大的模型,增益同样明显,8B 模型从 64.80% 提升到了 66.40%。
- “为什么”: 通过一系列实验,他们证明了这种改进不仅仅是因为增加了“噪声”或随机改变了数学逻辑。他们测试了使用固定门控(如旧方法)与使用智能变化门控的效果对比。事实证明,智能门控(DASH)才是赢家。他们还检查了逻辑方向是否重要(例如,应该更多还是更少地惩罚巨大的差距?)。他们发现,他们特定的逻辑——即通过打开门来让更多的纠正信号进入,从而惩罚巨大的差距——正是成功的关键。
- 效率: 最棒的部分是,DASH 不需要超级聪明的老师,也不需要额外的计算能力。它只是重新利用了标准方法已经在计算的信息,但以更聪明的方式进行处理。这就像是把一堆原始数据进行更好的整理,而不是去收集更多的数据。
总结
这篇论文表明,在教 AI 进行推理时,我们不应仅仅计算错误,而应该理解错误的“故事”。通过使监督具有“自适应性”——即根据学生随时间变化的表现来调整我们听取老师建议的程度——我们可以帮助 AI 更有效地学习。DASH 表明,一点点上下文的力量是巨大的,它能将一个僵化的评分系统转变为一个灵活、智能的教练,知道何时该严格,何时该宽容。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。