← 最新论文
🤖 AI

Cornerstones or Stumbling Blocks? Deciphering the Rock Tokens in On-Policy Distillation

本文在策略蒸馏中识别出“岩石令牌”这一持续存在的高损失令牌子集,它们消耗大量优化资源却对推理性能贡献微乎其微,表明战略性地绕过它们可以简化模型对齐过程。

原作者: Yuxuan Jiang, Runchao Li, Shubhashis Roy Dipta, Dawei Li, Zhao Yang

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuxuan Jiang, Runchao Li, Shubhashis Roy Dipta, Dawei Li, Zhao Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教导一位才华横溢但略显笨拙的学徒(学生模型)通过模仿一位大师级建筑师(教师模型)来撰写完美的数学证明。

在人工智能领域,这一过程被称为在线策略蒸馏。学徒撰写证明,教师进行纠正,然后学徒再次尝试。通常,我们假设学徒犯下的每一个错误都是一堂宝贵的课程。如果教师说“你这里错了”,学徒就会从中学习。

本文介绍了一个令人惊讶的发现:并非所有错误都是课程。 事实上,许多最频繁的“错误”实际上只是绊脚石,它们浪费时间和能量,而极少数的错误才是支撑整个结构的真正基石

以下是他们研究发现的分解,使用了简单的类比:

1. “岩石令牌”:顽固的鹅卵石

研究人员注意到,即使学徒已经练习了很长时间并似乎掌握了材料,仍有一些特定的单词和符号不断被教师“纠正”。他们将这些称为岩石令牌

  • 它们是什么? 它们不是复杂的数学公式或深层逻辑。它们是“枯燥”的内容:空格、换行符、括号、标点符号,以及像“所以”、“等等”或“让我们”这样的常见过渡词。
  • 问题所在: 这些令牌频繁出现(约占文本的 18%)。每当学徒使用它们的方式与教师略有不同时,计算机就会计算出“高损失”(即大误差)。
  • 悖论: 尽管计算机不断对这些令牌大喊“错误!”,但学徒实际上从未学会修正它们。在整个训练过程中,它们顽固地保持错误状态。这就像一个学生每次做作业都写错日期,无论老师圈出多少次,学生总是以同样的方式继续犯错。

2. 两大惊人发现

研究人员深入挖掘,发现了关于这些“岩石令牌”的两个惊人真相:

惊喜 A:梯度悖论(噪声与信号)
通常,我们认为大误差意味着巨大的学习机会。但对于岩石令牌而言,事实恰恰相反。

  • 隐喻: 想象教师正在试图操纵一艘船。岩石令牌就像一股巨大且持续不断的波浪拍打着船身。它猛烈地推动船只(产生高“梯度”),但由于波浪如此恒定且可预测,船舵只是忽略它。船只继续朝同一方向漂移。
  • 现实: 这些令牌在训练数据中产生了大量“噪声”。它们占据了计算机大量的处理能力试图修正它们,但实际上并没有帮助模型在推理方面变得更聪明。它们只是学徒过于顽固而无法打破的结构习惯。

惊喜 B:“支柱”与“绊脚石”
研究人员问道:“如果我们移除这些顽固的令牌,模型会崩溃吗?”

  • 隐喻: 想象一座建筑。大多数砖块只是填充物。但有几块特定的砖块是支柱——如果你把它们拿走,屋顶就会倒塌。其余的只是绊脚石——如果你移除它们,建筑物依然稳固,甚至可能更好,因为它更轻了。
  • 现实: 他们在测试阶段通过“剔除”这些令牌进行了测试。
    • 结果: 96% 到 98% 的这些顽固令牌是中性的。移除它们丝毫没有损害模型的数学能力。
    • 例外情况: 只有一小部分(约 1.5% 到 3.5%)是真正的支柱。这些是像“特定”、“战略”或“初始化”这样的特定词汇,它们对逻辑实际上至关重要。
    • 关键发现: 不存在任何“绊脚石”。移除顽固令牌从未使模型表现变差。它们只是死重。

3. 解决方案:“跳过”按钮

由于大多数这些“岩石令牌”只是在浪费时间,研究人员尝试了一种新策略:冻结梯度

  • 类比: 教师不再强迫学徒每次都重新学习如何写日期或使用逗号,而是说:“好吧,我们同意你按自己的方式写日期。让我们停止浪费时间去纠正那个,专注于实际的数学。”
  • 结果: 当他们停止尝试纠正这些顽固令牌时:
    • 模型的数学性能保持完全不变
    • 训练过程变得快了 1.4 到 1.7 倍

核心结论

本文认为,在我们目前训练 AI 模型的方式中,我们执着地试图修正学生与教师之间每一个微小的不匹配。

然而,这是低效的。我们花费了 18% 的精力试图对齐文本中“枯燥”的结构部分(空格、标点符号、常见词汇),模型根本拒绝改变这些部分,而且为了变得聪明,实际上也不需要改变它们。

要点:
为了使 AI 训练更快、更高效,我们不应再将每一个“错误”视为关键课程。我们应该识别这些岩石令牌(顽固的、高频的结构错误)并跳过它们。通过忽略“绊脚石”并只关注罕见的“基石”(实际逻辑),我们可以更快地构建更智能的模型,而不会损失任何推理能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →