← 最新论文
🤖 machine learning

Denser \neq Better: Limits of On-Policy Self-Distillation for Continual Post-Training

本文挑战了在持续后训练中同策略自蒸馏(on-policy self-distillation)是一种更优方法的假设,通过 SDPO 实验证明,虽然它加速了领域内专业化,但由于参数漂移的增加和格式伪影的放大,与同策略强化学习方法相比,它往往会导致更严重的遗忘和模型崩溃。

原作者: Meng Wang, Haohan Zhao, Wenzhuo Liu, Lu Yang, Geng Liu, Haiyang Guo, Guo-Sen Xie, Gaofeng Meng, Hongbin Liu, Fei Zhu

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Meng Wang, Haohan Zhao, Wenzhuo Liu, Lu Yang, Geng Liu, Haiyang Guo, Guo-Sen Xie, Gaofeng Meng, Hongbin Liu, Fei Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心思想:为什么“多”并不总是“更好”

想象你正在教一个学生(大语言模型)学习新技能。你希望他能先后学会数学、科学和编程,且在学习新学科时不会忘记之前的知识。

最近,一种被称为**自我蒸馏(Self-Distillation)**的方法成为了“黄金法则”。其理念非常简单:让学生生成一个答案,然后让这个学生本身(扮演老师的角色)对该答案中的每一个词进行实时评分。因为老师会对每一个词都给出反馈(即“密集监督”),这似乎会让学生学得飞快,且永远不会忘记旧课。

但这篇论文说:“等等,事实并非如此。”

作者发现,虽然这种“逐词教学”对于快速掌握某个特定主题非常有效,但在你试图连续教授模型许多不同事物时,它实际上是危险的。它经常会导致模型忘记之前学到的一切,有时甚至会导致模型彻底崩溃。


核心冲突:“狂热者” vs. “稳健的手”

论文对比了两种教学风格:

  1. “逐词纠错”的导师 (SDPO): 这是自我蒸馏方法。老师看着学生的草稿,并立即纠正其中的每一个词

    • 类比: 想象一位教练在短跑运动员身边奔跑,每走一步就大喊:“左脚移动!不对,再快点!膝盖弯曲!注意手臂动作!”
    • 结果: 运动员在跑当前这条特定的赛道时会变得非常快。但如果教练每隔几秒钟就改变一次对技术的看法,或者教练开始模仿运动员自身的错误,运动员就会感到困惑,失去平衡,甚至彻底忘记如何跑步。
  2. “终点线”教练 (GRPO): 这是传统的强化学习方法。学生跑完整个比赛,教练只在最后给出评分(例如:“做得好,你用了10秒完成”)。

    • 类比: 教练让运动员跑自己的比赛。他们不会干预每一个步伐,只对最终结果给出反馈。
    • 结果: 运动员进步的速度可能稍慢,但他们会形成一种稳定、自然的风格。当他们切换到一条新赛道(一个新学科)时,不会失去平衡,依然能记得如何跑步。

用比喻解释的关键发现

1. “脆弱的老师”问题

在“逐词纠错”的方法中,老师本身就是模型。论文发现,如果老师更新得太快(试图保持“新鲜感”),就会变得不稳定。

  • 类比: 想象一位既是老师又是学生的老师。如果老师根据学生刚刚说了什么,每5分钟就改变一次对“正确”答案的看法,学生就会感到头痛。学生会开始模仿老师的混乱。
  • 解决方法: 论文发现,老师需要保持稳定。与其让老师不断变化,不如让老师保持一段时间不变,然后进行快速刷新,这样效果更好。

2. 错误的“回音壁”效应

当模型进行逐词自我纠错时,它可能会无意中强化坏习惯。

  • 类比: 想象一个学生在作文里不小心写了一个奇怪的符号(比如一个故障的表情符号)。“逐词纠错”的老师看到了它,认为“哦,这是某种风格”,然后告诉学生再写一遍。学生又写了一遍,老师再次赞扬,很快学生就开始只写这些奇怪的符号了。
  • 结果: 模型发生了“崩溃”。它不再回答问题,而是反复重复格式错误,因为反馈循环将一个微小的错误放大成了一个巨大的习惯。

3. “中间地带”陷阱(遗忘)

论文发现了模型在遗忘方面的一种奇特模式。

  • 类比: 想象你在学习弹钢琴。
    • 如果你学习一首与你已知知识非常相似的曲子,你会在这两者上都变得更好。
    • 如果你学习一首完全不同的曲子(比如从钢琴转到架子鼓),你的钢琴技巧会保持安全,因为它们差异巨大。
    • 危险之处: 如果你学习一首有些相似但规则略有不同的曲子,你的大脑会产生混乱。你会尝试把旧规则应用到新曲子上,结果导致两者的表现都变差了。
  • 发现: “逐词纠错”法擅长处理“非常相似”的任务,但在处理“有些相似”的任务时表现糟糕。它会导致模型忘记那些足够接近以至于会产生干扰、但又不够接近以至于无法提供帮助的旧技能。

4. “漂移”

论文观察了模型内部的“大脑”(参数)发生了什么变化。

  • 类比: “终点线”教练(GRPO)会对运动员的鞋子进行细微且谨慎的调整。而“逐词纠错”教练(SDPO)则是在不断地重建运动员的腿部并改变他们的步幅。
  • 结果: “逐词纠错”法导致模型离原本的自我太远,以至于失去了处理新情况和意外情况的能力。它变成了一个只能在既定框架内思考的专家。

总结

论文得出结论:密集监督(纠正每一个词)是一把双刃剑。

  • 何时奏效: 如果你有一个非常稳定的老师和一个非常明确的任务,它能帮助模型快速实现专业化。
  • 何时失效: 在“持续学习”的情景下(即一个接一个地学习新事物),它过于激进。它会放大噪声,强化格式错误,并导致模型忘记先前的知识。

核心启示: 不要假设给模型更多的反馈(每个词都给反馈)会让它变得更聪明或更稳定。有时,一种更缓慢、更稳健的方法(如“终点线”教练)反而更好。论文警告我们,不要把自我蒸馏视为一种神奇的稳定器;它需要精细的管理,以避免破坏模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →