← 最新论文
🤖 machine learning

RL Fine-Tuning Heals OOD Forgetting in SFT

本文通过逐检查点分析和谱分析证明,监督微调(SFT)常导致分布外遗忘,而强化学习(RL)随后将其恢复,这一恢复过程与奇异向量的旋转相关而非奇异值的变化,从而挑战了"SFT 导致记忆、RL 实现泛化”的观点。

原作者: Hangzhan Jin, Sitao Luan, Tianwei Ni, Sicheng Lyu, Guillaume Rabusseau, Reihaneh Rabbany, Doina Precup, Mohammad Hamdaqa

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Hangzhan Jin, Sitao Luan, Tianwei Ni, Sicheng Lyu, Guillaume Rabusseau, Reihaneh Rabbany, Doina Precup, Mohammad Hamdaqa

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗易懂的语言和富有创意的类比对这篇论文的解释。

宏观图景:AI 训练的“两步舞”

想象你正在教导一位才华横溢但缺乏经验的学生(一个大语言模型)如何解开复杂的谜题。让这位学生成为推理专家的标准食谱包含两个步骤:

  1. 第一步:监督微调(SFT) – 你给学生一本带答案的教科书,并说:“记住这些模式,模仿这种风格。”
  2. 第二步:强化学习(RL) – 你让学生进入一个游戏,答对得分,答错扣分,并说:“现在,为了获胜,你自己去搞懂其中的逻辑。”

长期以来,AI 界信奉一个简单的故事:"SFT 让学生背诵教科书(擅长已知问题),而 RL 让学生举一反三、创造性思考(擅长新问题)。”

这篇论文指出,这个故事并不完整。 作者发现,虽然 SFT 起初效果很好,但如果你让学生研读教科书的时间过长,它实际上会损害学生解决新型谜题的能力。随后,RL 并不一定教会他们新的超能力;它主要只是修复了 SFT 造成的损害


发现:“峰值与崩溃”

研究人员在训练过程中每天观察这位学生的进步。他们发现了一个令人惊讶的模式:

  • 早期胜利: 在“教科书学习”(SFT)刚开始时,学生在解决类型谜题(分布外或 OOD 任务)方面变得非常出色。这就像学生突然理解了数学背后的逻辑。
  • 崩溃: 随着学生继续研读教科书,他们在解决新谜题方面开始变差,尽管他们在处理教科书上的具体问题时变得更好。他们变得如此痴迷于教科书答案的确切格式,以至于忘记了如何将逻辑应用到略有不同的情境中。
  • 修复: 当他们最终切换到“游戏”阶段(RL)时,学生在解决新谜题上的表现重新回升。

类比:
想象一位厨师在学习烹饪。

  • 早期 SFT: 厨师学习了风味的基本规则。他们可以用任何食材烹饪出美味的菜肴。
  • 晚期 SFT: 厨师被迫死记硬背一本特定的食谱。他们在制作那道特定的菜方面变得出类拔萃,但忘记了如果给不同的食材该如何调整风味。他们“遗忘”了通用的烹饪直觉。
  • RL: 厨师被投入一场比赛,无论食谱如何,只要食物美味就能得分。这迫使他们停止盲目照搬书本,重新开始运用直觉。他们恢复了通用的烹饪技能,但他们并没有突然变得比训练刚开始时更优秀。

关键发现:RL 是“修复者”,而非“创造者”

这篇论文挑战了 RL 从零开始创造新推理能力的观点。相反,作者发现:

  1. SFT 导致遗忘: 如果你在特定数据上训练时间过长,模型会“遗忘”其处理怪异或新情况的能力。
  2. RL 进行恢复: RL 就像创可贴。它修补了 SFT 造成的漏洞,将模型恢复到 SFT 阶段峰值时的性能水平。
  3. 天花板: RL 很少能让模型变得优于那个早期的峰值。它只是将其带回在变得过于专业化之前的水平。

“金发姑娘”区域:
研究人员发现,RL 只有在正确的时间开始才有效。

  • 如果你开始 RL 太早(在模型掌握基础知识之前),它会失败,因为模型太困惑。
  • 如果你开始 RL 太晚(在模型已经遗忘一切之后),“游戏”信号对模型来说太混乱,无法从中学习。
  • 存在一个特定的“甜蜜点”(一系列检查点范围),RL 可以在其中成功治愈遗忘。

秘密机制:“旋转的指南针”

为了理解为什么会发生这种情况,作者使用一种名为**奇异值分解(SVD)**的数学工具查看了模型内部的“大脑”。将模型的知识想象成一个巨大的指南针,上面有许多指向不同方向的指针。

  • 指针的大小(奇异值): 研究人员发现,这些指针的强度(存储了多少知识)在训练过程中几乎没有变化。它们保持稳定。
  • 指针的方向(奇异向量): 然而,指针指向的方向发生了剧烈变化。

类比:
想象模型的知识是一张地图。

  • SFT 并没有擦除地图(数据量保持不变),但它旋转了地图。它转动指南针,使“北方”指向具体的教科书示例,这使得在寻找新、不同地点的“北方”时变得困难。
  • RL 将指南针转回来。它并没有在地图上添加新的陆地;它只是重新校准指南针,使“北方”再次指向通用逻辑,从而允许模型在新的地形中导航。

给普通读者的总结

  • 旧观念: "SFT 负责记忆,RL 负责泛化。”
  • 新现实: "SFT 导致遗忘(因过度专业化),而 RL 进行恢复(通过重新校准)。”
  • 教训: 不要永远让你的 AI 在同样的特定数据上训练。它将失去灵活思考的能力。如果你希望它对新鲜事物保持聪明,你需要在正确的时间停止“记忆”阶段,并利用“游戏”阶段来修正焦点,而不是指望游戏从零开始教会它全新的技能。

该论文得出结论,解决新颖、棘手问题的最佳性能通常发生在训练过程的早期,而第二阶段(RL)主要是为了挽救我们在第一阶段训练过久所犯的错误。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →