← 最新论文
🤖 machine learning

Stabilizing LLM Supervised Fine-Tuning via Explicit Distributional Control

本文介绍了锚定学习,这是一种通过利用动态演进的移动锚点来控制分布漂移,从而在显著降低能力退化(相较于标准方法)的同时实现近乎最优性能提升的大语言模型监督微调框架,以缓解灾难性遗忘问题。

原作者: Xinyu Wang, Changzhi Sun, Yuanbin Wu, Xiaoling Wang

发布于 2026-05-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinyu Wang, Changzhi Sun, Yuanbin Wu, Xiaoling Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位博学多才、见多识广的图书管理员(即大型语言模型),他对万事万物都略知一二。你希望教会这位管理员一项全新的、非常具体的技能:如何解决复杂的医学数学问题。

问题:“覆盖”效应
如果你只是强迫这位管理员在数周内只研读医学数学书籍,他确实会在这件事上变得非常擅长。但遗憾的是,他可能会开始忘记如何写诗、编写代码,甚至进行正常的对话。在科技界,这被称为灾难性遗忘。新学习的内容“覆盖”了旧知识。

近期研究表明,这种现象发生的原因是管理员的大脑(即模型的内部分布)过度剧烈地向新主题摆动,从而失去了与旧知识的平衡。

旧方案(及其困境)

  • 标准训练:只是刻苦钻研新内容。结果:数学能力突飞猛进,但其他所有能力都变得糟糕。
  • “勿变”规则:告诉管理员,“完全不要改变你的个性”。结果:他依然是一位优秀的通才,但从未充分掌握新的数学技能,以至于无法实用。
  • 强化学习(RL):一种复杂的方法,管理员通过练习、获得反馈并再次尝试。它在保留旧技能方面效果良好,但速度慢、成本高,且需要管理员自行生成练习题(这在离线环境下很难做到)。

新方案:“锚定学习”
作者提出了一种巧妙的折中方案,称为锚定学习。其工作原理如下,借助一个简单的类比:

想象这位管理员正在学习一个新的舞步(即新任务)。

  1. 锚点:与其试图直接从“旧舞步”跳到“新舞步”,我们创建一个移动锚点。将其想象为一位舞伴,他是管理员“当前”自我与“原始”自我的混合体。
  2. 过程
    • 步骤 1:我们将管理员当前的知识与他们原始的、冻结的知识混合,创建一个“目标”舞步。
    • 步骤 2:管理员练习以匹配这个特定的目标。
    • 步骤 3:一旦他们掌握了该目标,我们就稍微更新一下“移动锚点”。锚点会向新舞步移动一小步,但绝不会完全抛弃原始的图书管理员。
    • 步骤 4:重复上述过程。

为何此法独特?

  • 它是一个“信任区域”:与其采取可能让管理员忘记自己名字的巨大且危险的跳跃,锚定学习迫使他们迈出微小而安全的步伐。这就像在走钢丝时,系着一根随你移动的保险绳,而不是一根可能会绊倒你的静态杆子。
  • 它是显式的:论文从数学上证明,该方法在每一步都能将“旧自我”与“新自我”之间的“距离”控制在一定范围内。
  • 它是离线的:与复杂的强化学习方法不同,这种方法不需要管理员即时生成新的练习题。它只是高效地利用现有的教科书(即数据集)。

结果
作者在数学、医学计算和遵循指令等任务上测试了这种方法。

  • 标准训练使模型在新任务上表现出色,但导致其通用技能(如图书管理员忘记如何阅读)损失超过53%
  • 锚定学习使模型在新任务上保持几乎同样优秀的表现,同时将通用技能的损失降低到**5%**以下。

权衡
文中提到的唯一缺点是,该方法比标准训练多消耗一些计算机时间(大约长 1.5 到 2 倍),因为它需要在每一步进行少量的额外“混合”和检查。然而,论文认为,为了避免遗忘模型所知其他一切内容的灾难,这一微小代价是值得的。

一言以蔽之
锚定学习就像教一位主厨学习新食谱:不是强迫他们扔掉整本食谱来学习一道新菜,而是让他们一步步品尝旧风格与新风格的混合体。这种方法在保留厨师原有天赋的同时,仍让他们掌握新技能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →