← 最新论文
🤖 machine learning

Fine-Tuning Without Forgetting via Loss-Adaptive Learning Rates

本文介绍了 FINCH,这是一种损失自适应的学习率调度方法,它通过在微调目标不变的情况下,根据训练损失动态调整学习率,从而在保持任务性能的同时显著减轻大语言模型中的灾难性遗忘。

原作者: Parjanya Prajakta Prashant, Jiongli Zhu, Aldan Creo, Babak Salimi

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Parjanya Prajakta Prashant, Jiongli Zhu, Aldan Creo, Babak Salimi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位才华横溢的学生,几乎读遍了图书馆里的所有书籍。他们通晓历史、科学,并能写出完美的文章。这就是你的**大型语言模型(LLM)**在完成初始“预训练”后的状态。

现在,你想教这位学生一项非常具体的新技能,比如如何说一种罕见的方言,或者为新书记忆一系列虚构角色。这就是微调

问题:“覆盖”效应

这篇论文指出了一个令人沮丧的问题,称为灾难性遗忘。当你强迫学生高度专注于这项新的、困难的材料时,他们的大脑开始“重写”旧的连接。他们在新任务上表现出色,但开始遗忘旧知识。他们可能会开始编造事实、给出错误建议,或者无法遵循他们曾经熟练掌握的简单指令。

现有的解决方案试图通过告诉学生来解决这个问题:“忽略新课中那些极难理解的部分;只关注简单的部分。”

  • 缺陷:论文认为这是一个糟糕的主意。要学习一门新语言或新事实,你必须在困难部分下功夫。如果你忽略那些难懂的词汇,你就永远无法真正掌握这项新技能。

解决方案:FINCH(智能节奏策略)

作者介绍了一种名为FINCH的新方法。FINCH 不改变学生学习什么,而是改变他们学习的速度

将学习想象成在蜿蜒的道路上驾驶汽车:

  • 旧方法(标准微调):你保持油门恒定速度。当你遇到一个尖锐、困难的转弯(即具有高困惑度/高损失的“困难”数据批次)时,你可能会失控并撞上路障(遗忘旧知识)。
  • FINCH 方法:FINCH 就像一个智能巡航控制系统,它会观察前方的道路。
    • 当道路棘手时(高损失):系统发现学生正在为某个困难概念挣扎。它会降低学习率(迈出更小的步伐)。这使学生能够小心翼翼地通过棘手部分,而不会失去平衡或忘记自己从何而来。
    • 当道路顺畅时(低损失):学生已经掌握了该概念。FINCH 会提高学习率(迈出更大的步伐),以便他们能快速完成课程。

核心发现

这篇论文的“顿悟”时刻是一个数学观察:遗忘的风险直接与该模型在特定时刻的困惑程度相关。

  • 如果模型非常困惑(高损失),一大步会导致其旧知识发生剧烈崩溃。
  • 如果模型充满信心(低损失),它可以安全地迈出更大的步伐。

FINCH simply 说:“当你困惑时,迈出微小、谨慎的步伐;当你充满信心时,大步前行。”

结果:两全其美

论文在三个严峻场景中测试了这种方法:

  1. 学习新事实:教模型它从未见过的人名和故事。
  2. 学习罕见语言:教模型说加利西亚语,这是一种训练数据极少的语言。
  3. 科学推理:教模型复杂的化学概念。

结果

  • 标准方法要么很好地学会了新任务但遗忘了其他一切,要么记住了旧内容但未能学会新任务。
  • FINCH 能够像标准方法一样很好地学会新任务,但它将遗忘减少了 93%

这就像学生完美地学会了新方言,同时保持了对历史、科学和安全性的知识 intact。他们不仅学会了新事物,而且在过程中保持了可靠、诚实,没有开始编造事实(幻觉)。

总结

FINCH 不改变课程,也不隐藏困难课程。它只是教导模型自我调节节奏。通过在困难时放慢脚步,模型学会了新技能,而不会抹去旧记忆。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →