Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less
本文引入了“优化器 - 模型一致性”的概念,证明在预训练和全量微调中使用相同的优化器相较于其他优化器或 LoRA 能够减少灾难性遗忘并改善学习与遗忘之间的权衡,同时也揭示了 Muon 等特定优化器因倾向于死记硬背而在推理任务中表现不佳。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一位才华横溢的学生,他花费数年时间阅读了一座巨大图书馆里的每一本书(这就是预训练)。他掌握了通用知识、语法以及思考世界的方式。现在,你想教他一项特定的新技能,比如解决数学问题或编写计算机代码(这就是监督微调或SFT)。
巨大的挑战在于:如何在不让他忘记在图书馆中学到的一切的情况下,教会他这项新技能?如果他对新数学过于专注,可能会开始忘记如何写一个简单的故事。这被称为**“学习 - 遗忘权衡”**。
这篇论文发现了一条关于如何最佳地教导这位学生的惊人规则,关键在于你如何教他们,而不仅仅是教他们什么。
主要发现:“同一位老师,同一种风格”
作者发现,教授新技能的最佳方式是使用与多年图书馆阅读期间完全相同的教学风格(优化器)。
- 类比:想象这位学生是通过一种特定方法学会阅读的,比如“方法 A"(例如一种特定的文本高亮和笔记方式)。如果你试图用“方法 B"(一种完全不同的文本高亮和笔记方式)教他数学,学生会感到困惑。他们可能会学会数学,但开始忘记阅读技能,因为新方法与他们经过多年练习而形成的思维模式相冲突。
- 发现:如果你在数学课上坚持使用“方法 A",学生既能学会数学,又能保持阅读技能完好无损。论文将这种现象称为**“优化器 - 模型一致性”**。
为什么会发生这种情况?(“大脑形状”理论)
论文解释说,不同的教学方法实际上会以不同的方式塑造学生的大脑(模型的内部权重)。
- 不同的形状:某些教学方法(如最常见的AdamW)将大脑训练得“稀疏”或“高效”,就像一座图书馆,书籍排列整齐,彼此之间留有空白。其他方法(如较新且更复杂的Muon)则将大脑训练得“稠密”,就像一座书籍紧密堆叠的图书馆。
- 不匹配:如果你用“稀疏”方法训练大脑数年,然后突然切换到“稠密”教学方法来学习数学,大脑就必须 scramble(混乱地)重新调整其整体结构。这种混乱会导致它丢弃旧书(遗忘)。
- 匹配:如果你继续在数学课上使用“稀疏”方法,大脑只需在现有书架上添加新书。它无需重建图书馆,因此遗忘更少。
LoRA 的惊喜
有一个流行的捷径叫做LoRA(低秩自适应)。可以将 LoRA 想象成给学生一本单独的笔记本,让他们在上面写数学答案,而无需触碰他们主要的图书馆藏书。许多人认为这是避免遗忘的最佳方式。
论文的转折:作者发现,虽然 LoRA 很好,但使用与之前相同的教学方法进行完全重新训练(重写整个大脑)实际上效果更好。
- 类比:LoRA 就像携带一本单独的笔记本。它有效,但如果你用相同的教学风格重写你的主要大脑,你不仅能容纳新数学,还能比仅使用侧边笔记本更有效地保留旧阅读技能。
“死记硬背者”(Muon)的案例
论文还考察了一种特定的高级教学方法,称为Muon。
- 优点:Muon 在图书馆阶段(预训练)表现出色。它帮助学生极其出色地记忆事实。
- 缺点:当用极少量数据学习新推理技能(如数学)时,Muon 倾向于成为一个“死记硬背者”。它试图记忆它看到的特定数学问题,而不是学习底层模式。
- 结果:如果你在整个旅程(图书馆 + 数学)中都使用 Muon,学生可能在背诵事实方面表现出色,但在解决新的、未见过的数学问题时却会挣扎。他们记住了例子,但没有学会逻辑。
用通俗英语总结
- 一致性是关键:要学习新技能而不忘记旧技能,请继续使用最初训练模型时所使用的相同学习算法(优化器)。
- 不要中途换风格:中途更改学习算法会迫使模型重新组织其“大脑”,从而导致其丢失旧知识。
- 完全重新训练 > 捷径:有时,使用正确的算法进行完全重新训练比使用 LoRA 等捷径更好,因为它与模型大脑的原始构建方式更契合。
- 警惕过度记忆:某些高级算法(如 Muon)擅长记忆,但在数据稀缺时,学习新模式的能力可能较差。
论文得出结论,如果你想在学新事物和记旧事物之间取得最佳平衡,请坚持使用你最初的那位老师。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。