Sharpness-Aware Pretraining Mitigates Catastrophic Forgetting
本文表明,通过锐度感知最小化、大学习率或缩短退火周期等方法将预训练优化偏向于更平坦的极小值,能够显著减轻灾难性遗忘,并在各种模型规模和训练后任务中提升下游性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在训练一位主厨(即 AI 模型),方法是让他们品尝数百万道不同的菜肴(预训练)。目标是在将他们派往特定餐厅厨房工作之前(后训练/微调),让他们成为尽可能出色的厨师。
长期以来,研究人员认为,唯一重要的是让主厨在初始训练阶段品尝到“最佳”风味。他们假设,如果主厨一开始就是一位“完美”的通才,那么无论厨房发生何种变化,他们日后自然会成为优秀的专才。
问题:“僵化”的厨师
本文指出,这一假设是错误的。事实证明,有些厨师被训练得在通用品尝上过于“僵化完美”,以至于一旦被要求做新事物时,便容易崩溃。
不妨将其想象为一颗坐落在山谷中的球。
- 标准方法(AdamW):这种方法将厨师训练得坐在一个非常深、狭窄且尖锐的山谷中。他们非常擅长待在原地不动。但如果你轻轻推他们一下(例如要求他们学习新菜谱,或压缩其记忆以适应更小的口袋),他们会立刻滚出山谷。他们“忘记”了所有已知知识。
- 本文的解决方案(锐度感知):这种方法将厨师训练得坐在一个宽阔平坦的山谷中。他们可能并非位于山谷的最深处,但周围是平坦的地面。如果你推他们一下,他们不会滚落;只会轻微滚动并安然无恙。他们是“稳健”的。
研究人员做了什么
该团队测试了三种训练这些“平坦山谷”厨师(而非“尖锐山谷”厨师)的方法:
- “摇晃”法(SAM):他们使用了一种名为“锐度感知最小化”的特殊技术。想象一下,在厨师学习时,你轻轻摇晃桌子。如果厨师在桌子摇晃时仍能正确品尝食物,说明他们正在学习保持稳定。这迫使模型找到那些宽阔平坦的山谷。
- “快车道”法(高学习率):他们让厨师在开始时学得更快、更激进。这就像赛跑;如果你跑得足够快,自然就不会被困在道路上那些微小而深的坑洞里。
- “快速停止”法(缩短退火):通常,训练结束时会逐渐让厨师慢下来。研究人员发现,提前停止这种减速(让节奏保持更久),有助于厨师停留在那个稳定、平坦的区域。
结果
他们在不同规模(从小型到中型大型)的模型上测试了这些方法,发现:
- 更少遗忘:当这些“平坦山谷”模型随后被要求学习特定任务(如数学或编程),或其记忆被压缩(量化)以加快运行时,它们遗忘原有知识的程度要低得多。
- “训练中”的捷径:你无需在整个训练过程中使用这种昂贵的特殊“摇晃”方法。研究发现,仅在训练的最后 10%(即“退火”阶段)使用该方法,就能以极低的成本获得几乎全部收益。
- 现实世界验证:他们在一个拥有 10 亿参数的大型模型(OLMo-2-1B)上进行了测试。尽管采用此方法训练的模型在通用任务上起步时略显“较弱”,但在学习数学后,其技能记忆能力提升了 31%;在经压缩以提高效率后,其技能保持能力提升了 40%。
核心结论
该论文得出结论:我们不应仅仅训练 AI 在起跑线上成为“最佳”,而应训练其具备灵活性和稳定性,以便在环境后续发生变化时不会崩溃。
这之间的区别在于:是训练体操运动员保持一个完美但僵硬的姿势(一旦地面倾斜就会崩溃),还是训练他们拥有强大且平衡的重心(使他们能够适应任何新动作而不跌倒)。通过专注于这种“平衡”(平坦度),而非仅仅追求“完美”(尖锐度),我们就能获得更擅长学习新事物而不遗忘旧知识的 AI 模型。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。