← 最新论文
🤖 machine learning

Loss Smoothing for Stable Adaptation Under Distribution Shift

本文提出了“损失平滑”(loss smoothing),一种通过在源目标与目标目标之间进行插值,以实现在分布偏移下的渐进式适应的方法,从而保留有用特征,并在微调和强化学习等多种任务中持续提升性能。

原作者: Darshan Patil, Ekaterina Lobacheva, Razvan Pascanu, Sarath Chandar

发布于 2026-07-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Darshan Patil, Ekaterina Lobacheva, Razvan Pascanu, Sarath Chandar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位精通法式经典菜谱、并用多年时间不断完善它的名厨。你对食材的处理、火候的掌控以及时机的把握都了如指掌。现在,有人请你去做一道完全不同的菜,比如泰式辛辣咖喱。

旧方法(“硬切换”):
在传统的机器学习中,当需要切换任务时,厨师会被告知立即扔掉手中的法式菜谱,忘掉关于法式烹饪的一切知识,仅凭新的指令从零开始学习泰式食谱。他们可能会保留切菜的基本技能(基础的切配能力),但被迫立即放弃所有的法式烹饪技巧。这种突然的变化往往会导致厨师陷入恐慌,导致新菜品失败,并丧失了原本积累的肌肉记忆。用论文中的术语来说,这是一种“突发性转变”(abrupt transition),它会扭曲有用的特征。

新方法(损失平滑/Loss Smoothing):
作者提出了一种更温和的方法,称为损失平滑(Loss Smoothing)。在切换到新任务时,并不要求厨师立即丢弃法式菜谱,而是建议设置一个过渡期。

  1. 融合: 在新任务开始时,厨师遵循的是一种“混合型”指令。他们使用 90% 的新泰式指令和 10% 的旧法式技巧。
  2. 淡出: 随着烹饪的进行,配比会逐渐变化。变成 80% 泰式 / 20% 法式,然后是 50/50,最后达到 100% 泰式。
  3. 结果: 因为厨师没有经历那种突然且剧烈的跳跃,他们可以在学习新风味的同时,保留有用的刀工和通用的烹饪直觉。旧知识充当了一个安全网,防止他们在学习新风格的过程中犯下灾难性的错误。

这篇论文实际的研究发现

研究人员在四种不同的现实场景中测试了这种“融合”理念,就像一位试图尝试不同新菜系的厨师:

  • 视频游戏 AI(强化学习): 想象一个利用旧的、记录好的数据(离线)进行训练的 AI。当它开始与真实对手进行实时对抗(在线)时,它往往会感到困惑。“硬切换”会让它忘记从记录中学到的安全策略。损失平滑帮助 AI 在保留这些安全策略的同时,慢慢学会承担风险,从而在 AntMazeHalfCheetah 等游戏中获得了更高的分数。
  • 语言模型(LLM): 大型语言模型首先在海量的互联网文本上进行预训练。然后,它们会被“微调”以遵循特定的指令。有时,如果模型在互联网数据上的训练过度,它会变得非常“脆弱”,一旦被要求遵循指令就会崩溃。论文发现,损失平滑(即从互联网文本向指令学习的逐渐过渡)防止了这种崩溃,使模型在保持聪明和有用性的同时,不会丢失其通用的知识。
  • 学习新任务(持续学习): 如果一个机器人先学习识别猫,然后是狗,接着是鸟,硬切换往往会导致它忘记如何识别猫。损失平滑帮助机器人在学习狗的同时记住猫,减少了通常会发生的“遗忘”现象。
  • 视觉模型: 当一个模型从一组图像(如 ImageNet)适配到另一组图像(如 DomainNet)时,平滑的过渡有助于模型在学习新图像风格的同时,保持识别物体的能力。

核心结论

论文认为,从一个旧任务过渡到新任务时,“如何”过渡与新任务本身同样重要。

  • 问题所在: 直接跳入一个新目标,就像是在踩死刹车的同时又猛踩油门。这会对系统造成冲击。
  • 解决方案: 损失平滑就像是缓缓松开油门,然后温柔地踩下新的踏板。它让旧训练中有用的部分保留得足够久,以引导模型进入新任务,然后通过缓慢淡出,让模型实现专业化。

作者总结道,这种简单的技巧——即在旧目标和新目标之间进行插值——使得模型更加稳定,不易在学习过程中“崩溃”,并且在面对新情况(无论是机器人、语言模型还是图像分类器)时具有更好的适应能力。

重要提示: 论文严格关注这些模型的训练机制。它并未声称这种方法可以治愈疾病、预测股市,或在测试的特定训练场景(微调、强化学习和持续学习)之外用于特定的未来应用。这种“魔力”纯粹在于如何将学习过程平滑化的数学逻辑。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →