← 最新论文
🤖 machine learning

Revitalizing the Beginning: Avoiding Storage Dependency for Model Merging in Continual Learning

本文提出了轨迹正则化合并(TRM),这是一个新颖的框架,通过将模型合并重构为增强轨迹子空间内的优化过程,以解决持续学习中的存储限制和优化停滞问题,从而实现最先进的性能。

原作者: Xi Wang, Cheng Deng

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Xi Wang, Cheng Deng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《重振开端:在持续学习中避免存储依赖以实现模型融合》的通俗解读,采用日常类比进行说明。

核心难题:“健忘的厨师”与“沉重的冰箱”

想象你是一位厨师,试图每天学习一道新菜谱。

  • 目标:你想成为精通所有菜谱的大师(持续学习)。
  • 问题:如果你过于专注于今天的菜肴,可能会忘记昨天菜肴的做法。这被称为“灾难性遗忘”。
  • 旧方案:通常,厨师会保留一个巨大的冰箱,里面装满了他们曾经用过的每一种食材和菜谱,以便随时回顾和记忆。
  • 限制:在这篇论文中,作者提出:“不允许使用大冰箱!”你只能保留刚学会的菜谱和紧挨着之前学会的那一道。你不能存储旧数据或旧模型。这是一项严格的隐私和存储规则。

现有缺陷:“糟糕的交接”

现有方法试图将你的“旧菜谱”和“新菜谱”合并成一份“大师菜谱”(模型融合)。然而,作者发现,当无法查看历史记录时,现有方法在执行这种“交接”时表现不佳。

他们指出了这种“交接”出错的三种具体方式:

  1. “平均导致平庸”问题(次优局部收敛):
    想象你有一份完美的千层面菜谱和一份完美的寿司菜谱。如果你只是将它们各取一半混合,你会得到一道奇怪且平庸的菜肴,尝起来既不像千层面也不像寿司。现有方法试图寻找一个“全局平均值”,但这破坏了每个任务所需的特定细节。结果是一个在所有任务上都表现尚可、但在任何任务上都表现出色的模型。

  2. “结构破坏”问题(语义表征的破坏):
    想象一座建筑。地基(底层)支撑着重量,但具体的房间(高层)才是独特功能发生的地方。当现有方法将两个模型强行合并时,它们会意外地破坏内部布线。这就像试图通过砸碎墙壁来合并两座房子;房间最终会出现在错误的位置,导致房子不再合理。

  3. “陷入泥潭”问题(优化可塑性的丧失):
    想象你在开车。如果你把车停在一个深而平坦的山谷里,由于没有坡度可以滚下,很难让车再次启动。现有的合并方法经常将模型停在一个数学上的“平坦山谷”中。当下一个新任务到来时,模型过于“僵硬”和被困住,无法学习任何新东西。它已经失去了适应能力。

解决方案:TRM(轨迹正则化融合)

作者提出了一种名为TRM的新方法。与其盲目地混合两份菜谱,他们将该融合过程视为在地图上寻找完美位置的引导式搜索。

以下是 TRM 的工作原理,它利用三条“规则”来寻找最佳位置:

  1. 规则 1:忠于新任务(任务对齐)

    • 类比:在离开厨房之前,确保新菜肴确实味道好。
    • 作用:它强制合并后的模型立即在当前任务上表现良好,确保我们不会丢失新菜谱的特定细节。
  2. 规则 2:保持房屋完整(预测一致性)

    • 类比:确保新房子里的房间仍然与旧房子里的房间对应。不要让厨房最终出现在浴室里。
    • 作用:它检查模型的内部“布线”是否未被打乱。它确保模型对世界的内部理解保持稳定和合乎逻辑。
  3. 规则 3:保持引擎运转(梯度响应性)

    • 类比:不要把车停在平坦的山谷里。把它停在一个小山坡上,这样引擎可以轻易地发动并向前移动。
    • 作用:它确保模型不会“卡住”。它保持数学上的“坡度”足够陡峭,以便当下一个新任务到来时,模型能够快速轻松地学习。

秘密配料:“魔法轻推”

由于作者不被允许查看旧数据,他们只能利用非常有限的信息(即旧模型和新模型之间的一条直线)。为了解决这个问题,他们引入了一个“扰动向量”(一种受控的随机轻推)。

  • 类比:想象你正沿着直线行走,但感觉像是撞到了墙。你向侧面迈出一小步(不是随机的踉跄,而是有意的步伐),看看是否有更好的路径。
  • 原因:这为模型提供了一点“回旋余地”,使其能够在不需要记住整个历史的情况下找到更好的位置。

结果

作者在几个困难的烹饪挑战(数据集如 CIFAR100、ImageNet-R 和 Stanford Cars)上测试了这位“厨师”(模型)。

  • 结果:TRM 始终胜过其他方法。
  • 分数:在最难的测试(包含 20 个任务的 ImageNet-R)中,TRM 达到了82.7%的准确率,而次佳方法仅获得79.3%
  • 效率:它在不需要巨大冰箱(无存储数据)的情况下做到了这一点,且烹饪(训练)时间并未比其他方法长多少。

总结

该论文认为,简单地将两个 AI 模型平均在一起会破坏它们后续学习新事物的能力。通过使用三条特定规则来检查模型的“味道”、“结构”和“引擎”,并通过向侧面迈出一小步经过计算的步伐,作者创造了一种融合模型的方法,使其保持敏锐、稳定并随时准备应对接下来的任何挑战——而无需囤积旧数据。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →