← 最新论文
💻 computer science

Take Only What You Need: Rank Minimization as an Implicit Forgetting Regularizer in Continual Learning

本文提出了 CoDyRA,这是一种持续学习方法,它在 LoRA 更新中利用秩最小化作为隐式遗忘正则化器,以动态平衡可塑性与稳定性,从而在多个基准测试中优于现有方法。

原作者: Haodong Lu, Chongyang Zhao, Jason Xue, Lina Yao, Kristen Moore, Dong Gong

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Haodong Lu, Chongyang Zhao, Jason Xue, Lina Yao, Kristen Moore, Dong Gong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和日常类比对论文《只取所需:秩最小化作为持续学习中的隐式遗忘正则化》的解释。

核心难题:学习的“漏桶”

想象你有一位非常聪明、博览群书的朋友(预训练模型),他知晓世间万物。你希望每天教他新事物,比如识别某种特定的狗,或者学习用一门新语言编写代码。这被称为持续学习

问题在于**“可塑性 - 稳定性权衡”**:

  • 可塑性:你希望你的朋友足够灵活,能轻松学会新的狗种。
  • 稳定性:你不希望他在学习狗的时候,忘记如何识别猫或如何说法语。

如果你教得太猛,他可能会“覆盖”旧记忆(灾难性遗忘);如果你过度保护旧记忆,他又学不到新东西。

旧方法:添加配件或使用图书馆

这篇论文探讨了人们迄今为止尝试过的解决方案:

  1. “配件”法(模型互补):与其教你的朋友新东西,不如为每个新主题给他一本新笔记本。他的原脑保持不动,但现在他得背着一背包的笔记本,并得 figuring out 该打开哪一本。这很笨重,且需要额外工具。
  2. “图书馆”法(参考约束):你在房间里保留一个巨大的旧书库(过往数据)。每次教他新东西时,你强迫他查阅旧书,以确保他不会遗忘。这既缓慢又昂贵,且需要存储所有旧数据。

新想法:CoDyRA(“极简主义”方法)

作者提出了一种名为CoDyRA的新方法。与其添加笔记本或保留图书馆,他们教朋友直接更新大脑,但遵循一条非常具体的规则:“只取所需”

他们使用了一种称为LoRA(低秩适应)的技术。把 LoRA 想象成一套可以覆盖在你朋友大脑上的透明胶片。这些胶片又薄又轻。

秘密武器:“秩最小化”

这篇论文的核心发现是关于这些胶片的大小(或“秩”)。

  • 大胶片(高秩):如果你使用厚而重的胶片,你的朋友学习新任务非常快(极佳的可塑性)。但是,因为胶片太厚,它会挤压并扭曲下面的旧记忆(高遗忘率)。
  • 小胶片(低秩):如果你使用非常薄的胶片,旧记忆就能保持安全(极佳稳定性)。但是,朋友可能难以学会新任务,因为胶片不够“厚”,无法承载新信息。

最佳平衡点:作者发现存在一个“金发姑娘”区域——一个中等偏小的尺寸,既能学习新事物,又不会破坏旧记忆。

创新之处:CoDyRA 不是去猜测正确的大小,而是使用一种特殊的数学“收缩射线”(称为秩最小化)。

  • 它从一个标准胶片开始。
  • 随着朋友学习,系统会自动“修剪”或切除胶片中那些严格来说不必要的部分。
  • 它强制更新尽可能小且尽可能简单。

类比:翻修房屋

想象你朋友的大脑是一座摆满家具(知识)的房子。

  • 旧方法:要么为每个新爱好建造整个新翼楼(配件),要么每次添加一把新椅子时,都雇佣搬运工不断检查旧家具(图书馆/重放)。
  • CoDyRA:你想添置一把新椅子(新知识)。与其买一把巨大沉重的椅子挡住走廊,不如买一把折叠椅
    • 如果椅子太大,它会挡住通往厨房的路(遗忘旧任务)。
    • 如果椅子太小,它就毫无用处。
    • CoDyRA就像一位聪明的木匠,他建造的椅子恰好是新任务所需的大小,不多不少。如果任务只需要椅子的三条腿,木匠就会拆掉另外两条。这让走廊保持畅通,供旧家具使用。

为何有效(“为什么”)

这篇论文从数学上证明:更新越小(秩越低),遗忘的可能性就越小。

  • 通过最小化“秩”(变化的复杂度),系统自然地保护了过去。
  • 它不需要记住旧数据或使用额外模块。它只是更新主大脑,但仅使用所需的最小变化量。

结果

作者在以下方面测试了该方法:

  1. 视觉模型(CLIP):教模型识别不同类型的飞机、花卉和宠物。
  2. 语言模型(LLaMA, Gemma):教聊天机器人掌握编程或数学等新技能。

结果

  • 更好的学习:模型很好地学会了新任务。
  • 更少的遗忘:相比以往的方法,它遗忘得少得多。
  • 无额外成本:它不需要存储旧数据或携带额外的“笔记本”。它只是更新主模型并合并更改,使系统保持整洁高效。

总结

CoDyRA是一种更聪明的教 AI 学习新事物的方法。与其强迫 AI 记住一切或添加笨重的额外部件,不如教 AI 进行微小而精确的更改。通过严格限制变化的“大小”,AI 在学会新技能的同时,不会意外删除旧记忆。这就像把整面墙刷成红色(这会掩盖旧画作)与小心翼翼地贴上一张小小的贴纸(在添加新信息的同时不覆盖过去)之间的区别。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →