← 最新论文
🤖 machine learning

Continual Distillation Learning for Rehearsal-Free Class-Incremental Learning via Decoupled Prompting

本文介绍了解耦持续蒸馏学习(Decoupled Continual Distillation Learning, D-CDL),这是一种用于无重放类增量学习的新颖框架,它通过持久的全局知识蒸馏提示将任务特定适配与蒸馏显式解耦,从而改进了从大型到小型 Vision Transformer 的知识迁移。

原作者: Qifan Zhang, Yunhui Guo, Yu Xiang

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Qifan Zhang, Yunhui Guo, Yu Xiang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人识别动物。你从猫开始,然后是狗,接着是鸟。棘手的部分在于,当机器人学习关于鸟的知识时,它往往会忘记猫长什么样。这是人工智能领域一个著名的难题,被称为“灾难性遗忘”(catastrophic forgetting)。为了解决这个问题,科学家们开发了一个聪明的技巧,叫做“基于提示的学习”(prompt-based learning)。他们并没有重新训练机器人的整个大脑(那非常庞大且昂贵),而是给了它一张小小的、粘性贴纸——一个“提示”(prompt),告诉它如何思考当前的任务。这样,机器人就能保持其原始大脑处于冻结且安全的状态,仅通过更换这些粘性贴纸来适应新动物。

然而,这里有一个陷阱:更大的大脑通常更擅长识别事物。一个巨大的机器人大脑(大模型)比一个小巧、高效的大脑要聪明得多。但巨大的大脑运行缓慢,且在日常设备上消耗过多能量。理想的情况是,将知识从巨大的大脑中提取出来,并挤进那个小巧、快速的大脑中,使小脑变得同样聪明,却不带有沉重的负担。这个过程被称为“知识蒸馏”(knowledge distillation)。通常情况下,如果你有一大堆旧照片可以学习,你可以轻松完成这个过程。但在持续学习的现实世界中,你无法查看旧照片;你只能随着新动物照片一个接一个地到来。这创造了一个独特的谜题:如何教一个小的机器人向一个大的机器人学习,一步步地进行,而不让小机器人每当出现新动物时就忘记大机器人的教诲?

这正是德克萨斯大学达拉斯分校的研究人员所解决的精确谜题。他们发现,试图从小脑向大脑挤压知识的标准方法,在这种特定的“逐步式”场景中实际上是失败的。他们发现,小机器人会不断忘记老师的教训,因为它用来学习的“粘性贴纸”一直在被更换。为了解决这个问题,他们发明了一种名为**基于提示的知识蒸馏(KDP)**的新方法。与其依赖不断更换的粘性贴纸,他们添加了一个特殊的、永久性的“大师级笔记”(master note),它会永远留在机器人身边,充当通往老师知识的专用桥梁。他们的实验表明,这种新方法能让小机器人学得更好,遗忘得更少,有效地让它运行起来既拥有巨型大脑的智慧,又具备小脑的速度。

问题所在:“更换粘性贴纸”的故障

为了理解为什么这很难,让我们看看这些“基于提示”的机器人是如何工作的。想象机器人有一个粘性贴纸库(提示)。当它看到猫时,它会挑选一个“猫笔记”。当它看到狗时,它会挑选一个“狗笔记”。这对于在学习新事物时不忘记旧事物非常有效,因为机器人只需更换笔记即可。

但这就是“蒸馏”(向大脑学习)失效的地方。研究人员发现,当他们尝试用大模型来教小机器人时,小机器人会挑选一个“猫笔记”来向大老师学习。然后,当新任务(如鸟类)到来时,它会扔掉“猫笔记”并挑选一个“鸟笔记”。问题在于,大老师关于猫的教训都卡在了那个“猫笔记”里。一旦笔记被更换,小机器人就会忘记老师教给它的关于猫的一切。研究人员称之为**“蒸馏信息遗忘”(distillation information forgetting)**。这就像是在学习一门语言,每当你切换到一个新章节时,你就会把记录老师作业的笔记本扔掉。

研究人员尝试了常用的技巧,比如观察老师的最终答案(logits)或老师的中间想法(features),但这些效果都不好,因为“更换笔记”的机制不断地抹去了所有痕迹。他们甚至测试了让机器人的部分大脑解冻以进行永久学习,但这会导致机器人更快地忘记之前的任务,违背了初衷。

解决方案:“永恒之桥”

为了修复这个问题,团队引入了一种新型的粘性贴纸,称为 KD 提示(KD Prompt)。与那些随每个新动物而更换的普通笔记不同,这些 KD 提示非常特殊。它们是全局可访问的,这意味着无论机器人正在执行什么任务,它们都会留在机器人身边。

你可以这样理解:

  • 普通提示: 就像临时的闪卡。你用“猫闪卡”学习猫,然后把它扔掉,换成“狗闪卡”学习狗。
  • KD 提示: 就像一张永久的、无法擦除的白板,贴在机器人的墙上。无论你在看什么动物,机器人都可以随时在这块白板上记录老师的教训。

通过将这些永久性的 KD 提示插入机器人的大脑,小模型就有了专门的空间来存储大老师的智慧,而这些知识永远不会被丢弃。他们还添加了一个特殊的“KD 分类器”(第二个用于评分的大脑),它专门检查机器人是否正确地模仿了老师,这与机器人识别动物的主任务是分开的。

研究发现

研究人员在两个著名的图像数据集上测试了这个想法:CIFAR-100(100 种小型图像)和 ImageNet-R(100 种物体的艺术化呈现)。他们设定了一个场景,机器人必须连续学习 10 个不同的任务,每个任务包含 10 个类别。

他们将这种新的 KDP 方法与传统的知识蒸馏和特征蒸馏等旧方法进行了对比。结果非常明确:

  • 旧方法: 当使用标准蒸馏时,小机器人的准确率仅略有提升,而且它遗忘先前任务的速度比没有任何帮助时还要快。例如,在 ImageNet-R 数据集上,一种名为“KD”的标准方法平均准确率为 69.91%,遗忘率为 7.64%
  • 新方法 (KDP): 使用这种“永恒之桥”方法,小机器人的智能显著提高,遗忘也大幅减少。使用相同的数据集,KDP 方法将平均准确率提升至 71.92%,并将遗忘率降至仅为 5.61%

当他们使用一个更大的老师(“ViT-Large”模型)来教一个中等大小的学生(“ViT-Base”)时,差距进一步扩大。KDP 方法实现了 78.62% 的平均准确率和 3.46% 的遗忘率,表现优于他们尝试过的所有其他方法。

为什么这很重要

论文指出,这不仅仅是一个微小的改进;它是对特定类型学习问题的根本性修复。通过将“学习新任务”的笔记与“向老师学习”的笔记分离,他们解决了困扰以往尝试的遗忘问题。

研究人员指出,这确实是有代价的:你必须同时训练大老师和小学生,这需要更多的时间和计算内存。然而,一旦训练完成,小型的学生模型就可以投入使用了。它可以运行在需要快速和高效的设备上,同时又承载着大模型的智慧。

简而言之,论文表明,如果你想让一个小型、快速的 AI 在持续学习的过程中不发生遗忘,你不能只是简单地复制粘贴老师的大脑。你必须给学生一个永久的、专门的空间,来确保老师的教训能够安全地保存下来,无论接下来遇到什么新事物。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →