← 最新论文
🤖 AI

Forgetting, plasticity, and co-observation: a third facet of continual learning

本文认为,除了众所周知的灾难性遗忘和塑性丧失挑战之外,无法同时共观测训练数据是限制持续学习性能的一个独特且关键的因素,这表明诸如记忆重放之类的机制之所以成功,是因为它们重新引入了这些共观测优势,而不仅仅是缓解了遗忘。

原作者: Timm Hess, Abhishek Jha, Gido M. van de Ven, Tinne Tuytelaars

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Timm Hess, Abhishek Jha, Gido M. van de Ven, Tinne Tuytelaars

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

深度神经网络是现代人工智能背后的强大引擎,能够识别面部、翻译语言并诊断疾病。这些系统通常是在一个单一且庞大的会话中进行训练的,它们一次性看到所有的数据,从而能够发现连接不同信息片段的模式。然而在现实世界中,数据往往是以随时间不断流动的形式到达的,就像一条永不停歇的河流。为了保持这些系统的实用性,它们必须在无法重新审视旧数据的情况下,从不断到达的新信息中学习。这个过程被称为持续学习(continual learning)。多年来,科学家们一直认为,使这项工作奏效的主要障碍是一个被称为“灾难性遗忘”(catastrophic forgetting)的问题,即模型在学习新知识时,会不小心抹去之前已掌握的知识。主流观点认为,如果我们能简单地阻止模型遗忘,并让它保持足够的灵活性以学习新事物,它的表现就会和同时看到所有数据的模型一样好。

来自鲁汶大学(KU Leuven)和格罗宁根大学的研究团队挑战了这一长期存在的假设。他们发现,即使一个模型从未遗忘任何东西且保持完美的灵活性,它仍然难以达到与一次性训练所有数据的模型同等的智能水平。他们在第五届终身学习智能体会议(5th Conference on Lifelong Learning Agents)上展示的研究工作指出,限制这些系统学习能力的第三个隐藏因素是“协同观察”(co-observation)的缺失。这个术词描述了一个简单的事实:当数据在不同时间段被分块学习时,模型失去了同时观察不同信息片段的机会。研究人员发现,这种缺失的连接阻碍了模型构建对世界最稳健理解的能力,无论遗忘管理得多么出色,这种局限性依然存在。

为了理解为什么这很重要,请想象你正在拼凑一个复杂的拼图。如果你一次性拿到所有的碎片,你可以轻松发现一个部分的边缘是如何与另一部分的中心相连的,从而让你看清全局并将碎片高效地组合在一起。这就是标准人工智能通常被训练的方式。相比之下,持续学习就像是被人一个接一个地递给拼图碎片,而且没有机会回头看已经放置好的碎片。你可能会完美地将当前的碎片嵌入现有的空间,但由于看不见周围的碎片,你可能会错过一个原本能帮助你理解整体图像的关键连接。研究人员认为,这种无法同时看到“完整拼图”的能力造成了一个根本性的性能差距,而这个差距无法仅仅通过记住过去来解决。

该团队设计了一系列实验来证明这种差距是真实存在且独立于遗忘问题的。他们使用了一种能够隔离这两个问题的方法。首先,他们创建了一个场景,让模型从四个独立的批次中学习,模拟现实世界的信息流。为了确保任何性能下降不仅仅是因为模型遗忘先前的教训,他们使用了一种称为“集成”(ensemble)的特殊技术。这涉及在每一个学习步骤后保存一份模型的“大脑”副本,并将所有这些副本结合在一起。这个结合后的模型实际上完美地记住了所有内容,彻底消除了遗忘问题。然后,他们将这个具有“完美记忆”的模型与一个同时看到所有数据的标准模型进行了对比。

结果清晰且一致。即使拥有完美的记忆,通过分块学习的模型表现仍然逊于同时看到所有数据的模型。无论计算机是在监督学习方式下(即被告知正确答案)还是在自监督学习方式下(即通过自主寻找模式)学习识别图像,这种差异都成立。研究人员在包括 CIFAR-100 和 ImageNet-100 在内的标准图像数据集上进行了测试,并使用了不同类型的神经网络架构。在所有案例中,即使具备完美的保留能力,顺序学习的模型也未能达到联合训练模型的泛化水平。这证明了问题不在于记忆的失败,而在于无法跨越不同时间段进行信息综合。

该研究还探讨了当前持续学习的解决方案如何处理这个问题。一种流行的方法是“经验回放”(experience replay),即让模型在学习新内容的同时,也展示一些旧的样本以帮助其记忆。研究人员发现,这种方法之所以有效,不仅是因为它阻止了遗忘,而是因为它人为地重建了“协同观察”的条件。通过将新旧数据放在一起展示,模型得到了观察它们之间联系的机会,这有助于它构建更好的表征。另一种常见的技术是“知识蒸馏”(knowledge distillation),它试图强迫新模型模仿旧模型,研究发现该技术虽然在防止遗忘方面有效,但未能缩小性能差距。这表明,仅仅保护旧知识是不够的;模型需要通过同时观察数据的积极益处才能实现真正的学习。

这些发现表明,人工智能领域需要重新思考其终身学习的方法。多年来,研究重点几乎完全集中在防止旧知识的丢失上。虽然这仍然很重要,但研究人员认为,我们也必须解决在孤立状态下学习所带来的结构性劣势。持续学习的性能天花板比此前认为的要低,这并非因为模型遗忘了,而是因为它缺乏来自同步观察的上下文。这一洞察改变了我们评估该领域进展的方式。它意味着未来的算法不仅要保护过去,还必须找到主动合成新旧信息之间联系的方法,例如通过设计更好的数据回放方式,或通过构建学习任务来鼓励跨分布思维。

这些影响超出了图像识别的范畴。研究人员指出,这种现象很可能也会影响大型语言模型和其他从庞大信息流中学习的复杂系统。如果一个模型在没有看到其已知背景的情况下学习一个新概念,它可能永远无法完全理解两者之间的关系。这项研究并不声称这是持续学习中的唯一问题,也不意味着遗忘不再是一个重大问题。在许多实际应用中,遗忘仍然是最直接且最具破坏性的问题。然而,通过将“协同观察”识别为一个独特且基本的限制因素,研究人员为未来的挑战绘制了一张更清晰的地图。他们表明,要构建能够终身学习的真正智能系统,我们不仅要解决记忆的问题,还要解决视角的问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →