Geometry of Forgetting: Representation Flux in Continual Learning
本文引入了“表示通量”(representation flux)这一将潜在表示位移与灾难性遗忘联系起来的几何度量,并提出了 FlowLess-R,一种通过在持续学习过程中约束表示变化来缓解遗忘的与架构无关的正则化方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
人工智能已经掌握了从海量数据中学习的能力,但它却在面对一个类似于人类的基本挑战时显得力不从心:如何在学习新知识的同时,记住昨天所学到的内容。在机器学习领域,这种现象被称为“灾难性遗忘”。当一个神经网络(一种模仿大脑结构的计算机系统)在处理一系列不同的任务时进行顺序训练,它往往会为了容纳新信息而覆盖掉之前的知识。想象一下,一名学生在学习一门新语言时,突然忘记了上周学习的词汇。几十年来,研究人员一直试图通过减缓计算机内部设置的变化速度,或者强制系统定期复习旧示例来解决这个问题。虽然这些方法有所帮助,但它们通常将问题视为调整机器内部数值的问题,而对计算机内部“理解”如何发生偏移的深层机制却基本未加探索。
一位研究人员现在将注意力转向了这一隐藏的理解层面,提出防止遗忘的关键不在于机器的设置,而在于其创建的“表示”(representations)的稳定性。在这些系统中,每一张图像或每一条数据都被转换为高维空间中的一个独特点,这是一个几何地图,相似的项会聚集在一起,而不同的项则会彼此远离。该研究人员发现,当计算机遗忘一项任务时,是因为这些内部点移动得太远、太快。他引入了一个被称为“表示通量”(representation flux)的概念,该概念衡量了特定数据点在相邻两次训练之间在内部空间中所移动的距离。通过追踪这些运动,他发现数据点位置的剧烈且突然的跳跃,是系统即将失去正确识别该项能力的可靠早期预警信号。
研究始于观察这些内部点在计算机学习一系列任务(如识别不同类型的手写数字或衣物)时的行为。研究人员注意到一个清晰的模式:在计算机对先前学习过的项目出错之前,该项目的内部表示往往会经历显著的位移。这种运动并非随机,它与计算机预测能力的信心下降密切相关。当内部点移动巨大距离时,系统对识别该物体的确定性会大幅下降。相反,当点保持相对静止时,系统便能保留其知识。这一观察结果表明,遗忘不仅仅是记忆检索的失败,更是数据在机器心智中物理位置的漂移。研究人员发现,这种关系在各种数据集(从简单的手写数字到复杂的日常物体图像)中均成立,表明这些内部空间的几何结构对于这些系统如何学习和遗忘至关重要。
受此发现的启发,研究人员开发了一种名为 FlowLess-R 的新方法来稳定这些内部运动。该方法并不试图冻结计算机的整个“大脑”或限制其学习能力,而是专注于让旧示例的内部点保持锚定状态。当系统将一张旧图像保存到其记忆库以备日后复习时,它也会同时记录下该图像在那个时刻的精确内部点位置。在未来的训练阶段,每当系统再次查看该旧图像时,它都会轻轻地将当前的内部点拉回到最初存储的那个位置。这创造了一种“系绳”,防止该点过度游走,从而确保系统对该旧示例的理解即使在学习新事物时也能保持一致。该方法具有灵活性,可以添加到现有的学习系统中而不改变其基本架构,起到一种维持内部地图稳定的简单约束作用。
应用该方法的成果是显著的。当与标准的记忆复习技术结合使用时,FlowLess-R 始终能降低计算机随时间流逝而丢失知识的速率。在涉及任务序列的测试中,该方法大幅降低了遗忘率,根据图像复杂度和记忆库大小的不同,改进幅度在近 6% 到 19% 之间。至关重要的是,这种记忆保持能力的提升并没有以牺牲学习新任务的能力为代价;在许多情况下,系统在所有任务上的最终准确率实际上反而提高了。研究人员还测试了网络中哪个部分的稳定化最为有效,发现将点锚定在靠近最终决策层的位置效果最好。这表明,虽然系统的早期部分需要具备提取新特征的自由度,但理解的最终阶段必须保持稳定,以保留已学到的知识。
这项工作为人工智能如何处理时间的流逝和知识的积累提供了新的视角。通过将关注点从机器的可调设置转向其内部表示的运动,研究人员识别出了一个能够预测遗忘何时发生的几何标记。他们的发现表明,这些内部地图的稳定性与学习新模式的能力同样重要。所提出的方法提供了一种维持这种稳定性的简便方式,为构建能够持续学习而不丢失过去的系统提供了实用的工具。虽然本研究侧重于图像识别任务,但其背后的原理——即保持旧数据的内部表示稳定可以防止其被覆盖——为未来研究更鲁棒、更持久的人工智能开辟了道路。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。