Regularizing modality contribution drift in multimodal continual learning
本文将“模态贡献漂移”(Modality Contribution Drift, MCD)识别并量化为多模态持续学习中的一个关键问题,即不同模态的相对重要性在不同任务间发生偏移,并提出了一种包含基于重放和无重放变体的创新正则化框架(CMCDR),旨在保持模态贡献结构并减轻遗忘。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在教一个机器人理解世界。你不仅仅是给它看图片;你还给它完整的感官体验:一段狗吠的视频、一段警笛的录音,或者一张带有描述的日落照片。这被称为多模态学习(multimodal learning)。机器人通过学习将这些不同的“感官”(比如视觉和听觉)结合起来,从而做出明智的决策。但棘手的部分在于:世界是在不断变化的。每天都会出现新型的狗、新的声音、新的问题。这就是持续学习(continual learning)。机器人必须在学习新事物的过程中,不遗忘旧的事物。
把它想象成一个正在参加一系列考试的学生。首先,他学习识别动物。然后,他学习识别车辆。一个聪明的学生不应该仅仅因为现在正在学习卡车,就忘记了如何识别一只猫。在过去,科学家们试图通过确保机器人的“大脑”(其内部表示)保持一致来解决这个问题。他们希望机器人看到猫和卡车时,其内部状态不会变得混乱。但本文指出,仅仅保持机器人内部地图的稳定是不够的。真正的难题在于机器人如何使用那张地图来进行最终决策。它是主要依赖于所看到的,还是更多地依赖于所听到的?如果机器人学习了一个需要更多依赖听觉的新任务,它可能会在无意中开始忽略以前依赖的视觉线索。本文将这种转变称为模态贡献漂移(Modality Contribution Drift)。这就像一个学生在学习了一门新学科后,突然开始根据一种以前从未用过的直觉来猜测旧数学题的答案,从而导致错误。
研究人员,来自西南交通大学的张震及其团队注意到,现有的方法忽略了这种特定类型的遗忘。他们发现,即使机器人的图像和声音的内部理解保持不变,它用于做出选择的权重也会发生漂移。为了解决这个问题,他们发明了一种名为**持续模态贡献漂移正则化(CMCDR)**的新方法。
把 CMCDR 想象成机器人的一个严格的“决策教练”。当机器人学习新任务时,这个教练会检查:“嘿,记得你以前是怎么解决那个旧问题的吗?你依靠特定比例的感觉组合来解决它。不要仅仅因为学了新东西就改变那个配方。”该方法通过两种方式运作。如果机器人有一个旧案例的记忆库(基于重放的方法),教练会对机器人进行旧案例测试,以确保它仍然在使用正确的感官比例。如果机器人没有旧案例(无重放方法),教练则会将新案例作为测试平台,要求机器人假装正在解决旧问题,并确保它不会偏离原始策略。
团队在几个具有挑战性的数据集上测试了这个想法,包括音频-视觉任务,如识别视频中的声音以及回答关于图像的问题。他们发现,只需将他们的“教练”添加到现有方法中,就能带来巨大的变化。例如,在 AVE 数据集上,将 CMCDR 添加到一种名为 iCaRL 的标准方法中,使机器人的平均准确率从 64.20% 提升到了 71.90%,并将遗忘率降低了一半(从 25.60% 降至 17.40%)。更有趣的是,他们展示了 CMCDR 可以与试图保持机器人内部大脑稳定的其他方法协同工作。这就像拥有一个修复决策过程的教练,而另一个教练负责保持大脑记忆的有序;两者结合在一起,效果比单一方法更好。
论文指出,这种“漂移”是一个真实且独特的问题,是之前的研究未能充分解决的。他们通过实验证明,仅仅保持机器人的内部特征稳定(确保它看猫的方式不变)并不能保证它做出相同的决策(即依赖视觉还是听觉)。通过直接对每种感官的贡献进行正则化,他们表明机器人可以在学习新事物的过程中,不丢失它们原有的决策习惯。这不仅仅是一个微小的改进;它是关于我们如何教机器进行持续学习的一个新原则,确保它们不仅能记住事实,还能记住最初是如何得出结论的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。