Continual Video-MLLM Adaptation over Evolving Domains
本文提出了分布感知专家路由(DAER),这是一个参数高效的框架,它采用具有域内和域间路由机制的领域隔离轻量级专家,使视频多模态大语言模型(Video-MLLMs)能够在适应不断演进的领域的同时,防止灾难性遗忘和跨域干扰。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个超级聪明的机器人通过视频来理解世界。这个机器人是一个“视频多模态大语言模型”(Video-MLLM),它就像一位才华横溢的学生,已经读遍了人类历史上所有的书籍,也看过了所有的电影。它知道如何回答关于猫追逐激光笔或汽车在暴风雨中行驶的问题。但问题在于,在现实世界中,新类型的视频并不会一次性全部出现,而是每天一个接一个地到来。也许今天是个交通摄像头,明天是卡通片,后天则是物理实验。
问题在于,当你教这个机器人新知识时,它往往会忘记昨天学到的东西。这被称为“灾难性遗忘”(catastrophic forgetting)。这就像一个学生为了准备数学考试而学习,通过了考试,但随后因为过于专注于新的数学知识,立刻忘记了如何阅读。以往解决这个问题的方法是尝试让机器人在一个巨大的、共享的大脑中学习所有内容,但这会导致过多的混乱;或者尝试保存旧的视频以便稍后展示给机器人看,但这会占用大量的内存。科学家们想要一种方法,让机器人能够持续学习新事物,而不会丢失旧技能,也不需要庞大的旧视频库。
于是,一个研究团队提出了一个聪明的解决方案,叫做 DAER(分布感知专家路由,Distribution-Aware Expert Routing)。把机器人的大脑想象成一座巨大的、永恒不变的冻结图书馆。DAER 不是去重写图书馆里的书,而是在图书馆之外建立一套专门的小型化“学习小组”或“专家团队”。每个团队都致力于处理特定类型的视频,比如“交通团队”、“卡通团队”或“科学团队”。
当一段新视频到达时,系统并不仅仅是靠猜测来决定使用哪个团队。相反,它使用了一个特殊的“侦探”工具,叫做 MMD(最大均值差异,Maximum Mean Discrepancy)。想象一下,这个工具就像一个“气味嗅探器”,可以闻出视频的“氛围”。如果这段视频闻起来像繁忙的高速公路,嗅探器就会将其引导至交通团队。如果它闻起来像有趣的卡通片,它就会被送往卡通团队。这确保了交通团队只学习关于汽车的内容而不会被卡通片搞混,反之亦然。这保持了学习过程的纯净,并防止了机器人记忆混淆。
但如果机器人在观看视频时不知道视频类别的名称怎么办?没问题。系统有第二个侦探,它会在一个特殊的“判别空间”(一个表示视频独特指纹的专业说法)中观察视频,从而确定应该由哪个专家团队接管。更棒的是,如果两种类型的视频非常相似(比如两种不同类型的交通视频),系统可以温和地合并它们的学习小组以节省空间,这样就不会让机器人的大脑因为拥有太多团队而变得臃颖。
研究人员在一个极具挑战性的任务上测试了这个想法:教机器人回答十种截然不同的视频问题,范围从“交通状况如何?”到“为什么这个魔术技巧很有趣?”他们使用了两个强大的机器人大脑来测试这种方法。结果令人印象深刻。在使用其中一个最强的机器人大脑(InternVideo2.5-8B)时,他们的方法将平均准确率从 64.38% 提升到了 67.59%。更重要的是,它阻止了机器人遗忘旧课。虽然其他方法会让机器人遗忘掉 1.81% 已知的内容,但 DAER 实际上将遗忘降低到了 -0.14%,这意味着机器人完美地记住了所有内容,甚至在旧任务上表现得略有提升。
该团队还展示了其方法的高效性。虽然之前的一种顶尖方法需要 3.023 亿个可训练参数并花费 1.46 秒来处理一段视频,但 DAER 仅需 1.3954 亿个参数和 1.33 秒。这意味着机器人学习得更快,消耗的能量更少,而且不需要庞大的计算机来运行。
简而言之,论文表明,通过保持主脑冻结,并使用由数据“气味”引导的智能专业团队,我们可以教 AI 在变化的世界中持续学习而不至于丧失理智。研究人员发现,这种方法比尝试共享单一大脑或仅仅重放旧视频效果更好,为视频机器人的成长提供了一种稳定且高效的方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。