Co-Learning for Missing Arbitrary Modalities in Multi-modal Classification
本文介绍了一种多模态协同学习框架,旨在通过优先考虑模态间的协作而非融合来处理分类任务中任意模态缺失的问题,并提供了两种互补的方法,这些方法在不同程度的模态缺失下均展现出了显著的鲁棒性增益。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试拼凑一个巨大的拼图,但不仅仅是一个画面,而是一群朋友,每个人手里都拿着不同的碎片。一位朋友拿着天空,另一位拿着海洋,第三位拿着山脉。如果你把他们的碎片组合在一起,就能得到一幅完美、完整的图像。这就是“多模态”AI的工作方式:它结合了不同类型的数据——比如照片、声音和传感器读数——以做出更明智的决策。但问题在于:在现实世界中,事情并不总是按计划进行。也许摄像头坏了,麦克风被打湿了,或者传感器没电了。突然间,你的团队失踪了几位成员,拼图变得不完整了。如果你的AI只被训练在所有人都在场的情况下工作,那么一旦缺少某个部分,它就会崩溃并彻底失败。对于需要即使在工具失效时也能可靠运行的机器人、自动驾驶汽车和医疗设备来说,这是一个巨大的问题。
你即将阅读的这篇论文正是在解决这个令人头疼的问题。它提出了这样一个问题:我们如何教AI即使在丢失部分数据源的情况下,依然保持聪明和准确?作者们提出了一种巧妙的新方法来训练这些系统,不是通过强迫它们将缺失的部分“粘合”在一起,而是通过教导不同的数据源彼此交流并互相帮助。他们称之为“协同学习”(co-learning)。把它想象成一个学习小组:擅长数学的学生帮助擅长历史的学生,这样如果历史专业的学生缺席了,数学专业的学生仍然可以解释整个故事。研究人员在两个截然不同的挑战上测试了他们的想法:利用卫星数据识别农作物类型,以及利用可穿戴传感器识别人类活动。他们发现,他们的新方法使AI更具韧性,即使在数据变得混乱或不完整时,也能让其保持在正轨上。
问题所在:当团队失去成员时
在人工智能的世界里,“多模态分类”就像是一个利用多种感官来侦破案件的侦探。侦探不仅看犯罪现场的照片,还会听音频录音、阅读证人陈述并查看天气报告。通过结合所有这些线索,侦探(或AI)可以对发生了什么做出更好的判断。然而,现实生活是混乱的。在地球观测领域,卫星摄像头可能会被云层遮挡,或者雷达可能会失效。在以人为本的研究中,可穿戴传感器可能会没电或断开连接。
大问题在于,大多数AI模型在训练时都假设所有的线索永远都在。如果你用五种类型的数据训练一个模型,然后尝试在只有三种数据的情况下使用它,它往往会感到困惑并犯下严重的错误。以往试图解决这一问题的尝试通常专注于“鲁棒融合”(robust fusion),这就像是试图建造一张即使拆掉一条腿也能站稳的桌子。本文作者认为,这种方法是有局限性的,尤其是当你拥有许多不同类型的数据且其中任何一种组合都可能丢失时。他们想知道:如果我们不仅仅是尝试修补漏洞,而是教导剩余的数据源去互相弥补,情况会怎样?
解决方案:数据的学习小组
作者引入了一个名为“针对任意模态缺失的协同学习”(Co-Learning for Missing Arbitrary Modalities)的框架。他们没有强迫AI将所有数据融合成一个巨大的整体,而是建立了一个由专门模型组成的团队,每个模型对应一种数据类型(例如一个用于光学图像,一个用于雷达,一个用于天气)。这些模型被训练在一起工作,分享彼此所知。
他们开发了两种具体的策略,即“方法”,来让这种团队协作发挥作用:
Co-Miss(缺失协同): 这种方法就像是一场严格的演习。在训练期间,AI被强制要求不断在数据缺失的情况下进行练习。这就像老师随机告诉历史专业的学生:“你今天缺席了”,而数学专业的学生必须设法解释整堂课的内容。AI学会了“模仿”全员到齐时会表达的内容,即使部分成员不在场。这被称为“缺失蒸馏”(missing distillation)。当只有一个或少数几个数据项缺失时,这种方法效果非常好。
FullCo(全协同): 这种方法是为最坏的情况设计的,即几乎整个团队都缺失了。它使用了一种称为“相互蒸馏”(mutual distillation)的技术,其中每一个数据模型都试图向其他模型以及最终的集体决策学习。这就像是一个轮流进行的学习会议,每个人都在教导其他人。当AI只剩下极少的信息(例如只有一个传感器仍在工作)时,这种方法表现出色。
这两种方法都依赖于两个层面的学习。在特征层面,模型学习识别什么是“共享的”(例如树木的一般形状,这是照片和雷达都能看到的)以及什么是“特有的”(例如树皮的纹理,这是只有照片能看到的)。在决策层面,它们使用知识蒸馏技术,即模型试图在最终答案上达成一致,从而在数据稀缺时帮助彼此保持在正确的轨道上。
结果:风暴中的强者
研究人员在两个真实世界的数据集上测试了他们的想法。第一个是 Multi-CropHarvest,涉及使用四种不同的传感器(光学图像、雷达、天气数据和地形图)来识别农作物类型。第二个是 HL-Opportunity,这是一个包含人体身上19种不同传感器的数据集,用于识别如“做三明治”或“打扫卫生”等活动。
结果非常理想。当AI在所有数据齐全的情况下进行测试时,表现得非常好。但真正的考验在于他们开始移除数据时:
- 在“极小缺失”(Minimal Missing)场景下(即只有一个传感器失效时),Co-Miss 方法成为了明星。它的准确率几乎没有损失,证明了其“演习”方法完美地应对了微小的故障。
- 在“极端缺失”(Extreme Missing)场景下(即几乎所有传感器都失效,只剩下一个时),FullCo 方法占据了领先地位。当其他方法性能大幅下降并崩溃时,Full-Co 成功守住了阵地,表明其“相互教学”策略帮助它在风暴中生存了下来。
例如,在作物识别任务中,当AI只剩下一个传感器时,传统方法的表现下降了约40分。作者的方法下降得少得多,FullCo仅下降了约24分。在拥有19个传感器的活动识别任务中,FullCo方法即使在大多数传感器消失的情况下,仍能保持高水平的准确度,优于许多其他先进的方法。
这意味着什么
本文表明,通过将重点从仅仅“粘合”数据转向教导数据源如何协作,我们可以构建出更加鲁棒的AI系统。作者发现,通过这种方式,他们的模型在不同的缺失数据场景下,始终能达到或超越现有的最佳技术。
然而,他们也指出了一种权衡。Co-Miss 方法虽然在处理小规模数据缺失问题时表现出色,但由于它必须模拟每一种可能的缺失组合,因此训练时的计算成本很高。如果你有10个传感器,那就是超过1,000种组合需要练习!因此,他们建议在数据可能严重缺失或传感器数量较多的情况下使用 FullCo。
最终,这项工作表明,可靠AI的未来不仅仅在于拥有更多的数据,而在于教导我们现有的数据如何在出现问题时互相帮助。无论是试图看透云层的卫星,还是在电池耗尽时仍要追踪你运动情况的智能手表,这些协同学习策略都为“当灯光熄灭时仍不放弃”的AI提供了一条路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。