Deep Multimodal Learning with Missing Modality: A Survey
本综述首次对缺失模态多模态学习(MLMM)的深度学习方法进行了全面的回顾,详细阐述了其动机、与标准设置的区别、当前技术、应用、数据集以及未来的挑战。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大局观:“五感”问题
想象一下,你正在试图理解一部电影。通常情况下,你有两个主要的输入:视觉(视频)和听觉(对话和音乐)。这就像是一个“多模态”系统——它利用多种感官来获取完整的故事。
然而,在现实世界中,事情总会出错。也许你的扬声器坏了(没有声音),或者屏幕变黑了(没有视频)。也许你在一个大雾弥漫的森林里,看不清东西,但能听到沙沙声。这就是**缺失模态(Missing Modality)**问题。
大多数 AI 模型就像是那些只有在同时拥有教科书和音频笔记时才会学习的学生。如果拿走其中之一,它们就会陷入恐慌并失败。这篇综述论文是一本为研究人员准备的庞大指南,教导 AI 如何在失去其中一种“感官”时保持冷静并表现出色。
这篇论文是关于什么的?
这篇论文是一篇综述(Survey)。你可以把它想象成一位图书管理员,他读完了 2012 年到 2025 年间关于这个特定主题的所有书籍(354 篇论文!)。作者 Renjie Wu 及其团队将这些不同的解决方案整理成一张清晰的地图,让研究人员知道哪些方法有效,哪些无效,以及下一步该往哪里走。
他们将这个领域称为 MLMM(缺失模态的多模态学习)。
两种主要策略:“修复数据” vs. “修复大脑”
作者将所有的解决方案分为两大阵营,就像通过修理零件或改变驾驶员的驾驶方式来修理一辆坏掉的汽车一样。
1. 数据处理:“修复零件”
这种方法试图在 AI 开始思考之前,先填补缺失的信息。
- “空白页”法(模态组合/Modality Composition): 想象你在读一本书,但其中一页被撕掉了。你可以直接留下一片空白(零值),或者在上面乱涂乱画(随机值)。AI 会学会忽略空白区域,专注于剩余的部分。这很简单,但不太聪明。
- “复制粘贴”法(检索/Retrieval): 如果一页丢了,你就去图书馆找其他版本的同一本书,找到匹配的那一页,然后把它粘贴进来。如果书的内容完全一致,这招很管用;但如果故事略有不同,你可能会把错误的场景粘贴进去。
- “想象力”法(模态生成/Modality Generation): 这是最先进的方法。AI 扮演的是创意作家。如果音频缺失,AI 会观察视频并“想象”出声音应该是怎样的,然后将其创造出来。这就像魔术师从帽子里变出一只兔子。论文指出,虽然这很酷,但有时 AI 会产生“幻觉”(编造一些不真实的内容)。
2. 策略设计:“修复大脑”
这种方法不是试图修复缺失的数据,而是改变 AI 的架构,使其能够自然地处理缺失数据。
- “聚光灯”法(注意力机制/Attention): 想象一位在教室里的老师。如果一名学生缺席了,老师不会停止授课,而是将聚光灯转向还在座的学生。“注意力”机制允许 AI 动态地只关注现有的数据,并忽略缺失的部分。
- “导师”法(蒸馏/Distillation): 想象一个聪明的学生(老师)拥有所有的书,而一个没那么聪明的学生(学生)只有一半的书。老师向学生解释缺失的章节。学生即使没有实物书,也能学会理解整个故事。
- “团队协作”法(模型组合/Model Combinations): 与其使用一个巨大的 AI,不如组建一个专家团队。如果视频缺失,你就询问“音频专家”;如果音频缺失,你就询问“视频专家”。他们一起投票决定答案。
- “超级大脑”(大语言模型/Large Language Models): 最近,巨大的 AI 模型(如驱动聊天机器人的模型)变得非常聪明,它们可以同时理解文本、图像和声音。它们的灵活性极高,以至于如果拿掉其中一个输入,它们也能适应并继续运行,就像一个即使看不见图片也能讲好故事的人。
这些技术用在哪里?(现实世界的例子)
论文列举了许多这些技术至关重要的应用场景:
- 医学影像: 医生可能只有患者的 MRI 扫描图,却没有 CT 扫描图。AI 需要仅凭 MRI 就能诊断疾病,而不会进行瞎猜。
- 自动驾驶汽车: 汽车的摄像头可能会被大雪遮挡,或者雷达可能会损坏。汽车的 AI 需要仅靠仍在工作的传感器来安全驾驶。
- 情绪检测: 视频通话可能音频质量很差,但画面很清晰。AI 应该仍能通过观察你的脸来判断你是开心还是难过。
- 机器人技术: 在洞穴中探索的机器人可能会失去 GPS 信号。它需要仅靠摄像头和触觉传感器来进行导航。
我们仍未解决的问题
尽管我们有了这些酷炫的技巧,但论文指出了一些主要的难题:
- “假数据”陷阱: 当 AI “想象”缺失的数据时,它有时会编造错误细节。如果自动驾驶汽车在悬崖边“想象”出了一条路,那是极其危险的。
- “懒惰”的 AI: 有时,即使 AI 尝试填补缺失的部分,它最终也会忽略新信息,仅仅依赖于它拥有的那一个传感器,而这可能并不足够。
- “混乱的图书馆”: 目前还没有统一的标准测试。一位研究者可能会在缺失 10% 数据的情况下进行测试,而另一位可能在缺失 90% 的情况下进行测试。这使得很难比较谁的表现真正更好。
- 过于沉重: 许多解决方案需要巨大的计算能力(比如超级计算机)。但现实世界的设备(如智能手表或无人机)体积小且电池容量有限。我们需要能在小型芯片上运行的“轻量化”解决方案。
总结
这篇论文是一份路线图。它告诉我们,尽管我们在教 AI 如何应对损坏的传感器和缺失的数据方面取得了巨大进步,但我们仍需要更好的方法——既不能编造事实,也不需要超级计算机,且不会在复杂的现实情况面前感到困惑。我们的目标是构建像人类一样强大的 AI:即使在视野模糊或麦克风损坏时,也能理解这个世界。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。