Learning from Reliable Latent Prompts for Visual Recognition with Missing Modalities
本文提出了一种名为“从可靠潜在提示中学习”的新范式,该范式利用与输入无关的可学习潜在锚点作为稳定的先验,以克服实例级特征的不稳定性,并实现在极端模态缺失场景下的最先进视觉识别性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你拥有一位天才侦探(AI 模型),他受过专门训练,通过观察两种类型的证据来破案:照片和证人陈述。在一个完美的世界里,侦探总能同时获得照片和陈述。但在现实世界中,事情总会出错:有时相机坏了(没有照片),有时证人因为太害怕而不敢说话(没有陈述),或者有时两者都缺失了。
如果侦探只在完美的案例上接受训练,当证据缺失时,他们会感到困惑并表现得一败涂地。
旧方法:“从残余信息中猜测”
以往试图解决这个问题的尝试,就像是要求侦探根据他们手中仅有的少量证据,去猜测缺失的证据可能说了什么。
- 问题所在: 如果照片很模糊,或者证人陈述被抹掉了一半,侦探的“猜测”就是建立在摇摇欲坠的基础之上的。缺失的证据越多,猜测就越糟糕。这就像是通过观察一个极其微小且模糊的拼图角落,就试图补全整个拼图。缺失的碎片越多,你就越有可能把整幅画作看错。
新思路:“可靠的记忆库”
该论文的作者 Taixi Chen 和 Nancy Guo 提出了一种不同的方法,称为学习可靠的潜在提示(Learning from Reliable Latent Prompts, LLP)。
他们不再要求侦探根据手中破碎的证据进行猜测,而是给了侦探一个稳定的内部记忆库(称为“潜在锚点/Latent Anchors”)。
以下是其运作方式的简单类比:
- 记忆库(潜在锚点): 想象侦探有一个特殊的、不可动摇的笔记本。这个笔记本并不包含当前犯罪现场的具体细节。相反,它包含了关于照片通常看起来是什么样子的,以及证人陈述通常听起来是什么样子的这些通用本质。这个笔记本是“输入无关(input-agnostic)”的,这意味着它不在乎当前的证据是否缺失或损坏;它只持有关于“什么是照片”和“什么是文本”的可靠核心知识。
- 对话(双路径交叉注意力/Dual-Path Cross-Attention): 当侦探面对证据缺失的案件时,他们不会强行让破碎的证据变得合理。相反,他们会打开他们可靠的笔记本。他们让笔记本中的“照片知识”与笔记本中的“文本知识”进行交流。
- 例子: 如果照片缺失,笔记本中的“文本知识”可以通过回忆对于这类故事而言,一张照片通常应该长什么样,从而填补空白。
- 他们交换想法,以创建一个新的、可靠的指南(即“提示/Prompt”),告诉侦探如何解决这个案件,即使在证据缺失的情况下也是如此。
- 结果: 因为这个指南来自于稳定的记忆库,而不是破碎的证据,所以即使在 90% 的证据都丢失的情况下,侦探也能保持冷静和准确。
他们的发现
研究人员在三个不同的“犯罪现场”(数据集)上测试了这个想法:
- 电影类型: 根据海报和剧情猜测电影类型。
- 食物: 通过照片和描述识别菜肴。
- 仇恨迷因(Hateful Memes): 检测图像和文本结合在一起是否具有恶意。
结果:
- 当一切都缺失时: 旧的方法(那些“猜测者”)完全崩溃了。
- 新方法 (LLP): 即使在 90% 的数据缺失时,它依然保持着极高的水平。与所有测试过的其他方法相比,它是表现最好的。
- 为什么有效: 论文表明,通过阻止侦探依赖破碎的线索,转而让他们咨询其稳定的内部记忆,系统会变得更加强大且可靠。
简而言之
该论文认为,当数据缺失时,我们不应该试图基于剩下的破碎碎片来构建解决方案。相反,我们应该基于独立于破碎数据之外的稳定的内部知识来构建解决方案。这使得 AI 能够可靠地“填补空白”,就像一位即便在证据不全时也深谙游戏规则的侦探一样。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。