Respecting Modality Gap in Post-hoc Out-of-distribution Detection with Pre-trained Vision-Language Models
本文提出了一种在线伪监督框架,该框架从无标签测试数据中学习视觉类原型,以弥合文本与视觉表示之间的固有模态差距,从而在不依赖分布内训练数据的情况下实现最先进的后验分布外检测。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一位非常聪明、博览群书的图书管理员(即 AI 模型),他花费多年时间研究了一个关于特定主题(如“猫”、“汽车”和“树”)的庞大图书馆。这位管理员擅长识别这些事物。然而,在现实世界中,人们可能会走进来,向管理员展示一张“闪闪发光的烤面包机”或“会飞的香蕉”的图片。这些是管理员从未见过的东西。
分布外(OOD)检测的目标是教导这位管理员说出“我不知道这是什么”,而不是猜测它是猫或汽车并出错。
旧方法:“教科书”问题
最近,科学家们发现了一种新工具:视觉 - 语言模型(如 CLIP)。你可以将其想象为一位既能阅读图片又能阅读文字的图书管理员。为了帮助管理员识别“猫”,旧方法只是在卡片上写下“猫”这个词,并告诉管理员:“这个词代表了猫的概念。”
问题在于,文字和图片是不同的语言。
- “猫”这个词存在于文本世界中。
- 猫的图片存在于图像世界中。
该论文认为,简单地使用“猫”这个词作为猫图片的替代品,就像试图用另一座城市的地图来导航这座城市。尽管地图和城市共享一些名称,但街道并不完全对应。这里存在一个**“模态差距”**——即文本描述与实际视觉现实之间的结构性不匹配。无论你如何巧妙地重写提示(指令),都无法消除这一差距,因为在 AI 的“大脑”中,文本和图像根本不住在同一个“街区”。
新方案:在实践中学习(“在线”方法)
作者提出了一种新方法来解决这个问题。他们不再依赖静态的文本卡片,而是让管理员在工作中直接学习视觉地图。
以下是他们方法的工作原理,使用一个简单的类比:
- 设置:管理员以文本卡片(旧方法)作为粗略的起点。
- 流式输入:当人们带着新图片(测试数据)走进来时,管理员查看它们。
- 猜测:管理员根据当前知识做出“软猜测”。“这看起来 80% 像猫,20% 像狗。”
- 更新:
- 如果管理员非常确信这是猫,他们会稍微调整心理上的“猫地图”,使其与刚刚看到的实际图片相匹配。
- 如果管理员非常确信这不是猫(它是一个未知物体),他们会调整“未知物体地图”。
- 如果管理员感到困惑,他们暂时忽略该图片。
- 结果:随着时间的推移,管理员不再依赖不完美的文本卡片,而是构建出一幅完美的视觉地图,展示“猫”和“未知”在现实世界中实际的样子。
为什么这很重要
该论文从数学上证明,旧方法(使用文本作为原型)存在永久性缺陷,因为文本和图像本质上是不同的。他们的新方法通过利用图片本身实时校准地图来修复这一问题,无需任何人工标签或重新训练整个系统。
验证
他们在大型数据集(如包含数千个类别的 ImageNet)上测试了这种方法。结果令人印象深刻:
- 新方法在识别“未知事物”(如会飞的香蕉)方面比之前的方法出色得多。
- 它显著减少了 AI 自信地猜错事物的次数(假阳性)。
- 即使图片以不同的顺序打乱或来自不同来源,该方法依然表现良好。
简而言之,该论文指出:“不要只读标签;要看图片并从中学习。” 这使得 AI 在遇到从未见过的事物时更加可靠。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。