← 最新论文
💬 NLP

Mitigating the Modality Gap: Few-Shot Out-of-Distribution Detection with Multi-modal Prototypes and Image Bias Estimation

本文提出了 SUPREME,这是一个通过集成图像原型、估计用于提示词生成的图像领域偏差,并强制执行图文一致性,从而在无需额外训练的情况下显著优于现有方法的少样本微调框架,旨在缓解视觉语言模型在分布外检测中的模态间隙问题。

原作者: Yimu Wang, Evelien Riddell, Adrian Chow, Sean Sedwards, Krzysztof Czarnecki

发布于 2026-01-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Yimu Wang, Evelien Riddell, Adrian Chow, Sean Sedwards, Krzysztof Czarnecki

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位非常聪明、博学多才的图书管理员(AI 模型),他花费多年时间研究一个特定的图书库(即“分布内”或 ID 数据)。这位管理员非常擅长识别来自该图书馆的书籍。然而,在现实世界中,人们经常带来小册子、杂志或随机传单,并询问:“这是我们图书馆的东西吗?”

问题在于,图书管理员有时会感到困惑。尽管那张传单并不属于图书馆,但它在视觉上可能看起来与书封非常相似,或者上面的文字听起来有些耳熟。这会导致图书管理员错误地认为:“是的,这是我们的东西!”而实际上它是一个全新的事物。这被称为假阳性(False Positive)

这篇论文介绍了一个名为 SUPREME 的新系统,旨在帮助图书管理员做出更好的决策。以下是其工作原理的拆解,通过简单的概念进行说明:

1. 问题所在:“语言障碍”

这里使用的 AI 模型(称为 CLIP)就像一个精通“图像”和“文本”双语的人。

  • 旧方法: 以前的方法仅要求管理员将传入的图片与一系列文本描述(例如“一张猫的照片”)进行比较。
  • 问题: 这里存在一个“模态间隙(Modality Gap)”。想象一下,“图像”语言和“文本”语言居住在两个不同的社区。即使一张随机狗的图片在语义上与“猫”不同,由于偶然因素,它在 AI 的意识中仍可能意外地落在“猫”这个文本描述附近。这会导致图书管理员产生混淆,从而误收了错误的物品。

2. 第一种修复方案:引入“相册”

作者意识到,仅仅依赖文本描述是有风险的。

  • 类比: 他们不再仅仅询问:“这看起来像‘猫’这个吗?”,而是同时询问:“这看起来像我们相册里那些真实的猫的照片吗?”
  • 结果: 通过同时使用文本描述和一组真实的示例照片(称为“原型/Prototypes”)作为参考点,系统创建了一个更紧密、更准确的边界。这就像是既拥有字典定义,又拥有相册作为对照。仅此一项就提高了系统的准确性,且无需任何额外的训练。

3. 第二种修复方案:“翻译官”与“偏差”(SUPREME)

为了进一步解决“语言障碍”,他们构建了一个名为 SUPREME 的特殊框架。它有两个主要工具:

  • 工具 A:“偏置提示”(BPG)

    • 想象图书管理员正在利用几页样本页进行备考(少样本学习/Few-Shot learning)。他可能会过度死记硬背那些特定的页面,从而无法识别来自同一图书馆但略有不同的新页面。
    • 解决方案: 系统添加了一个“高斯偏差(Gaussian Bias)”。你可以把它想象成一个安全网或一张“泛化地图”,展示了图书馆通常是什么样子的。这可以防止管理员过度关注所学习的少量样本页,并帮助他们理解图书馆的整体“氛围”,即使是对于他们从未见过的图像也是如此。
  • 工具 B:“翻译官”(ITC - 图像-文本一致性)

    • 问题: “图像”社区和“文本”社区仍然相距甚远。
    • 解决方案: 系统在两种语言之间搭建了一座桥梁(翻译官)。它将一张图像翻译成“文本语言”,并检查它是否与文本描述相匹配。然后,它将该文本重新翻译回“图像语言”,并检查它是否仍然看起来像原始图像。
    • 目标: 这迫使两种语言靠得更近,缩小了混乱间隙。如果翻译过程完美无缺,系统就知道自己走在正确的轨道上。

4. 最终得分:“超级得分”

最后,论文引入了一种计算最终决策的新方法,称为 SGMPS_{GMP}

  • 该得分不再只从一个角度(图像 vs. 文本)来看,而是同时观察四个角度:
    1. 原始图像 vs. 文本描述
    2. 原始图像 vs. 相册
    3. 翻译后的图像 vs. 文本描述
    4. 翻译后的图像 vs. 相册
  • 通过平均这四个视角,系统能够获得更清晰的图景,从而判断一件物品是否真正属于该图书馆。

核心结论

论文表明,通过将文本描述真实照片相结合,并利用翻译官来弥合 AI 如何看待图片与如何阅读文字之间的差距,该系统在识别“冒充者”(OOD 数据)方面变得更加出色。

在测试中,这种新方法(SUPREME)始终优于所有现有的方法,它犯错更少,并且能捕捉到更多试图混入图书馆的“伪造”物品。它之所以能做到这一点,并不需要重新训练 AI 的整个大脑,而只需调整它观察数据的方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →