← 最新论文
🤖 machine learning

Localized Conformal Prediction for Image Classification with Vision-Language Models

本文提出了一种针对视觉-语言模型的图像分类局部符合预测框架,证明了虽然原始余弦相似度无法改进非局部基准模型,但所提出的对这些相似度进行简单的非线性变换,可以在保持边际覆盖保证的同时,显著减小预测集的规模。

原作者: Clément Fuchs, Tim Bary, Benoît Macq

发布于 2026-07-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Clément Fuchs, Tim Bary, Benoît Macq

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在向一位非常聪明、见多识广的朋友(一个视觉语言模型,即 Vision-Language Model)请教如何识别照片中的物体。他们通常很擅长这一点,但有时也会感到不确定。在现实世界中,如果只是盲目猜测“这是一只猫”而一旦出错,后果是非常危险的,比如在驾驶汽车或诊断病人时。你希望他们能说:“我非常确定这是一只猫,但也可能是一只狐狸,”或者“我完全不知道,别太相信我。”

这就是符合性预测Conformal Prediction)发挥作用的地方。把它想象成一个安全网。系统不再只给出一个单一答案,而是给出一个可能性的列表(一个“预测集”),并保证在大多数情况下(例如 90% 的时间)包含正确答案。

问题: “一刀切”的安全网

这种标准安全网的工作方式就像一本全局规则手册。它观察成千上万个过去的案例(校准数据)并规定:“好吧,为了保证 90% 的安全性,我们需要为每个人列出 5 个可能性。”

问题在于,这本规则手册太笨拙了。

  • 对于一张简单的照片(比如一张清晰的金毛寻回犬照片),列出 5 个可能性是很荒谬的。你只需要 1 或 2 个就够了。
  • 对于一张棘手的照片(比如一只看起来像狼的模糊狗的照片),5 个选项可能甚至不够。

标准方法将模糊、令人困惑的图像与晶莹剔透的图像同等对待。它没有根据具体情况进行调整,无法适应不同的情境。

提出的解决方案:“局部”安全网

研究人员尝试了一种更聪明的方法,称为局部符合性预测Localized Conformal Prediction, LCP)。

想象一下,你不再拥有一本全局规则手册,而是为每一张照片配备了一个局部向导。当一张新照片到达时,向导会查看它过去的经验并说:“这张照片看起来和我昨天看到的这 10 张照片很像。对于那些特定的照片,我只需要列出 2 个选项就能保证安全。所以,对于这张新照片,我也只列出 2 个。”

这就是“局部”的部分:它会根据新照片与以往照片的相似程度来调整安全网。

转折点:“天真型”向导失败了

研究人员试图利用视觉语言模型VLMs)来构建这个局部向导。这些模型将图像转化为巨大空间中的数学点。衡量相似度最直观的方法是看两个点之间的距离(使用余弦相似度)。

他们认为:“如果两张图像在数学空间中靠得很近,它们就是相似的。让我们利用这种距离来调整我们的安全网。”

结果: 效果并不好。事实上,它往往会让情况变得更糟。

  • 类比: 想象一下,如果你仅仅通过身高来判断两个人的相似度。两个人的身高可能一样,但性格、风格或背景却完全不同。“身高”这个指标(余弦相似度)太简单了,无法捕捉到图像真正的“神韵”(vibe),从而有效地帮助安全网。这个“天真型”向导给出了错误的建议,导致生成的列表要么太长(浪费),要么太短(不安全)。

修复方案:“Sigmoid”过滤器

作者意识到他们需要一种更好的衡量相似度的方法。他们引入了一种非线性变换(一种被称为 sigmoid 函数 的数学过滤器)。

  • 类比: 想象一下,原始的相似度得分就像一个从 0 到 100 的调光开关。之前的“天真型”向导直接使用了这个数值。而新方法是在这个调光器上加了一层特殊的透镜
    • 如果图像非常相似,透镜会让它们看起来极其相似(把旋钮调高)。
    • 如果图像只是还可以相似,透镜会让它们看起来非常不同(把旋钮调低)。
    • 它创造了一种更鲜明的界限,区分出“足够接近以值得信任”和“太远以至于不可信”。

通过调节这个透镜(使用一种称为交叉验证的过程),他们可以告诉局部向导应该如何精确地权衡过去的案例。

成果

当他们在 9 种不同类型的图像数据集(涵盖汽车、宠物、花卉和卫星照片等)上测试这种“透镜”方法时:

  1. 更小、更智能的列表: 与旧的“一刀切”方法相比,新方法在保持安全性不变的前提下,始终能生成更小的可能性列表。它更加高效。
  2. “天真型”方式失败了: 在许多情况下,如果不使用透镜而直接使用原始相似度,会导致列表变得更长且效率更低。
  3. 安全性得以保持: 正确答案一定在列表中的保证(90% 的覆盖率)保持不变。他们并没有为了效率而牺牲安全性。

他们并未发现的问题

论文还检查了这种方法是否解决了所谓的“覆盖差距”(即某些图像组,如稀有动物,其安全性较低的问题)。

  • 结果: 局部方法并未显著解决这个特定问题。安全差距与旧方法相比基本保持不变。主要的提升仅仅在于让列表变得更短、更高效,而不是让不同群体之间的安全性变得更平等。

总结

这篇论文关于如何教会一个聪明的 AI 更高效地进行猜测。

  • 旧方法: “为每个人列出 5 个选项。”(安全,但通常很浪费)。
  • 失败的新方法: “观察图像在数学空间中的距离并进行调整。”(太简单了,反而让情况变糟)。
  • 成功的新方法: “观察图像的接近程度,但使用一个特殊的数学过滤器来锐化这种视角,以便我们只在真正有信心时才列出选项。”(安全、高效且行之有效)。

他们发布了代码,以便他人可以使用这个“特殊过滤器”来让自己的 AI 预测变得更高效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →