← 最新论文
🤖 machine learning

GeoFlowVLM: Geometry-Aware Joint Uncertainty for Frozen Vision-Language Embedding

GeoFlowVLM 引入了一种事后适配器,该适配器利用乘积超球面上的黎曼流匹配,为冻结的双编码器视觉 - 语言模型配备偶然不确定性和认知不确定性估计,从而在检索和零样本分类任务中实现近乎理想的校准。

原作者: Mayank Nautiyal, Li Ju, Andreas Hellander, Ekta Vats, Prashant Singh

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Mayank Nautiyal, Li Ju, Andreas Hellander, Ekta Vats, Prashant Singh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位超级聪明的图书管理员(一个视觉 - 语言模型),他 memorized 了数百万张图片及其描述。如果你向这位图书管理员展示一张狗的图片,他能立刻找到文本“一只可爱的狗”。如果你向他展示文本“一只可爱的狗”,他也能找到对应的图片。

但问题在于:这位图书管理员过于自信。他从不表示“我不确定”或“这是个棘手的问题”。如果你给他看一张模糊的猫的照片,看起来像狗,他可能仍然自信地说是“狗”,而不承认自己是在猜测。他也无法判断何时被问及从未见过的事物(例如一张未来主义外星人的图片)。

本文介绍了GeoFlowVLM,这是一个新的“附加”模块,充当这位图书管理员的置信度计。它不改变图书管理员的大脑;它只是倾听他的判断,并评估他应该有多大的把握。

以下是其工作原理,使用简单的类比说明:

1. 问题所在:“平面地图”与“地球仪”

大多数现有系统将这些图文对视为平面纸张上的点(欧几里得空间)。但本文认为,图书管理员的记忆实际上呈地球仪形状(超球面)。

  • 类比:想象试图在一张平纸上绘制地球地图。边缘处的距离会被扭曲。如果在现实是地球仪的情况下,却在平面地图上测量不确定性,你的测量结果将是错误的。
  • 解决方案:GeoFlowVLM 尊重“地球仪”的形状。它理解图书管理员的知识存在于弯曲的表面上,而非平坦的纸张上。

2. 两种类型的“不确定”

本文教导系统区分两种不同类型的不确定性:

A. “一对多”的混淆(偶然不确定性)

有时,一张图片可以用多种有效的方式描述。

  • 类比:你向图书管理员展示一张一个人拿着红球的图片。
    • 是“一个拿着球的人”吗?
    • 是“一个在玩接球游戏的人”吗?
    • 是“一个拿着红色球体的人”吗?
      所有描述都是正确的。图书管理员感到困惑,是因为世界本身具有歧义,而非因为他愚蠢。
  • GeoFlowVLM 的做法:它计算**“检索熵”**。这可以理解为衡量图书管理员脑海中有多少不同的答案在浮动。如果答案分散在许多可能性中,系统会说:“高不确定性:这是一个棘手、模糊的问题。”如果答案集中在一个清晰的峰值上,它则说:“低不确定性:这很简单。”

B. “从未见过”的混淆(认知不确定性)

有时,图书管理员被问及完全超出其训练范围的事物。

  • 类比:你向图书管理员展示一张“闪闪发光的紫色龙”的图片。图书管理员从未见过龙,更不用说紫色的龙了。他处于“知识地球仪”上从未涉足的区域。
  • GeoFlowVLM 的做法:它计算**“典型性得分”**。它会问:“这张图文对看起来像我研究过的数百万对吗?”如果该对与训练数据相比显得怪异或罕见,得分就会上升,发出信号:“我不认识这个;我可能在产生幻觉。”

3. 工作原理:“流”与“掩码”

该系统使用一种名为黎曼流匹配的数学技术。

  • 类比:想象图书管理员的知识是一条河流,从混乱、嘈杂的源头(随机噪声)流向清晰、有序的目的地(实际的图片和文本)。
  • “流”:GeoFlowVLM 学习这条河流的方向。它学习如何将一个随机点引导至特定的图文对。
  • “掩码”:这是巧妙之处。系统使用单个“大脑”(神经网络),它可以佩戴不同的“掩码”。
    • 掩码 1(联合):它学习整条河流(图片和文本如何共同流动)。
    • 掩码 2(条件):它在文本上覆盖掩码,并问:“如果我有这张图片,文本会流向哪里?”
    • 掩码 3(条件):它在图片上覆盖掩码,并问:“如果我有这段文本,图片会流向哪里?”
      因为它同时学习这三者,所以无需重新训练图书管理员,就能回答“这个有多模糊?”以及“这是新的吗?”这两个问题。

4. 结果:更精准的指南针

作者在三项主要任务上测试了该系统:

  1. 从图像中查找文本:他们证明,当系统表示“高不确定性”时,图书管理员确实很可能选错文本。当它表示“低不确定性”时,图书管理员通常是正确的。这是一个非常可靠的指南针。
  2. 从文本中查找图像:结果相同。系统能正确识别何时文本描述过于模糊,无法 pinpoint 到一张具体的图像。
  3. 发现未知:当他们在从未见过的图像(如不同种类的鸟类或物体)上测试该系统时,“典型性得分”正确标记了那些怪异的样本。

“秘密武器”(链式法则)

本文还发现了一个数学技巧。他们发现,一张图文对的总“惊喜度”可以拆分为两部分:

  1. “典型性”部分:这对图书管理员来说有多怪异?(这是认知得分)。
  2. “匹配”部分:图片和文本结合得有多好?(这仅仅是衡量匹配质量的指标,而非图书管理员的不确定程度)。

本文证明,应使用“典型性”部分来衡量图书管理员是否对新的数据感到不确定。使用“匹配”部分实际上会混淆系统。

总结

GeoFlowVLM 是一个工具,它将“置信度计”附加到现有的 AI 视觉 - 语言模型上。它尊重 AI 记忆的弯曲形状,使其能够告诉你:

  1. “这个问题本质上很棘手,因为有多个正确答案。”
  2. “这个问题很棘手,因为我从未见过类似的东西。”

它无需改变原始 AI 即可实现这一点,使其成为一种安全有效的方法,用于判断何时信任 AI,何时应保持怀疑。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →