想象你有一位超级聪明的图书管理员(一个视觉 - 语言模型),他 memorized 了数百万张图片及其描述。如果你向这位图书管理员展示一张狗的图片,他能立刻找到文本“一只可爱的狗”。如果你向他展示文本“一只可爱的狗”,他也能找到对应的图片。
但问题在于:这位图书管理员过于自信。他从不表示“我不确定”或“这是个棘手的问题”。如果你给他看一张模糊的猫的照片,看起来像狗,他可能仍然自信地说是“狗”,而不承认自己是在猜测。他也无法判断何时被问及从未见过的事物(例如一张未来主义外星人的图片)。
本文介绍了GeoFlowVLM,这是一个新的“附加”模块,充当这位图书管理员的置信度计。它不改变图书管理员的大脑;它只是倾听他的判断,并评估他应该有多大的把握。
以下是其工作原理,使用简单的类比说明:
1. 问题所在:“平面地图”与“地球仪”
大多数现有系统将这些图文对视为平面纸张上的点(欧几里得空间)。但本文认为,图书管理员的记忆实际上呈地球仪形状(超球面)。
- 类比:想象试图在一张平纸上绘制地球地图。边缘处的距离会被扭曲。如果在现实是地球仪的情况下,却在平面地图上测量不确定性,你的测量结果将是错误的。
- 解决方案:GeoFlowVLM 尊重“地球仪”的形状。它理解图书管理员的知识存在于弯曲的表面上,而非平坦的纸张上。
2. 两种类型的“不确定”
本文教导系统区分两种不同类型的不确定性:
A. “一对多”的混淆(偶然不确定性)
有时,一张图片可以用多种有效的方式描述。
- 类比:你向图书管理员展示一张一个人拿着红球的图片。
- 是“一个拿着球的人”吗?
- 是“一个在玩接球游戏的人”吗?
- 是“一个拿着红色球体的人”吗?
所有描述都是正确的。图书管理员感到困惑,是因为世界本身具有歧义,而非因为他愚蠢。
- GeoFlowVLM 的做法:它计算**“检索熵”**。这可以理解为衡量图书管理员脑海中有多少不同的答案在浮动。如果答案分散在许多可能性中,系统会说:“高不确定性:这是一个棘手、模糊的问题。”如果答案集中在一个清晰的峰值上,它则说:“低不确定性:这很简单。”
B. “从未见过”的混淆(认知不确定性)
有时,图书管理员被问及完全超出其训练范围的事物。
- 类比:你向图书管理员展示一张“闪闪发光的紫色龙”的图片。图书管理员从未见过龙,更不用说紫色的龙了。他处于“知识地球仪”上从未涉足的区域。
- GeoFlowVLM 的做法:它计算**“典型性得分”**。它会问:“这张图文对看起来像我研究过的数百万对吗?”如果该对与训练数据相比显得怪异或罕见,得分就会上升,发出信号:“我不认识这个;我可能在产生幻觉。”
3. 工作原理:“流”与“掩码”
该系统使用一种名为黎曼流匹配的数学技术。
- 类比:想象图书管理员的知识是一条河流,从混乱、嘈杂的源头(随机噪声)流向清晰、有序的目的地(实际的图片和文本)。
- “流”:GeoFlowVLM 学习这条河流的方向。它学习如何将一个随机点引导至特定的图文对。
- “掩码”:这是巧妙之处。系统使用单个“大脑”(神经网络),它可以佩戴不同的“掩码”。
- 掩码 1(联合):它学习整条河流(图片和文本如何共同流动)。
- 掩码 2(条件):它在文本上覆盖掩码,并问:“如果我有这张图片,文本会流向哪里?”
- 掩码 3(条件):它在图片上覆盖掩码,并问:“如果我有这段文本,图片会流向哪里?”
因为它同时学习这三者,所以无需重新训练图书管理员,就能回答“这个有多模糊?”以及“这是新的吗?”这两个问题。
4. 结果:更精准的指南针
作者在三项主要任务上测试了该系统:
- 从图像中查找文本:他们证明,当系统表示“高不确定性”时,图书管理员确实很可能选错文本。当它表示“低不确定性”时,图书管理员通常是正确的。这是一个非常可靠的指南针。
- 从文本中查找图像:结果相同。系统能正确识别何时文本描述过于模糊,无法 pinpoint 到一张具体的图像。
- 发现未知:当他们在从未见过的图像(如不同种类的鸟类或物体)上测试该系统时,“典型性得分”正确标记了那些怪异的样本。
“秘密武器”(链式法则)
本文还发现了一个数学技巧。他们发现,一张图文对的总“惊喜度”可以拆分为两部分:
- “典型性”部分:这对图书管理员来说有多怪异?(这是认知得分)。
- “匹配”部分:图片和文本结合得有多好?(这仅仅是衡量匹配质量的指标,而非图书管理员的不确定程度)。
本文证明,仅应使用“典型性”部分来衡量图书管理员是否对新的数据感到不确定。使用“匹配”部分实际上会混淆系统。
总结
GeoFlowVLM 是一个工具,它将“置信度计”附加到现有的 AI 视觉 - 语言模型上。它尊重 AI 记忆的弯曲形状,使其能够告诉你:
- “这个问题本质上很棘手,因为有多个正确答案。”
- “这个问题很棘手,因为我从未见过类似的东西。”
它无需改变原始 AI 即可实现这一点,使其成为一种安全有效的方法,用于判断何时信任 AI,何时应保持怀疑。
技术摘要:GeoFlowVLM
问题陈述
标准的双编码器视觉 - 语言模型(VLM),如 CLIP 和 SigLIP,通过 ℓ2 归一化将图像和文本映射到共享单位超球面上的确定性点。虽然这种方法在检索和零样本迁移方面行之有效,但这种确定性表示无法量化预测的不确定性。具体而言,它既未揭示偶然不确定性(内在的跨模态歧义,即一个输入对应多个有效输出),也未揭示认知不确定性(缺乏对落在训练分布之外查询的支持)。
现有的事后不确定性量化(UQ)方法存在两个主要局限性:
- 几何无意识性:许多方法在环境欧几里得空间中运行,忽略了定义 VLM 嵌入空间的 ℓ2 归一化约束。
- 不确定性建模不完整:大多数方法仅捕捉一种类型的不确定性(偶然性或认知性),或者未能同时尊重两种模态的超球面几何结构。例如,ProbVLM 虽然捕捉了两者,但使用了启发式方法,忽略了超球面结构,并且测量的是适配器不确定性而非骨干网络密度。
核心挑战在于:在不重新训练底层编码器的情况下,从冻结的 VLM 嵌入中量化这两种不确定性,同时严格尊重乘积超球面几何结构(Sd−1×Sd−1)。
方法论:GeoFlowVLM
作者提出了GeoFlowVLM,这是一种事后概率适配器,用于学习乘积超球面上成对 ℓ2 归一化嵌入的联合分布。
核心架构与训练
- 黎曼流匹配:该模型利用黎曼流匹配在流形 M=Sd−1×Sd−1 上学习联合密度 pϕ(eI,eT)。它回归到闭式测地线切向目标,避免了昂贵的热核近似。
- 单一掩码速度场:一个关键的设计选择是使用带有块结构二元掩码 m∈{0,1}2d 的单个神经网络。该单一速度场 vϕ(zt,m) 通过不同的掩码处理三种不同的模式:
- 联合流(mjoint):生成图像和文本嵌入。
- 条件流(mI→T):给定固定图像生成文本。
- 条件流(mT→I):给定固定文本生成图像。
- 训练目标:该模型使用掩码条件流匹配(CFM)目标进行训练。掩码将监督限制在生成的维度上,同时将条件维度固定在其观测值(t=0)处。训练采用熵最优传输来配对源样本和目标样本,从而在流形上拉直轨迹。
- 一致性:定理 1 证明,在总体极限下,这种单一掩码网络无需辅助一致性损失即可恢复跨模态方向及联合分布的有效黎曼条件流速度场。
不确定性读数
从单一训练好的联合模型中,推导出两个不确定性指标:
偶然不确定性(检索熵):
- 源自条件后验 pϕ(eT∣eI)(或反之)。
- 从条件流中采样,并在检索库上聚合,形成离散后验分布 π。
- 香农熵 H(π) 量化检索歧义。
- 理论依据:利用 Fano 不等式,熵提供了 MAP 贝叶斯风险的严格下界,证明高熵对应高检索难度。
认知不确定性(边际典型性):
- 通过联合负对数似然(NLL)的精确链式法则分解得出:
−logpϕ(eI,eT)=认知典型性[−logpϕ(eI)−logpϕ(eT)]−跨模态匹配PMIϕ(eI,eT)
- 作者认为,点互信息(PMI)项在结构上是判别性的(衡量兼容性),而非认知性的。
- 认知得分定义为边际典型性之和:uep=−logpϕ(eI)−logpϕ(eT)。
- 这些边际值利用贝叶斯恒等式并通过流 ODE 的反向时间积分从联合模型计算得出,无需额外参数。
主要贡献
- GeoFlowVLM 适配器:一种在乘积超球面上通过黎曼流匹配训练的事后概率适配器,使用单一掩码速度场。它在无需重新训练编码器的情况下,提供联合、边际和条件密度。消融研究证实,尊重超球面几何结构对于校准不确定性在结构上是必要的。
- 条件检索熵:一种新的偶然性估计量,用于量化跨模态歧义。它在基准测试中表现出近乎理想的单调校准(跟踪检索难度),并为贝叶斯风险提供了决策理论下界。
- 链式法则分解:一项理论推导,表明联合 NLL 可分解为边际典型性(正确的认知信号)和跨模态 PMI(判别信号)。这解释了基于单模态密度的方法(如 REPVLM)的经验成功,并将其框定为联合模型的连贯扩展。
实验结果
该方法在冻结的 OpenCLIP ViT-H/14 骨干网络上进行评估,在 Conceptual Captions (CC-1M) 上训练,并在七个基准测试上进行零样本测试。
偶然不确定性(检索):
- 在 MS-COCO、Flickr30k 和 CUB-200(包括图像到文本和文本到图像)上进行了评估。
- GeoFlowVLM 实现了预测熵与 Recall@1 之间近乎完美的单调校准(Spearman ρ≈−1.0),显著优于基线模型(ProbVLM、AsymVLM、GroVE)。
- ProbVLM 显示出正相关(不确定性在正确查询上上升),而其他基线则表现出不稳定或非单调的趋势。
认知不确定性(零样本分类):
- 在 ImageNet-1K、Food-101、CIFAR-100 和 ObjectNet 上进行了评估。
- 边际典型性之和(uep)随着覆盖率的降低(拒绝高不确定性样本)而呈现出一致增加的筛选准确率。
- 组件分析证实,PMI 作为独立的认知得分表现不佳(经常拒绝正确预测),而边际典型性提供了可靠的信号。
- GeoFlowVLM 的表现与 REPVLM 相当或更优,在 ObjectNet(视角偏移)上具有显著优势,这归因于联合模型能够捕捉独立单模态流所遗漏的跨模态结构。
消融实验:
- 几何结构:欧几里得基线(架构相同但在 Rd×Rd 中运行)在偶然性和认知性指标上均灾难性失败,证实了黎曼几何的必要性。
- 效率:仅需 10 个 ODE 积分步长和一个 Hutchinson 探针即可进行散度估计,即可获得可靠的估计。
- 骨干网络:结果迁移到了 SigLIP 骨干网络,尽管由于 SigLIP 嵌入更具各向同性,基于密度的方法在 ImageNet-1K 上的性能有所下降。
意义与主张
本文主张,GeoFlowVLM 通过提供一个单一的、感知几何的模型,同时揭示偶然不确定性和认知不确定性,解决了冻结 VLM 事后 UQ 的关键空白。
- 理论洞察:该工作为以下问题提供了原则性解释:为何在此设置中边际典型性是正确的认知信号,以及为何跨模态 PMI 不应作为不确定性得分。它证明了在乘积超球面上的联合建模严格优于单模态建模。
- 实用价值:该方法提供了一种校准的、方向对称的检索难度估计量,以及用于零样本分类中分布外检测的鲁棒基于密度的得分,且无需修改预训练的 VLM 骨干网络。
- 局限性:作者指出,一致性定理是总体极限结果;有限样本界限仍待解决。认知得分是基于密度的(典型性),而非贝叶斯的(参数后验方差)。此外,该方法需要在大规模数据上进行一次性训练,并且每个查询需要多次 ODE 求解,这使其区别于免训练方法。
作者总结道,联合嵌入建模是一种在视觉 - 语言表示上进行更丰富概率推理的通用策略,特别适用于医疗检索和自主系统等安全关键应用。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。