Density-Aware Translation of Spurious Correlations in Zero-Shot VLMs
本文提出了密度感知转换(Density-Aware Translation, DAT),这是一种通过基于局部嵌入密度对图像-文本相似度得分进行重缩放,从而缓解由 CLIP 特征空间各向异性几何结构导致的伪相关性放大的校准方法,旨在提升零样本视觉语言模型(VLM)的分类性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
问题:“热门选手”偏见
想象你有一位非常聪明、见多识广的图书管理员(AI 模型,例如 CLIP),他读过数百万本书,看过数百万张照片。这位管理员非常擅长在不需要预先学习新知识的情况下识别事物(这被称为“零样本/zero-shot”学习)。
然而,这位管理员有一个坏习惯:他很容易被人群所干扰。
- 场景: 想象你给管理员看一张岩石上鸟的照片。
- 错误: 在管理员的记忆中,他见过的“岩石上的鸟”的照片里,90% 都是陆禽。只有 10% 是水鸟。因为管理员见过太多“岩石上的陆禽”的照片,他的大脑会自动假设:“这一定是陆禽!”
- 现实: 你照片中的鸟实际上是一只恰好落在岩石上的稀有水鸟。
- 问题: 管理员忽略了鸟的具体细节(语义内容),而是根据背景进行猜测(虚假相关性/spurious correlation)。他依赖的是“热门”模式,而非真相。
这种情况之所以发生,是因为在 AI 的“大脑”(数学特征空间)中,常见的模式聚集在中心位置,而稀有但重要的模式则被推向了孤独、稀疏的边缘。AI 过度信任拥挤的中心,而忽略了边缘。
解决方案:“密度感知转换”(DAT)
作者提出了一种名为密度感知转换(Density-Aware Translation, DAT)的新方法。你可以把这想象成给管理员配备了一个“人群测量计”。
以下是它的工作步骤:
拍摄人群快照(参考集):
在做出最终判断之前,系统会为每种类型的鸟和每种类型的背景抽取一组平衡的小样本照片。这就像是要求管理员快速浏览一叠公平的卡片,展示所有可能的组合(例如:水里的水鸟、陆地上的水鸟、水里的陆禽、陆地上的陆禽)。测量“人群密度”:
当管理员看到一张新照片时,系统会检查:“这张照片是位于图书馆拥挤、热门的区域,还是位于一个安静、稀疏的角落?”- 如果一张照片看起来像是“水里的陆禽”(一种稀有、奇特的组合),系统会注意到它处于一个稀疏区域。
- 如果一张照片看起来像是“陆地上的陆禽”(一种常见的组合),它就处于一个稠密区域。
“转换”(调整分数):
系统随后会调整管理员的置信度分数:- 如果管理员对常见模式过度自信(例如,仅仅因为背景是陆地就猜是“陆禽”),系统会降低分数。它会说:“等等,你只是在随大流。让我们再仔细看看。”
- 如果管理员发现了一个稀有但正确的模式(例如,陆地上的水鸟),系统会保留或提升分数。它会说:“做得好!你发现了一个稀有且有意义的东西,尽管它不是那个‘热门’的选择。”
为什么这很特别
大多数其他方法试图通过以下方式来修复这个问题:
- 重新训练管理员: 这需要大量时间,并且需要新的老师(标注数据)。
- 重写问题: 尝试用更好的提示词(prompts)来迷惑管理员,但这往往并不可靠。
DAT 的不同之处在于:
- 它不需要重新训练管理员。
- 它不需要知道背景的“秘密”标签(如果需要,它可以自行猜测)。
- 它仅仅通过一个小而公平的样本来理解管理员记忆的“形状”,并实时修正分数。
结果
论文在多个数据集上测试了该方法(例如:在不同背景下识别鸟类、识别不同发色的面部、以及识别 X 光片中的疾病)。
- 结果: DAT 一致地帮助 AI 在最难的情况下(即那些通常被忽视的稀有群体)得到了正确答案。
- 类比: 在使用 DAT 之前,管理员擅长猜测“热门”答案,但在处理“稀有”答案时表现糟糕。使用 DAT 后,管理员变得更加均衡,在不丢失识别常见事物能力的前提下,也能正确识别出稀有事物。
总结
这篇论文介绍了一个简单而巧妙的技巧,用来阻止 AI 模型成为“从众者”。通过测量 AI 记忆中特定模式的拥挤程度或空旷程度,该方法迫使 AI 停止过度依赖常见的背景线索,转而开始关注图像的实际主体。这使得 AI 更加公平和准确,尤其是在面对稀有或代表性不足的群体时。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。