← 最新论文
💻 computer science

Birds of a Feather Flock Together: Background-Invariant Representations via Linear Structure in VLMs

本文提出了一种预训练方法,该方法利用视觉 - 语言模型嵌入空间的线性可加性,将场景表征分解为前景和背景组件,从而构建背景不变表征,在无需真实世界去偏数据的情况下,于 Waterbirds 数据集上实现了创纪录的最差组准确率。

原作者: Youssef Zaazou, Mark Thomas

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Youssef Zaazou, Mark Thomas

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和创造性类比对论文《物以类聚》(Birds of a Feather Flock Together)的解释。

核心问题:“懒惰的侦探”

想象一下,你正在教一个机器人识别动物。你给它看一张北极熊站在冰面上的照片。机器人学会了:“白色皮毛 + 冰面 = 北极熊”。

现在,你给它看一张北极熊站在草地上的照片(也许是在动物园或电影布景中)。机器人困惑了。它想:“等等,没有冰!这一定是另一种动物!”

这就是当前人工智能模型(称为视觉 - 语言模型或 VLM)所发生的情况。它们就像懒惰的侦探,喜欢走捷径。它们不去研究物体(熊),而是研究背景(冰),因为在它们的训练数据中,熊和冰总是同时出现。这被称为虚假相关性

该论文指出,这些模型太容易被背景景色所迷惑,导致它们在现实世界的场景变化中失败。

秘密超能力:“数学乐高”

研究人员发现了一个关于这些 AI 模型如何“思考”的有趣现象。他们发现,AI 对场景的内部表征就像是一叠透明的乐高积木

  • 积木 A:物体(鸟)。
  • 积木 B:背景(沼泽或草地)。

在大多数 AI 模型中,这些积木以混乱、纠缠的方式粘在一起。但研究人员发现,在这些特定模型(如 CLIP 和 SigLIP 2)中,积木是完全线性的。这意味着 AI 对“沼泽中的鸟”的“想法”,仅仅是“鸟” + “沼泽”在数学上的完美总和。

因为它们是独立的积木,研究人员意识到可以把“沼泽”积木抽走,只留下“鸟”积木。

解决方案:“抗背景工作坊”

作者们创造了一种新的训练方法,称为BAP(背景不变锚点预训练)。把它想象成一个特殊的 workshop,AI 在这里学习忽略景色。

这个工作坊分两步运作:

第一步:创建“纯鸟”蓝图
研究人员取一张鸟的照片,将其粘贴到数百个不同、随机的背景上(海滩、森林、城市、沙漠)。

  • 他们问 AI:“这只鸟长什么样?”
  • 由于鸟是一样的,但背景每次都变,AI 对背景的回答会被“平均化”并相互抵消。
  • 剩下的就是完美、纯净的鸟的蓝图,没有任何背景噪音。他们称之为锚点(Anchor)

第二步:“多对一”训练
现在,他们再次让 AI 看同一只鸟,但这次是在新的随机背景上。

  • 他们迫使 AI 将其回答与第一步中创建的纯鸟蓝图进行匹配。
  • 这就像一名教官在喊:“无论背景看起来像什么,你的回答必须匹配这个特定的‘鸟’目标!”
  • 如果 AI 试图利用背景作为线索,它就会受到“惩罚”,因为它与蓝图不匹配。
  • 随着时间的推移,AI 学会了完全忽略背景,只专注于鸟。

结果:为何重要

该论文在一个名为Waterbirds的著名棘手数据集上测试了这种方法(在该数据集中,鸟通常位于陆地或水域,且背景完美匹配)。

  • 旧方法:如果 AI 是在“每只水鸟都在水上”且“每只陆鸟都在陆地上”(100% 相关性)的数据上训练的,那么当测试一只在水上的陆鸟时,它会惨败。它几乎每次都会答错。
  • BAP 方法:即使 AI 是在100% 误导性线索(没有任何“错误”组合的示例)的数据上训练的,它仍然学会了忽略背景。
  • 得分:新方法在最难的测试案例中实现了超过90% 的准确率,击败了所有先前的方法。

权衡:“专家 vs 通才”

该论文诚实地指出了一个缺点。通过如此严格地教导 AI 忽略背景,它变成了一名专家,但失去了一些通用知识

  • 之前:AI 可以识别一只鸟,并告诉你它在“森林”里。
  • 之后:AI 在识别鸟方面表现出色,但如果你问它“这是什么地方?”(没有鸟),它可能会感到困惑。因为它被训练成将景色视为“噪音”,所以它忘记了如何识别景色。

作者表示,对于特定任务来说,这是一个很好的权衡。例如,如果你使用相机在野外寻找动物,你希望 AI 即使在不寻常的地方也能找到动物。你并不一定需要 AI 去描述森林。

总结

该论文介绍了一个巧妙的技巧:通过认识到 AI 关于物体和背景的“想法”在数学上是分离的,他们可以训练 AI 平均化背景锁定物体。这创造了一个超级稳健的 AI,它不会被物体的位置所迷惑,即使在训练数据充满误导性线索的情况下,也能取得破纪录的准确率。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →