On the modality gap and the contrastive loss in multi-modal representation learning
本文将 CLIP 式对比学习中的模态间隙识别为具有独立编码器的 InfoNCE 目标函数在低温度参数下的失效,并提出了 xNCE,一种通过引入模态内负样本来消除该间隙,同时在不牺牲检索准确性的前提下提升零样本分类性能的改进型损失函数。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有两个最好的朋友:一个只会说“图像”,另一个只会说“文字”。你想让他们在同一个房间里(一个共享的数字空间)聚会,以便他们能完美地理解彼此。这正是像 CLIP 这样的 AI 模型试图做的事情:它们学习如何将图像与其描述进行匹配。
但奇怪的是,即使经过训练后,这两个朋友往往还是站在房间的两个对角处。他们虽然仍能交流,但从未真正融合在一起。图像嵌入(image-embeddings)聚集在一个簇中,而文本嵌入(text-embeddings)则聚集在另一个簇中。这被称为**“模态间隙”(modality gap)**。
长期以来,科学家们认为这种分离是因为这两个朋友最初性格不同(随机初始化)或者来自不同的社区(不同的数据)。但 Fabian Mager、Hiba Nassar 和 Lars Kai Hansen 的这篇论文指出:“等一下。事实并非如此。”
真正的罪魁祸首:一场糟糕的“烫手山芋”游戏
作者通过一个巧妙的实验证明了他们的观点。他们拿了两对完全相同的双胞胎(两个具有完全相同初始权重的独立编码器),并给它们喂食了完全相同的图片,只是做了微小的调整(比如旋转或缩放)。在理想情况下,这对双胞胎应该产生完全相同的输出。
然而,当他们使用标准的训练方法(称为 InfoNCE)并配合一个特定的设置(即“低温度”,这会让 AI 变得非常挑剔)时,这对双向竟然还是产生了分歧。尽管它们看到的都是同一个东西,但一个双胞胎开始说“图像”,而另一个却开始说“文字”!
这证明了间隙并不是由数据或起点引起的。相反,论文指出,InfoNCE 公式本身存在一个缺陷。
你可以这样理解:训练游戏告诉 AI,“让匹配对(图像 + 文本)靠得超级近,让所有不匹配的对离得超级远。”
- 缺陷在于: 为了让不匹配的对“离得远”,AI 找到了一个偷懒的捷径。它把整个“图像”组推向房间的一侧,把整个“文本”组推向另一侧。这满足了“让它们分开”的规则,却并没有真正学会将它们融合。论文称之为**“模式失效”(mode-failure)**——AI 找到了一个局部最优解,它觉得自己做得很好,但实际上它只是把两组人藏在了各自的角落里。
这种情况特别发生在 AI 被设定得非常严格(低温度)的时候。如果你让 AI 变得更宽松(高温度),这些组就会混合在一起,但那样的话,AI 就会忘记如何区分不同的物体,从而破坏它识别事物的能力。
解决方案:xNCE(“调酒师”)
作者提出了一个简单的修复方案,叫做 xNCE。
再次想象那个训练游戏。在旧版本中,当 AI 试图将一个“不匹配”的图像推离一个“不匹配”的文本时,它只是把它们推到了对角的角落。
在新的 xNCE 版本中,游戏的规则改变了:“你不能只把文本推离图像。你还必须把文本推离其他文本,把图像推离其他图像。”
通过混合“负样本”(即 AI 不应该 匹配的东西)使得这些样本同时来自两个组,AI 就被迫停止躲在角落里。它必须学会保持两组数据的混合状态,同时仍保持特定匹配项的接近。
实验室里发生了什么?
作者在两件事上测试了该方法:
- MNIST(手写数字): 他们将两个编码器视为两种不同的“模态”。
- 结果: 使用旧方法在低温度下,两组是完全分离的(100% 可分)。使用 xNCE 后,即使在那些严格的低温度下,间隙也显著缩小了。
- COCO(图像与说明文字): 这是现实世界的测试。
- 间隙: 标准方法留下了巨大的间隙(距离为 0.88)。新方法将其缩小到了 0.12(使用极少量混合)甚至 0.05(使用大量混合)。
- 权衡: 作者找到了一个平衡点。如果他们只混合一小部分负样本(1% 到 5%),他们几乎可以完全消除间隙,同时不会损害 AI 寻找正确图像的能力(检索能力)。
- 额外收获: 最重要的是,这种新方法让 AI 在无需学习的情况下猜测图像内容(零样本分类)的能力变得更好了。在四项不同的测试中,新方法都击败了旧方法。例如,在 CIFAR-100 测试中,它的准确率提升了 4.2 个百分点。
这篇论文没有说的话
了解这篇论文没有声称的内容也很重要:
- 它并不认为高温度是解决办法。事实上,论文表明,仅仅通过提高温度来混合两组数据,就会破坏 AI 识别特定物体的能力(使 ImageNet 准确率从 51.9% 降至 15.5%)。
- 它并不说添加额外的“正则化”(强制 AI 趋于均匀分布)是最好的修复方法。作者测试了一个正则化版本,发现它在零样本性能上的提升不如他们的混合方法。
- 它并不声称这是解决所有问题的万灵药。论文建议,对于需要极端精确的任务(如寻找第 1 名的精确匹配),你可能需要混合得很少(1-5%);对于需要更通用理解的任务,你可以进行更多混合。
总结
这篇论文表明,“模态间隙”并不是自然的奥秘,而是标准训练配方中的一个漏洞。通过简单地混合训练游戏中的“负样本”,作者创造了一种方法(xNCE),它迫使 AI 真正学习一种共享语言,而不是仅仅躲在各自的角落里。这是一个微小的改进,它让 AI 变得更聪明、更统一,并且在保持通常使其擅长捕捉细节的“挑剔”设置的同时,还能更好地进行预测。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。