Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models
本文指出双编码器视觉-语言模型由于“概念袋”相似性接口而导致组合推理失败,并提出了一种名为 LCSE(逻辑约束分数编辑)的无需训练的方法,该方法将证据提取与约束执行分离,在显著提高逻辑准确性的同时保持了检索性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教会一个机器人如何“看”世界,方法是给它看数百万张图片,并用文字来描述它们。这就是视觉语言模型(Vision-Language Models, VLMs)的世界——这是人工智能的一个分支,旨在让计算机学会将图像与文本进行匹配。这些机器人最流行的学习方式是构建一个共享的“地图”,让相似的图片和相似的词汇在空间中靠在一起。当你向机器人提问时,它只需测量你的文字与图片之间的距离,就能找到最佳匹配。这就像一场巨大的“热与冷”游戏,随着机器人找到与你输入的文字看起来更匹配的图像,它会变得越来越“热”(即越来越自信)。
然而,这种简单的距离游戏存在一个棘手的难题。虽然机器人非常擅长识别单个事物——比如“狗”或“球”——但当你试图让它结合逻辑来处理这些事物时,比如“有一只狗,但没有球”或者“一只猫和一只鸟”,它就会感到困惑。机器人往往会忽略“但没有”或“和”这些部分,而仅仅寻找它认识的词汇。这就像机器人在玩一场“词袋模型”(Bag of Words)的游戏,它只计算一个词出现了多少次,却完全忘记了句子的规则。这篇论文研究了为什么会发生这种情况,并提出了一种巧妙的新方法,旨在不重新训练其整个“大脑”的情况下,修复机器人的逻辑问题。
问题所在:机器人的“概念袋”
本文作者发现,那些本应足够聪明以理解复杂句子的标准 AI 模型,实际上表现得像一个非常刻板、甚至有点糊涂的图书管理员。想象一下,你向这位图书管理员要一本关于“一辆没有驾驶员的红车”的书。这位图书管理员并没有找出一辆没有驾驶员的红车,而是递给你一本关于一辆带有驾驶员的红车的书,因为管理员太专注于“红”和“车”这两个词,以至于完全忽略了“没有”这个词。
从技术角度来看,这些模型使用一种“标量相似度”(scalar similarity)评分。你可以把这个评分看作是一个单一的数字,它告诉你一张图片与一段文本的匹配程度。论文指出,当你询问组合概念(如“A 和非 B”)时,模型实际上并没有进行逻辑运算。相反,它只是简单地对“A”的证据和“B”的证据取了平均值。这就像制作奶昔:如果你要求“草莓但不要香蕉”,模型只会把草莓和香蕉混合在一起,然后给你一个混合物,因为它认为“不要”这个指令只是另一个需要被搅拌进去的原料,而不是一个剔除原料的规则。
研究人员通过要求模型寻找符合特定逻辑规则(如“雨伞和没有人”)的图像来测试这一点。即使模型能清晰地看到图片中的人,它仍然会将这张图片标记为良好的匹配,因为查询语句中包含了“人”这个词。模型并不是看不见那个人,而是无法利用句子的逻辑来将那个人过滤掉。
调查:逻辑为何失效
为了弄清楚原因,作者并没有仅仅靠猜测,而是对模型的“大脑”进行了“手术”。他们观察了模型阅读的文本,查看逻辑词(如“不”或“且”)是否真的改变了句子的含义。他们发现,逻辑确实存在于文本之中,隐藏在其中,但它的力量太弱,不足以改变最终的评分。
想象一下,文本嵌入(即句子的数字表示)是一支由两人组成的搬运重物的团队。一个人代表“概念”(名词,如“狗”或“车”),另一个人代表“逻辑”(“和”或“不”)。论文发现,“概念”那个人是一个巨人,而“逻辑”那个人只是个小孩子。当他们共同推动箱子以决定选择哪张图片时,巨人的推力如此之大,以至于小孩子的推力被完全忽略了。结果呢?箱子朝着概念的方向移动,逻辑在混乱中丢失了。
作者还检查了仅仅通过重新训练模型(教它新的例子)是否能解决问题。他们发现,即使在成千上上万个关于“无”和“非”的例子上进行训练后,模型仍然难以应对。这就像试图教一个天生习惯用左手的人用右手写字,仅仅通过增加练习是不够的;底层的肌肉记忆(即模型组合评分的方式)才是真正的瓶颈,而非缺乏练习。
解决方案:分解推理与 LCSE
由于模型的内部“逻辑肌肉”太弱,无法修复这个问题,作者提出了一种名为**分解推理(Factored Inference)**的新策略。与其要求模型一次性完成所有数学运算,他们决定将任务拆分为两个独立的步骤:
- 证据提取: 首先,要求冻结(保持不变)的模型仅识别单个概念。“有狗吗?是的,90%确定。有猫吗?是的,80%确定。”
- 约束执行: 然后,获取这些数字并在模型之外进行逻辑运算。如果用户说“有狗但没有猫”,系统会获取“狗”的分数,并减去“猫”的分数(或将“猫”的分数翻转以代表“没有猫”),并使用严格的逻辑规则进行组合。
为了在实现这一目标的同时不破坏模型处理普通句子的能力,他们引入了一种称为 LCSE(逻辑约束评分编辑,Logic-Constrained Score Editing) 的方法。你可以把 LCSE 看作是一个聪明的编辑。它会倾听模型的原始答案,但如果句子包含逻辑规则(如“没有”或“和”),编辑就会介入,对最终得分进行微调,使逻辑生效。如果句子很简单,编辑则不对得分做任何改动。通过这种方式,模型保留了其原有的“个性”和检索能力,但终于能够遵守逻辑规则了。
结果:逻辑能力的巨大飞跃
这种新方法的表现令人印象深刻。作者在一个专门构建的基准测试集 FACTOR-Bench 上测试了他们的系统,该基准专门用于测试模型是否理解逻辑。
- 旧方法: 现有的最佳模型(即使是经过专门训练以理解否定含义的模型)大约只能答对 73.2% 的逻辑问题。
- 新方法 (LCSE): 作者的方法在使用相同的底层模型并配合其新“编辑器”后,准确率跃升至 85.5%。
- 更优表现: 当他们将此方法应用于一个更新、更强大的模型 SigLIP 2 时,准确率飙升至 90.7%。
他们还在另一个名为 NegBench 的挑战赛上进行了测试,该挑战赛侧重于“无”和“非”类问题。标准模型的正确率仅为 27.2%,但在使用 LCSE 后,准确率提升到了 65.2%。至关重要的是,这种逻辑能力的巨大提升并没有损害模型执行常规搜索的能力;它在标准图像检索方面保持了同样的高水平性能。
为什么这很重要
这篇论文表明,问题不在于 AI 模型能否很好地“看”或“读”,而在于它们组合信息的方式在处理复杂任务时存在根本性的缺陷。通过将“观察”(寻找概念)与“思考”(应用逻辑规则)这两个动作分离,我们可以在无需从头构建模型的情况下,让这些模型变得更加聪明。这提醒我们,有时修复一个聪明的机器人,最好的办法不是教它更多的知识,而是给它一个更好的计算器,来处理它已经掌握的知识。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。