Investigating Relational Reasoning in VLMs
本文通过使用合成几何数据集和 Qwen3-VL-4B 模型,研究了视觉语言模型究竟是真正理解视觉关系,还是依赖于语言捷径,结果表明当前的视觉语言模型将真正的视觉推理与主要基于语言线索的策略结合在了一起。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代人工智能的版图中,新一代计算机已经学会了同时观察与交谈。这些被称为视觉语言模型的系统可以观察一张照片并描述其内容、回答关于所见之物的提问,甚至解决基于图像的谜题。对于人类观察者而言,它们表现得像是拥有真正的视觉世界理解力,就像一个人扫视一眼场景就能瞬间掌握物体之间如何相互关联一样。然而,一个根本性的问题仍悬而未决:这些机器是真的理解物体之间的空间关系和联系,还是仅仅是巧妙的模式匹配器,依赖于语言技巧和统计猜测?这种不确定性至关重要,因为如果这些系统只是通过捷径来模仿理解,那么在面对与其训练数据不匹配的情况时,它们可能会出现不可预测的失败,从而在关键应用中导致错误。
一个研究小组试图通过剥离现实世界的复杂性,并将其替换为一个受控的合成环境,来揭示这些模型的内部运作机制。他们创建了一个定制的数据集,由数千张简单的图像组成,每张图像都包含少量基本的几何形状,如圆形、正方形和三角形,并以特定的模式排列。这些形状被赋予了不同的颜色和大小,在某些情况下,还画有箭头以明确连接它们,而在另一些情况下,这种连接仅通过它们的相对位置来暗示。研究人员随后向一个现代视觉语言模型提出了一系列精确的问题,要求它识别形状的数量、识别特定颜色,或确定两个物体之间箭头的方向。通过将模型的答案与合成图像中的已知事实进行对比,他们可以精确地衡量机器的表现如何。
结果显示,模型在能够轻松完成的任务与难以理解的任务之间存在着显著的分歧。当被问及简单的识别类问题时,例如计算形状的总数或判断是否存在一个绿色的正方形,模型的表现近乎完美,准确率经常超过百分之九十六。它似乎对图像中的实体元素有着牢固的把握。然而,一旦问题涉及到在没有显式视觉线索的情况下理解关系,其表现就会大幅下降。例如,当被问及在没有画出箭头的情况下哪些物体是被连接的,或者仅根据布局描述一个形状相对于另一个形状的位置时,模型的准确率下降到了百分之六十或更低。有趣的是,当查询提供了显式的视觉标记(例如询问所画箭头的方向)时,模型保持了超过百分之九十二的高准确率。这表明机器并没有构建一个连贯的场景心理地图,而是高度依赖于问题中所使用的特定词汇以及提供的显式视觉标记。
为了确定模型是在真正“观察”关系还是仅仅在基于语言进行猜测,研究人员通过改变图像本身进行了严格的测试。他们创建了原始图片的修改版本,其中通过数字手段移除了一个特定的元素,例如单个形状或一个箭头,然后再次提出相同的问题。如果模型确实在根据视觉证据进行推理,那么移除关键部分应该会导致其准确率骤降。在某些情况下,情况确实如此:当模型被要求计数形状或跟随箭头方向时,移除相关的视觉元素导致其表现下降了近百分之二十五。这表明对于这些任务,模型确实在观察图像,但它也将这些视觉数据与使其变得脆弱的内部偏差混合在了一起,当场景发生变化时,这种偏差就会显现。
更令人惊讶的是,研究人员发现对于其他类型的提问,移除视觉元素实际上提高了模型的性能或使其保持不变。当被问及形状的相对位置或在没有箭头的情况下是否存在连接时,当视觉证据被遮蔽时,模型的回答反而变得稍微好了一些。这一反直觉的结果在论文中被记为“令人惊讶”且“直接矛盾于视觉推理”,这强烈表明模型根本没有利用视觉数据来解决这些问题。相反,它依赖于从训练数据中学习到的统计模式,本质上是根据问题的措辞来猜测答案,而不是根据图片中实际存在的内容。机器并不是在对空间进行推理;它是在根据语言线索背诵一个可能的回答。
通过窥探模型处理层的内部,研究人员追踪了信息如何从初始图像输入流动到最终答案的过程。他们发现,模型的早期层非常擅长捕捉简单的细节,如特定颜色或形状的存在。随着信息向系统深处移动,模型变得更擅长计数和识别粗略的关系。然而,深层模型无法一致地编码物体之间复杂的抽象关系,例如箭头的精确方向或在没有显式标记时的空间排列。研究结论指出,虽然这些强大的系统可以在许多视觉任务上获得高分,但它们的理解严格限于显式可观察到的内容。它们并未表现出真正的视觉理解,而是依赖于一种结合了真实视觉感知与语言捷径的混合策略。这一发现凸显了当前人工智能的一个关键局限性,即真正的视觉理解不仅需要处理像素和文字,还需要一种更深层、更稳健的推理能力,而这些模型尚未实现这一点。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。