JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles
该论文介绍了 JigShape,这是一个具有互锁拼图块的拼图基准测试,它揭示了当前的视觉语言模型缺乏鲁棒的几何推理能力,因为尽管它们在简单的 4×4 拼图上表现出色,却无法将性能扩展到更小的网格之外。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教会一个机器人如何理解这个世界,不仅是通过识别物体的外观,更是通过理解它们在空间中是如何组合在一起的。这便是**视觉语言模型(Vision-Language Models, VLMs)**的领域——这类人工智能既能“看”图像,也能“读”文本,通常还能针对所见内容进行交谈。虽然这些机器人识别物体名称或描述场景的能力已经变得极其出色,但科学家们开始产生疑问:它们真的能进行空间推理吗?它们能否看着一堆散乱的物体,就精准地判断出每一个都属于什么位置,就像人类一样?这不仅仅是一个表演技巧;这是机器人拿起工具、建筑师设计建筑,以及任何人工智能真正理解物理世界所必需的一项基本技能。如果一个人工智能无法弄清楚部件是如何契合在一起的,那它就像是一个能读完所有书籍却无法整理书架的图书管理员。
于是,一项名为 JigShape 的新研究应运而生,它决定用一个经典的童年挑战来测试这些 AI 大脑:拼图游戏。但不仅仅是普通的拼图。研究人员意识到,之前的测试有点像是在“作弊”。他们使用的拼图只是将照片切割成简单的正方形块。如果你有一张蓝天的照片,任何一个蓝色方块都可以放在任何地方,这使得很难判断 AI 到底是在“思考”还是仅仅在瞎猜。为了解决这个问题,团队创建了一个使用**凸凹结合(tab-and-blank)**形状的新基准——即那种带有用于锁定的凸起和凹槽的形状。这增加了一个严格的规则:凸起必须进入凹槽。这把拼图从一个模糊的猜测游戏变成了一个精确的逻辑问题,其中只有一个正确答案。
研究人员构建了一个庞大的拼图库,范围从 4x4 的小网格到拥有数百个部件的 16x16 大网格。随后,他们要求世界上最聪明的 AI 模型来解决这些难题。结果既令人惊喜又令人失望。当拼图较小(4x4)时,一个顶尖模型 GPT-5.5 表现得相当出色,实现了 69.65% 的部件准确率(这意味着平均而言,近 70% 的单个部件都被放置在了正确的位置)。它似乎同时理解了图像内容和部件的形状。然而,几乎所有其他模型,即使是那些旨在提升“推理”能力的模型,也表现得一败涂地,其表现并不比随机乱选更好。
真正的故事在于,当拼图变大时发生了什么。随着网格增长到 8x8 和 12x12,即使是表现最好的模型的性能也崩塌了。那个在小规模拼图中表现优异的模型,在面对大型拼图时突然跌落至接近随机猜测的水平。研究人员将这种现象称为**“缩放悬崖”(scaling cliff)**。这表明,虽然这些 AI 可以处理少量部件,但当部件数量增多时,它们会完全失去追踪所有规则的能力。它们无法在大型棋盘上维持这种“锁与钥匙”般的逻辑关系。
团队还深入研究了模型是如何解决拼图的。他们发现,那些学会解决小型拼图(通过针对性训练)的模型实际上在某种程度上“作弊”了。它们几乎完全依赖于部件的形状(凸起和凹槽),而很大程度上忽略了部件内部的图像。当研究人员移除形状并给出纯正方形部件时,这些“经过训练”的模型崩溃了,准确率从 97% 骤降至仅 10%。这表明它们并没有真正理解图像,而只是记住了形状规则。
最终,JigShape 揭示了一个残酷的事实:目前的 AI 模型在几何推理方面仍然非常糟糕。它们可以识别照片中的猫,但却难以搞清楚那一百块组成猫的碎片是如何在 3D 空间中拼接在一起的。虽然有一个模型在小型任务中展现出了希望的微光,但“缩放悬崖”证明,随着复杂度的增加,这些系统会撞上一堵墙。论文指出,为了让 AI 真正理解物理世界,我们需要建立新的方法,让它们能够将视觉线索与几何规则相结合,而不是仅仅记忆模式。目前来看,拼图游戏仍然是一个连最聪明的机器人也无法完全掌握的挑战。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。