← 最新论文
💻 computer science

JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles

该论文介绍了 JigShape,这是一个具有互锁拼图块的拼图基准测试,它揭示了当前的视觉语言模型缺乏鲁棒的几何推理能力,因为尽管它们在简单的 4×4 拼图上表现出色,却无法将性能扩展到更小的网格之外。

原作者: Shawn Li, Wei Yang, Jike Zhong, Jiate Li, Jiawei Yang, You Qin, Ryan Rossi, Franck Dernoncourt, Roger Zimmermann, Yue Wang, Zhengzhong Tu, Vicente Ordonez, Mohit Bansal, Yue Zhao

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Shawn Li, Wei Yang, Jike Zhong, Jiate Li, Jiawei Yang, You Qin, Ryan Rossi, Franck Dernoncourt, Roger Zimmermann, Yue Wang, Zhengzhong Tu, Vicente Ordonez, Mohit Bansal, Yue Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教会一个机器人如何理解这个世界,不仅是通过识别物体的外观,更是通过理解它们在空间中是如何组合在一起的。这便是**视觉语言模型(Vision-Language Models, VLMs)**的领域——这类人工智能既能“看”图像,也能“读”文本,通常还能针对所见内容进行交谈。虽然这些机器人识别物体名称或描述场景的能力已经变得极其出色,但科学家们开始产生疑问:它们真的能进行空间推理吗?它们能否看着一堆散乱的物体,就精准地判断出每一个都属于什么位置,就像人类一样?这不仅仅是一个表演技巧;这是机器人拿起工具、建筑师设计建筑,以及任何人工智能真正理解物理世界所必需的一项基本技能。如果一个人工智能无法弄清楚部件是如何契合在一起的,那它就像是一个能读完所有书籍却无法整理书架的图书管理员。

于是,一项名为 JigShape 的新研究应运而生,它决定用一个经典的童年挑战来测试这些 AI 大脑:拼图游戏。但不仅仅是普通的拼图。研究人员意识到,之前的测试有点像是在“作弊”。他们使用的拼图只是将照片切割成简单的正方形块。如果你有一张蓝天的照片,任何一个蓝色方块都可以放在任何地方,这使得很难判断 AI 到底是在“思考”还是仅仅在瞎猜。为了解决这个问题,团队创建了一个使用**凸凹结合(tab-and-blank)**形状的新基准——即那种带有用于锁定的凸起和凹槽的形状。这增加了一个严格的规则:凸起必须进入凹槽。这把拼图从一个模糊的猜测游戏变成了一个精确的逻辑问题,其中只有一个正确答案。

研究人员构建了一个庞大的拼图库,范围从 4x4 的小网格到拥有数百个部件的 16x16 大网格。随后,他们要求世界上最聪明的 AI 模型来解决这些难题。结果既令人惊喜又令人失望。当拼图较小(4x4)时,一个顶尖模型 GPT-5.5 表现得相当出色,实现了 69.65% 的部件准确率(这意味着平均而言,近 70% 的单个部件都被放置在了正确的位置)。它似乎同时理解了图像内容和部件的形状。然而,几乎所有其他模型,即使是那些旨在提升“推理”能力的模型,也表现得一败涂地,其表现并不比随机乱选更好。

真正的故事在于,当拼图变大时发生了什么。随着网格增长到 8x8 和 12x12,即使是表现最好的模型的性能也崩塌了。那个在小规模拼图中表现优异的模型,在面对大型拼图时突然跌落至接近随机猜测的水平。研究人员将这种现象称为**“缩放悬崖”(scaling cliff)**。这表明,虽然这些 AI 可以处理少量部件,但当部件数量增多时,它们会完全失去追踪所有规则的能力。它们无法在大型棋盘上维持这种“锁与钥匙”般的逻辑关系。

团队还深入研究了模型是如何解决拼图的。他们发现,那些学会解决小型拼图(通过针对性训练)的模型实际上在某种程度上“作弊”了。它们几乎完全依赖于部件的形状(凸起和凹槽),而很大程度上忽略了部件内部的图像。当研究人员移除形状并给出纯正方形部件时,这些“经过训练”的模型崩溃了,准确率从 97% 骤降至仅 10%。这表明它们并没有真正理解图像,而只是记住了形状规则。

最终,JigShape 揭示了一个残酷的事实:目前的 AI 模型在几何推理方面仍然非常糟糕。它们可以识别照片中的猫,但却难以搞清楚那一百块组成猫的碎片是如何在 3D 空间中拼接在一起的。虽然有一个模型在小型任务中展现出了希望的微光,但“缩放悬崖”证明,随着复杂度的增加,这些系统会撞上一堵墙。论文指出,为了让 AI 真正理解物理世界,我们需要建立新的方法,让它们能够将视觉线索与几何规则相结合,而不是仅仅记忆模式。目前来看,拼图游戏仍然是一个连最聪明的机器人也无法完全掌握的挑战。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →