← 最新论文
💻 computer science

PolyComp: A Polycube-based Benchmark for Compositional 3D Spatial Reasoning in Multimodal Models

该论文介绍了 PolyComp,这是一个由 120 个问题组成的程序化生成基准测试,旨在评估多模态模型在组合式 3D 空间推理方面的能力,研究结果显示,尽管成本和呈现形式各异,但虽然像 GPT-5.6 Sol 这样的先进模型达到了中等准确率(50%),其他模型却在接近随机猜测的水平上挣扎。

原作者: Siddharth Patel

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Siddharth Patel

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

人类的大脑拥有一种安静、近乎本能的天赋,能够将复杂的形状拆解开来,并想象它们如何重新组合。我们可以观察一个拼图碎片、一个破碎的玩具或一叠箱子,并能瞬间直观地理解这些部件是如何与整体相关的,即使我们无法看到每一个表面。这种被称为空间推理的能力,是我们在物理世界中导航的基石。几十年来,科学家们一直想知道,能够识别图像和阅读文本的新一代人工智能,是否也发展出了这种内在的空间感。虽然这些机器在识别照片中的猫或总结文章方面表现出色,但目前尚不清楚它们是否真正理解物体的三维几何结构,或者它们仅仅是基于以往见过的模式进行猜测。

一项新研究引入了一项严谨的测试,旨在解决这一问题,它超越了简单的图像识别,转而探测机器思考形状与组装的核心方式。研究人员创建了一个名为 PolyComp 的基准测试,这是一个由块状、基于立方体结构的 120 个视觉谜题组成的集合。在每个谜题中,人工智能会被展示一个由若干个相连立方体组成的目标物体,并从两个不同的角度进行观察。随后,它会被呈现出四对可能的较小部件,并被要求识别哪一对部件在经过旋转和移动后,能够完美地结合起来重构出原始目标。这项任务要求模型在脑海中构建部件的三维表示,模拟它们在空间中可能如何转动,并验证它们是否能无缝隙或无重叠地组合在一起。这并非是对记忆力或语言能力的测试,而是一场纯粹的几何逻辑测试。

该研究对三款最先进的人工智能系统进行了测试:GPT-5.6 Sol、Claude Fable 5 和 Gemini 3.1 Pro Preview。每个系统都被要求解决相同的 120 个谜题,但谜题以三种不同的方式呈现,以观察图像格式是有助于还是阻碍了推理过程。有时,目标物体和选项会出现在同一张图像中;而其他时候,目标物体显示在一张图像中,而四个选项则分布在四张独立的图像中,这些图像要么带有通用标签,要么带有描述性名称。其目标是观察将视觉信息拆分为更小的块是否会让任务变得更容易,或者无论信息如何展示,模型是否都会感到吃力。

结果揭示了人类水平的直觉与当前机器能力之间的显著差距。表现最好的模型 GPT-5.6 Sol 仅能正确解决一半的谜题,准确率为 50%。第二名模型 Claude Fable 5 解决了约 39%,而第三名 Gemini 3.1 Pro Preview 的表现接近随机猜测,仅答对了 27.5% 的题目。由于每个谜题都有四个选项,一台盲目猜测的计算机预期应有 25% 的正确率。这意味着,即便最先进的模型也仅仅比随机猜测好一点点,而最弱的模型基本上就是在瞎猜。研究还发现,形状的类型比图像的呈现方式更为重要。模型在处理涉及矩形环(即部件形成环状结构的谜题)时最为吃力,但在处理看起来像是简单块体被拆分或组合在一起的谜题时,表现稍好一些。

有趣的是,谜题展示的方式并未对结果产生显著影响。将图像拆分为独立文件或添加描述性标签并没有显著提高任何模型的得分。这表明,难点不在于模型能否清晰地看到图片,而在于它们无法构建一个稳定的内部三维模型并模拟物体的运动。研究人员指出,当模型成功时,通常是因为部件具有非常明显的整体形状或巨大的平面,使其易于匹配。而当谜题需要追踪微小的隐藏角落,或推算部件如何嵌入空心空间时,模型则表现得持续失败。

该研究还强调了这种深度推理的成本。为了解决总计 360 个问题(120 个谜题以三种方式呈现),能力最强的模型消耗了大量的计算资源,按标准定价计算,每个问题耗费近一美元。能力较弱的模型运行成本较低,但准确度也较低。这种权衡表明,即便我们为最强大的系统付费,它们仍然缺乏人类自然发展的基本空间智能。研究人员发布了所有 120 个谜题及其生成的代码,邀请他人使用这一标准来测试未来的模型。

最终,这项工作作为一个明确的诊断工具,表明虽然人工智能在理解语言和识别物体方面取得了巨大进步,但尚未掌握在脑海中操纵三维空间的能力。这些模型可以描述一个立方体或识别一个形状,但它们还无法可靠地想象两个分离的部件在空中旋转并如何组合在一起。直到机器能够建立这些内部三维地图并在其中模拟变换,它们的空间推理能力才会显得脆弱,容易出现人类儿童都能轻松解决的错误。该研究并不声称这种能力对于机器来说是无法学习的,但它明确指出当前的系统尚未实现这一能力,从而为未来通过研究弥合这一差距指明了清晰的路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →