← 最新论文
🤖 machine learning

SpaRRTa: A Synthetic Benchmark for Evaluating Spatial Intelligence in Visual Foundation Models

本文介绍了 SpaRRTa,这是一个旨在通过测试视觉基础模型识别物体相对位置的能力来评估其空间推理能力的合成基准测试,揭示了当前模型在空间意识方面的显著差异,并为未来的发展提供指导。

原作者: Turhan Can Kargin, Wojciech Jasiński, Adam Pardyl, Bartosz Zieliński, Marcin Przewięźlikowski

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Turhan Can Kargin, Wojciech Jasiński, Adam Pardyl, Bartosz Zieliński, Marcin Przewięźlikowski

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人如何在凌乱的房间里导航。你给它看了一张照片,照片里有一只坐在椅子上的猫,椅子旁边还有一个灯。一个聪明的机器人需要知道两件事:这些东西是“什么”(猫、椅子、灯),以及它们相对于彼此在“哪里”(猫在灯的左边)。长期以来,计算机在第一部分——识别照片中的物体——方面已经做得非常出色了。但第二部分,即理解3D布局和方向,却一直像是一个蒙着眼睛的人,试图仅凭一张平面的画来猜测球的位置。

这就是“视觉基础模型”(Visual Foundation Models)的世界。把它们想象成超级聪明的AI大脑,它们阅读了数百万张图片并学会了识别模式。它们是许多现代图像工具背后的引擎。然而,研究人员注意到一个故障:这些大脑很擅长说“那是一棵树!”,但当被问到“这棵树是在汽车的左边还是右边?”时,却经常出错。这很重要,因为如果我们想要机器人能在我们的房屋中行走或让汽车在路上行驶,它们需要理解空间,而不仅仅是标签。一个大问题是:这些AI大脑是真的“看到”了3D世界,还是仅仅通过记忆技巧来猜测特定数学问题的正确答案?

为了解开这个谜团,一个研究小组创建了一个新的测试,叫做 SpaRRTa(空间关系识别任务)。SpaRRTa并没有要求AI进行复杂的数学运算,比如测量精确距离或绘制3D地图,而是提出了一个更简单、更基本的问题:“从这个特定的视角来看,物体A是在物体B的左边、右边、前面还是后面?”

为了使这项测试既公平又极其精确,研究人员没有使用来自互联网的真实照片。相反,他们使用高端游戏引擎(Unreal Engine 5)构建了一个虚拟世界。他们创建了写实的场景——如森林、沙漠、雪镇、桥梁和繁华城市——并在其中放置了汽车、树木和狗等物体。他们可以移动摄像机,甚至可以假装“视角”是站在场景中的一个人,让AI想象从这个人的眼睛里看世界,而不是仅仅从摄像机的角度。这就像是在问:“如果我站在汽车后面,树会在我的左边还是右边?”

研究人员测试了各种各样的AI大脑,包括那些仅通过观察图片学习的模型,以及那些经过专门3D几何训练的模型。他们使用了一种巧妙的技巧,叫做“探测”(probing)。想象一下,AI的大脑是一个装满信息的锁定的盒子。他们没有重新训练整个盒子,而只是构建了一个小巧、简单的“钥匙”(探测器),以观察空间信息是否已经存在于其中。他们尝试了三种不同的钥匙:一种是同时观察整张图片的简单钥匙;一种是更聪明、能够挑选出重要位置的钥匙;还有一种是超级聪明、可以同时关注多个特定目标的钥匙。

以下是他们的发现,这有点令人惊讶。首先,简单的钥匙往往会失败。事实证明,AI对图片的“全局”视图(将整张图片视为一个大色块)实际上隐藏了空间细节。关于物体位置的信息存储在图像的微小、局部斑块中,就像一个个独立的拼图碎片一样。当你把所有这些碎片挤压成一个总结性的概要时,方向感就丢失了。然而,当他们使用更聪明、更专注的钥匙时,AI大脑的表现要好得多。

这项研究表明,虽然这些模型确实拥有空间意识,但这种意识隐藏在细微之处。那些经过专门3D数据训练(例如知道物体具体距离有多远)的模型表现最好,但即使是那些只看平面2D图片的模型,只要你知道如何提出正确的问题,也能展现出对方向的理解。有趣的是,当要求AI转换视角(即“以心传心”的视角,相对于摄像机的视角)去观察场景中的人时,AI的表现明显变差。这就像是我们很容易根据照片说“树在汽车的左边”,但如果我们想象自己站在汽车后面,要说“树在汽车的右边”就会变得困难得多。

研究人员还检查了“识别花朵或飞机的能力”是否意味着“理解空间的能力”。答案是否定的。AI可以是一个命名物体的专家,但在了解物体位置方面却可能表现糟糕。这证明了 SpaRRTa 衡量的是一种与单纯物体识别完全不同的技能。

简而言之,这篇论文表明,现代AI大脑并不是对空间“盲目”,而是将它们的空间知识隐藏在图像的精细细节中,而不是在宏观的整体总结中。为了构建能够真正穿越我们世界的机器人,我们不能仅仅要求它们识别物体,而应该开始教它们理解物体之间的关系,并使用像 SpaRRTa 这样的工具来引导这条道路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →