Contextual Observer Grounding: Evaluating Situated Spatial Reasoning in Vision-Language Models
本文引入了视角基准测试(POVBench),旨在评估视觉语言模型执行“语境观察者定位”(即从语境线索中推断说话者的处境化视角)的能力,并证明虽然当前模型在这一任务上表现吃力,但通过对观察者相关空间推理进行显式分解,可以显著提升目标定位的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,仅凭朋友对某个物品摆放位置的描述,去寻找一个你从未进入过的房间里丢失的物品。你可能会听到:“我在冲咖啡的时候,把钥匙掉在了灯左边的桌子上。”要解决这个谜题,你不仅需要知道桌子和灯长什么样;你还必须首先重建你朋友在房间里的位置,想象他们的视线方向,然后在那个特定的视角下,在脑海中定位钥匙的位置。这种理解他人空间视角的能力——利用关于其活动和环境的线索来理解空间——是人类沟通的基础。它让我们能够高效地协作,而无需分享每一个视觉细节。为了让机器人和人工智能能够在我们的家庭中与我们协作,它们必须掌握这项同样的技能,即被称为“情境化空间推理”的能力。
东京大学和卡内基梅隆大学的研究人员的一项新研究调查了现代人工智能系统是否真的能够执行这项任务。由 Mimo Shirasaka、Haochen Zhang 和 Yonatan Bisk 领导的研究团队创建了一个严谨的测试,称为“视角基准测试”(Point-of-View Benchmark),旨在观察机器是否可以推断说话者的位置,并基于推断出的视角来定位物体。他们的工作表明,虽然目前的 AI 模型在许多视觉任务上表现出色,但在被要求从一个它们无法直接看到的视角进行空间推理时,表现却显著吃力,即使在给出了明确指令的情况下也是如此。
研究人员利用一个程序化生成的、包含真实家具和布局的计算机生成房屋世界构建了他们的测试。在这个数字环境中,一个模拟机器人探索每个房屋,并在从一个房间移动到另一个房间的过程中捕捉一系列第一人称图像。实验的核心在于一段描述物体位置的自然语言句子,例如“我看到书在床的左边”。人工智能面临的挑战是查看机器人的探索照片,弄清楚说话者在说那句话时站在哪里,然后指出书在那个特定视角下的位置。研究通过测试三个不同的难度等级,以了解 AI 究竟在哪里遇到了瓶颈。在最难的版本中,句子仅提供关于活动的提示,例如“在更换灯泡时”,迫使 AI 去猜测位置。在中等版本中,句子明确指出了说话者正在互动的物体,例如“在更换落地灯上的灯泡时”。在最简单的版本中,AI 被直接展示了来自说话者视角的准确照片。
结果令人警醒。在包括商业系统和开源版本在内的广泛先进 AI 模型中,在所有三种场景下的表现都处于较低水平。即使 AI 被明确告知说话者靠近哪个物体,或者被给予了来自说话者视角的准确照片,模型也经常无法精准定位正确位置。最难版本与中等版本之间的差距出人意料地小,这表明主要的困难不仅在于弄清楚说话者站在哪里,而是在于如何将诸如“在……左边”之类的描述转化为视觉场景中的特定位置。模型经常选错房间或混淆参考物体,例如将门框误认为冰箱,因为它们无法有效地将视觉线索与活动的语境结合起来。
为了了解模型是否可以通过帮助得到改进,研究人员尝试了一种不同的方法。他们要求 AI 逐步拆解其思考过程,明确说明它是如何识别说话者位置、定位参考物体以及确定目标方向的。这种被称为“结构化空间推理”的方法使准确率有了明显的提升。当模型被引导以这种结构化的方式进行推理时,它们在定位隐藏物体方面变得更加出色。这表明 AI 拥有必要的组成信息,但由于缺乏关于如何连接这些信息的明确引导,难以将它们组装成一个连贯的心理模型。
研究还利用人们在房屋中走动的实际视频片段在现实世界中测试了这些想法。结果反映了计算机模拟的情况:AI 模型在处理该任务时依然表现挣扎,成功率维持在 50% 或以下。然而,使用逐步推理方法的模型再次显示出比不使用该方法更好的结果。这表明,困难不仅仅是计算机生成环境的缺陷,而是当前技术在面对复杂、混乱的人类空间时所面临的真实挑战。
最终,这项研究凸显了具身智能(embodied artificial intelligence)能力中的一个关键差距。虽然机器可以识别物体并回答有关它们所见内容的问题,但它们尚未学会如何自然地推断人类说话者的视角,或从一个从未直接观察过的视角来重建场景。研究结果表明,为了让机器人能在日常生活中真正与人类协作,它们需要发展出一种更深层次的能力,即利用语境和常识来填补视觉拼图中的缺失部分,从而从他人的视角进行空间推理。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。