← 最新论文
🤖 AI

OrientSAM: Mitigating Camera-Centric Shortcut in Multimodal Spatial Reasoning via Orientation-Aware Spatial Alignment

本文介绍了 OrientSAM,这是一个面向方向感知的空间对齐框架,通过注入显式的方向信息并采用课程学习,来缓解多模态大语言模型中的以相机为中心的捷径问题,从而实现鲁棒的以物体为中心的空间推理。

原作者: Wenxiao Fan, Hang Yin, Kan Li

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenxiao Fan, Hang Yin, Kan Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正站在一个房间里,看着一张两个朋友正在交谈的照片。如果你问一个人,“左边是谁?”他可能会看着照片说,“照片左侧的那个人。”但如果你指着其中一个朋友问,“在你左边的是谁?”答案就完全不同了。你必须在脑海中换位思考,代入那个朋友的角色,转身面向他们所面对的方向,然后观察另一个人。这种脑力体操被称为“视角转换”(perspective-taking),这是人类拥有的超能力,而计算机在这方面却表现得异常糟糕。

在人工智能领域,特别是“多模态大语言模型”(MLLMs)的世界里,计算机在看图和阅读文本方面已经变得非常出色。它们能告诉你垫子上有一只猫,或者一辆车是红色的。但当涉及到空间推理——即理解物体相对于其他物体(而非仅仅相对于摄像机)在三维空间中的位置时——它们往往会碰壁。这些 AI 模型往往是“以摄像机为中心”的,这意味着它们只能从镜头的视角来看待世界。它们难以理解“左”和“右”取决于人或物体的朝向,而不仅仅是他们在屏幕上的位置。这篇题为 OrientSAM 的论文,深入探讨了为什么这些聪明的计算机会在这个简单的技巧上栽跟头,并构建了一个新系统来帮助它们用他人的眼睛看世界。

摄像机陷阱:为什么 AI 会迷失

研究人员首先调查了一种特定的失败模式。他们注意到,当 AI 被问到“球在球员的左边还是右边?”时,它通常根据球员在照片中的位置(即“摄像机视角”)来回答,而不是根据球员实际的面向方向。

为了证明这一点,他们设置了一个“陷阱”。他们设计了一些测试问题,使摄像机视角与玩家视角产生分歧。例如,想象一名球员正对着摄像机。对于摄像机来说,一个球可能在球员图像的右侧。但如果该球员正对着摄像机,那么这个球实际上是在球员的“左手”边。研究发现,目前的 AI 模型几乎总是会掉进这个陷阱。它们依赖于一种“捷径”:它们只是观察图像的左侧和右侧,而忽略了玩家的朝向。这就像一个学生死记硬背“左边永远是页面的左侧”,却从未理解如果把页面转过来,“左边”也会随之改变。

研究人员发现,当参考对象(你所询问的人或物)直接面向摄像机时,这种捷径会导致问题更加严重。目标物与摄像机的对齐程度越高,AI 就越容易产生困惑,并默认使用图像平面捷径。这表明问题不在于 AI 看不到物体,而在于它缺乏一个关于物体如何在空间中定向的特定“心理模型”。

解决方案:OrientSAM

为了解决这个问题,团队构建了 OrientSAM(方向感知空间对齐模型)。你可以把它想象成给 AI 戴上了一副“3D 眼镜”并给了它一个指南针。

OrientSAM 并没有只是将图片和问题喂给 AI,而是将关于**方向(orientation)**的显式信息直接注入到模型的“大脑”中。以下是它的工作原理,使用了几个创造性的步骤:

  1. “指南针”Token: 系统不仅仅是说“这里有一个人”。它还会添加一个特殊的数字 Token,说明“这个人正向右偏转 45 度”。为了确保计算机理解面向 359 度几乎等同于面向 1 度(因为 0 和 360 是同一个点),他们使用了一种巧妙的数学技巧——傅里叶编码(Fourier encoding)。想象一下把一根绳子绕在圆圈上;无论你绕多少圈,绳子都能平滑地连接。这有助于 AI 理解方向是一个连续的循环,而不是一条直线。
  2. “脑力体操”(课程学习): 你不会在孩子还没学会数数之前就让他们解复杂的几何题。同样,研究人员并没有直接把最难的视角问题抛给 AI。他们使用了一种**课程学习(curriculum learning)**策略。
    • 第一阶段: 首先,他们教 AI 识别物体的朝向。“看这辆车,它正朝着北边行驶。”
    • 第二阶段: 一旦 AI 擅长识别方向,他们就会转向更难的任务:“现在,如果这辆车正朝着北边,那么树相对于它在哪里?”
      这一步步循序渐进的训练防止了 AI 退回到那种偷懒的、以摄像机为中心的捷径上。

结果:透过新视角看世界

团队在三个基准测试(Spatial-MM、ViewSpatial 和 3DSRBench)上测试了 OrientSAM,这些测试就像是 AI 空间能力的标准化考试。

结果非常明确:OrientSAM 在表现上始终优于其他强大的 AI 模型,尤其是在那些棘手的“非摄像机视角”问题上。

  • Spatial-MM 测试中,对于答案取决于人的视角(而非摄像机视角)的问题,OrientSAM 得分为 87.31%,而排名第二的模型仅为 39.55%
  • ViewSpatial 测试中,特别是在“人视角相对方向”(即从人的视角判断物体位置)方面,OrientSAM 达到了 85.04%,碾压了此前最好的 72.57%

这项研究表明,通过显式地教授 AI 关于方向的知识并进行阶段性训练,我们可以阻止它依赖于偷懒的图像平面捷径。AI 不再仅仅是“看到”图片,它开始理解三维世界,并能从其中物体的视角进行推理。

这意味着什么

这篇论文并不声称已经解决了所有的空间推理问题。该系统仍然依赖于其他工具来估计深度和方向,如果这些工具出错,OrientSAM 也会受到影响。然而,研究结果有力地表明,许多 AI 模型缺失的并不是更多的数据或更大的大脑,而是一种更好的表示方向的方法。通过赋予 AI 一个清晰的“向前看”的概念,我们可以帮助它们超越摄像机镜头,开始像我们一样,从内部向外理解这个世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →