← 最新论文
💬 NLP

Visuospatial Perspective Taking in Multimodal Language Models

该论文通过改编人类研究中的“导演任务”和“旋转图形任务”评估多模态语言模型的视空间观点采择能力,发现其在需要抑制自我视角以采纳他人视角的二级观点采择方面存在显著缺陷,揭示了当前模型在协作场景中推理替代视角的局限性。

原作者: Jonathan Prunty, Seraphina Zhang, Patrick Quinn, Jianxun Lian, Xing Xie, Lucy Cheke

发布于 2026-03-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Jonathan Prunty, Seraphina Zhang, Patrick Quinn, Jianxun Lian, Xing Xie, Lucy Cheke

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是一份给多模态大语言模型(MLMs)(也就是那些能看图片、能听懂人话的超级 AI)做的“心理体检报告”。

体检的核心项目叫做**“视觉空间视角采择”(VPT)。用大白话讲,就是“能不能站在别人的角度看世界”**。

想象一下,你和一个朋友面对面坐着,中间放着一个杯子。

  • 你的视角:杯子把手在右边。
  • 朋友的视角:杯子把手在左边。
  • 人类的能力:你不需要费力想就能知道,朋友眼里的杯子把手是在左边。
  • AI 的困境:这篇论文发现,现在的顶级 AI 在这方面表现得像个“死脑筋”,经常搞不清楚。

以下是这篇论文的通俗解读:

1. 为什么要测这个?

现在的 AI 越来越像我们的老师、同事甚至朋友。如果 AI 不能理解“别人看到了什么”或者“别人觉得东西在哪”,那它在合作时就会很笨拙。
比如,朋友说:“把我左边的那个苹果递给我。”

  • 如果 AI 不能切换视角,它可能会递给你你左边的苹果(那是朋友眼里的右边),结果把朋友气坏了。
  • 以前的测试大多是用文字故事(比如“小明把球藏在盒子里”),AI 靠背答案就能考高分。但这次,研究者用了图片空间旋转,这才是真正的“看图说话”和“空间推理”。

2. 两个核心测试游戏

研究者设计了两个游戏来“折磨”AI:

游戏一:旋转小人任务 (The Rotating Figure Task)

  • 场景:图片里有一个小人站在房间中央,地上有个数字(比如"6"或"9")。
  • 挑战
    • Level 1(简单版):问 AI“小人能看到这个数吗?”(只要看视线有没有被挡住)。
    • Level 2(困难版):问 AI“在小人眼里,这个数是 6 还是 9?”或者“这个数在小人的左手边还是右手边?”
    • 关键点:你需要把图片在脑子里旋转,模拟小人的视角。
  • AI 的表现
    • 当小人和 AI 面对面(0 度)或背对背(180 度)时,AI 偶尔能蒙对。
    • 一旦小人转到侧面(比如 90 度),AI 就彻底晕了。它就像个只会照镜子的人,只会做简单的“左右互换”,一旦角度稍微复杂点,它就不知道该怎么在脑子里“旋转”图像了。
    • 比喻:就像你让一个只会背“左变右”口诀的人去转体 45 度,他直接死机了。

游戏二:导演任务 (The Director Task)

  • 场景:AI 面前有一个 4x4 的格子,里面放着各种物品。对面站着一个“导演”,但导演面前有些格子被挡板挡住了(他看不见)。
  • 挑战:导演说:“请把能看到的最左边的那个蓝色书拿给我。”
  • 陷阱
    • AI 自己能看到所有东西(包括被挡住的)。
    • 如果 AI 不能抑制住“自己能看到”的冲动,它可能会选一个被挡板挡住的东西,或者选错了左右方向。
  • AI 的表现
    • 当任务只需要考虑“谁看得见”(视觉视角)时,AI 还能凑合。
    • 一旦加上“左右方向”(空间视角),AI 就崩盘了。它很难同时处理“那个东西被挡住了”和“那是导演眼里的左边”这两个信息。
    • 比喻:这就像让你一边玩“找不同”(找出被挡住的),一边玩“镜像游戏”(左右互换),AI 的大脑直接过载,开始胡乱猜。

3. 主要发现:AI 的“死穴”在哪里?

  • Level 1 还能凑合,Level 2 彻底拉胯
    人类大脑里有一个区域(rTPJ)专门负责“抑制自我,想象别人”。AI 似乎没有这个专门的“开关”。它很难主动抑制自己看到的画面,强行切换到别人的视角。
  • 靠“投机取巧”而不是“真理解”
    AI 在 0 度(面对面)和 180 度(背对背)时表现不错,是因为它可能学会了简单的**“镜像口诀”**(比如:如果是背对背,我就把左右反过来)。但在中间角度(比如 45 度、90 度),这种简单的口诀不管用了,AI 就不知道该怎么办了。
  • 推理模型也没用
    即使是那些号称“会思考”、“会推理”的最新模型(如 o3, o4-mini),在这个任务上也没有本质突破。它们只是把“猜”的过程写得更有逻辑了,但核心的空间转换能力依然很弱。

4. 这意味着什么?

  • 现在的 AI 还很“自我中心”:它们很难真正理解“别人眼中的世界”是什么样的。
  • 合作有风险:如果让这样的 AI 去当机器人助手,在复杂的物理环境里(比如帮你拿东西、指挥交通),它可能会因为搞不清视角而把东西拿错,甚至造成危险。
  • 未来的方向:我们需要给 AI 装上真正的“空间想象力”和“换位思考”能力,而不仅仅是让它背更多的文字故事。

总结

这篇论文告诉我们:虽然现在的 AI 能写诗、能画画、能聊天,但在**“站在别人的角度看东西”这件人类觉得很简单的事上,它们还像个“没长大的孩子”**,甚至有点“固执己见”。在让它们真正融入人类社会之前,我们还得帮它们补补这门“空间心理课”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →