Beyond Recognition: Evaluating Visual Perspective Taking in Vision Language Models
该论文通过构建包含 144 个受人类测试启发的视觉任务,评估了多种视觉语言模型在场景理解、空间推理及视觉观点采择方面的能力,发现尽管模型在场景理解上表现优异,但在空间推理和观点采择任务上存在显著缺陷,揭示了当前模型在深层几何与空间推理能力上的不足。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文就像是在给现在的顶级 AI(视觉语言模型)做一场**“心理体检”**,专门测试它们是否真的能“换位思考”,还是仅仅在“看图说话”。
我们可以把这项研究想象成一场**“乐高积木大考”**。
1. 考试背景:AI 真的懂“别人怎么看世界”吗?
现在的 AI 很聪明,能认出图片里的猫、狗、桌子,甚至能数数。但是,如果我们要让 AI 去开车或者当机器人助手,它光认识物体是不够的。它必须知道**“别人看到了什么”**。
- 例子:自动驾驶汽车必须知道旁边的司机能不能看到前面的行人;机器人递东西前,得知道人能不能看到那个杯子。
- 核心问题:AI 能像人类一样,站在别人的角度(比如一个乐高小人)去看世界吗?这就是**“视觉视角转换” (Visual Perspective Taking)**。
2. 考试设计:乐高积木的“极简”迷宫
为了公平测试,作者们没有用复杂的真实照片(怕 AI 以前见过),而是用乐高积木搭建了一个个简单的场景:
- 主角:一个乐高小人。
- 道具:一个物体(比如一只乐高小狗、一把椅子)。
- 玩法:把小人和小狗放在不同的位置,让小人面向不同的方向,然后从两个角度(俯视像看地图,平视像看照片)拍照。
- 题目:一共 144 道题,每道题问 7 个问题,难度层层递进:
- 看图说话(简单):图里有几个东西?小人和狗在同一个平面上吗?(AI 这关几乎满分)。
- 空间推理(中等):狗在小人的哪边?小人面向哪个方向?(AI 开始犯迷糊)。
- 换位思考(困难):如果你是那个乐高小人,你能看到狗吗?狗在你的左边还是右边?(AI 在这里彻底崩盘)。
3. 考试成绩:眼高手低
测试了包括 GPT-4o、Claude、Gemini 等在内的 9 个最厉害的 AI 模型,结果令人惊讶:
- 场景理解(眼力):🌟🌟🌟🌟🌟
AI 们非常擅长认东西。问“图里有几只狗?”,它们几乎全对。就像你一眼就能看出桌上有个苹果。 - 空间推理(脑力):🌟🌟
问“狗在小人左边还是右边?”,AI 们表现一般。 - 视角转换(同理心):🌟
这是最惨的。当问“从小人的角度看,狗在哪里?”时,AI 们的正确率大幅下降,甚至不如随机猜。
比喻:这就像是一个**“超级近视眼”**。它能把桌上的东西看得清清楚楚(认得出来),但如果你让它想象“如果我是坐在椅子上的那个人,我会看到什么”,它的大脑就死机了,或者开始胡乱猜。
4. 发现的怪病:AI 的“方向强迫症”
研究人员发现,AI 们不仅不会换位思考,还患上了严重的**“方向偏见”**。
- 现象:不管乐高小人实际面向哪里,很多模型(比如 GPT-4 Turbo)总是固执地认为小人面向“东方”。
- 实验:
- 把周围的杂物拿走?没用,它还是猜东。
- 把图片放大,让小人看得更清楚?没用,它还是猜东。
- 直接在图上标出“东南西北”?没用,它还是猜东。
- 把乐高小人换成真人照片?没用,它还是说真人面向东方。
- 结论:这说明 AI 并不是真的在“看”图片并计算角度,而是在背答案或者依赖语言习惯。它的大脑里似乎有一个默认的“开关”,一遇到这种问题就自动跳到“东方”这个选项,完全忽略了图片里的真实信息。
5. 核心发现:认得出来 想得明白
论文揭示了一个残酷的真相:AI 的“眼力”和“脑力”是脱节的。
- 它能完美地识别物体(这是“眼”)。
- 但它无法在脑海中构建一个几何空间,去模拟另一个视角(这是“脑”)。
- 这就好比一个人能背下所有的地图,但如果你让他闭上眼睛在房间里转个圈,他就不知道自己现在面对哪面墙了。
6. 这对我们意味着什么?
如果未来的自动驾驶汽车或机器人像现在的 AI 一样,“认得路但不懂别人怎么看路”,那将是危险的。
- 它可能看到前面有障碍物,但不知道旁边的司机也看到了,从而做出错误的判断。
- 它可能把东西递给一个根本看不见的人。
总结
这篇论文就像给 AI 做了一次**“透视眼”检查**。结果显示,虽然现在的 AI 是**“超级识图大师”,但在“换位思考”这种需要真正理解空间关系和他人视角的能力上,它们还像个“死记硬背的小学生”**,甚至经常犯一些人类不会犯的、奇怪的“方向强迫症”。
未来的 AI 要想真正像人一样聪明,不能只靠“看”,还得学会在脑子里真正“转起来”,建立真正的空间几何感。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。