The Cartesian Shortcut: Re-evaluate Vision Reasoning in Polar Coordinate Space
本文介绍了 Polaris-Bench,这是一个将视觉推理任务重构为极坐标形式的基准测试,旨在揭示当前多模态大语言模型中存在的“笛卡尔捷径”漏洞,并表明其在标准网格基准测试中的优异表现源于对文本坐标模式的利用,而非稳健且拓扑不变的视觉理解。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是论文《笛卡尔捷径:在极坐标空间中重新评估视觉推理》的解释,已用通俗易懂的语言和类比进行翻译。
核心理念:AI 模型究竟是在“看”,还是仅仅在“读”?
想象一下你在参加数学考试。其中一个版本的题目,数字排列在整齐的方格网中(就像电子表格)。另一个版本,数字则排列成圆形,就像披萨的切片。
谷歌 DeepMind 和斯坦福大学的研究人员发现,世界上最聪明的 AI 视觉模型就像那些死记硬背了方格网解题技巧、却并不真正理解数学的学生。一旦将考试形式改为圆形,它们就会惨败。
他们将这种技巧称为“笛卡尔捷径”。
什么是“笛卡尔捷径”?
大多数针对 AI 的视觉推理测试都使用笛卡尔坐标。这只是一个 fancy 的说法,意指“行和列”(就像棋盘或电子表格)。
- 第 1 行,第 2 列。
- 第 3 行,第 5 列。
该论文发现,当 AI 模型观察这些方格网时,它们并没有真正“看见”图像。相反,它们迅速将图像在“大脑”(即思维链)中转换成一串文本坐标列表。它们不再观察视觉形状,而是像人类阅读地图一样,利用文本逻辑来解决问题。
类比:
想象 AI 在方格网上做题,就像一个人通过阅读指令列表来解迷宫:“向下走 3 步,右转,再走 2 步。”它们并没有在脑海中构建迷宫的图像,而只是在遵循文本指令。
实验:“披萨”测试
为了证明 AI 是通过这种文本技巧在“作弊”,研究人员创建了一个名为Polaris-Bench的新基准测试。
他们选取了 53 种不同的视觉谜题(如数独、迷宫和模式匹配),并将它们从方格网转换为极坐标形式。
- 极坐标就像飞镖靶或披萨。你不再使用“行和列”,而是使用环(距离中心的距离)和扇区(角度)。
结果:
- 在方格网(笛卡尔)上: 顶级 AI 模型得分极高(70% 到 83%)。它们看起来像天才。
- 在披萨网(极坐标)上: 分数崩塌。同样的模型得分跌至 31% 到 39%。
这就像那个在电子表格形式的数学考试中取得满分的学生,当数字被写成圆形时,却在完全相同的数学考试中突然不及格了。
为什么会发生这种情况?
研究人员认为,AI 模型失败并不是因为圆形形状“更难”。谜题的逻辑完全相同。它们失败是因为:
- 它们依赖网格: 模型已经学会将方形图像转换为文本列表(第 1 行,第 2 列)来解决问题。
- 它们无法对圆形做同样的事: 当图像是圆形时,AI 无法轻易将其转换为简单的“行/列”文本列表。“捷径”失效了。
- 它们无法“看见”拓扑结构: 模型缺乏拓扑不变推理能力。用通俗的话说,这意味着它们无法理解方格网和圆形网格只是绘制同一张地图的两种不同方式。它们被卡在网格的具体形状上。
关键发现(通俗版)
- “文本”拐杖: AI 模型严重依赖基于文本的推论来解决视觉问题。当视觉布局变为不适合文本列表的形式时,模型就迷路了。
- 思考无济于事: 即使研究人员让 AI“更深入地思考”(使用高推理模式),也无法解决问题。AI 只是更多地思考了错误的东西(网格结构),而不是真正理解图像。
- 这是一个普遍问题: 这不仅仅是某个特定 AI 的问题。他们测试了 14 种不同的最先进模型(来自谷歌、OpenAI、Anthropic 等),它们都落入了同一个陷阱。
- “迷宫”例外: 论文指出了一个有趣的例外:如果迷宫的房间里写有数字(如“房间 1,房间 2"),即使在圆形版本中,AI 的表现也很好。为什么?因为数字充当了新的“文本捷径”。AI 忽略了形状,只跟随数字。但如果迷宫没有数字,AI 就会失败。
结论
该论文得出结论:当前的 AI 模型在视觉推理方面并不像我们想象的那么出色。它们在标准测试中的高分是一种幻觉,是由这些测试使用方格网这一事实造成的。模型是利用网格结构来作弊,而不是真正理解视觉世界。
要构建真正聪明的 AI,我们需要停止在方格网上测试它们,转而测试那些迫使它们真正“看见”并进行推理的形状,而不仅仅是读取坐标。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。