VRIQ: Benchmarking and Analyzing Visual-Reasoning IQ of VLMs
VRIQ 基准测试显示,当前的视觉语言模型在视觉推理任务上表现不佳,这主要是由于感知能力的局限性而非推理能力的缺陷,其准确率在抽象谜题上为 28%,在自然图像上为 45%。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一支由极其聪明的机器人组成的团队,它们能够阅读书籍并观察图片。你想知道它们是真的“聪明”,还是仅仅擅长瞎猜。为了弄清这一点,这篇论文的作者构建了一个特殊的测试,名为 VRIQ(视觉推理智商)。
把 VRIQ 想象成一个巨大的数字“拼图盒”,专门设计用来戏弄这些机器人。这个盒子包含两类谜题:
- 抽象谜题: 这些就像经典的 IQ 测试卡片,上面有奇怪的形状、线条和图案。这里没有现实世界的物体,只有符号。
- 自然谜题: 这些使用现实生活中的照片,比如苹果、汽车或人,但询问的是同样的逻辑难题。
大惊喜:机器人是“盲”的
当研究人员测试目前最先进的 AI 模型(包括来自 OpenAI 和 Google 的著名模型)时,他们发现了一些令人震惊的事实。
- 在抽象谜题上: 机器人的表现几乎和随机乱猜一样糟糕。它们的平均得分约为 28%(其中 25% 是纯靠运气)。这就像一个背下了整本字典,却连一个句子都读不出来的学生。
- 在自然谜题上: 它们表现得稍好一些(约为 45%),但仍远未达到完美。
论文揭示了问题并不在于机器人不擅长“思考”(推理),而在于它们不擅长“看”(感知)。
侦探工作:它们为什么失败了?
为了查明机器人究竟在哪里失败,研究人员化身为侦探。他们不仅仅是问“答案是什么?”,而是通过“探测问题”将每一个谜题拆解成微小的步骤。
想象一个机器人正在处理一个需要找出不同形状的谜题时失败了。研究人员问道:
- 感知探测: “你看到了多少个红色的圆圈?”
- 推理探测: “如果有 3 个红色圆圈,且规则是‘减去一个’,那么还剩几个?”
调查结果:
- 56% 的时间: 机器人失败是因为它看不清基础情况(例如,它无法数出圆圈的数量,或者无法辨别形状的方向)。
- 43% 的时间: 机器人既看不清基础情况,也无法理解逻辑。
- 仅 1% 的时间: 机器人看得很清楚,只是逻辑理解错了。
比喻: 这就像给一位厨师一份做蛋糕的食谱。厨师(AI)完美掌握了烘焙的逻辑。但如果厨师被蒙上了眼睛,看不见现在只有 2 个鸡蛋而不是 4 个,那么蛋糕就会失败。失败的原因不是烹饪逻辑,而是看不清食材。
“工具”的转折
研究人员尝试了最后一件事。他们给其中一个特定的 AI 模型(OpenAI 的 o3)配备了一套数字工具,比如放大镜、一把剪刀(用于裁剪图像)和一个计算器。这个模型被允许通过主动操作图片来进行“视觉化思考”,从而在回答之前先处理图片。
结果: 这个会使用工具的机器人表现飞跃。它在抽象谜题上的得分从 28% 飙升到了 50% 以上,在自然谜题上的得分甚至达到了 80-100%。这证明了,如果你给机器人更好的“眼睛”(工具来清晰地观察),它的“大脑”(推理)就会运作得更好。
核心结论
论文得出结论,目前的 AI 模型并不是因为缺乏智能或逻辑而失败。它们失败是因为难以准确地感知视觉世界。它们无法可靠地计数物体、理解 3D 深度或辨别物体的旋转方向。
要让 AI 在视觉推理方面真正变得聪明,我们不仅需要更大的大脑,更需要给它们一双更好的眼睛。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。