← 最新论文
🤖 machine learning

GroundBench: A Factorized, Counterfactual Benchmark for Locating VLM Affordance Failures

GroundBench 是一个因子分解式的反事实基准测试,旨在通过证明许多表象上的定位成功实际上是由类别到动作的关联而非真正的视觉或机械推理所驱动的,从而隔离并诊断视觉语言模型在示能性(affordance)方面的具体失效原因。

原作者: Sarthak Sattigeri

发布于 2026-09-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Sarthak Sattigeri

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个机械臂正伸手去拿一个咖啡杯。为了成功,机器必须同时解决三个不同的谜题:它必须决定杯子的哪个部分是重要的(是把手,而不是杯缘);它必须在视觉世界中精确定位这个部分的位置;以及理解这个部分所引导的动作(是抓取,而不是推动)。多年来,研究人员通过要求人工智能系统描述机器人应该对某个物体做什么,来测试这些任务。最近的一项伴随性研究表明,如果你仅仅告诉 AI 目标部件的名字——比如说“抓取把手”而不是仅仅说“抓取杯子”——系统的表现就会大幅提升。这引出了一个令人乐观的结论:AI 终于学会了观察图像并推理物体的物理机制。

然而,一项名为 GroundBench 的新调查表明,这个结论可能为时过早。由曼尼帕尔大学斋浦尔分校的 Sattigeri 领导的研究人员怀疑,AI 实际上并没有学会更好地观察物体。相反,他们假设系统可能是在利用一种捷径:仅仅记住某些词汇(如“把手”)几乎总是与动作“抓取”成对出现,而不管图像实际显示了什么。为了测试这一点,他们构建了一个严谨的新基准,旨在将“在图像中找到部件的能力”与“根据单词猜测动作的能力”区分开来。他们不仅仅是要求 AI 执行任务;他们有系统地逐一剥离信息,以观察究竟是哪一个具体的线索驱动了成功。

研究人员构建了一系列六种不同的场景(或条件),用以测试三种不同版本的领先人工智能模型。在第一种场景中,AI 只看到一个物体的图像,比如键盘或门,没有任何文本指令。在第二种场景中,他们添加了物体的名称,例如“键盘”。在第三种场景中,他们指明了特定部件的名字,比如“空格键”。在第四种场景中,他们提供了该部件在屏幕上的精确位置——一个特定的点和一个围绕它的方框——但故意隐瞒了该部件的名字。在第五种场景中,他们同时给出了名称和位置。最后,在第六种场景中,他们增加了关于物体如何运动的技术细节,例如关节是铰链还是滑块。

结果是惊人的且违反直觉。当研究人员给出目标部件的精确位置,却拒绝告诉 AI 这个部件叫什么名字时,系统的表现崩溃了。在测试的三个模型中,选择正确动作的准确率下降到了随机猜测的水平,甚至更低。其中一个模型,在被告知是一个按钮但没被告知其名称的情况下,得分仅为 0.26,而一个完全忽略图像的简单基准模型得分却有 0.53。AI 可以完美地复现它所看到的定位,将它的“手指”精准地放在研究人员指出的位置,但它却无法理解该位置意味着什么。这就像是机器人能看到按钮,却不知道按钮是用来按压的。

形成鲜明对比的是,当研究人员给出部件的名字但隐瞒其位置时,性能飙升了。同样的模型在只有位置数据时表现不佳,但在被告知部件是“按钮”或“门”而没有看到位置时,准确率跃升到了 0.68 到 0.74 之间。这种模式在所有测试中都成立:只要 AI 被给予了部件的类别名称,它几乎总能猜出正确的动作。研究人员发现,在他们精心策划的一组物体中,仅凭部件的名字就足以确定答案。AI 并不是在观察图像以理解物理学,它是在阅读单词并回忆预先学到的关联。

为了证实这一怀疑,研究人员进行了一项控制实验,即完全移除图像,并要求模型仅根据文本进行回答。对于测试的最先进的模型而言,移除图像对其在提供部件名称时的表现没有产生影响。在没有看到物体的情况下,该模型的得分与有图像时一样好,甚至略高。这提供了强有力的证据,证明该系统并非在使用“视觉接地”(visual grounding)——即将单词与图像中的特定像素相连接的过程——而是在依赖基于文本的捷径。AI 知道“铰链门”意味着“拉”,“滑块按钮”意味着“推”,是因为它在训练数据中见过这些配对,而不是因为它理解了面前那个特定门或按钮的力学原理。

研究还测试了 AI 是否能应对“陷阱问题”。研究人员选取了一个具有多个部件的物体图像,例如有很多按键的键盘,并要求 AI 对一个非标准的部件执行动作,比如一个很少使用的特定按键。他们想看看 AI 是否真的会观察那个特定的按键,还是会默认执行整个物体的常见动作。虽然模型通常能遵循新指令,但在请求的动作不寻常时(例如垂直抬起一个部件),它们表现得非常吃力。在这种情况下,模型往往会退回到标准动作,这表明它们仍然在依赖最常见的关联,而非真正分析视觉场景。

或许最令人惊讶的发现是,增加更多信息并不总是会有帮助。当研究人员给出了 AI 位置和部件名称,并增加了关于物体如何运动的详细机械描述后,性能反而下降了。模型并没有进步,反而变得不那么准确了。这表明额外的信息干扰了系统,或者分散了它利用部件名称进行简单有效捷径的注意力。研究人员得出结论,对于这些特定任务,更多的数据并不等于更好的推理。

这项工作的影响对于机器人技术和人工智能领域具有重要意义。它揭示了某些测试的高分可能是具有误导性的。一个 AI 看起来像是物理推理的大师,实际上它可能只是单词关联的大师。研究人员发现,早期研究中观察到的现象——即命名一个部件能大幅提升准确率——其原因很可能不是 AI 突然学会了更好地观察,而是因为名字本身就包含了答案。这项研究并不声称这些模型无法进行视觉推理,但它确实表明,在这些特定条件下,它们并未使用视觉推理。

GroundBench 是一个诊断工具,一种剥开 AI 表现层层外壳以观察其底层运作机制的方法。通过将视觉位置与语义名称分离,研究人员暴露了模型表现出的行为与其实际行为之间的鸿沟。他们发现,当部件的名字被移除时,即使位置非常清晰,模型也无法找到对应的动作。这表明,对于这些系统而言,通往真正机械推理的道路比之前认为的要长得多。它们尚未学会观察一个物体并理解其功能;它们学会的是聆听一个单词并猜测其功能。这项研究的结束并非是对失败的宣告,而是绘制了一张更清晰的路线图,指明了未来的工作方向:构建能够真正将听到的词汇与看到的物理世界联系起来的系统,而不是依赖那些直到现在为止一直为它们提供便利的捷径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →