GUI-Primitives: Diagnosing Spatial Reasoning Failures in Vision-Language GUI Grounding
该论文引入了 GUI-Primitives,这是一个揭示了视觉语言模型主要失败于定位候选界面元素而非理解空间关系的研究基准,其证据在于这些模型在受限于正确区域时具有高准确率,但在无约束的坐标预测上表现不佳。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,这样一台电脑:它能观察软件程序的截图,读出像“点击保存图标右侧的按钮”这样的句子,然后将鼠标光标移动到那个精确的位置。这是一种新一代人工智能智能体(AI agents)所承诺的前景,旨在为我们操作电脑。它们的构建目标是执行从填写表格到导航复杂菜单等各种任务,充当能够看见并与我们日常使用的图形界面进行交互的数字助手。为了让这些智能体发挥作用,它们必须具备一种被称为“接地”(grounding)的基本技能:即将句子中的特定词汇与屏幕上的特定形状或按钮联系起来的能力。如果智能体无法可靠地找到“右侧的按钮”,那么无论它的规划或打字能力有多聪明,它都无法完成任务。
研究人员早已知道这些电脑智能体有时会犯错,但他们一直难以准确找出原因。是电脑无法读取屏幕上的文本?是因为它对“右”这个词感到困惑?还是因为它根本无法定位那些按钮?现有的针对这些系统的测试通常将所有这些技能混合在一起,导致当智能体点击错误位置时,人们无法判断是哪个部分出了问题。为了解决这个谜题,一组科学家创建了一种高度受控的新型测试,旨在隔离一项单一的基础能力:理解计算机界面中的空间关系。
研究人员构建了一个名为 GUI-PRIMITIVES 的数据集,其中包含近一千对问题。每一对都使用完全相同的截图和完全相同的起始点(或称“锚点”),但仅改变指令中的一个单词。在其中一个版本中,电脑被要求点击特定图标左侧的元素;而在对应的版本中,它被要求点击该图标右侧的元素。由于图像和锚点是完全相同的,唯一的区别在于方向。如果电脑真正理解了语言,它应该在第一个问题中点击左边的按钮,在第二个问题中点击右边的按钮。如果它对两个问题都点击同一个按钮,或者点击了完全不同的区域,这就暴露了它在理解空间关系方面的失败。团队在这一挑战上测试了 19 种不同的 AI 模型,涵盖了从功能强大、价格昂贵的商业系统到较小的开源版本。
结果非常悬殊。即使是最先进的模型表现也很差,最好的系统也仅在约 32% 的案例中答对。与人类的表现相比,这是一个巨大的差距——人类的正确率接近 97%。研究人员进行了深入调查,以了解失败发生在哪里。他们发现,问题主要不在于模型对“左”或“右”这些词感到困惑。相反,模型失败的原因在于它们首先无法找到屏幕上的正确区域。在 60% 到 92% 的错误案例中,电脑预测的点击位置既不在正确的目标上,也不在错误的干扰项上,而是落在了一个完全空白的图像区域。
当研究人员过滤掉这些“迷失”的预测,仅观察电脑实际指向两个候选按钮中的情况时,情况发生了变化。对于水平和垂直方向,一旦模型缩小了搜索范围,它们在选择正确按钮方面表现得相当出色。然而,对于更复杂的空间关系,例如判断一个项目是在面板内部还是隐藏在弹出窗口后面,即使在面对正确的候选对象时,模型的表现也不比随机猜测好多少。这表明,虽然模型有时能理解这些词汇,但在处理将这些词汇应用于复杂屏幕上的视觉定位任务时,仍面临显著困难。
该研究还测试了这些空间技能是否会对现实世界的表现产生影响。他们发现了一个强关联:在这些基础空间测试中表现更好的模型,在处理点击真实桌面应用程序的更复杂基准测试时,也表现得更好。这证实了理解简单空间指令的能力是进行更高级计算机操作的基础构建模块。研究人员还尝试了几种辅助模型的方法,例如让它们进行“分步思考”,或者在屏幕上添加视觉标记以突出选项。其中一种方法是在候选按钮上直接放置编号标签,这极大地提升了得分,使某些模型的表现从 30% 提升到了接近 90%。然而,这只是一种诊断工具而非实际的解决方案,因为这要求电脑预先知道按钮的位置才能放置标签。
最终,这项研究揭示了当前这一代使用电脑的智能体缺失了关键的一块拼图。它们的失败并非因为无法进行语言推理,也不是因为看不见屏幕,而是因为它们无法可靠地将简单的空间指令映射到拥挤且复杂的界面上的特定位置。在解决这种将词汇与视觉位置相连接的基础技能之前,这些数字助手将继续在导航数字世界的各种基础任务中挣扎。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。