← 最新论文
💬 NLP

Learning GUI Grounding with Spatial Reasoning from Visual Feedback

本文介绍了 GUI-Cursor,该模型将 GUI 定位重构为一种交互式搜索任务,利用渲染光标提供的视觉反馈和强化学习来克服视觉语言模型在坐标预测方面的局限性,从而以更少的训练数据在空间推理和智能体任务中实现更优越的性能。

原作者: Yu Zhao, Wei-Ning Chen, Huseyin Atahan Inan, Samuel Kessler, Lu Wang, Lukas Wutschitz, Fangkai Yang, Chaoyun Zhang, Pasquale Minervini, Saravan Rajmohan, Robert Sim

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Yu Zhao, Wei-Ning Chen, Huseyin Atahan Inan, Samuel Kessler, Lu Wang, Lukas Wutschitz, Fangkai Yang, Chaoyun Zhang, Pasquale Minervini, Saravan Rajmohan, Robert Sim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗易懂的语言和富有创意的类比,对论文《通过视觉反馈中的空间推理学习 GUI 定位》的解释。

核心难题:“盲眼建筑师”

想象你是一位建筑师,正试图告诉一个机器人,如何在巨大而复杂的墙壁(即电脑屏幕)上放置一块特定的砖块。这面墙非常巨大,而砖块却极其微小。

长期以来,研究人员试图通过让机器人一次性猜出精确坐标(例如“第 45 行,第 12 列”)来教会它们完成这项任务。但论文指出,这就像让建筑师在不看墙壁、也不看砖块的情况下猜测位置。即使是最高明的 AI 模型也往往在此失败,因为它们擅长识别事物“是什么”,却极不擅长确定它们在高分辨率屏幕上的确切“位置”。它们是“空间盲”的。

解决方案:“寻宝游戏”(GUI-CURSOR)

作者 Yu Zhao 及其团队决定不再让 AI 立即猜测答案,而是将这项任务变成了一场寻宝游戏

他们引入了一种名为GUI-CURSOR的新方法。AI 不再仅仅被告知“按钮位于 (500, 500)",而是获得了一个虚拟鼠标光标。它必须在屏幕上一步步移动这个光标,直到找到目标。

以下是这场“寻宝游戏”的运作方式:

  1. 移动:AI 观察屏幕并说:“我认为目标在那边”,然后移动光标。
  2. 反馈:电脑向 AI 展示一张新图片,显示光标现在位于那个新位置。
  3. 检查:AI 观察新图片并自问:“光标在正确的按钮上吗?没有?好的,我需要向左移动。”
  4. 重复:它不断移动并检查,直到它说:“是的,我找到了!”然后停止。

关键秘诀:从错误中学习

论文解释说,这一过程由强化学习驱动。这就像训练一只狗。

  • 如果狗将光标移向目标更近的位置,它就会得到“奖励”(奖励)。
  • 如果狗向错误的方向移动、过早停止,或者一直在原地打转,它就会得到“否定”(惩罚)。

作者制定了一套特殊的规则(奖励函数)来教导 AI 如何高效地寻宝:

  • 不要过早放弃:如果你还没到达就停止,这将受到惩罚。
  • 不要原地打转:如果你移动到了已经去过的地方,这将受到惩罚。
  • 不要远离:如果你向远离目标的方向移动,这将受到惩罚。

为何这种方法更优

论文声称,这种方法在两个主要原因上优于旧方法:

  1. 视觉反馈循环:在旧方法中,AI 猜一个数字,却从未看到结果是否正确。而在新方法中,AI 能看到它的猜测落在了哪里。这就像是在地图上猜测一个位置,与真正走到那里看看是否找到了宝藏之间的区别。这有助于 AI 学习“数字”与“视觉位置”之间的联系。
  2. 更强的空间推理能力:作者在简单的游戏上测试了 AI:“一个黑点是否在红框内?”他们发现,标准 AI 模型对这项简单任务的表现令人惊讶地差,除非红框正好位于屏幕中心,否则它们往往会失败。然而,通过“寻宝游戏”方法训练的 AI 在这项任务上表现要好得多,尽管他们并没有明确地教它玩这个游戏。似乎,学习移动光标教会了 AI 更好地理解空间和距离。

结果:更快、更智能、更经济

团队将他们的新 AI(GUI-CURSOR)与其他顶级模型进行了测试。

  • 准确性:在困难的高分辨率屏幕上,它击败了之前的最佳模型。
  • 效率:它学会了在仅仅两步内解决 95% 的问题。
  • 数据节省:它仅使用8,000个训练样本就取得了这些成果,而之前的领先者需要64,000个。这就像在小型赛道上练习几小时就学会了开车,而不是需要驾驶好几天。

总结

该论文提出,与其强迫 AI 成为计算机坐标的“一次性猜测者”,不如让它成为一个“好奇的探索者”。通过给 AI 一个虚拟鼠标,让它移动、观察并自我修正,AI 能更好地理解屏幕布局。这不仅使其在寻找按钮和图标方面更聪明,而且令人惊讶的是,它也提高了 AI 理解基本空间关系的能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →