← 最新论文
🤖 AI

VISTA: View-Consistent Self-Verified Training for GUI Grounding

VISTA 是一个基于 GRPO 的 GUI 定位训练框架,它通过从同一实例的多个保持目标的视图中构建比较组,并引入自验证跨视图锚点以稳定坐标生成,从而增强模型的性能和鲁棒性。

原作者: Xinyu Qiu, Yunzhu Zhang, Heng Jia, Shuheng Shen, Changhua Meng, Linchao Zhu

发布于 2026-06-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinyu Qiu, Yunzhu Zhang, Heng Jia, Shuheng Shen, Changhua Meng, Linchao Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何在电脑屏幕上点击按钮。机器人的任务是听取类似“点击‘导出’按钮”的指令,并将鼠标移动到完全正确的位置。

这篇论文介绍了一种名为 VISTA 的新训练方法,旨在帮助机器人做得更好。为了理解为什么 VISTA 特别,我们首先需要了解它所解决的问题。

问题所在:“旧视图”陷阱

此前,研究人员使用一种称为 GRPO 的方法来训练这些机器人。把 GRPO 想象成一位老师,一遍又一遍地向学生展示同一张电脑屏幕的照片,并要求他们找到那个按钮。

  • 简单情况: 如果按钮很大且显眼,学生每次都能做对。老师会想:“太棒了!”但由于尝试之间没有任何差异,老师也学不到任何新东西。
  • 困难情况: 如果按钮很小或被遮挡,学生每次都会失败。老师会想:“糟糕,”但同样学不到任何东西,因为每一次尝试都以完全相同的方式失败了。

在这两种情况下,老师都无法告诉学生如何改进,因为反馈缺乏多样性。这就像试图通过 100 次击打同一个位置的球来学习打网球一样;你永远无法学会如何去适应一个移动中的球。

解决方案:VISTA(“缩放与裁剪”老师)

VISTA 通过意识到无论你怎么看,一个按钮始终是同一个按钮,从而改变了游戏规则。与其反复向机器人展示相同的全屏图像,VISTA 会创建多个不同的“裁剪视图”(缩放或偏移后的视图)来展示同一个屏幕,并确保目标按钮始终可见。

以下是 VISTA 的工作原理,使用一个简单的类比:

1. “合影”类比(视图一致性组)

想象一下,你正在试图教你的朋友在停车场里找到一辆特定的红车。

  • 旧方法: 你向他们展示 8 张整个停车场的宽幅照片。如果他们没找到车,他们会 8 次都找不到。如果他们找到了,他们会 8 次都找到。这不会产生学习效果。
  • VISTA 方法: 你向他们展示 8 张关于同一个停车场的不同照片。在其中一些照片中,镜头放大了;在另一些照片中,镜头向左或向右偏移了。红车都在所有照片里,但它在照片中的位置发生了变化。
    • 在一张照片中,车很容易被发现。
    • 在另一张照片中,它被一棵树部分遮挡了。
    • 在第三张照片中,它就在角落里。

现在,机器人必须弄清楚:“好吧,车是同一辆,但在这张特定的照片里,它在哪里?”这迫使机器人去理解按钮的“概念”,而不仅仅是死记硬背一个坐标。这创造了一组包含正确和错误答案的“组”,从而为老师提供了用于改进机器人的有用数据。

2. “安全网”(自我验证锚点)

这种新方法存在一个风险:如果机器人被缩放照片中奇怪的角度搞糊涂了,它可能会开始胡乱猜测并导致失败频率增加。

为了解决这个问题,VISTA 加入了一个自我验证锚点(Self-Verified Anchor)。你可以把它想象成一个只在机器人准备好时才部署的安全网。

  • 老师(计算机)会观察机器人的尝试。
  • 如果机器人在 8 张照片中都完全无法找到按钮,老师就什么也不做。老师不会强加答案,因为机器人还没准备好。
  • 然而,如果机器人在其中至少一张照片中正确找到了按钮,老师就会说:“啊哈!你证明了你能做到!”
  • 只有到那时,老师才会展示“完美答案”(按钮的正中心)作为稳定的引导,以锁定这一成功。

这防止了机器人被迫去模仿它尚未理解的答案,同时也通过在它展现出能力时给予助力。

结果

论文在多个基准测试(如 ScreenSpot-Pro,这是一个寻找微小按钮的严苛测试)上测试了这种方法。

  • 使用 VISTA 之前: 机器人(特别是 Qwen3-VL 模型)大约能完成 55% 的困难点击任务。
  • 使用 VISTA 之后: 它们的表现跃升至 63% 到 67%(取决于模型大小)。

论文还指出,机器人的“鲁棒性”变得更强了。即使在测试期间屏幕被裁剪或从奇怪的角度观看,机器人也不太容易感到困惑或“翻转”其答案。

总结

VISTA 是一种更聪明的训练 AI 点击按钮的方法。它不再让 AI 对同一个静态图像进行重复练习,而是让它在同一图像的许多不同“视图”上进行练习。它只有在 AI 已经证明自己可以独立解决谜题时,才会给出“标准答案”(完美答案)。这使得 AI 更聪明、更具适应性,并且能更好地在混乱、真实的电脑屏幕中找到按钮。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →