POINTS-GUI-G: GUI-Grounding Journey
本文介绍了 POINTS-GUI-G-8B,这是一种通过利用精细的数据工程、改进的训练策略以及带有可验证奖励的强化学习,从空间感知能力极弱的基础模型进行训练,从而在多个基准测试中实现卓越性能的最先进 GUI 定位模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个非常聪明的机器人助手,它既能阅读文本,也能观察图片。你想教它像你一样使用电脑或手机。但问题在于,机器人虽然能读懂指令(“点击红色按钮”),但它并不知道这个红色按钮实际上在屏幕上的哪个位置。这就像是给了某人一张城市地图,却没告诉他目前正站在哪条街道上。
这篇论文介绍了一个名为 POINTS-GUI-G 的新版本机器人助手,它终于学会了观察屏幕并开口说:“啊,我看到那个按钮了!就在这组精确的坐标处。”
以下是研究人员如何通过简单的类比,将这个机器人培养成为屏幕大师的过程:
1. 起点:一张白纸
大多数其他研究人员都是拿一个已经擅长寻找事物的机器人(比如一位经验丰富的侦探),然后只给它增加一些线索。而本文的作者决定从一个不擅长寻找事物的机器人开始。他们想要从底层构建这项技能,就像教一个孩子识字,而不是仅仅纠正一个青少年的拼写错误。他们使用的基础模型是“POINTS-1.5”,该模型几乎没有任何指向屏幕上物体点的能力。
2. 成功的三个支柱
为了将这个“盲目”的机器人变成“有视觉”的机器人,他们使用了三个主要策略:
A. 清理并整理教科书(精炼数据工程)
想象一下,你正试图用一堆教科书来教学生。有些书用英寸,有些用厘米,有些是用英文写的,有些是用法文写的。有些页面撕裂了,有些上面到处是涂鸦。这会是一个学习噩梦。
研究人员做了三件事来修复这个问题:
- 标准化: 他们将所有杂乱、各异的数据集强制统一为一种格式。现在,每一个“坐标”(位置)都以相同的方式进行测量,就像把所有东西都转换成一把标准的尺子。
- 降噪: 他们扮演了严格编辑的角色。他们使用了一个特殊工具(称为 OmniParser-v2)来检查教科书。如果一本教科书说“按钮在这里”,但图片清晰地显示按钮在别处,他们就会把那一页扔掉。他们只保留完美的范例。
- 增加难度: 一旦机器人变得擅长寻找巨大的、显眼的按钮,研究人员就开始喂给它“困难模式”的谜题。他们创建了带有微小、拥挤按钮和混乱布局的屏幕(就像一个到处是纸张的凌乱桌面),以迫使机器人变得更加敏锐和精确。
B. 调整眼睛(改进训练策略)
通常在训练这些 AI 模型时,它们的“眼睛”(处理图像的部分)是固定不动的。研究人员意识到,对于寻找屏幕上的按钮,眼睛需要具有灵活性。
- 解冻视觉: 他们让“眼睛”在其他大脑部分学习的同时进行学习和调整。这使得机器人能够更好地捕捉微小的细节。
- 分辨率一致性: 想象一下,你通过在 5 英尺外投篮来练习篮球赛,但到了真正的比赛现场,篮筐却在 10 英尺远的地方。你会投丢的。研究人员注意到他们的机器人是在低分辨率的小图像上进行练习,但在测试时面对的是巨大的、高清晰度的屏幕。他们通过在更大、更清晰的图像上训练机器人来解决这个问题,使其“视觉”为实战做好准备。
C. 视频游戏奖励系统(强化学习)
这是最独特的部分。通常,强化学习(RL)被用于教机器人如何“思考”或解决逻辑谜题。在这里,他们利用它来教机器人如何“看”。
把它想象成一个电子游戏:
- 机器人猜一个按钮的位置。
- 计算机检查:“你击中按钮了吗?”
- 中了? +100 分。
- 没中? 0 分。
因为答案要么是对,要么是错(不存在“可能”这种中间状态),所以机器人得到了非常明确的反馈。研究人员发现,这种“尝试、得分、再尝试”的循环,让机器人的准确度比仅仅向它展示范例并说“这是对的”要高得多。
结果
通过结合这三种方法,POINTS-GUI-G 模型成为了寻找屏幕事物的冠军。
- 它击败了许多规模更大、成本更高的模型。
- 它在衡量机器人能否在手机、电脑和网站上找到按钮、文本和图标的测试中,取得了极高的分数。
简而言之: 论文表明,如果你清理训练数据,让模型的“眼睛”自由学习,并使用严格的“对或错”奖励系统,你就可以构建一个小型、高效的机器人,它在导航你的电脑屏幕方面比许多庞大且昂贵的替代方案都要出色。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。