DRS-GUI: Dynamic Region Search for Training-Free GUI Grounding
DRS-GUI 是一个无需训练的框架,它通过采用轻量级 UI 感知器和基于蒙特卡洛树搜索的动作规划器,动态模拟类人的感知动作(聚焦、转移和散射),从而在多模态大语言模型中增强图形用户界面定位能力,以高效地在复杂截图中定位与指令相关的元素。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图在电脑屏幕上点击一个特定的微小按钮。但这并非普通屏幕;它是一个高分辨率、杂乱无章的界面,充斥着数百个图标、菜单和文本框。如果你让标准 AI 去“点击保存按钮”,它往往会被视觉噪音淹没,就像一个人戴着模糊的眼镜在干草堆里找针。
本文介绍了一种名为DRS-GUI的新方法,它是一种“无需训练”的机制,如同一个智能、类人的向导,帮助 AI 在无需重新训练或学习新技能的情况下,找到屏幕上的正确位置。
以下是其工作原理,使用简单的类比说明:
问题所在:“单次尝试”的失误
当前的 AI 模型通常试图通过一次大幅跳跃来猜测按钮的位置。如果它们审视整个杂乱的屏幕并猜错,就会陷入困境。这就像试图在巨大的城市中通过猜测地图上的单个坐标来寻找特定街道,而不进行放大。如果你猜错了街区,就无法挽回。
解决方案:DRS-GUI(智能侦探)
DRS-GUI 改变了游戏规则。它不像那样立即猜测,而是像一个先搜索、后解决的侦探。它将过程分解为三个主要部分:
1. “界面感知器”(侦探的放大镜)
在 AI 尝试猜测答案之前,该模块会扫描屏幕并将其分解为对象列表(按钮、文本、图标)。然后它会问:“这些对象中,哪一个实际上符合用户的请求?”
- 类比:想象你在果盘里寻找一个“红苹果”。感知器就是那只手,它在果盘中筛选,忽略香蕉和橙子,只高亮显示红色的水果。
2. 三种“类人”动作
一旦感知器有了潜在候选列表,系统就不会只盯着一个点看。它使用三种动态动作来调整视角,就像人类会做的那样:
- 聚焦(放大):如果 AI 看到一组相关项目,它会紧密放大以获得更好的视野,忽略其余的杂乱内容。
- 类比:眯起眼睛阅读菜单上的小字。
- 移动(偏移):如果 AI 意识到自己正在查看屏幕的错误部分(例如,按钮在底部,却在看顶部菜单),它会立即将视野转移到新区域。
- 类比:意识到自己在图书馆看错了书架,于是走到正确的书架旁。
- 分散(缩小):如果 AI 变得过于狭窄而忽略了上下文,它会缩小视野以再次看到更大的图景。
- 类比:因为靠得太近看不清细节,于是退后一步观看整幅画布。
3. “动作规划器”(棋手)
AI 如何知道下一步该做什么动作?它使用一种称为**蒙特卡洛树搜索(MCTS)**的策略。
- 类比:将其想象成一名棋手。AI 不是只走一步,而是在脑海中模拟几种可能的未来。它会问:“如果我此刻放大,能找到目标吗?如果我向左移动,能找到吗?”
- 它使用“质量奖励”系统来评估每种可能性。它会问:“这个放大后的视图包含正确类型的按钮吗?是否太空旷?文字是否清晰?”
- 如果某条路径看起来不好(例如,它放大到了空白区域),AI 就会“回溯”并尝试不同的动作。这防止了它陷入死胡同。
结果:更清晰的搜索
由于 DRS-GUI 在主 AI 尝试做出预测之前过滤掉了“视觉垃圾”,AI 只需查看屏幕上一小块干净、相关的内容。
- 论文主张:在困难的高分辨率屏幕(如拥有数百个按钮的专业软件)上进行测试时,该方法将 AI 的准确率提高了14%。
- 关键要点:它适用于现有的 AI 模型,无需重新训练。这是一种“即插即用”的升级,使 AI 在尝试行动之前,变得更擅长观察。
简而言之,DRS-GUI 教导 AI 停止在杂乱的屏幕上盲目猜测,而是像人类一样扫描、移动、放大和评估其周围环境,确保每次都能找到正确的按钮。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。