SEE: Structure-aware Exploring \& Exploiting for Long-horizon GUI Agent Trajectory Synthesis
该论文提出了 SEE,这是一个通过结合显式 UI 状态转移图探索与基于图的规划来合成高覆盖率、长时程 GUI 智能体轨迹的两阶段框架,旨在克服现有数据收集方法的局限性并提高智能体的泛化能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教会一个机器人如何使用你的智能手机。你不会只是把一本说明书递给它然后听天由命;你可能会向它演示如何打开一个应用、点击一个按钮,甚至可能教它如果误点错了该如何恢复。这就是 GUI 智能体(GUI agents) 的世界——这些是由“视觉-语言模型”驱动的智能计算机程序(可以把它们想象成拥有眼睛和大脑,既能阅读文本又能理解图像的机器人)。这些智能体旨在完成手机上的现实世界任务,比如订咖啡或预订机票。但问题在于:为了学习如何做这些事情,这些机器人需要大量的练习记录,称为“轨迹(trajectories)”。我们目前拥有的练习数据大多就像是在玩“简单模式”的游戏。它们只展示了那些简单的、直线式的路径,即一切顺利的场景。然而,现实生活是混乱的。App 中充满了密集的按钮,弹窗会凭空出现,有时你甚至必须回退或尝试另一条路线。如果不在这些混乱、漫长且复杂的场景中进行训练,我们的机器人助手就会变得非常脆弱,一旦面对真实的 App 就会迷失方向。
于是,由哈尔滨工业大学研究人员开发的 SEE 方法应运而生,旨在解决这一训练差距。可以将 SEE 想象成一位超级聪明的导游,它不仅仅是在 App 中漫无目的地游荡,而是会在派遣机器人外出练习之前,先构建一张包含每条可能路径的详细交互式地图。SEE 不再是仅仅靠猜测和尝试(这既慢又容易导致死路),而是首先通过“探索(explore)”该 App 来绘制一张连接每个屏幕和按钮的图谱。随后,它利用这张地图来“利用(exploit)”知识,规划出涉及多个步骤、绕路甚至处理烦人弹窗的长距离复杂旅程。其结果是生成了一个规模庞大、长度更长且更真实的练习记录数据集。论文指出,通过在这种更艰难的新数据上进行训练,机器人将能够更好地在混乱的移动端 App 世界中导航,成功完成以前会让它们感到困惑的任务。
问题所在:机器人在应用商店中迷失方向
想象一下,你正试图教一只狗如何在巨大的、不断变化的迷宫中穿行。如果你只让这只狗在一条狭窄、空旷的走廊里练习,且它每次都能第一次就找到零食,那么它永远学不会如何应对带有死胡同、移动墙壁和混乱标识的真实迷宫。这正是目前的 GUI 智能体 面临的情况。
这些智能体是旨在控制手机屏幕的 AI 系统。它们观察屏幕,识别出有哪些按钮,并点击它们以完成任务。但要学会这一点,它们需要看到成千上万个使用 App 的示例。问题在于,我们现有的数据大多就像那条空旷的走廊。它们充满了短小、简单的任务,其中一切都进展得非常完美。然而,真实的移动应用就像一座繁忙的城市。它们有数百个按钮,有遮挡视线的弹出广告,还有从“首页”到“结账”页面漫长且曲折的路径。
目前的创建此类训练数据的方法要么成本太高(雇佣人类记录每一个动作),要么太笨拙(让 AI 随机点击)。随机点击就像是在地图上投掷飞镖;你可能会击中目标,但更多时候击中的是墙壁。它会错过那些虽然罕见但至关重要的时刻,比如当权限请求弹窗出现时该如何恢复,或者如何导航复杂的菜单。正因如此,当这些 AI 智能体尝试使用真实的 App 时,它们经常会陷入困境,被海量的选项或完成任务所需的长链条步骤所迷惑。
解决方案:在旅程开始前先绘好地图
开发 SEE(结构感知探索与利用,Structure-aware Exploring & Exploiting)的研究人员决定不再乱投飞镖,而是开始绘制地图。他们的方法是一个两步走的流程,模拟了人类学习新城市的方式:首先,探索并绘制地图;其次,规划最佳路线。
第一步:探索者(构建地图)
在第一阶段,AI 智能体扮演着好奇探索者的角色。它不是随机点击,而是使用一种聪明的策略来发现 App 的布局。它观察屏幕,识别按钮和图标,并自问:“如果我点击这个会发生什么?”
- “结构感知”部分: 智能体不只是看到一张图片,它理解其中的“结构”。它知道“返回”按钮通常会带你回到上一个屏幕,而“搜索”栏会引导至新页面。
- “反思”部分: 在每次点击后,智能体会停下来思考。“这奏效了吗?我是不是真的到了预期的页面,还是仅仅触发了一个弹窗?”如果操作合理并导致了新的状态,它会将这种连接添加到其心理地图中。如果这是一个死胡同或错误,它也会记录下来。
- 结果: 这个过程构建了一个转移图(Transition Graph)。想象一张地铁图,每个站点就是手机上的一个屏幕,而每条线路就是你可以按下的按钮。这张地图不仅包含了简单的路径,还包括了棘手的路径,比如如何通过“登录”屏障或处理系统通知。
第二步:规划者(绘制路线)
一旦地图构建完成,第二阶段便开始了。这是实现**长程(long-horizon)**任务的奇迹发生之处。它不再需要每次都从头开始摸索整个旅程,而是直接观察地图。
- 它选择一个起点(如“首页”)和一个目的地(如“支付”页面)。
- 然后它利用地图寻找路径。但最酷的地方在于:它可以规划复杂的行程。它可以说:“让我们从‘首页’出发,前往‘动漫’板块,然后找到一件特定的衬衫,将其加入愿望清单,最后分享它。”
- 因为它使用的是预建的地图,所以它不需要猜测。它准确地知道要从一个屏幕跳转到下一个屏幕需要按哪些按钮。它甚至可以创建“子目标”,将一个大任务分解为若干个易于管理的微小环节。
这种方法使 SEE 能够生成数千个练习记录,其平均长度为 14.8 个步骤。对比来看,许多现有数据集的任务长度仅为 5 到 8 步左右。SEE 正在教机器人进行一场马拉松,而不仅仅是在街区周围慢跑。
研究发现:一个更艰难、更聪明的训练场
研究人员通过创建一个名为 SEE 的数据集并将其与其他方法进行对比,测试了这种新方法。结果令人印象深刻,但也凸显了现实世界的手机使用场景究竟有多难。
1. 数据更加丰富
SEE 数据集充满了复杂性。其他数据集的屏幕可能平均只有约 14 个按钮,而 SEE 的屏幕平均拥有 24.63 个交互元素。这意味着 AI 必须学会在一个更加拥挤、混乱的环境中挑选正确的按钮。任务也更长,单次旅程平均为 14.8 步,远高于其他数据集中的短任务。
2. 机器人很挣扎(但也在学习)
当研究人员在这一更具挑战性的数据上测试现有的 AI 智能体时,表现并不理想。它们通常能猜出所需的动作类型(如“点击”或“滑动”),但无法选出正确的按钮。这就是所谓的“落地(grounding)”问题。这就像你知道需要左转,却在错误的街道口转了弯。
- 成功率: 在没有额外训练的情况下,即使是最优秀的模型,在测试集上的成功率也仅为 39.92% 左右。
- 瓶颈: 主要问题不在于规划步骤,而在于如何在满是相似元素的屏幕中找到正确的按钮。
3. 在 SEE 上进行训练效果显著
然而,当研究人员对 AI 模型进行微调(针对 SEE 数据进行专门训练)时,结果大幅提升。
- 微调模型的成功率飙升至 77.29%。
- 选对按钮的能力(落地准确度,Grounding Accuracy)从 60.79% 提升到了 69.91%。
- 更重要的是,这种训练帮助机器人在处理从未见过的其他 App 时表现得更好。这表明,在这些复杂、长程的任务上进行学习,可以培养出可迁移到新场景的通用技能。
4. 地图至关重要
研究人员还检查了他们的“建图过程”(探索阶段)是否奏效。他们发现,“反思”步骤(即 AI 检查动作是否合理的步骤)至关重要。如果没有这一步,地图会出现很多错误(约 27.1% 的连接是错误的)。有了反思步骤后,地图变得更加清晰,错误率降至 9.1%。这证明了停下来思考刚才发生了什么,能让整个系统更加可靠。
为什么这很重要
论文指出,我们不能仅仅依靠投入更多的人力进行演示,或者寄希望于随机点击来教会机器人如何使用手机。现实世界太复杂了。通过使用一种先构建地图、再规划长距离且真实的旅程的结构感知方法,我们可以创造出真正让 AI 为应对移动端 App 的混乱现实做好准备的训练数据。
SEE 框架表明,通过正确类型的练习——即长程、复杂且充满现实干扰的练习——AI 智能体可以更有效地导航数字世界。这是迈向让我们的数字助手真正变得有用的一大步。虽然仍有许多工作要做(成功率尚未达到完美),但这种方法为让 AI 智能体在变幻莫测的智能手机世界中高效运作提供了一条充满希望的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。