想象这样一个世界:你的手机能够理解你的口头指令,并为你操作应用程序,像你本人一样点击按钮和输入文本。这就是图形用户界面智能体(GUI Agent)所承诺的愿景——这是一种旨在以人类方式与屏幕进行交互的人工智能。多年来,研究人员一直在教这些系统识别图标、阅读文本并点击特定目标。然而,一个关键的差距依然存在:尽管这些智能体在指向和点击方面的准确度不断提高,但在处理最常见的动作——“滑动”(swipe)时却表现得极其吃力。无论是滚动新闻动态、调节音量滑块,还是展开隐藏的菜单选项,机器的数字之手往往表现出一种僵硬且机械的精准,无法触发屏幕的响应。这种局限性意味着,即使是最聪明的智能体也可能陷入困境,无法完成那些需要人类手指般流畅动作的简单任务。
复旦大学的一个研究小组致力于解决这一特定问题,他们提出了一个根本性的问题:为什么机器在执行滑动操作时如此失败,而人类却觉得它如此自然?他们发现,问题的核心不在于缺乏智能,而在于数据的匮指定以及对滑动原理的误解。现有的系统是在由简单点击主导的数据集上进行训练的,将每一次交互都视为屏幕上的一个点。但滑动不是一个点,而是一段旅程。它涉及起点、方向、距离和速度。研究人员发现,目前的智能体试图猜测一个单一的坐标,却常常完全失准,因为它们并不理解滑动的速度或精确的起点可能会改变结果。为了解决这个问题,他们开发了一个名为 SwipeGen 的新工具,这是一个自动化系统,旨在通过生成数千个类人手势的示例来教会机器如何滑动。
这一过程始于让系统像用户一样自主探索移动应用。它在屏幕间导航,识别出可以滚动的区域,例如照片列表或图标行。一旦找到了可滚动的区域,系统并不仅仅是盲目猜测,而是系统地尝试不同的滑动方式。它测试了从屏幕中心开始、从边缘开始,以及向上、向下、向左或向右移动的各种滑动,并尝试了不同的速度。至关重要的是,系统会在每次尝试前后观察屏幕。如果滑动导致内容发生移动或变化,系统就会将其记录为成功,并捕捉实现该效果的精确坐标、方向和持续时间。如果屏幕没有反应,该次尝试则会被丢弃。这种尝试、观察并记录的循环,使团队得以建立一个庞大的成功滑动交互库,其中还附带了解释每个手势效果的自然语言描述。
有了这个全新的数据库,研究人员训练了一个名为 GUISwiper 的新版本人工智能模型。他们不仅教会模型寻找按钮,还教会它理解滑动的物理特性。结果令人瞩目。在对模型从未见过的全新应用集进行测试时,GUISwiper 执行滑动动作的成功率比之前的顶尖模型高出两倍半以上。旧模型只能正确完成大约四分之一的滑动任务,而新模型在超过 60% 的任务中取得了成功。更重要的是,研究人员证明了教授机器滑动并不会削弱它处理其他任务的能力。该模型在识别按钮和阅读文本方面依然保持着同样优秀的水平,这表明它可以在不丧失理解屏幕布局能力的情况下,学习复杂的动作。
这项研究还强调,对于这些智能体而言,最大的障碍不在于不知道“要做什么”,而在于不知道“如何去做”。研究人员发现,当模型失败时,通常是因为它开始滑动的起始位置不对,或者移动速度太慢无法触发屏幕响应,而不是因为它选择了错误的方向。通过专注于执行细节——即动作的精确起点、终点和速度——他们弥合了机器的僵硬逻辑与人类用户的流畅直觉之间的鸿沟。这项工作表明,人工智能若要真正掌握数字世界,不仅要学会“看”,还要学会像它所服务的对象那样,拥有细致入微的动作感和时机感。有效滑动不再仅仅是一个次要功能,它是任何希望像人类之手一样轻松驾驭屏幕的智能体所必须具备的基本要求。
技术摘要:SwipeGen
问题陈述
尽管由视觉语言模型(VLM)驱动的图形用户界面(GUI)智能体已大量涌现,但这些系统在现实场景中往往无法实现令人满意的交互能力。通过实证分析,作者指出这一局限性的根本原因在于僵化的滑动执行(rigid swipe execution)。
目前的 GUI 智能体主要依赖于以组件为中心的交互策略,即将自然语言指令映射到特定的目标坐标(例如点击一个按钮)。然而,滑动交互与点击有着本质的区别:
- 非锚定特性: 滑动通常发生在通用区域(例如内容信息流)之上,而非针对特定组件。
- 多参数复杂性: 与点击不同,一次有效的滑动需要同时预测多个参数:起始位置、结束位置、方向和持续时间(速度)。
- 数据稀缺与不完整性: 现有的 GUI 数据集严重向点击和文本输入倾斜(占交互总量的 76.4%–94.9%)。此外,稀疏的滑动标注往往缺乏关键的执行参数(例如明确的方向或持续时间),导致 VLM 无法学习生成有效的、可执行的滑动轨迹。
因此,现有的智能体在精细调节(例如滑块)和内容探索(例如滚动信息流)方面表现挣扎,导致频繁的任务失败。
方法论:SwipeGen
为了解决缺乏多样化、可执行的人类模拟滑动数据的问题,作者提出了 SwipeGen,这是一个无需依赖预定义人类指令即可自动合成滑动交互的流水线。该流水线由五个核心模块组成:
- GUI 探索: 使用深度优先搜索(DFS)策略系统地导航移动应用,记录交互路径以发现多样化的屏幕状态。
- 可滚动目标识别:
- 组件: 通过对 XML 布局的启发式解析,识别显式的可滚动元素(例如滑块、RecyclerView)。
- 区域: 使用 VLM(Qwen3-VL-4B-Instruct)根据视觉布局和语义功能,推断缺乏显式层级节点的滚动区域(例如内容信息流、图标网格)。
- 统一滑动表示: 使用四个显式参数来定义一次滑动,以确保与下游自动化工具(ADB、UIAutomator、Appium)的兼容性:
- 起始位置: 手势的起点。
- 结束位置: 终止点。
- 方向: 显式标注(例如向上、向下)以促进学习,而非仅仅从坐标中推断。
- 持续时间: 对于控制速度至关重要,尤其是在处理区域级滑动时,速度决定了滚动距离。
- 候选滑动生成:
- 对于组件,候选方案基于组件的边界框和宽高比生成,并采用固定持续时间。
- 对于区域,候选方案通过从区域中心偏移至边界来生成,并采样快速(150ms)和慢速(500ms)两种持续时间,以模拟粗粒度的用户控制。
- 滑动有效性验证: 执行候选滑动,并通过比较交互前后的屏幕截图来验证其有效性。只有产生明显视觉变化(通过目标区域内的像素强度差异进行衡量)的滑动才会被保留。
- 滑动描述生成: 使用 VLM 根据视觉变化和参数生成执行该滑动的步骤级自然语言指令,从而创建多模态训练数据集。
核心贡献
- 识别瓶颈: 本文首次指出,以组件为中心的僵化滑动执行策略是限制现有 GUI 智能体交互能力的初级瓶 actually 瓶颈。
- SwipeGen 流水线: 作者设计并发布了第一个用于合成多样化、类人滑动交互的自动化流水线,解决了高质量滑动数据稀缺的问题。
- SwipeBench: 引入了第一个专门用于评估 GUI 智能体滑动执行质量的基准测试,包含来自 16 个域外(OOD)移动应用的 382 个有效交互。
- GUISwiper: 在 SwipeGen 合成数据上进行微调后的 VLM,证明了可以在不降低通用 GUI 定位性能的情况下提升滑动能力。
实验结果
作者在三个基准测试中将 GUISwiper 与多个最先进的基准模型(包括 Qwen2.5-VL、UI-R1、UI-TARS 和 MAI-UI)进行了对比评估:
- 滑动执行(SwipeBench): GUISwiper 实现了 61.25% 的成功率,相比基准模型 Qwen2.5-VL(24.87%)实现了 2.46 倍的提升,并优于所有其他基准模型。它成功完成了 23 个基准模型均失败的任务,特别是涉及长距离滚动和信息流导航的任务。
- 定位能力(ScreenSpot): 使用 SwipeGen 数据进行微调并未降低通用的定位性能。GUISwipier 达到了 85.83% 的准确率,优于其骨干网络(75.80%),并与 UI-TARS(84.25%)等工业级模型保持竞争水平。
- 端到端任务执行(AndroidWorld): GUISwiper 实现了 40.52% 的任务成功率,优于同等规模的模型以及更大的骨干模型(例如 Qwen2.5-VL-72B 的 35.00%)。执行轨迹分析显示,可靠的滑动执行对于需要长程离屏导航的任务至关重要。
意义与主张
本文主张,无法有效地执行滑动是当前 GUI 智能体中一个关键且被忽视的局限性。通过引入 SwipeGen,作者证明了:
- 数据合成是可行的: 高质量、可执行的滑动数据可以自动合成,无需人工标注,从而克服了人类交互轨迹稀缺的问题。
- 滑动与定位是互补的: 增强区域级滑动能力并不会以牺牲元素定位能力为代价;两者可以共同提升。
- 弥合执行差距: 提高特定的滑动执行能力可以直接转化为更复杂的端到端 GUI 自动化任务中的更好表现,验证了超越以组件为中心的交互模型的必要性。
作者承认了局限性,指出其“类人”定义侧重于任务效果的一致性,而非复制精细的运动特征(如轨迹曲率),并且其验证方法依赖于轻量级的像素比较。未来的工作建议引入真实的用户交互轨迹以进行更精细的模型建模,并将基准测试扩展到更多样化的应用中。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。