← 最新论文
💻 computer science

SwipeGen: Bridging the Execution Gap in GUI Agents via Human-like Swipe Synthesis

本文介绍了用于合成多样化类人滑动交互的工具 SwipeGen,以及用于评估它们的基准测试 SwipeBench,旨在解决当前 GUI 智能体在现实场景中因滑动执行过于僵硬而限制其性能的问题。

原作者: Xuan Wang, Siyuan Su, Quantong Fu, Yongxiang Hu, Yangfan Zhou

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Xuan Wang, Siyuan Su, Quantong Fu, Yongxiang Hu, Yangfan Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象这样一个世界:你的手机能够理解你的口头指令,并为你操作应用程序,像你本人一样点击按钮和输入文本。这就是图形用户界面智能体(GUI Agent)所承诺的愿景——这是一种旨在以人类方式与屏幕进行交互的人工智能。多年来,研究人员一直在教这些系统识别图标、阅读文本并点击特定目标。然而,一个关键的差距依然存在:尽管这些智能体在指向和点击方面的准确度不断提高,但在处理最常见的动作——“滑动”(swipe)时却表现得极其吃力。无论是滚动新闻动态、调节音量滑块,还是展开隐藏的菜单选项,机器的数字之手往往表现出一种僵硬且机械的精准,无法触发屏幕的响应。这种局限性意味着,即使是最聪明的智能体也可能陷入困境,无法完成那些需要人类手指般流畅动作的简单任务。

复旦大学的一个研究小组致力于解决这一特定问题,他们提出了一个根本性的问题:为什么机器在执行滑动操作时如此失败,而人类却觉得它如此自然?他们发现,问题的核心不在于缺乏智能,而在于数据的匮指定以及对滑动原理的误解。现有的系统是在由简单点击主导的数据集上进行训练的,将每一次交互都视为屏幕上的一个点。但滑动不是一个点,而是一段旅程。它涉及起点、方向、距离和速度。研究人员发现,目前的智能体试图猜测一个单一的坐标,却常常完全失准,因为它们并不理解滑动的速度或精确的起点可能会改变结果。为了解决这个问题,他们开发了一个名为 SwipeGen 的新工具,这是一个自动化系统,旨在通过生成数千个类人手势的示例来教会机器如何滑动。

这一过程始于让系统像用户一样自主探索移动应用。它在屏幕间导航,识别出可以滚动的区域,例如照片列表或图标行。一旦找到了可滚动的区域,系统并不仅仅是盲目猜测,而是系统地尝试不同的滑动方式。它测试了从屏幕中心开始、从边缘开始,以及向上、向下、向左或向右移动的各种滑动,并尝试了不同的速度。至关重要的是,系统会在每次尝试前后观察屏幕。如果滑动导致内容发生移动或变化,系统就会将其记录为成功,并捕捉实现该效果的精确坐标、方向和持续时间。如果屏幕没有反应,该次尝试则会被丢弃。这种尝试、观察并记录的循环,使团队得以建立一个庞大的成功滑动交互库,其中还附带了解释每个手势效果的自然语言描述。

有了这个全新的数据库,研究人员训练了一个名为 GUISwiper 的新版本人工智能模型。他们不仅教会模型寻找按钮,还教会它理解滑动的物理特性。结果令人瞩目。在对模型从未见过的全新应用集进行测试时,GUISwiper 执行滑动动作的成功率比之前的顶尖模型高出两倍半以上。旧模型只能正确完成大约四分之一的滑动任务,而新模型在超过 60% 的任务中取得了成功。更重要的是,研究人员证明了教授机器滑动并不会削弱它处理其他任务的能力。该模型在识别按钮和阅读文本方面依然保持着同样优秀的水平,这表明它可以在不丧失理解屏幕布局能力的情况下,学习复杂的动作。

这项研究还强调,对于这些智能体而言,最大的障碍不在于不知道“要做什么”,而在于不知道“如何去做”。研究人员发现,当模型失败时,通常是因为它开始滑动的起始位置不对,或者移动速度太慢无法触发屏幕响应,而不是因为它选择了错误的方向。通过专注于执行细节——即动作的精确起点、终点和速度——他们弥合了机器的僵硬逻辑与人类用户的流畅直觉之间的鸿沟。这项工作表明,人工智能若要真正掌握数字世界,不仅要学会“看”,还要学会像它所服务的对象那样,拥有细致入微的动作感和时机感。有效滑动不再仅仅是一个次要功能,它是任何希望像人类之手一样轻松驾驭屏幕的智能体所必须具备的基本要求。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →