← 最新论文
🤖 AI

CoAdapt-GUI: Joint Workflow Context and Policy Adaptation for Unseen GUI Applications

CoAdapt-GUI 是一个测试时自适应框架,它通过利用 LoRA 对特定任务策略进行联合自适应,并从智能体自身的交互中提炼可迁移的工作流上下文,从而提升移动端 GUI 智能体对未知应用的泛化能力,并取得了相较于基准方法的显著性能提升。

原作者: Linqiang Guo (Peter), Li Gu (Peter), Zihuan Jiang (Peter), Zhixiang Chi (Peter), Siobhan Reid (Peter), Ziqiang Wang (Peter), Yuanhao Yu (Peter), Wei Liu (Peter), Yang Wang (Peter), Tse-Hsun (Peter)
发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Linqiang Guo (Peter), Li Gu (Peter), Zihuan Jiang (Peter), Zhixiang Chi (Peter), Siobhan Reid (Peter), Ziqiang Wang (Peter), Yuanhao Yu (Peter), Wei Liu (Peter), Yang Wang (Peter), Tse-Hsun (Peter), Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何在数字世界中导航。这个机器人是一个“GUI智能体”,它是一个聪明的助手,能够观察手机屏幕,读取它所看到的内容,并点击按钮来执行你的指令,比如“预订机票”或“发送短信”。在一段时间内,这些机器人已经变得相当出色,但前提是它们必须在稍后会使用的完全相同的应用程序上进行练习。这就像是一个背下了特定数学考试答案的学生,但在看到一本新教科书时却不知所措。真正的挑战在于,当机器人遇到一个它从未见过的应用程序——拥有它不认识的按钮和菜单时。这就是“未见应用程序”问题。科学家们正试图研究如何教这些机器人进行即时学习,仅通过几次尝试就能弄清楚一个新应用是如何运作的,而不需要人类每次都手把手地教导它们。

这篇论文介绍了一个名为 CoAdapt-GUI 的巧妙新系统,它能帮助这些机器人智能体比以往更好地适应全新的应用程序。把机器人的大脑想象成有两个部分:一个是“策略”(policy),即它关于如何点击和滑动的一种本能;另一个是“工作流”(workflow),即它完成一项任务所需的步骤和规则的心理清单。以往帮助机器人学习新应用的方法大多只是试图调整它们的本能(策略),却忽略了它们的清单。作者发现这还不够。如果机器人的清单里充满了针对旧应用的特定细节(例如“寻找主屏幕上的蓝色按钮”),那么当新应用有一个位于不同位置的红色按钮时,它就会感到困惑。

CoAdapt-GUI 通过同时做两件事解决了这个问题。首先,它充当机器人清单的严格编辑。它提取机器人已知的通用规则(例如“如果你卡住了,尝试返回”),但剔除掉任何关于旧应用的特定细节(例如“返回按钮在左上角”)。这创建了一个可以在任何地方通用的“纯净版”指南。其次,它让机器人在新应用上进行练习,并根据成功或失败的结果来更新其本能(策略)。神奇之处在于这两个部分是如何相互促进的:纯净的清单帮助机器人进行更好的练习,而练习的结果则帮助机器人完善其清单。

研究人员在名为 AndroidWorld 的数字游乐场中测试了这个系统。在一项测试中,机器人需要处理熟悉任务的新版本,CoAdapt-GUI 的成功率为 45.0%。与之前的最佳方法相比,这是一个显著的飞跃,之前的最佳方法仅能达到 37.5%。在另一项更难的测试中,机器人必须学习它从未见过的全新类型的任务,该系统将成功率从 38.6% 提升到了 52.9%。论文表明,通过将“做什么”(工作流)与“怎么做”(策略)分离,并在使用前清理指令,机器人可以变得更加灵活,并为总是变化着的现实世界做好准备。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →