UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations
本文介绍了 UI-Mate,这是一个开源权重的 GUI 智能体基础模型,它利用可扩展的环境落地训练栈和上下文示例学习,在长程计算机使用任务上实现了最先进的性能,并显著提升了其相对于基座模型的可靠性和成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
计算机已成为处理复杂信息的强大工具,然而,要求一台机器执行多步骤的办公任务,往往感觉就像是在仅通过描述目的地来教一个孩子开车。多年来,研究人员一直试图构建能够观察屏幕、理解任务需求并点击正确按钮以达成目标的智能体(AI agents)。这些被称为 GUI 智能体的系统已经取得了进展,但仍面临两个持久的问题:首先,它们缺乏足够高质量的实践数据来学习人类使用软件时那些微妙且不成文的规则;其次,它们通常过于僵化;如果人类给出一个模糊的指令,机器可能会因运气好而成功一次,但下一次就会失败,因为它无法适应屏幕的微小变化或用户的特定习惯。目标是创造一个不仅足够聪明能遵循脚本,而且足够可靠能应对真实桌面混乱现实的数字员工。
腾讯的一个团队推出了一种名为 UI-Mate 的新系统,通过改变智能体的学习方式和获取帮助的方式来解决这些问题。UI-Mate 并非仅仅通过记忆点击列表进行训练,而是在一个模拟环境中进行训练,使其可以练习数千项任务(从整理电子表格到管理电子邮件),同时由一个专门的引擎进行实时工作检查。这个过程让系统不仅能学习最终结果应该是什么样子,还能学习在犯错时如何恢复。研究人员发现,通过这种严谨的闭环训练方式,他们可以创造出一个表现显著优于以往开源系统的模型,甚至能媲美功能强大的闭源专有模型。
这种改进的核心在于研究人员称之为“环境落地训练”(environment-grounded training)的方法。想象一名学生学习烹饪,不仅仅是通过阅读食谱,而是真正站在厨房里,切菜,并且有一位老师立即指出刀是否滑了或者火是否太大了。同样地,UI-Mate 在一个数字环境中接受训练,在这个环境中,它采取的每一个动作都会针对一个真实的、正在运行的电脑屏幕进行测试。如果智能体尝试将文件保存在错误的地方,系统会立即察觉并记录这次失败。这种尝试、失败并纠正的循环在不同的应用程序中发生了数百万次,使智能体能够建立起对软件行为的深度理解。研究人员构建了一个庞大的此类练习任务库,涵盖了从简单的文件管理到需要跨日历、邮件客户端和项目管理工具移动信息的复杂工作流。通过仔细平衡智能体看到的任务类型,他们确保了智能体既能处理短小简单的任务,也能处理长而复杂的序列,而不会产生混乱。
然而,即使是训练良好的智能体,在面对人类给出的模糊指令(例如“处理这个候选人的录用通知”)时也可能感到吃力。由于指令缺乏必要的细节,智能体可能不知道该打开哪些具体文件或点击哪些确切按钮。为了解决这个问题,研究人员开发了一种新的让智能体从演示中学习的方法。系统不再强迫智能体盲目复制一段鼠标点击的记录序列,而是将演示分解为一个灵活的子任务计划。它观察人类或更强大的 AI 完成类似工作的视频,并提取出目标:“找到录用通知”、“核实薪资”、“发送邮件”。在实际工作中,智能体将此计划作为指南,但仍会观察实时屏幕以决定如何移动鼠标或输入文本。这意味着,如果屏幕看起来与视频中的略有不同,智能体可以调整其动作而不是陷入停滞。
研究结果令人瞩目。在测试一套标准的计算机使用挑战时,这个新系统(特别是其 270 亿参数版本)实现了 77.0% 的成功率,不仅超越了其他开源模型,而且非常接近目前最好的闭源系统。更重要的是,研究人员创建了一个名为 OSWorkerBench 的新测试,该测试模拟了跨越数十种不同应用程序的现实办公工作。在这项测试中,该系统的表现比其基础模型提高了近 18 个百分点。然而,最显著的发现出现在他们向智能体的指令中添加了一个单一演示时。对于一组 33 项长而复杂的任务,提供一个关于如何工作的示例,就将智能体的成功率从 17.2% 提升到了 35.4%。这表明该系统不仅仅是在死记硬背示例,它理解底层的逻辑并能将其应用于新情况,从而使其在实际应用中更加可靠。
研究人员还发现,智能体处理长任务的能力不仅仅取决于原始计算能力。他们测试了不同规模的模型,并发现虽然较大的模型通常表现更好,但特定的训练方法比规模本身更为重要。一个经过严谨的环境落地训练的小型模型,其表现优于一个未接受相同训练的庞大模型。这表明,高质量的实践数据和反馈循环比单纯扩大智能体的“大脑”规模更为关键。该系统还证明了其处理需要记住流程起始信息并在流程末尾使用该信息之类任务的能力,而这正是以往 AI 智能体的常见失败点。
为了确保这些结果并非偶然,团队构建了一个包含 100 项不同办公任务(涵盖人力资源、销售和工程等领域)的基准测试。他们评估了系统在没有任何帮助下的完成任务能力,以及在有演示情况下的表现。数据表明,在获得视觉引导后,智能体的表现持续提升,但它并未产生依赖性。它仍然能够仅凭指令进行工作,证明了演示起到了“有用的地图”而非“僵化的规则”的作用。这种平衡对于实际部署至关重要,因为这意味着系统可以在没有预设示例的情况下使用,同时也能在用户提供示例时快速学习。
这项工作的意义超出了更高的测试分数。通过展示智能体可以可靠地处理复杂的、跨多个应用程序的工作流,研究人员在使数字自动化成为日常办公实践现实方面迈出了重要一步。该系统不需要人类对每一次点击进行微观管理;相反,它可以接收一个高层目标并找出必要的步骤,并在遇到意外的屏幕布局或缺失信息时纠正自己的路径。能够从单一演示中学习的能力意味着,这些智能体最终可以在几分钟内而非几个月内学会新的、特定的公司流程。
该研究还强调了如何评估这些系统的重要性。研究人员发现,仅仅统计任务是否完成,往往会掩盖智能体在最后一步失败前可能已经取得了显著进展的事实。通过测量部分进度,他们能够看到智能体即使没有完成任务,也往往已经完成了 80% 的复杂任务。这种细微差别对于理解当前技术现状及改进方向非常重要。团队确定,最常见的剩余失败点不在任务的早期阶段,而是在最后几个步骤,例如忘记发送确认邮件或遗漏表单中的特定字段。
最后,这项工作为构建更强大的计算机智能体指明了清晰的道路。它表明,严谨的模拟训练与从视觉示例中学习的能力相结合,可以创造出一个既强大又具适应性的系统。研究人员已向社区开放了他们的训练数据和基准测试,允许他人基于这些发现进行开发。随着这些系统的不断演进,它们正趋向于一个未来:人工智能可以处理那些目前消耗大量人类工作日的常规、重复且复杂的数字任务,从而让人类能够专注于真正需要人类判断力的决策。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。