PhoneWorld: Scaling Phone-Use Agent Environments
PhoneWorld 引入了一种可扩展的流水线,能够将真实的移动图形用户界面轨迹自动转换为涵盖 34 款应用程序的可控且可验证的训练环境,通过将重心从手动构建基准测试转向大规模生成手机使用环境,显著提升了智能体在多项基准测试上的表现。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你想教机器人如何使用智能手机。机器人需要看到屏幕,理解各个按钮的功能,并弄清楚如何完成任务——比如预订航班、点餐或发送消息。
根据这篇论文,主要问题并不仅仅在于机器人“不够聪明”。而在于我们缺乏足够的练习场地供其学习。真实的手机应用杂乱无章,它们不断变化,难以重置到“全新开始”的状态,而且将其转化为安全的训练环境成本高昂。这就像试图只通过在真实繁忙的高速公路上练习来教人开车,一旦撞车,既无法暂停也无法倒带。
PhoneWorld 就是作者们构建的解决方案。请将其视为一个构建练习场地的工厂,而不仅仅是一次单一的测试。
以下是其工作原理,使用简单的类比说明:
1. 蓝图(从现实生活中学习)
团队没有去猜测手机应用长什么样,而是观察了真实用户使用真实应用的过程。他们记录了人们查看的屏幕以及他们走过的路径(例如从主屏幕到搜索栏,再到商品页面)。
- 类比:想象你想为烹饪课建造一家热门餐厅的完美复制品。与其猜测菜单,不如观察数百名真实顾客:看他们坐在哪张桌子、点了什么菜,以及服务员如何在厨房和餐厅之间移动。PhoneWorld 对应用做了同样的事。
2. 构建“模拟”应用
利用这些观察结果,PhoneWorld 自动构建真实应用的虚假版本(例如一个假的 QQ、一个假的购物应用或一个假的旅行应用)。
- 神奇之处:这些虚假应用的外观和手感与真实应用无异,但它们可重置。如果机器人犯错,你可以点击“重置”,应用就会完全恢复到初始状态。
- 数据库:在这些虚假应用内部,隐藏着一个“记分牌”(数据库)。如果机器人成功发送了消息或将商品加入购物车,记分牌会自动更新。这让计算机能够即时知道“是的,机器人做对了”,而无需人工监视。
3. 训练循环
由于这些环境是安全且可重置的,机器人可以练习成千上万次。
- 过程:机器人尝试完成任务(例如“找一部电影并买一张票”)。如果成功,系统会将该成功保存为一次学习经验;如果失败,它会再次尝试。
- 规模:团队构建了34 个不同的虚假应用,涵盖 16 个不同类别(购物、社交媒体、旅行等)。这为机器人提供了海量的“驾驶课程”供其学习。
他们的发现(结果)
团队进行了实验,以验证这种“练习场地工厂”是否真的让机器人变得更聪明。他们对比了仅在旧数据上训练的机器人与使用新 PhoneWorld 数据训练的机器人。
- “混合搭配”测试:他们选取了一个强大的机器人,仅将其旧训练数据中的一小部分(10,000 步)替换为新的 PhoneWorld 练习数据。
- 结果:机器人在所有方面的表现都显著提升。它不仅更擅长处理虚假应用,在真实世界的测试中也表现更好。这就像将几小时在安静赛道上的驾驶,替换为几小时在繁忙城市模拟中的驾驶——机器人学会了更好地应对真实交通。
- “越多越好”测试:他们发现,单纯增加更多的 PhoneWorld 练习有帮助,但增加更多种类的应用帮助更大。
- 类比:这不仅仅是关于在一条直路上练习驾驶 100 小时。而是要在高速公路上、土路上、雨天的街道以及停车场里进行练习。环境多样性才是秘诀所在。
核心启示
论文认为,要让使用手机的机器人变得更聪明,我们不应仅仅构建更大的模型或收集更多静态数据。相反,我们需要扩大练习环境的供给。
PhoneWorld 是一个工具,它将真实世界的用法转化为可重用、可重置且自动化的训练健身房。它允许我们快速构建许多不同的“手机世界”,为机器人提供其掌握真实应用所需的多样化、安全且无尽的练习。
简而言之:PhoneWorld 是一个工厂,它构建真实手机应用的安全、可重置的视频游戏版本,让 AI 机器人能够练习数百万次,从而最终能够在不“撞车”的情况下使用真实的手机。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。