Darwin Mobile Agent: A Roadmap for Self-Evolution
本文介绍了 Darwin Mobile Agent,这是一个利用并行云手机交互来克服数据瓶颈,并为消除任务课程、验证和记忆中的人类先验知识建立路线图的开源基础设施,从而使自主、自进化的智能体能够通过与复杂的移动图形用户界面(GUI)环境进行交互来学习通用行为。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你想教一个机器人如何使用智能手机。你可以为它编写一本巨大的手册,涵盖它可能见到的每一个 App、每一个按钮和每一个屏幕。但现实世界太混乱,变化也太快了。相反,这篇论文的作者提出了一种不同的方法:让机器人通过实践来学习,就像人类婴儿通过跌倒再爬起来来学习走路一样。
他们将这个项目称为 Darwin Mobile Agent。以下是他们构建的内容以及它为何重要的简单拆解,我使用了日常类比来进行说明。
1. “大世界”游乐场
大多数 AI 测试都发生在一个受控的、静态的视频游戏(如 Atari)中,那里的规则永远不会改变。作者认为,要构建一个真正聪明的智能体,它需要在 “大世界” 中进行练习——这是一个巨大、复杂且不断变化的地方。
- 类比: 想象一个永不结束的视频游戏关卡,在你玩游戏的同时,房间和家具一直在不断增加。
- 解决方案: 他们选择了 手机屏幕 作为这个“大世界”。为什么?因为这里有数以百万计的 App,它们在不断更新,并且充满了现实世界的复杂性。这是一个比智能体本身复杂好几个数量级的数字沙盒。
2. “云端手机农场”(健身房)
为了学习,智能体需要进行数百万次的练习。如果你尝试在一台物理手机上完成这些工作,会耗费极长时间。如果你使用标准的计算机模拟器,它会不稳定且经常崩溃。
- 类比: 想象一个拥有 1,000 个平行宇宙的健身房。在一个宇宙里,机器人尝试打开一个 App;在另一个宇宙里,它尝试发送一条短信。它们同时发生。
- 解决方案: 他们构建了一个使用 云端手机 的系统。与其等待一台手机完成一项任务后再开始下一项,他们的系统可以并行运行数百台手机。
- “异步”技巧: 在正常的队伍中,每个人都要等待最慢的那个人。在他们的系统中,如果一台手机变慢了(比如网络延迟),其他的手机会继续工作。这些“快”手机不会因为等待“慢”手机而闲置。这保持了学习过程的高速运转。
3. “自我进化”的路线图
作者认为,要让一个智能体实现真正的进化,我们需要停止扮演它的老师,而是让它进行自我教学。他们提出了一个旨在消除人类帮助的三步走路线图,重点关注三个支柱:
A. 课程表(下一步学什么)
- 现状: 人类挑选任务(例如,“打开天气应用”)。
- 目标: 智能体最终应该能够发现自己哪些地方做得不好,并要求更难的任务来进行练习,就像一个意识到自己需要更多数学练习的学生一样。
- 论文中的步骤: 目前,人类仍然在挑选任务,但他们挑选的是“恰到好处”的任务——既不太容易,也不可能完成——以便让智能体能够学习。
B. 裁判(我赢了吗?)
- 现状: 人类(或简单的代码)来检查机器人是否成功。
- 目标: 智能体应该能够观察自己的行为,并说:“是的,我实现了我的目标”,而不需要人类在它身后监督。
- 论文中的步骤: 他们使用了一个 智能 AI “裁判”(大型语言模型)来观察机器人的行为,并判断其是否成功。这是介于人类裁判和机器人自我评判之间的一个中间步骤。
C. 记忆(我学到了什么?)
- 现状: 人类设计机器人如何记忆事物(例如,“记住最近的 5 个屏幕”)。
- 目标: 智能体应该学会如何组织自己的记忆,决定哪些信息值得记住,哪些应该忘记。
- 论文中的步骤: 目前,该系统使用简单的“滑动窗口”(它会记住最后几次操作)。目标是让智能体最终学会如何总结自己的历史记录。
4. 结果:有效吗?
团队使用了一个特定的 AI 模型(UI-TARS)尝试解决 8 个不同的手机任务进行测试。
- 它学会了: 智能体随着时间的推移在任务上变得越来越好,证明了该系统是有效的。
- 它具备扩展性: 他们展示了增加云端手机可以加快训练速度,直到达到 AI 模型本身成为瓶颈的程度(就像有 1,000 名学生但只有一位老师一样)。
- 它很鲁棒: 即使在手机断开连接或网络延迟的情况下,系统也能持续学习而不会崩溃。
- “评论家”教训: 他们发现,如果 AI 的“内心声音”(即预测动作好坏的声音)从随机猜测开始,机器人就会陷入恐慌并停止学习。但如果给这个内心声音一个合理的起点,机器人就能平稳地学习。
总结
Darwin Mobile Agent 是一个全新的、开源的游乐场,旨在训练 AI 自主使用智能手机。他们没有硬编码规则,而是构建了一个大规模的、并行的“云端健身房”,让 AI 可以进行数百万次的练习。
他们的终极愿景是一个 自我进化的智能体:一个不需要人类为其布置作业、批改试卷或整理笔记的智能体。它通过与复杂的、混乱的移动应用世界的互动,完全实现学习、适应并变得更加聪明。这篇论文证明了这一愿景的第一步是稳定且已准备好进入下一阶段的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。