← 最新论文
🤖 AI

OpenMobile: Building Open Mobile Agents with Task and Trajectory Synthesis

OpenMobile 是一个开源框架,通过可扩展的任务合成流水线与结合学习者及专家模型的政策切换轨迹生成策略,构建了高质量指令与轨迹数据,显著提升了基于开源数据的移动智能体在 AndroidWorld 等基准测试中的性能表现。

原作者: Kanzhi Cheng, Zehao Li, Zheng Ma, Nuo Chen, Jialin Cao, Qiushi Sun, Zichen Ding, Fangzhi Xu, Hang Yan, Jiajun Chen, Anh Tuan Luu, Jianbing Zhang, Lewei Lu, Dahua Lin

发布于 2026-04-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Kanzhi Cheng, Zehao Li, Zheng Ma, Nuo Chen, Jialin Cao, Qiushi Sun, Zichen Ding, Fangzhi Xu, Hang Yan, Jiajun Chen, Anh Tuan Luu, Jianbing Zhang, Lewei Lu, Dahua Lin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 OpenMobile 的新项目,它的目标是教 AI 像人一样熟练地操作手机。

为了让你更容易理解,我们可以把训练一个“手机操作 AI"想象成培养一个刚入职的“数字实习生”

1. 现状:为什么现在的 AI 还不够聪明?

目前,很多大公司(如 Google、OpenAI 等)已经训练出了非常聪明的手机操作 AI,它们能在“安卓世界”(AndroidWorld,一个模拟手机操作的考试)里拿到 70% 的高分。

但是,这些大公司的训练数据是保密的(就像他们的“独门秘籍”)。开源社区(大家都能用的免费资源)只能拿到一些公开但质量一般的旧数据,导致训练出来的 AI 就像个只会死记硬背的笨学生,在同样的考试中只能考 30 分,而且遇到稍微复杂点的问题就“死机”了。

核心问题: 我们不知道那些大公司是怎么教 AI 的,所以我们也教不好。

2. OpenMobile 的解决方案:两个“独门秘籍”

OpenMobile 团队决定自己造一套“教材”,而且这套教材是开源的。他们用了两个聪明的策略来教这个“实习生”:

策略一:先“逛地图”,再“出题” (任务合成)

  • 以前的做法: 就像让实习生只盯着一条狭窄的走廊走,然后让他根据这一条路想象出整个大楼的任务。这导致他只能学会很简单的任务,视野很窄。
  • OpenMobile 的做法:
    1. 先探索(逛地图): 让 AI 先在手机里像无头苍蝇一样乱逛(随机点击),把整个 APP 里所有能点的按钮、能跳的页面都记下来,建立一张**“全局记忆地图”**。
    2. 再出题(合成任务): 有了这张地图,AI 就能像老练的导游一样,把“短距离”(当前屏幕附近的功能)和“长距离”(APP 深处不相关的功能)结合起来,编造出各种复杂、真实的任务。
    • 比喻: 以前是“盲人摸象”,摸到腿就说大象像柱子;现在是“上帝视角”,把大象全身都看清楚了,才能设计出“给大象穿裤子”这种复杂任务。

策略二:不仅教“怎么做对”,更教“错了怎么改” (策略切换)

  • 以前的做法: 让一个“专家”(超级 AI)演示一遍完美的操作,让“实习生”照着学。但这有个大问题:实习生在考试时如果不小心点错了,专家没教过他怎么纠错,他就不懂怎么从错误中恢复,直接放弃。
  • OpenMobile 的做法: 采用**“师徒切换”**模式。
    1. 让“实习生”先自己操作。
    2. 一旦“监工”发现实习生走偏了(比如点错了地方),立刻切换成“专家”来接手,把路修好,继续完成任务。
    3. 最后,把这段“实习生犯错 -> 专家纠正”的过程记录下来,作为教材。
    • 比喻: 就像学骑自行车。以前只教“怎么骑得直”,现在OpenMobile会教“车歪了怎么扶正”。这让 AI 在面对真实世界(充满意外)时,拥有了**“救场”**的能力。

3. 成果:从“学渣”变“学霸”

OpenMobile 用这套方法生成了 2800 个任务指令和 3.4 万个操作步骤,覆盖了 20 个常见的安卓 APP。

  • 成绩: 用这些数据训练的 AI,在“安卓世界”考试中,分数从开源界的 30 分直接飙升到了 51.7% 甚至 64.7%
  • 意义: 这个成绩已经非常接近那些拥有保密数据的大公司水平了!而且,他们证明了这个高分不是靠“背答案”(死记硬背考题),而是因为 AI 真的学会了广泛的功能纠错能力

4. 总结:为什么这很重要?

这就好比 OpenMobile 把大公司的“独门秘籍”拆解成了公开的教科书

  • 以前: 只有少数人知道怎么教 AI 操作手机,大家只能看着干瞪眼。
  • 现在: OpenMobile 把“如何构建全局地图”和“如何模拟犯错与纠错”的方法都公开了。

这意味着,未来的开源 AI 也能像大公司的 AI 一样聪明,能帮你处理更复杂的手机任务,比如“帮我把上周的会议录音整理成文档,并发送给老板”,而不仅仅是简单的“打开微信”。

一句话总结: OpenMobile 通过让 AI 先“逛遍”手机再“出题”,并专门训练它“犯错后如何补救”,成功把开源手机 AI 的水平从“新手”提升到了“高手”级别,而且这套方法是免费共享的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →