MobileExplorer: Accelerating On-Device Inference for Mobile GUI Agents via Online Exploration
MobileExplorer 是一个新颖的框架,它通过利用模型的推理时间对 UI 元素进行并行在线探索,从而加速移动 GUI 代理的设备端推理,这种方法生成的上下文提示能够减少推理步骤和延迟,同时保持高任务成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你的手机里住着一位非常聪明但略显迟缓的个人助理。这位助理的工作是观察你的屏幕,判断你想要做什么(比如“发送短信”或“查找食谱”),然后点击正确的按钮来完成任务。
问题在于,这位助理是一个“视觉 - 语言模型”。它在理解图片和文字方面极其出色,但思考起来却需要很长时间。这就好比一位才华横溢的教授,解决一道数学题需要 30 秒。与此同时,在手机屏幕上实际点击一个按钮只需要一瞬间。
按照旧有的方式,助理会盯着屏幕,花 30 秒思考,然后终于点击一个按钮。在这 30 秒里,手机只是坐在那里无所事事。如果一个任务需要点击 20 次,那等待的时间就太长了。
“MobileExplorer”登场了。
MobileExplorer 背后的研究人员意识到,他们可以利用这段“思考时间”来做些别的事情。以下是其工作原理,通过几个简单的类比来说明:
1. “趁你等待”策略
想象你正在等待烤箱里的披萨烘烤(这相当于 30 秒的思考时间)。与其只是呆呆地盯着烤箱,不如利用这段时间快速查看冰箱、拿取饮料并摆好餐桌。你并没有拖延披萨的出炉,只是在烤箱工作的同时为下一步做好准备。
MobileExplorer 正是这样做的。当 AI 正在“思考”下一步该做什么时,系统会悄无声息且迅速地点击屏幕上的几个不同按钮,看看会发生什么。这就像在走廊里试探几扇门,看看哪些能打开,只是为了收集信息。
2. “聪明侦探”(任务相关性)
系统并不是随机乱点按钮,那样会一片混乱。相反,它像一个清楚目标的侦探。
- 目标: “我需要找一部电影。”
- 行动: 系统观察屏幕并问道:“哪些按钮看起来可能通向电影?”它忽略“计算器”或“天气”按钮,专注于"Netflix"或“搜索”按钮。
- 结果: 它快速检查这些特定区域,查看出现了哪些新屏幕,并记下一个小笔记:“哦,‘电影’按钮通向一个类型列表。”
3. “魔法撤销”按钮(两级回滚)
这里是棘手之处:如果你试探得太多,可能会迷路。你可能会不小心打开一个本不想打开的菜单,现在却找不到回到原始屏幕的路了。
MobileExplorer 拥有一个超级强大的“撤销”系统,分为两级:
- 第一级(快速撤销): 它尝试按几次“返回”按钮,以回到起点。它会检查屏幕是否与之前看起来一样(使用一种称为“感知哈希”的数字指纹)。
- 第二级(重置按钮): 如果“返回”按钮失效(也许有弹窗挡住了路),它不会惊慌。它会立即直接回到手机的“主屏幕”,然后重新执行它到达原始位置所采取的确切步骤。这就像在说:“好吧,让我们从主屏幕重新开始,再次走一遍这条路,但这次我会更快。”
这确保了“四处试探”永远不会搞砸主要任务。手机总是会恢复到探索开始前的确切状态。
4. “作弊小抄”(上下文提示)
一旦系统收集了所有这些额外信息(例如“电影列表在‘娱乐’标签下”),它就会将其总结成一条简短、易读的笔记。在 AI 做出最终决定之前,系统会将这张小抄交给 AI。
因此,AI 不再需要猜测,而是拥有了一张作弊小抄:“嘿,我刚才检查过了。电影列表就在这里。”这有助于 AI 更快地做出正确选择,意味着它完成整个任务所需的总步骤更少。
结果
研究人员在真实的手机上用真实的应用程序测试了这种方法。他们发现:
- 更快: 整个过程耗时减少了约23%,因为 AI 不需要做那么多猜测。
- 更聪明: AI 正确完成任务的频率略有提高(最高提升 5%),因为它拥有了更多信息。
- 更私密: 所有操作都在手机本地完成。没有数据发送到云端,因此你的屏幕活动保持私密。
简而言之,MobileExplorer 将缓慢但聪明的 AI 的“等待时间”转化为“高效时间”,让手机能够安全、高效地探索界面,从而使 AI 能更快地完成你的任务。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。