← 最新论文
💬 NLP

iOSWorld: A Benchmark for Personally Intelligent Phone Agents

本文介绍了 iOSWorld,这是首个包含 26 个互联应用并具有持久用户身份的交互式原生 iOS 模拟器基准测试,用于评估个人智能手机智能体,研究表明,尽管拥有特权的视觉+XML 访问权限显著提升了前沿模型的性能,但目前的智能体在处理复杂的跨应用和个性化任务方面仍然存在困难。

原作者: Lawrence Keunho Jang, Mareks Woodside, Geronimo Carom, Andrew Keunwoo Jang, Jing Yu Koh, Ruslan Salakhutdinov

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Lawrence Keunho Jang, Mareks Woodside, Geronimo Carom, Andrew Keunwoo Jang, Jing Yu Koh, Ruslan Salakhutdinov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个住在手机里的数字助手。目前,大多数这类助手都像是失忆的游客。它们可以完美地执行单条指令——比如“打开手电筒”——但如果你要求它们“根据我的习惯、银行余额和短信来规划我的一周”,它们就会迷失方向。它们不知道你是,不记得你的历史,也无法在不同的应用之间建立联系。

论文 "iOSWorld" 引入了一种新的测试方法,用来检测手机助手是否真的足够聪明,能够成为你的私人帮手。以下是简单易懂的解析:

1. 问题所在:“空白状态” vs. “现实生活”

目前的手机助手测试就像是给一个人一本空白笔记本并要求他们写故事。他们能写出一个句子,但没有背景故事。

  • 现实情况: 你的手机充满了承载一生数据的各种信息:你的银行交易、旅行计划、朋友的名字以及你最喜欢的餐厅。一个真正实用的助手需要了解所有这些。
  • 差距: 目前还没有办法测试 AI 是否真的能在这种混乱且相互关联的现实生活中进行导航。大多数测试只关注安卓(Android)手机上孤立的任务,忽略了 iPhone(iOS)工作的独特方式。

2. 解决方案:构建 "iOSWorld"

研究人员构建了一个模仿真实 iPhone 的大型交互式视频游戏

  • 角色: 他们创建了一个虚构人物,名叫 Jordan Avery,是一位住在旧金山的 31 岁人士。
  • 世界观: 他们为 Jordan 构建了 26 个定制应用(例如一个假的 Uber、一个假的银行、一个假的电子邮件和一个假的食物配送应用)。
  • 神奇之处: 这些应用都是互联的。如果 Jordan 在 "QuickBite" 应用上订购了一个卷饼,"MyBank" 应用会自动显示一笔扣款,并且 "Mail" 应用会收到一份收据。如果 Jordan 在 "SkyTrip" 上预订了航班,"Notes" 应用里就会有一个提醒。
  • 目标: 他们给了 AI 133 个不同的任务。有些很简单(点杯咖啡),但许多非常复杂(检查你的银行余额,找到那杯咖啡的收据,并根据你的日历告诉你的老板你可能会迟到)。

3. 测试方法:两种观察手机的方式

为了观察 AI 到底有多聪明,他们通过两种“模式”进行了测试,就像给人类考试时提供或不提供“小抄”一样:

  • 模式 A:仅视觉模式(“盲测”)
    AI 只能看到屏幕的截图,就像人类一样。它必须通过观察图片来猜测按钮的位置并弄清楚发生了什么。

    • 类比: 就像试图通过一张模糊的照片来解开一个拼图。
  • 模式 B:视觉 + XML 模式(“超级视觉”测试)
    AI 不仅能看到截图,还能看到一个隐藏的文本列表(称为可访问性树/accessibility tree),该列表会准确告知每个按钮的名称及其位置。

    • 类比: 就像看着一个带有发光高亮器的拼图,高亮器指向每个碎片并说:“这是天空碎片,这是树木碎片。”

4. 结果:谁通过了测试?

他们测试了目前最智能的 AI 模型(即“前沿”模型)以及一个开源模型。

  • 好消息: 当 AI 拥有“超级视觉”(视觉 + XML)时,最智能的模型表现得更好。它们终于可以正确地操作应用。其中一个模型(Opus)的成功率从 26% 跃升到了 52%
  • 坏消息: 即使在最好的设置下,AI 在处理最难的任务时仍然很吃力。
    • 单应用任务: 表现出色(82% 成功率)。
    • 多应用任务: 表现挣扎(37% 成功率)。在 3 到 4 个不同应用之间建立联系对它们来说太难了。
    • 记忆任务: 表现尚可(54% 成功率),但经常遗忘细节。
  • “小模型”问题: 较小的、更便宜的 AI 模型在获得“超级视觉”数据后,表现反而变差了。这就像给学生提供了过多的信息;他们感到不知所措并陷入了混乱。

5. 为什么失败了?

研究人员发现了 AI 陷入困境的三个主要原因:

  1. 时间耗尽: AI 被给予 50 步来完成一项任务。在处理复杂工作时,它会把所有的 50 步都花在试图搞清楚点击哪里,导致最后没时间完成任务。
  2. 迷失方向: AI 会打开错误的 App,或者陷入循环,不停地重复点击同一个按钮。
  3. “坐标”问题: 在“仅视觉”模式下,AI 经常猜错屏幕上的点击位置,就像在黑暗中试图接住一个球。

核心结论

iOSWorld 是首次在模拟真实人类数字生活的、具有连接性的现实环境中测试手机助手。

论文得出结论:虽然 AI 在观察屏幕和点击按钮方面正在变得更好,但它尚未聪明到能够成为一个真正理解你的历史、你的金钱以及你在不同应用间关系的“个性化智能”助手。在它能真正取代人类助手之前,它需要在规划、记忆和建立联系方面做得更好。

好消息是?研究人员免费发布了所有的代码和这个“游戏”,以便其他科学家可以使用这个新的游乐场来构建更好的助手。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →