← 最新论文
🤖 AI

AOHP: An Open-Source OS-Level Agent Harness for Personalized, Efficient and Secure Interaction

本文介绍了 AOHP,这是一个基于 Android 构建的开源操作系统级智能体框架,它将智能体视为一等系统参与者,以实现个性化、高效且安全的交互,并证明了与传统系统相比,该框架在任务完成率、Token 成本和安全合规性方面均有显著提升。

原作者: Shanhui Zhao, Jiacheng Liu, Guohong Liu, Jichao Yan, Jialei Ye, Yuhao Yang, Hao Wen, Shizuo Tian, Yizhen Yuan, Yuxuan Chen, Yunxin Liu, Ju Ren, Ya-Qin Zhang, Chao Huang, Yao Guo, Yuanchun Li

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Shanhui Zhao, Jiacheng Liu, Guohong Liu, Jichao Yan, Jialei Ye, Yuhao Yang, Hao Wen, Shizuo Tian, Yizhen Yuan, Yuxuan Chen, Yunxin Liu, Ju Ren, Ya-Qin Zhang, Chao Huang, Yao Guo, Yuanchun Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:为 AI 改变“操作系统”

想象一下,你的智能手机就像一栋繁忙的办公大楼。目前的建筑设计是为人类服务的。门、电梯和办公桌的布局方式,是为了让一个人可以走进去,找到特定的房间(应用),然后完成一项任务。

但现在,我们有了 AI Agent(智能数字助手),它们想要为我们执行任务。问题在于,这些 AI Agent 正试图在一个为人类设计的建筑中穿行。它们必须像人类一样去“看”屏幕、“点击”按钮、“阅读”菜单。这不仅速度慢、会让 AI 感到困惑,而且还存在风险——在试图弄清楚如何点击按钮时,AI 可能会无意中看到你的私人密码或信用卡号。

AOHP (Android Open Harness Project) 是一种为这些 AI Agent 量身定制构建“办公大楼”(操作系统)的新方法。AOHP 不再强迫 AI 模仿人类的行为,而是重新设计了这座建筑,让 AI 可以直达任务目标,跳过那些令人困惑的走廊,并确保你的秘密安全。


AOHP 的三大超能力

该论文介绍了 AOHP 改变游戏规则的三种主要方式:

1. 个性化服务组合:定制化的“管家”

旧方式: 如果你想买鞋,你必须打开应用 A 进行搜索,然后打开应用 B 比较价格,接着打开应用 C 查看运费。是你自己在连接这些环节。
AOHP 方式: 想象一位了解你需求的超级管家。你只需说:“帮我买一双 50 美元以下最好的鞋子。”操作系统(建筑管理员)会立即为那一刻构建一个定制界面。它会从所有这些不同的应用中提取搜索结果、价格和运费信息,并将它们整合在同一个屏幕上呈现给你。

  • 类比: 与其为了准备一顿饭而奔波于三家不同的杂货店,不如由操作系统派一名厨师去这三家店,收集好食材,然后将它们装进一个篮子里送到你的厨房。AI 处理的是“购物”过程,而你看到的只是最终结果。

2. 高效的 Agent 接口:一张“后台通行证”

旧方式: AI Agent 通常需要像人类一样“观察”屏幕。它们拍一张屏幕照片,判断按钮的位置,然后进行点击。如果屏幕发生变化,它们就会感到困惑。这既慢又浪费计算资源(以及 AI 的成本)。
AOHP 方式: AOHP 给 AI 发了一张后台通行证。AI 不再需要通过“看”屏幕来操作,而是可以直接与应用的内部代码进行对话。

  • 并行处理: AI 可以在后台同时处理多项任务,而不会阻塞你的屏幕。
  • 结构化数据: AI 不再通过观察图片来猜测一个按钮的内容,而是获得清晰的文本描述:“这是一个‘购买’按钮。”
  • 类比: 想象你在修理汽车。旧方式是通过挡风玻璃向内窥视,猜测引擎零件的位置。AOHP 的方式则是直接打开引擎盖,直接与引擎对话。这更快、更准确,而且不需要眯着眼睛盯着仪表盘看。

3. 安全的信息流:一个“保险库”

旧方式: 当 AI Agent 尝试处理你的私密数据(如家庭住址或信用卡)时,它通常会看到明文数据。如果 AI 被黑客攻击或发生错误,你的秘密就会暴露。
AOHP 方式: AOHP 将你的私密数据视为保险库里的金条

  • 遮罩(Mask): 当 AI 请求你的地址时,它看到的不是“123 Main St.”,而是一个类似 <address:ID-999> 的代码。
  • 受信任的守卫: 如果 AI 确实需要使用该地址(例如填写运送表单),它会向“受信任的保险库”(操作系统的安全部分)发起请求。保险库会检查操作是否合规,将真实的地址填入应用中,然后立即将其隐藏。AI 永远不会真正看到真实的号码。
  • 类比: 想象魔术师的助手。助手(AI)可以请求一张“红色的卡片”,但他们永远看不到真正的卡片。魔术师(操作系统)持有真实的卡片,完成表演,并只展示结果。助手永远不知道那个秘密。

他们测试了什么?(实验结果)

研究人员使用了一个名为 “OpenClaw” 的智能 AI Agent,在 30 个复杂的移动端任务(如购买商品、检查通知和管理文件)上对这个新系统进行了测试。他们将其与普通的 Android 手机进行了对比。

  • 成功率: 在新系统上,AI 的成功率提高了 21%。由于不再受困于“观察”按钮或在混乱的菜单中导航,它能够完成在普通手机上会失败的任务。
  • 速度与成本: AI 完成任务的速度快了 44%,且消耗的计算资源(Token)减少了 51%。因为不再需要“观察”屏幕或猜测下一步动作,它减少了时间与资金的浪费。
  • 安全性: 在涉及一个虚假支付应用的测试中,系统成功阻止了 AI 查看真实的信用卡号或地址,仅向其展示了“遮罩”后的代码。实验证明,AI 可以在完全不知道秘密的情况下,依然能顺利完成工作(如购买商品)。

总结

AOHP 是一个新型手机操作系统的原型。它不再把 AI Agent 当作笨拙的人类在使用手机,而是将其视为强大的系统工具。通过为每个任务构建“定制界面”、赋予 AI 直接访问数据的权限,并将私密秘密锁在保险库中,AOHP 让 AI Agent 变得更快、更聪明,也更安全。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →