想象一下,你的智能手机不仅仅是一个你手持的工具,而是一个能够替你看见、听见、记忆并行动的“数字身体”。这正是 OPPO 研究人员打造的全新“移动智能体”——X-OmniClaw 的核心理念。
将 X-OmniClaw 想象成一个超级智能的个人数字助理,它直接驻留在你的手机上(而非云端),旨在通过结合你在屏幕上看到的内容、通过摄像头看到的内容以及你对它说的话,来处理复杂任务。
以下是其工作原理,分为三个简单部分:
1. 眼睛与耳朵:“全知感知”(Omni Perception)
大多数助手等待你输入指令。X-OmniClaw 则不同;它拥有一个统一网关,能同时倾听一切。
- 类比:想象一名侦探,能同时查看犯罪现场(你的屏幕)、倾听证人(你的声音),并望向窗外的真实世界(你的摄像头)。
- 工作原理:它不仅仅听到“价格是多少?”。它会查看你用摄像头指向的物体,听到你的问题,并瞬间理解:“哦,你想要这瓶特定商品在淘宝上的价格。”在开始工作之前,它就已经将真实世界与数字世界联系在了一起。
2. 大脑与日记:“全知记忆”(Omni Memory)
旧式助手一旦通话结束就会遗忘一切。X-OmniClaw 拥有一个两部分记忆系统,能保持你的上下文鲜活。
- 类比:把它想象成一个短期工作台和一个长期图书馆。
- 工作台(工作记忆):这里存放你此刻正在做的事情。如果你正在填写表单而应用崩溃,助手机会记住你确切的位置,这样你就不必从头开始。
- 图书馆(长期记忆):这里从你的过去中学习。如果你拍摄了鹦鹉的照片,助手不仅仅存储图片;它会创建一条“语义笔记”,写道:“用户喜欢鹦鹉。”稍后,如果你请求关于鹦鹉的视频,它会瞬间知道要抓取哪些照片,而无需你翻阅数百个文件。
- 隐私优先:由于这种记忆驻留在你的手机上(边缘原生),你的私人照片和数据无需发送到遥远的服务器即可被理解。
3. 双手:“全知行动”(Omni Action)
这是魔法发生的地方。X-OmniClaw 不仅仅是与你交谈,它实际上会为你做事。
- 类比:想象一只机械手,可以点击、滑动和输入,但它同时也是一位智能学习者。
- 混合双手:有时应用界面很混乱(充满广告、布局怪异)。X-OmniClaw 采用“混合策略”。它会读取应用的代码(XML)以了解按钮应该在哪里,但如果代码令人困惑,它会像人类一样利用其“眼睛”(视觉感知)来寻找按钮。
- “克隆”技巧:这是最酷的部分。如果你在应用中手动导航到特定的促销页面(例如美团),你可以告诉助手:“看着这个。”它会克隆你的行为。下次你说“去闪购”时,它不仅仅是搜索;它会瞬间跳转到那个确切的页面,跳过所有无聊的点击和滚动。它将你的手动导航转化为可重复使用的“技能卡”。
为什么这很重要?
大多数当前的“智能”助手运行在远程服务器(云端)上。它们就像在数英里外的控制塔里驾驶飞机的飞行员;它们无法感受湍流,也无法直接访问飞机的本地传感器。
X-OmniClaw 是边缘原生的。
- 汽车类比:智能手机是汽车。云端只是加油站(在需要时提供燃料/推理能力)。引擎(智能体)在汽车内部。
- 因为引擎在汽车内部,它可以对交通状况(你的屏幕变化)做出即时反应,使用汽车自身的传感器(摄像头/麦克风),并且无需等待来自遥远塔台的信号。
论文中的现实案例
- 摄像头副驾驶:你用摄像头对准产品并问:“这个多少钱?”助手识别该物品,打开购物应用,找到价格,并读给你听。
- 一键视频:你说:“用我的鹦鹉照片制作一个视频。”助手记得哪些照片是鹦鹉(来自其图书馆),打开视频编辑应用,并自动选择这些照片以开始视频制作。
- 即时门户:你想去一个特定的、难以找到的促销页面。你只需教一次助手路径。现在,你只需说“闪购”,它就会瞬间将你传送至那里。
结论
X-OmniClaw 是下一代个人助理的蓝图,它不仅仅与你聊天,还能主动管理你的手机,学习你的习惯,并通过结合所见、所闻和所记来执行复杂任务。它的目标是让你的手机感觉不再像是一个你操作的工具,而更像是一个理解你生活的伙伴。
技术摘要:X-OmniClaw
问题陈述
大语言模型(LLMs)的演进正转向能够自主执行任务的多模态大语言模型(MLLMs)。虽然包括 Doubao Phone 在内的现有解决方案已证明了在 Android 上进行跨应用编排的工程可行性,但它们往往缺乏对用户定义逻辑和定制化的深度控制。相反,像 OpenClaw 这样的框架提供了稳健且可引导的执行能力,但其核心仍侧重于 PC 端执行,使其脱离了移动交互所需的动态、实时上下文。此外,当前的移动智能体架构主要依赖以云为中心的范式(例如 RedFinger、Wuying),其中智能体在虚拟化的远程环境中运行。这种方法导致与用户真实的本地硬件(传感器、摄像头)、系统配置和私有数据脱节,同时也未能解决终端用户治理和可定制执行框架的需求。
方法论
X-OmniClaw 引入了一种专为 Android 生态系统设计的统一、边缘原生移动智能体。与以云为中心的模型不同,其核心逻辑完全驻留在用户的本地设备上,利用智能手机作为多模数据流的持久接口。该系统构建于三个协同设计的紧密耦合模块之上:Omni 感知、Omni 记忆和Omni 行动。
1. Omni 感知(统一多模态入口)
该模块作为系统的感官输入,整合了三个领域:屏幕 UI 状态、现实世界视觉上下文和语音输入。
- 统一入口:它将多样化的触发源(用户 UI 交互、系统小组件、麦克风输入、计划任务和远程网关)整合到单一管道中。它利用 Android 的
AlarmManager 即使在低功耗状态下也能维持计划任务的唤醒路径。
- 集成感知:它采用解耦的流式管道,捕获摄像头流、屏幕投射和实时语音转录。它包含设备端自适应声学回声消除(AEC)以处理音频干扰。
- 场景锚定的意图理解:视觉 - 语言模型(VLM)结合用户查询解读视觉场景。它将原始输入扩展为结构化的语义意图。如果查询可以直接从场景中回答,则立即响应;否则,它将请求分解为结构化格式以输入智能体循环。
2. Omni 记忆(运行时与长期上下文)
该模块通过统一短期工作记忆与长期个人知识,确保任务的连续性和个性化。
- 工作记忆:在多个回合和应用切换之间维护多模态运行时上下文,包括截图、压缩的语义观察和执行状态。这使得智能体能够在不丢失上下文的情况下恢复任务。
- 长期记忆:从本地个人数据(例如相册照片、交互轨迹)中提取多模态信息,形成持久化的记忆制品和用户画像。这些被转化为紧凑、结构化的语义记录(例如识别照片中的物体和场景),而非原始图像。
- 技能 - 工具协调:记忆生成(同步、总结)与消费(检索、问答)是分离的。在写入记忆之前会进行安全过滤步骤以删除敏感信息。用户保留对记忆启用和画像注入的明确控制权。
3. Omni 行动(混合锚定与执行)
该模块通过结合结构化 XML 元数据与视觉感知来执行任务,以应对 Android 接口的异构性。
- 混合 UI 理解:系统采用动态策略,在可靠时利用 XML 信号,而在结构线索微弱或模糊时(例如在广告密集的界面中),则回退到视觉锚定(通过设备端模型)和 OCR。
- 行为克隆与轨迹回放:系统不是一次性执行,而是记录用户导航以创建可复用的“技能”。
- 克隆:它捕获用户轨迹的语义意图(例如“跳转到特定视频模板”),而非 literal 点击。它通过
dumpsys 内省提取 deeplink 和 intent 参数,以绕过冗余的 UI 回放。
- 回放:当调用技能时,系统尝试使用捕获的
deeplink 或意图直接跳转到目标状态。如果直接进入失败,则采用多层回退策略(例如任务栈恢复)来恢复页面。
关键贡献
- 边缘原生架构:X-OmniClaw 将范式从云托管虚拟机转变为设备端执行,使智能体能够直接访问本地传感器、私有数据和系统配置,同时保持隐私。
- 统一感知到行动框架:它将 UI 状态、现实世界视觉和音频整合到单一连贯的循环中,超越了基于孤立截图的自动化。
- 混合锚定策略:通过结合结构化 XML 与视觉感知,该系统在传统方法失效的复杂、视觉杂乱移动环境中实现了稳健的交互。
- 轨迹克隆执行:系统通过行为克隆和
deeplink 提取,将复杂用户导航转化为可复用的高级技能,实现了精确的直接访问执行,并减少了对脆弱逐步回放的依赖。
结果与演示
本文提出了三个演示场景,验证了系统的能力:
- 现实世界副驾驶助手:
- 摄像头知情执行:智能体通过摄像头识别产品,推断购物意图,并使用
deeplink 打开目标应用(例如淘宝),随后通过基于 VLM 的读取进行滚动并提取结构化数据(价格、评分)。
- 屏幕化身执行:一个浮动助手通过持续解读实时屏幕状态并更新执行策略,来执行长链条、多步骤任务(例如解决一系列问题)。
- 主动个性化服务:
- 基于记忆的一键视频:系统在空闲时间主动将照片组织成语义记忆。收到语音命令后,它检索主题匹配的素材,并使用
deeplink 直接跳转到视频编辑应用(CapCut),批量选择照片并生成视频,无需手动浏览。
- 行为克隆与轨迹回放:
- 即时门户:系统允许用户将复杂的导航路径(例如到达美团中的特定闪购页面)克隆为技能。随后的查询通过捕获的
deeplinks 或回退恢复方法触发直接启动,绕过多页导航。
意义与主张
作者声称,X-OmniClaw 为下一代移动原生个人助手提供了实用的架构蓝图。其意义在于:
- 弥合差距:它将架构执行与移动原生自主性连接起来,使智能体能够利用现实世界上下文来处理数字任务。
- 提升效率与可靠性:通过利用行为克隆和混合锚定,该系统提高了在多样化、以移动为中心的环境中的交互效率和任务可靠性。
- 隐私与控制:边缘原生设计消除了对云身份的需求,并将原始数据保留在本地,解决了隐私和用户治理方面的担忧。
- 开放研究:该项目旨在进行学术研究,并承诺开源所有代码和素材,以促进社区驱动的开发。
本文总结道,虽然当前系统解决了现有框架中存在的可控性和透明度问题,但未来的工作将集中在自我演进的执行轨迹、动态记忆演进(语义整合与选择性遗忘)以及优化的设备 - 云协同上。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。