あなたのスマートフォンが、単に手に持つ道具ではなく、あなたに代わって視覚・聴覚・記憶・行動を行う「デジタルボディ」だと想像してみてください。それが、OPPO の研究者によって開発された新しい「モバイルエージェント」X-OmniClaw の核心となるアイデアです。
X-OmniClaw を、クラウド上ではなくあなたの電話機そのものの中に住み、画面で見るもの、カメラで捉えるもの、そしてあなたが発する声を組み合わせることで複雑なタスクを処理するように設計された「超スマートな個人用デジタルアシスタント」と考えてください。
その仕組みは、以下の 3 つの簡単な部分に分解して説明できます。
1. 目と耳:「Omni Perception(万能知覚)」
ほとんどのアシスタントは、あなたがコマンドを入力するのを待ちます。X-OmniClaw は異なります。それはすべてを同時に聞く「統合ゲートウェイ」を持っています。
- 比喩: 犯罪現場(あなたの画面)を見ながら、目撃者(あなたの声)に耳を傾け、窓の外から現実世界(あなたのカメラ)を見渡す探偵を想像してください。すべてを同時に処理します。
- 仕組み: それは単に「価格はいくらですか?」と聞くだけではありません。カメラを向けている対象物を見、あなたの質問を聞き、瞬時に「ああ、あなたはタオバオのこの特定のボトルの価格を知りたいんだ」と理解します。作業を開始する前に、現実世界とデジタル世界のつながりを結びつけるのです。
2. 脳と日記:「Omni Memory(万能記憶)」
古いアシスタントは、通話が切れる瞬間にすべてを忘れ去ります。X-OmniClaw は、あなたの文脈を維持する「2 段階の記憶システム」を持っています。
- 比喩: それは「短期間の作業台」と「長期の図書館」のようなものです。
- 作業台(ワーキングメモリ): これはあなたが今まさに行っていることを保持します。フォームに入力中にアプリがクラッシュした場合、アシスタントはあなたがどこまで進んでいたかを正確に記憶しているため、最初からやり直す必要がありません。
- 図書館(長期記憶): これはあなたの過去から学びます。あなたがオウムの写真を撮った場合、アシスタントは単に写真を保存するだけでなく、「ユーザーはオウムが好きだ」という「意味的なメモ」を作成します。後でオウムに関する動画をリクエストした場合、あなたが何百ものファイルを検索する必要なく、どの写真を取り出すべきかを瞬時に理解します。
- プライバシー最優先: この記憶はあなたの電話機内(エッジネイティブ)に存在するため、あなたのプライベートな写真やデータを理解するために、遠くのサーバーへ送信する必要がありません。
3. 手:「Omni Action(万能行動)」
ここが魔法が起きる場所です。X-OmniClaw はあなたと話すだけでなく、実際にあなたのために「何かを行います」。
- 比喩: タップ、スワイプ、入力が可能な「ロボットの手」を想像してください。しかし、それは同時に「賢い学習者」でもあります。
- ハイブリッドな手: アプリは散らばっており(多くの広告や奇妙なレイアウト)、混乱することがあります。X-OmniClaw は「ハイブリッド戦略」を使用します。ボタンのあるべき場所を知るためにアプリのコード(XML)を読み取りますが、コードが混乱している場合は、人間のように「目」(視覚知覚)を使ってボタンを見つけます。
- 「クローン」のトリック: これが最もクールな部分です。もしあなたがアプリ(Meituan など)で特定のセールページを見つけるために複雑なパスを手動でナビゲートした場合、アシスタントに「これを見て」と指示できます。それはあなたの行動をクローンします。次に「フラッシュセールへ行く」と言うと、単に検索するだけでなく、その正確なページへ瞬時にジャンプし、退屈なクリックやスクロールをすべてスキップします。あなたの手動ナビゲーションを、再利用可能な「スキルカード」に変えるのです。
なぜこれが重要なのか?
現在のほとんどの「スマート」アシスタントは、遠隔サーバー(クラウド)上で動作します。それらは、何マイルも離れた管制塔から飛行機を操縦するパイロットのようなものです。乱気流を感じたり、飛行機のローカルセンサーに直接アクセスしたりすることはできません。
X-OmniClaw はエッジネイティブです。
- 車の比喩: スマートフォンは車です。クラウドは単にガソリンスタンド(必要に応じて燃料/推論能力を提供)です。エンジン(エージェント)は車の中にあります。
- エンジンが車の中にいるため、交通状況(画面の変化)に瞬時に対応でき、車自身のセンサー(カメラ/マイク)を使用でき、遠くの塔からの信号を待つ必要がありません。
論文からの実生活の例
- カメラコパイロット: 商品にカメラを向け、「これはいくらですか?」と尋ねます。アシスタントは商品を特定し、ショッピングアプリを開き、価格を見つけ、それをあなたに読み上げます。
- ワンタップ動画: 「オウムの写真で動画を作って」と言うと、アシスタントは図書館からどの写真がオウムか(記憶から)を思い出し、動画編集アプリを開き、自動的にそれらの写真を選択して動画作成を開始します。
- インスタントポータル: 見つけにくい特定のセールページに行きたい場合、アシスタントにそのパスを一度教えます。これで「フラッシュセール」と言うだけで、瞬時にそこへテレポートします。
結論
X-OmniClaw は、単にあなたとお喋りするだけでなく、あなたの電話を積極的に管理し、あなたの習慣を学び、視覚・聴覚・記憶を組み合わせることで複雑なタスクを実行する次世代の個人用アシスタントの青写真です。それは、あなたのスマートフォンを、あなたが操作する道具というよりも、あなたの人生を理解するパートナーのように感じさせることを目指しています。
技術概要:X-OmniClaw
問題定義
大規模言語モデル(LLM)の進化は、自律的なタスク実行を可能にするマルチモーダル大規模言語モデル(MLLM)へとシフトしつつある。Doubao Phone などの既存ソリューションは、Android におけるアプリ間オーケストレーションの工学的実現可能性を実証しているが、ユーザー定義のロジックやカスタマイズに対する深い制御が欠けていることが多い。一方、OpenClaw などのフレームワークは堅牢で制御可能な実行を提供するものの、PC 側での実行に焦点が当てられており、モバイルインタラクションに必要な動的かつリアルタイムな文脈から切り離されている。さらに、現在のモバイルエージェントアーキテクチャは、RedFinger や Wuying のようなクラウド中心のパラダイムに主に依存しており、エージェントは仮想化されたリモート環境で動作する。このアプローチは、ユーザーの真のローカルハードウェア(センサー、カメラ)、システム構成、およびプライベートデータとの接続を断ち切り、エンドユーザーによるガバナンスとカスタマイズ可能な実行フレームワークの必要性に対応できていない。
手法
X-OmniClaw は、Android エコシステム向けに特別に設計された統合型エッジネイティブモバイルエージェントを導入する。クラウド中心のモデルとは異なり、その中核ロジックはユーザーのローカルデバイス上に完全に存在し、スマートフォンをマルチモーダルデータストリームの永続的インターフェースとして利用する。このシステムは、Omni Perception(包括的知覚)、Omni Memory(包括的記憶)、**Omni Action(包括的行動)**という 3 つの共同設計モジュールの密結合したスタックに基づいて構築されている。
1. Omni Perception(統合マルチモーダル入力)
このモジュールはシステムの感覚入力として機能し、画面上の UI 状態、現実世界の視覚的コンテキスト、音声入力の 3 つのドメインを統合する。
- 統合入力ゲートウェイ: ユーザーの UI 操作、システムウィジェット、マイク入力、スケジュールされたタスク、リモートゲートウェイなど、多様なトリガーを単一のパイプラインに統合する。低電力状態であってもスケジュールされたタスクの起動経路を維持するために、Android の
AlarmManager を利用する。
- 統合知覚: カメラストリーム、スクリーン投影、リアルタイム音声書き起こしを捕捉するデカップリングされたストリーミングパイプラインを採用する。音声干渉を処理するためのデバイス内適応型エコーキャンセレーション(AEC)も含まれる。
- シーンに基づく意図理解: ビジョン・言語モデル(VLM)が視覚的シーンとユーザーのクエリを解釈する。生入力を構造化された意味的意図へと拡張する。クエリがシーンから直接回答可能であれば即座に回答し、そうでない場合はエージェントループ用の構造化形式に要求を分解する。
2. Omni Memory(ランタイムおよび長期コンテキスト)
このモジュールは、短期の作業記憶と長期の個人知識を統合することで、タスクの継続性とパーソナライゼーションを確保する。
- 作業記憶: スクリーンショット、圧縮された意味的観測、実行状態など、複数のターンおよびアプリ切り替えにわたるマルチモーダルランタイムコンテキストを維持する。これにより、エージェントはコンテキストを失うことなくタスクを再開できる。
- 長期記憶: ローカルの個人データ(ギャラリーの写真、インタラクション軌跡など)からのマルチモーダル情報を、永続的な記憶アーティファクトとユーザープロファイルへと蒸留する。これらは生画像ではなく、写真内の物体やシーンの特定など、コンパクトで構造化された意味的記録へと変換される。
- スキル・ツール協調: メモリの生成(同期、要約)と消費(検索、Q&A)は分離されている。メモリ書き込みの前に、機密情報を削除するための安全フィルタリングステップが実施される。ユーザーはメモリの有効化とプロファイルの注入について明示的な制御を保持する。
3. Omni Action(ハイブリッドグラウンディングと実行)
このモジュールは、構造的 XML メタデータと視覚的知覚を組み合わせることで、Android インターフェースの多様性に対応し、タスクを実行する。
- ハイブリッド UI 理解: システムは、信頼性が高い場合に XML シグナルを活用する動的戦略を採用するが、構造的な手がかりが弱いか曖昧な場合(広告の多いインターフェースなど)、視覚的グラウンディング(デバイス内モデル経由)および OCR にフォールバックする。
- 行動クローニングと軌道再生: 単発実行の代わりに、システムはユーザーのナビゲーションを記録して再利用可能な「スキル」を作成する。
- クローニング: 文字通りのクリックではなく、ユーザーの軌道の意味的意図(例:「特定の動画テンプレートにジャンプする」)を捕捉する。
dumpsys によるイントロスペクションを通じて deeplink や intent パラメータを抽出し、冗長な UI 再生を回避する。
- 再生: スキルが呼び出されたとき、システムは捕捉された
deeplink または意図を使用して、ターゲット状態へ直接ジャンプしようとする。直接進入が失敗した場合、ページを回復するためにマルチティアのフォールバック戦略(例:タスクリストの復元)を採用する。
主要な貢献
- エッジネイティブアーキテクチャ: X-OmniClaw は、クラウドホスト型仮想マシンからデバイス内実行へのパラダイムシフトを実現し、プライバシーを維持しながらローカルセンサー、プライベートデータ、システム構成への直接アクセスを可能にする。
- 統合された知覚から行動へのフレームワーク: UI 状態、現実世界の視覚、音声を単一の整合したループに統合し、孤立したスクリーンショットベースの自動化を超えている。
- ハイブリッドグラウンディング戦略: 構造的 XML と視覚的知覚を組み合わせることで、従来の手法が失敗する複雑で視覚的に散らかったモバイル環境において、堅牢なインタラクションを実現する。
- 軌道クローン実行: 行動クローニングと
deeplink 抽出を通じて、複雑なユーザーナビゲーションを再利用可能で高レベルのスキルに変換し、正確な直接アクセス実行を可能にし、脆弱なステップバイステップの再生への依存を軽減する。
結果とデモンストレーション
本論文は、システムの能力を検証する 3 つのデモンストレーションシナリオを提示する。
- 現実世界のコパイロットアシスタント:
- カメラ情報に基づく実行: エージェントがカメラを通じて製品を識別し、ショッピング意図を推論し、
deeplink を使用してターゲットアプリ(例:Taobao)を開く。その後、VLM ベースの読み取りによりスクロールして価格や評価などの構造化データを抽出する。
- ScreenAvatar 実行: 浮遊コンパニオンが、ライブスクリーン状態を継続的に解釈し、実行戦略を更新することで、一連の問題解決などの長鎖・多段階タスクを実行する。
- 能動的パーソナライズサービス:
- 記憶ベースのワンタップ動画: システムはアイドル時間中に写真を意味的記憶として自発的に整理する。音声コマンドを受けると、テーマに合致したアセットを検索し、
deeplink を使用して動画編集アプリ(CapCut)へ直接ジャンプする。手動での閲覧なしに写真を一括選択し、動画を生成する。
- 行動クローニングと軌道再生:
- インスタントポータル: システムは、複雑なナビゲーション経路(例:Meituan 内の特定のタイムセールページへの到達)をスキルとしてクローン化することをユーザーに可能にする。その後のクエリは、捕捉された
deeplink またはフォールバック復元方法を通じて直接起動をトリガーし、多ページナビゲーションを回避する。
意義と主張
著者らは、X-OmniClaw が次世代のモバイルネイティブパーソナルアシスタントのための実用的なアーキテクチャ設計図を提供すると主張する。その意義は以下の点にある。
- ギャップの橋渡し: アーキテクチャ実行とモバイルネイティブ自律性を接続し、エージェントがデジタルタスクに現実世界の文脈を利用できるようにする。
- 効率性と信頼性の向上: 行動クローニングとハイブリッドグラウンディングを活用することで、多様でモバイル中心の環境におけるインタラクション効率とタスク信頼性を向上させる。
- プライバシーと制御: エッジネイティブ設計によりクラウドアイデンティティの必要性を排除し、生データをローカルに保持することで、プライバシーとユーザーガバナンスに関する懸念に対応する。
- オープンな研究: このプロジェクトは学術研究として実施されており、コミュニティ主導の開発を促進するためにすべてのコードとアセットをオープンソース化するコミットメントを持っている。
本論文は、現在のシステムが既存フレームワークに見られる制御性と透明性の問題に対処している一方で、将来の作業は自己進化型の実行軌道、動的記憶進化(意味的統合と選択的忘却)、および最適化されたデバイス - クラウド協調に焦点を当てると結論づけている。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録