← 最新の論文
💻 computer science

X-OmniClaw Technical Report: A Unified Mobile Agent for Multimodal Understanding and Interaction

本論文は、直感的な相互作用を通じて効率的かつ信頼性の高い複雑なタスク実行を可能にするために、マルチモーダル知覚、個人化された記憶、およびハイブリッド行動戦略を統合した、Android エコシステム向けの統一型モバイルエージェント「X-OmniClaw」を提案する。

原著者: Xiaoming Ren, Ru Zhen, Chao Li, Yang Song, Qiuxia Hou, Yanhao Zhang, Peng Liu, Qi Qi, Quanlong Zheng, Qi Wu, Zhenyi Liao, Binqiang Pan, Haobo Ji, Haonan Lu

公開日 2026-05-22
📖 1 分で読めます☕ さくっと読める

原著者: Xiaoming Ren, Ru Zhen, Chao Li, Yang Song, Qiuxia Hou, Yanhao Zhang, Peng Liu, Qi Qi, Quanlong Zheng, Qi Wu, Zhenyi Liao, Binqiang Pan, Haobo Ji, Haonan Lu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたのスマートフォンが、単に手に持つ道具ではなく、あなたに代わって視覚・聴覚・記憶・行動を行う「デジタルボディ」だと想像してみてください。それが、OPPO の研究者によって開発された新しい「モバイルエージェント」X-OmniClaw の核心となるアイデアです。

X-OmniClaw を、クラウド上ではなくあなたの電話機そのものの中に住み、画面で見るもの、カメラで捉えるもの、そしてあなたが発する声を組み合わせることで複雑なタスクを処理するように設計された「超スマートな個人用デジタルアシスタント」と考えてください。

その仕組みは、以下の 3 つの簡単な部分に分解して説明できます。

1. 目と耳:「Omni Perception(万能知覚)」

ほとんどのアシスタントは、あなたがコマンドを入力するのを待ちます。X-OmniClaw は異なります。それはすべてを同時に聞く「統合ゲートウェイ」を持っています。

  • 比喩: 犯罪現場(あなたの画面)を見ながら、目撃者(あなたの声)に耳を傾け、窓の外から現実世界(あなたのカメラ)を見渡す探偵を想像してください。すべてを同時に処理します。
  • 仕組み: それは単に「価格はいくらですか?」と聞くだけではありません。カメラを向けている対象物を見、あなたの質問を聞き、瞬時に「ああ、あなたはタオバオのこの特定のボトルの価格を知りたいんだ」と理解します。作業を開始する前に、現実世界とデジタル世界のつながりを結びつけるのです。

2. 脳と日記:「Omni Memory(万能記憶)」

古いアシスタントは、通話が切れる瞬間にすべてを忘れ去ります。X-OmniClaw は、あなたの文脈を維持する「2 段階の記憶システム」を持っています。

  • 比喩: それは「短期間の作業台」と「長期の図書館」のようなものです。
    • 作業台(ワーキングメモリ): これはあなたが今まさに行っていることを保持します。フォームに入力中にアプリがクラッシュした場合、アシスタントはあなたがどこまで進んでいたかを正確に記憶しているため、最初からやり直す必要がありません。
    • 図書館(長期記憶): これはあなたの過去から学びます。あなたがオウムの写真を撮った場合、アシスタントは単に写真を保存するだけでなく、「ユーザーはオウムが好きだ」という「意味的なメモ」を作成します。後でオウムに関する動画をリクエストした場合、あなたが何百ものファイルを検索する必要なく、どの写真を取り出すべきかを瞬時に理解します。
  • プライバシー最優先: この記憶はあなたの電話機内(エッジネイティブ)に存在するため、あなたのプライベートな写真やデータを理解するために、遠くのサーバーへ送信する必要がありません。

3. 手:「Omni Action(万能行動)」

ここが魔法が起きる場所です。X-OmniClaw はあなたと話すだけでなく、実際にあなたのために「何かを行います」。

  • 比喩: タップ、スワイプ、入力が可能な「ロボットの手」を想像してください。しかし、それは同時に「賢い学習者」でもあります。
  • ハイブリッドな手: アプリは散らばっており(多くの広告や奇妙なレイアウト)、混乱することがあります。X-OmniClaw は「ハイブリッド戦略」を使用します。ボタンのあるべき場所を知るためにアプリのコード(XML)を読み取りますが、コードが混乱している場合は、人間のように「目」(視覚知覚)を使ってボタンを見つけます。
  • 「クローン」のトリック: これが最もクールな部分です。もしあなたがアプリ(Meituan など)で特定のセールページを見つけるために複雑なパスを手動でナビゲートした場合、アシスタントに「これを見て」と指示できます。それはあなたの行動をクローンします。次に「フラッシュセールへ行く」と言うと、単に検索するだけでなく、その正確なページへ瞬時にジャンプし、退屈なクリックやスクロールをすべてスキップします。あなたの手動ナビゲーションを、再利用可能な「スキルカード」に変えるのです。

なぜこれが重要なのか?

現在のほとんどの「スマート」アシスタントは、遠隔サーバー(クラウド)上で動作します。それらは、何マイルも離れた管制塔から飛行機を操縦するパイロットのようなものです。乱気流を感じたり、飛行機のローカルセンサーに直接アクセスしたりすることはできません。

X-OmniClaw はエッジネイティブです。

  • 車の比喩: スマートフォンはです。クラウドは単にガソリンスタンド(必要に応じて燃料/推論能力を提供)です。エンジン(エージェント)は車の中にあります。
  • エンジンが車の中にいるため、交通状況(画面の変化)に瞬時に対応でき、車自身のセンサー(カメラ/マイク)を使用でき、遠くの塔からの信号を待つ必要がありません。

論文からの実生活の例

  • カメラコパイロット: 商品にカメラを向け、「これはいくらですか?」と尋ねます。アシスタントは商品を特定し、ショッピングアプリを開き、価格を見つけ、それをあなたに読み上げます。
  • ワンタップ動画: 「オウムの写真で動画を作って」と言うと、アシスタントは図書館からどの写真がオウムか(記憶から)を思い出し、動画編集アプリを開き、自動的にそれらの写真を選択して動画作成を開始します。
  • インスタントポータル: 見つけにくい特定のセールページに行きたい場合、アシスタントにそのパスを一度教えます。これで「フラッシュセール」と言うだけで、瞬時にそこへテレポートします。

結論

X-OmniClaw は、単にあなたとお喋りするだけでなく、あなたの電話を積極的に管理し、あなたの習慣を学び、視覚・聴覚・記憶を組み合わせることで複雑なタスクを実行する次世代の個人用アシスタントの青写真です。それは、あなたのスマートフォンを、あなたが操作する道具というよりも、あなたの人生を理解するパートナーのように感じさせることを目指しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →