← 最新の論文
🤖 AI

MobileExplorer: Accelerating On-Device Inference for Mobile GUI Agents via Online Exploration

MobileExplorer は、モデルの推論時間を活用して UI 要素の並列オンライン探索を実行することで、モバイル GUI エージェントのオンデバイス推論を加速する新規フレームワークであり、これにより高タスク成功率を維持しつつ推論ステップとレイテンシを低減する文脈的ヒントを生成します。

原著者: Runxi Huang, Liyu Zhang, Shengzhong Liu, Xiaomin Ouyang

公開日 2026-05-27
📖 1 分で読めます☕ さくっと読める

原著者: Runxi Huang, Liyu Zhang, Shengzhong Liu, Xiaomin Ouyang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたの電話の中に、非常に賢いけれど少し遅い個人アシスタントが住んでいると想像してください。このアシスタントの役割は、あなたの画面を見て、「テキストを送る」や「レシピを探す」といったあなたが何をしたいのかを判断し、それを実現するために正しいボタンをタップすることです。

問題は、このアシスタントが「視覚言語モデル」であることです。画像やテキストの理解においては驚くほど優れていますが、考えるのに非常に時間がかかります。まるで、1 つの数学の問題を解くのに 30 秒を要する天才教授のようなものです。一方、電話のボタンをタップする実際の動作は、一瞬で終わります。

従来の方法では、アシスタントは画面をじっと見つめ、考えるのに 30 秒をかけ、ようやくボタンをタップします。その 30 秒の間、電話は何もせずじっとしています。もし 20 回のタップを要するタスクであれば、それは長い待ち時間になります。

そこで登場するのが「MobileExplorer」です。

MobileExplorer を開発した研究者たちは、その「考える時間」を別のことに活用できることに気づきました。いくつかの簡単な比喩を用いて、その仕組みを説明します。

1. 「待ち時間」を活用する戦略

オーブンでピザを焼いている間(30 秒の思考時間)を想像してください。オーブンをじっと見つめて立ちすくむのではなく、その時間を使って冷蔵庫を素早く確認し、飲み物を取り出し、テーブルをセッティングします。ピザの出来上がりを遅らせているのではなく、オーブンが作業をしている間に次のステップの準備をしているだけです。

MobileExplorer はまさにこれをやります。AI が「次に何をするか」を考えている間、システムは静かに、かつ素早く画面のいくつかの異なるボタンをタップして、何が起きるかを試します。廊下にあるいくつかのドアを、どのドアが開くか確認するように、情報を集めるために軽くつつくようなものです。

2. 「賢い探偵」(タスクの関連性)

システムは単にランダムにボタンをつつくわけではありません。それは無秩序です。代わりに、目標を知っている探偵のように振る舞います。

  • 目標: 「映画を見つけたい」
  • 行動: システムは画面を見て、「どのボタンが映画につながる可能性がありそうか?」と問いかけます。「電卓」や「天気」のボタンは無視し、「Netflix」や「検索」のボタンに焦点を当てます。
  • 結果: 特定の領域を素早く確認し、新しい画面がどのように表示されるかを見て、小さなメモを残します。「ああ、『映画』ボタンはジャンルのリストにつながっているな」と。

3. 「魔法の元に戻す」ボタン(2 段階のロールバック)

ここが難しい部分です。あまりにも多くを試しすぎると、道に迷う可能性があります。意図しないメニューを開いてしまい、元の画面に戻る道が見つからなくなるかもしれません。

MobileExplorer には、2 段階の超強力な「元に戻す」システムがあります。

  • レベル 1(クイック元に戻す): 「戻る」ボタンを数回押して、出発点に戻ろうとします。画面が以前と同じかどうかを確認します(「知覚的ハッシュ」と呼ばれるデジタル指紋を使用して)。
  • レベル 2(リセットボタン): 「戻る」ボタンが失敗した場合(ポップアップが道を塞いでいるなど)、パニックになりません。即座に電話の「ホーム」画面まで完全に戻り、元の場所に戻るために取った正確な手順を再実行します。「よし、ホームからやり直して、この道を通り直そう。今回はもっと速くやるぞ」と言うようなものです。

これにより、「試し探索」がメインの作業を混乱させることがありません。電話は、探索が始まる前の正確な状態に戻ります。

4. 「カンニングペーパー」(文脈の手がかり)

システムが「映画のリストは『エンターテインメント』タブの下にある」などの追加情報をすべて収集すると、それを小さく読みやすいメモに要約します。AI が最終的な決定を下す前に、このメモを AI に渡します。

つまり、AI が推測するのではなく、今やカンニングペーパーを持っていることになります。「ねえ、さっき確認したよ。映画のリストはここにあるよ」と。これにより、AI は正しい選択をより速く行えるようになり、タスクを完了するために必要な合計ステップ数が減ります。

結果

研究者たちは、実際の電話と実際のアプリでこれをテストしました。その結果、以下がわかりました。

  • 高速化: AI が推測する必要がなくなったため、プロセス全体が約23% 短縮されました。
  • 賢さの向上: より多くの情報を持っていたため、タスクを正しく完了する割合がわずかに向上しました(最大 5% 改善)。
  • プライバシーの保護: すべての処理は電話内で行われます。データはクラウドに送信されないため、画面の活動はプライバシーが保たれます。

要するに、MobileExplorer は、遅いけれど賢い AI の「待ち時間」を「生産的な時間」に変え、電話が安全かつ効率的にインターフェースを探索できるようにすることで、AI があなたのタスクをより速く完了できるようにします。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →