あなたのスマートフォンがあなたの音声コマンドを理解し、ボタンをタップしたりテキストを入力したりと、まるであなた自身が行うかのようにアプリを操作してくれる世界を想像してみてください。これは、グラフィカル・ユーザー・インターフェース(GUI)エージェントの約束です。これは、人間と同じように画面と対話するように設計された人工知能の一種です。長年、研究者たちはこれらのシステムに、アイコンを認識し、テキストを読み取り、特定のターゲットをクリックする方法を教えてきました。しかし、決定的な溝が残っていました。これらのエージェントは、精度を上げながら指し示しやクリックを行うことはできても、最も一般的なジェスチャーである「スワイプ」にはひどく苦戦していたのです。ニュースフィードをスクロールしたり、音量スローダーを調整したり、隠れたメニューを表示させたりする際、機械のデジタルの手は、画面の反応を引き出すことができない、硬く機械的な精密さで動いてしまうことがよくありました。この制限により、たとえ極めて賢いエージェントであっても、人間の指のような流動的な動きを必要とする単純なタスクを完了できず、行き詰まってしまうことがあったのです。
復旦大学の研究チームは、この特定の問題を解決するために、「なぜ人間にとってこれほど自然なスワイプを、機械は失敗するのか?」という根本的な問いを投げかけることから着手しました。彼らは、問題は知性の欠如ではなく、データの不足とスワイプの仕組みに対する誤解にあることを発見しました。既存のシステムは、単純なクリックが支配的なデータセットで学習されており、あらゆるインタラクションを画面上の単一の点として扱っていました。しかし、スワイプは点ではありません。それは「旅」なのです。それは、開始地点、方向、距離、そして速度を含んでいます。研究者たちは、現在のエージェントが単一の座標を推測しようとする際、スワイプの速度や正確な開始地点が結果を変えてしまうことを理解していないために、的外れな動きをしてしまうことが多いことを突き止めました。これを修正するために、彼らは「SwipeGen」と呼ばれる新しいツールを構築しました。これは、人間のようなジェスチャーの例を何千ものパターン生成することで、機械にスワイプの方法を教えるための自動化されたシステムです。
プロセスは、システムがユーザーと同じようにモバイルアプリを自律的に探索することから始まりました。システムは画面内をナビゲートし、写真のリストやアイコンの列など、スクロール可能な領域を特定しました。一度スクロール可能な領域を見つけると、システムは単に推測するのではなく、さまざまな方法でスワイプを体系的に試みました。画面の中央から、あるいは端から、上へ、下へ、左へ、右へと、異なる速度でスワイプを開始してテストしました。決定的なのは、システムが各試行の前後で画面を観察したことです。もしスワイプによってコンテンツが移動したり変化したりした場合、システムはそれを成功として記録し、それが機能した正確な座標、方向、および継続時間を記録しました。もし画面が反応しなかった場合、その試行は破棄されました。この「試行、観察、記録」のサイクルによって、チームは、それぞれのジェスチャーが何を達成したかを説明する自然言語の記述を伴った、成功したスワイプ・インタラクションの膨大なライブラリを構築することができました。
この新しいデータライブラリを手にした研究者たちは、新しいバージョンの人工知能モデルを訓練し、それに「GUISwiper」と名付けました。彼らはモデルに対し、単にボタンを見つけるだけでなく、スワイプの物理学を理解するように教えました。その結果は驚くべきものでした。モデルが一度も見たことのない新しいアプリのセットでテストされた際、GUISpiwerは従来の最先端モデルよりも2.5倍以上優れたスワイプ動作の実行に成功しました。旧来のモデルはスワイプ・タスクの約4分の1程度しか正しく完了できなかったのに対し、新しいモデルは60パーセント以上で成功しました。さらに重要なことに、研究者たちは、機械にスワイプを教えることが他のタスクの能力を低下させないことを証明しました。モデルはボタンの識別やテキストの読み取りにおいても同様に優れた性能を維持しており、画面のレイアウトを理解する能力を失うことなく、複雑なジェスチャーを学習できることを示しました。
この研究はまた、これらのエージェントにとって最大の障害は「何をすべきか」を理解することではなく、「どのように行うか」を知ることであったことも浮き彫りにしました。研究者たちは、モデルが失敗する場合、それは間違った方向を選んだためではなく、通常、スワイプの開始位置が間違っていたり、画面の反応を引き出すには動きが遅すぎたりしたためであることを発見しました。実行の詳細、つまり動きの正確な開始、終了、および速度に焦点を当てることで、彼らは機械の硬直した論理と、人間のユーザーが持つ流動的な直感との間の溝を埋めました。この研究は、人工知能が真にデジタル世界をマスターするためには、単に「見る」だけでなく、それが仕える人々と同じようなニュアンスとタイミングを持って「動く」ことを学ばなければならないことを示唆しています。効果的にスワイプする能力は、もはや単なるマイナーな機能ではなく、人間の手の容易さで画面をナビゲートしようとするあらゆるエージェントにとって、根本的な要件なのです。
技術要約: SwipeGen
問題提起
視覚言語モデル(VLM)を活用したグラフィカルユーザーインターフェース(GUI)エージェントが普及しているにもかかわらず、これらのシステムは現実世界のシナリオにおいて満足のいくインタラクション能力を実現できず、頻繁に失敗するという課題がある。著者らは経験的な分析を通じて、この制限の根本原因が硬直的なスワイプ実行にあることを特定した。
現在のGUIエージェントは、主にコンポーネント中心のインタラクション戦略(自然言語コマンドを特定のターゲット座標、例えばボタンへのタップなどにマッピングする手法)に依存している。しかし、スワイプ操作はクリックとは根本的に異なる:
- 非アンカー性(Non-anchored Nature): スワイプは特定のコンポーネントではなく、一般的な領域(例:コンテンツフィード)に対して行われることが多い。
- マルチパラメータの複雑性: クリックとは異なり、有効なスワイプには、開始位置、終了位置、方向、および持続時間(速度)という複数のパラメータを同時に予測する必要がある。
- データの希少性と不完全性: 既存のGUIデータセットは、クリックやテキスト入力に大きく偏っている(インタラクションの76.4%〜94.9%)。さらに、利用可能な希薄なスワイプ注釈には、重要な実行パラメータ(例:明示的な方向や持続時間)が欠けていることが多く、VLMが実行可能なスワイプ軌道を生成することを学習するのを妨げている。
その結果、既存のエージェントは微細な調整(例:スライダー)やコンテンツの探索(例:フィードのスクロール)に苦しみ、頻繁なタスク失敗を招いている。
手法: SwipeGen
多様で実行可能な人間らしいスワイプデータの不足に対処するため、著者らは、定義済みの人間によるコマンドに頼ることなくスワイプインタラクションを合成する自動パイプラインであるSwipeGenを提案する。このパイプラインは、5つのコアモジュールで構成される:
- GUI探索: 深さ優先探索(DFS)戦略を用いてモバイルアプリを体系的にナビゲートし、インタラクションパスを記録することで、多様な画面状態を発見する。
- スクロール可能なターゲットの特定:
- コンポーネント: XMLレイアウトのヒューリスティックな解析を通じて、明示的なスクロール要素(例:スライダー、RecyclerView)を特定する。
- 領域: VLM(Qwen3-VL-4B-Instruct)を使用し、階層ノードが存在しないスクロール可能な領域(例:コンテンツフィード、アイコングリッド)を、視覚的なレイアウトと意味的な機能に基づいて推論する。
- 統一されたスワイプ表現: 下流の自動化ツール(ADB、UIAutomator、Appium)との互換性を確保するため、4つの明示的なパラメータを用いてスワイプを定義する:
- 開始位置: ジェスチャの起点。
- 終了位置: ジェスチャの終点。
- 方向: 学習を容易にするため、座標から単に推論するのではなく、明示的に注釈付けされる(例:上、下)。
- 持続時間: 特に領域レベルのスワイプにおいて、速度がスクロール距離を決定するため、速度を制御するために極めて重要である。
- 候補スワイプの生成:
- コンポーネントについては、コンポーネントのバウンディングボックスとアスペクト比に基づき、固定の持続時間で候補が生成される。
- 領域については、領域の中心から境界までのオフセットに基づいて候補が生成され、粗い粒度のユーザー制御をシミュレートするために、高速(150ms)と低速(500ms)の両方の持続時間をサンプリングする。
- スワイプ妥当性の検証: 候補となるスワイプを実行し、実行前後のスクリーンショットを比較することで、その有効性を検証する。ターゲット領域内の画素強度の差によって測定される、知覚可能な視覚的変化を引き起こすスワイプのみが保持される。
- スワイプ記述の生成: VLMを使用して、実行されたスワイプに関するステップレベルの自然言語コマンドを、視覚的な変化とパラメータに基づいて生成し、マルチモーダルなトレーニングデータセットを作成する。
主な貢献
- ボトルネックの特定: 本論文は、既存のGUIエージェントのインタラクション能力を制限する主要なボトルネックとして、硬直したコンポーネント中心のスワイプ実行戦略を初めて指摘した。
- SwipeGenパイプライン: 高品質なスワイプデータの不足に対処するため、多様で人間らしいスワイプインタラクションを合成する初の自動パイプラインを設計し、公開した。
- SwipeBench: 16種類のドメイン外(OOD)モバイルアプリからなる382件の有効なインタラクションを含み、GUIエージェントにおけるスワイプ実行の品質を評価するために特別に設計された初のベンチマークを導入した。
- GUISwiper: SwipeGenによって合成されたデータでファインチューニングされたVLMであり、一般的なGUIグラウンディング性能を低下させることなく、改善されたスワイプ能力が達成できることを示した。
実験結果
著者らは、3つのベンチマークにおいて、複数の最先端のベースライン(Qwen2.5-VL、UI-R1、UI-TARS、MAI-UIを含む)に対してGUISwiperを評価した:
- スワイプ実行 (SwipeBench): GUISwiperは61.25%の成功率を達成し、これはベースラインのQwen2.5-VL(24.87%)に対して2.46倍の向上となり、他のすべてのベースラインを上回った。特に長距離のスクロールやフィードのナビゲーションを伴う、すべてのベースラインモデルが失敗した23のタスクを成功させた。
- グラウンディング能力 (ScreenSpot): SwipeGenデータを用いたファインチューニングは、一般的なグラウンディング性能を低下させなかった。GUISwiplは**85.83%**の精度を達成し、そのバックボーン(75.80%)を上回り、UI-TARS(84.25%)のような産業用モデルとも遜色のない結果となった。
- エンドツーエンドのタスク実行 (AndroidWorld): GUISwiperは**40.52%**のタスク成功率を達成し、同規模のモデルやより大きなバックボーンモデル(例:Qwen2.5-VL-72Bの35.00%)を上回った。実行トレースの分析により、信頼できるスワイプ実行が、長期間のオフスクリーンナビゲーションを必要とするタスクにおいて極めて重要であることが明らかになった。
意義と主張
本論文は、スワイプを効果的に実行できないことが、現在のGUIエージェントにおける、見落とされがちな重要な制限事項であると主張している。SwipeGenを導入することで、著者らは以下のことを示した:
- データ合成の実現可能性: 人間のインタラクション・トレースの希少性を克服するために、高品質で実行可能なスワイプデータを、手動の注釈なしに自動的に合成できる。
- スワイプとグラウンディングの相補性: 領域レベルのスワイプ能力を高めることは、要素のローカライゼーション(位置特定)を犠牲にすることにはならず、両方を同時に改善できる。
- 実行ギャップの解消: スワイプ実行という特定の能力を向上させることは、複雑なエンドツーエンドのGUIオートメーションタスクにおけるパフォーマンスの向上に直接つながり、コンポーネント中心のインタラクションモデルを超えていく必要性を裏付けている。
著者らは、自身の「人間らしい」という定義が、微細な運動特性(例:軌跡の曲率)の再現ではなく、タスク効果への適合に焦点を当てていること、および検証方法が軽量な画素比較に依存していることを認め、限界事項として挙げている。今後の展望として、より微細なモデリングのための実際のユーザーインタラクション・トレースの組み込みや、より多様なアプリケーションをカバーするためのベンチマークの拡張を提案している。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録