← 最新の論文
💻 computer science

SwipeGen: Bridging the Execution Gap in GUI Agents via Human-like Swipe Synthesis

本論文では、現在のGUIエージェントの性能を現実世界のシナリオにおいて制限している硬直的なスワイプ実行に対処するため、多様で人間のようなスワイプ操作を合成するためのツールであるSwipeGenと、それらを評価するためのベンチマークであるSwipeBenchを紹介する。

原著者: Xuan Wang, Siyuan Su, Quantong Fu, Yongxiang Hu, Yangfan Zhou

公開日 2026-08-21
📖 1 分で読めます☕ さくっと読める

原著者: Xuan Wang, Siyuan Su, Quantong Fu, Yongxiang Hu, Yangfan Zhou

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたのスマートフォンがあなたの音声コマンドを理解し、ボタンをタップしたりテキストを入力したりと、まるであなた自身が行うかのようにアプリを操作してくれる世界を想像してみてください。これは、グラフィカル・ユーザー・インターフェース(GUI)エージェントの約束です。これは、人間と同じように画面と対話するように設計された人工知能の一種です。長年、研究者たちはこれらのシステムに、アイコンを認識し、テキストを読み取り、特定のターゲットをクリックする方法を教えてきました。しかし、決定的な溝が残っていました。これらのエージェントは、精度を上げながら指し示しやクリックを行うことはできても、最も一般的なジェスチャーである「スワイプ」にはひどく苦戦していたのです。ニュースフィードをスクロールしたり、音量スローダーを調整したり、隠れたメニューを表示させたりする際、機械のデジタルの手は、画面の反応を引き出すことができない、硬く機械的な精密さで動いてしまうことがよくありました。この制限により、たとえ極めて賢いエージェントであっても、人間の指のような流動的な動きを必要とする単純なタスクを完了できず、行き詰まってしまうことがあったのです。

復旦大学の研究チームは、この特定の問題を解決するために、「なぜ人間にとってこれほど自然なスワイプを、機械は失敗するのか?」という根本的な問いを投げかけることから着手しました。彼らは、問題は知性の欠如ではなく、データの不足とスワイプの仕組みに対する誤解にあることを発見しました。既存のシステムは、単純なクリックが支配的なデータセットで学習されており、あらゆるインタラクションを画面上の単一の点として扱っていました。しかし、スワイプは点ではありません。それは「旅」なのです。それは、開始地点、方向、距離、そして速度を含んでいます。研究者たちは、現在のエージェントが単一の座標を推測しようとする際、スワイプの速度や正確な開始地点が結果を変えてしまうことを理解していないために、的外れな動きをしてしまうことが多いことを突き止めました。これを修正するために、彼らは「SwipeGen」と呼ばれる新しいツールを構築しました。これは、人間のようなジェスチャーの例を何千ものパターン生成することで、機械にスワイプの方法を教えるための自動化されたシステムです。

プロセスは、システムがユーザーと同じようにモバイルアプリを自律的に探索することから始まりました。システムは画面内をナビゲートし、写真のリストやアイコンの列など、スクロール可能な領域を特定しました。一度スクロール可能な領域を見つけると、システムは単に推測するのではなく、さまざまな方法でスワイプを体系的に試みました。画面の中央から、あるいは端から、上へ、下へ、左へ、右へと、異なる速度でスワイプを開始してテストしました。決定的なのは、システムが各試行の前後で画面を観察したことです。もしスワイプによってコンテンツが移動したり変化したりした場合、システムはそれを成功として記録し、それが機能した正確な座標、方向、および継続時間を記録しました。もし画面が反応しなかった場合、その試行は破棄されました。この「試行、観察、記録」のサイクルによって、チームは、それぞれのジェスチャーが何を達成したかを説明する自然言語の記述を伴った、成功したスワイプ・インタラクションの膨大なライブラリを構築することができました。

この新しいデータライブラリを手にした研究者たちは、新しいバージョンの人工知能モデルを訓練し、それに「GUISwiper」と名付けました。彼らはモデルに対し、単にボタンを見つけるだけでなく、スワイプの物理学を理解するように教えました。その結果は驚くべきものでした。モデルが一度も見たことのない新しいアプリのセットでテストされた際、GUISpiwerは従来の最先端モデルよりも2.5倍以上優れたスワイプ動作の実行に成功しました。旧来のモデルはスワイプ・タスクの約4分の1程度しか正しく完了できなかったのに対し、新しいモデルは60パーセント以上で成功しました。さらに重要なことに、研究者たちは、機械にスワイプを教えることが他のタスクの能力を低下させないことを証明しました。モデルはボタンの識別やテキストの読み取りにおいても同様に優れた性能を維持しており、画面のレイアウトを理解する能力を失うことなく、複雑なジェスチャーを学習できることを示しました。

この研究はまた、これらのエージェントにとって最大の障害は「何をすべきか」を理解することではなく、「どのように行うか」を知ることであったことも浮き彫りにしました。研究者たちは、モデルが失敗する場合、それは間違った方向を選んだためではなく、通常、スワイプの開始位置が間違っていたり、画面の反応を引き出すには動きが遅すぎたりしたためであることを発見しました。実行の詳細、つまり動きの正確な開始、終了、および速度に焦点を当てることで、彼らは機械の硬直した論理と、人間のユーザーが持つ流動的な直感との間の溝を埋めました。この研究は、人工知能が真にデジタル世界をマスターするためには、単に「見る」だけでなく、それが仕える人々と同じようなニュアンスとタイミングを持って「動く」ことを学ばなければならないことを示唆しています。効果的にスワイプする能力は、もはや単なるマイナーな機能ではなく、人間の手の容易さで画面をナビゲートしようとするあらゆるエージェントにとって、根本的な要件なのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →