Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining
本論文は、マルチモーダル GUI エージェントの汎化性能を大幅に向上させ、データ不足を克服するために、ラベル付けされていないインターネット動画から 1200 万件の GUI 相互作用軌跡の大規模データセットを合成する自動化フレームワーク「Video2GUI」を提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットにパソコン、スマートフォン、またはウェブサイトの使い方を教えると想像してください。そのためには、人々がボタンをクリックしたり、テキストを入力したり、ページをスクロールしたりする例を数百万件示す必要があります。
問題は、これらの例を見つけることが極めて困難だということです。通常、研究者はすべてのクリックを手動で記録し、ラベル付けするために人々を雇わなければならず、これは時間がかかり、費用も高く、利用可能なアプリの種類を数種類に限定してしまいます。これは、辞書の数ページだけを読んで言語を学ぼうとするようなものです。
Video2GUIは、インターネット全体を巨大で無料の教室に変えることでこの問題を解決する新しいシステムです。いくつかの単純な比喩を用いて、その仕組みを説明します。
1. 大規模な選別(適切な動画の発見)
インターネットには動画があふれていますが、そのほとんどはロボットを教えるには役に立ちません(料理番組や猫の動画など)。研究者はまず、5 億本の YouTube 動画から始めました。
- 粗い選別: まず、スマートな AI を使ってタイトルと説明をスキャンしました。これは、本を開く前に背表紙を素早く確認して「コンピューター」に関するものかどうかを調べる司書のようなものです。これにより、対象は 2,000 万本に削減されました。
- 細かい選別: 次に、より高度な AI を使って、それらの動画の最初の 1 分間を実際に「視聴」させました。画面は明確か?声は手順をよく説明しているか?実際にソフトウェアの使い方を示しているか?を確認しました。これは、動画が高品質なチュートリアルであることを保証するために、厳格な教師が採点するようなものです。
- 結果: 最終的に、420 万本の高品質なチュートリアル動画が残りました。
2. 翻訳者(動画を指示文へ変換)
これで動画は手に入れましたが、ロボットは人間のように動画を「視聴」して理解することはできません。動画は構造化された指示リストに変換される必要があります。
- プロセス: 強力な AI(超優秀な翻訳者のようなもの)を使って動画を視聴し、分解しました。目標(例:「靴を買う」)、実行された手順、そして各クリックが発生した正確な瞬間を特定しました。
- 魔法: AI は単に推測したわけではありません。動画のフレームを見て、クリックされたボタンの正確な座標を見つけました。オンラインで買い物をする 10 分間の動画を、正確なステップバイステップの地図に変換しました。「0:05 に検索バーをクリック。0:10 に『スニーカー』と入力。」
3. 図書館(WildGUI)
これらすべての変換された指示は、WildGUIと呼ばれる巨大な新しい図書館に収集されました。
- 規模: この図書館には、1,500種類以上の異なるアプリやウェブサイトを網羅する1,200 万のインタラクション経路(軌道)が含まれています。
- 多様性: Windows デスクトップから Android スマートフォン、Mac コンピュータまで、あらゆるものが含まれています。これは、人間が過去にコンピューターを使ったあらゆる可能性を収蔵し、すべてが整理されてロボットが学習する準備ができている図書館のようなものです。
4. 訓練(ロボットへの教育)
研究者は、既存の 2 つの AI モデル(Qwen2.5-VL と Mimo-VL)に、この新しい図書館を「与えて」学習させました。
- 結果: この巨大なデータセットを学習した後、ロボットは著しく向上しました。さまざまなテストで**5% から 20%**の改善が見られました。
- 証明: 彼らはもはやボタンを見つけ、正しいものをクリックし、複雑なウェブサイトを以前よりもはるかにうまくナビゲートできるようになりました。現在存在する最高のロボットと同等か、それ以上の性能を発揮しています。
結論
この論文は、インターネット上の動画をトレーニングデータに変換するプロセスを自動化することで、AI エージェントがコンピューターの使用においてはるかに賢くなるような、巨大で多様なデータセットを作成したと主張しています。彼らは新しいタイプのロボットを発明したわけではありません。既存のロボットに、はるかに優れていて、大きく、多様な教科書を与えただけです。
彼らは、このデータセットとそれを構築するために使用されたツールを公開しており、他の研究者が将来、さらに優れた AI エージェントを構築するためにそれらを利用できるようにしています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。