← 最新の論文
💬 NLP

GUICrafter: Weakly-Supervised GUI Agent Leveraging Massive Unannotated Screenshots

GUICrafterは、大量の未注釈のスクリーンショットと少量の高品質なデータを用いて学習を行う2段階のカリキュラム学習フレームワークを活用した弱教師ありGUIエージェントであり、UI-TARSのような高度なシステムが使用する注釈付きデータのわずか0.1%のみを必要としながら、優れた性能とデバイスを横断した汎用性を実現しています。

原著者: Sunqi Fan, Lingshan Chen, Runqi Yin, Qingle Liu, Yongming Rao, Meng-Hao Guo, Shi-Min Hu

公開日 2026-06-30
📖 1 分で読めます☕ さくっと読める

原著者: Sunqi Fan, Lingshan Chen, Runqi Yin, Qingle Liu, Yongming Rao, Meng-Hao Guo, Shi-Min Hu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットにスマートフォンやコンピュータの使い方を教えたいと想像してみてください。これまでの方法は、ロボットがすべてのタスクを行うたびに、人間の家庭教師が横に座り、「ここをクリックして」「そこにタイプして」「これをドラッグして」と一つひとつのボタンを指し示すようなものでした。これは非常にコストがかかり、時間がかかり、拡張性も低いため、何百万もの異なるアプリやウェブサイトに対して人間がすべてに注釈(アノテーション)をつけることは不可能です。

GUICrafterは、この状況を一変させる新しい手法です。ロボットにすべてのレッスンで人間の家庭教師をつける代わりに、ロボットが「観察」し、「推測」し、そして少しの助けを借りて「自己修正」しながら学ぶ方法を教えます。

その仕組みを、簡単なステップに分けて説明します。

1. 問題点:「データの砂漠」

現在、AIエージェント(画面を使うロボット)は「データの砂漠」に取り残されています。彼らは、学習のために大量のラベル付きデータ(「赤いボタンをクリック」といった人間による指示が付いたスクリーンショットなど)を必要とします。しかし、このデータを収集することは、浜辺の砂粒を一つひとつ手作業で数えるようなもので、あまりにも遅く、高価です。このため、これらのロボットは画面上の小さなボタンを見つけるのが苦手であり、見たことがない新しいタイプのアプリにも対応できません。

2. 解決策:「2段階のジム」

研究者たちは、ジムでのトレーニングのように、2段階でロボットを訓練するGUICrafterというシステムを構築しました。

ステージ1:「荒野でのサバイバル」コース(弱教師あり事前学習)

何百万ものランダムなウェブページやアプリのスクリーンショットが詰まった巨大な図書館に、生徒を放り込む場面を想像してください。誰も正確に何をすべきかは教えてくれません。その代わりに、システムはそのページが「何ができるか」に基づいたヒントを与えます。

  • 比喩: これは、子供に「これはドアです」と言わずに、何千ものドアを見せることで「ドア」という概念を認識させる教育に似ています。システムは、画面上のインタラクティブな要素(ボタン、テキストボックス、メニューなど)を自動的に見つけ出します。
  • タスク: ロボットには、「クリック可能なボタンをすべて探せ」や「入力できる場所を探せ」といった、単純で汎用的な指示が与えられます。
  • 報酬: もしロボットが本物のボタンをクリックすれば、「よくできました」という信号を受け取ります。もし空白の場所をクリックしたら、「やり直し」という信号を受け取ります。
  • 結果: ロボットは画面を見る方法を学びます。ボタンと画像の区別や、インタラクティブな部分がどこにあるのかを、何百万ものラベルのないスクリーンショットを見るだけで学習します。すべてのものに人間がラベルを貼る必要はありません。

ステージ2:「微調整(ファインチューニング)」コース(高品質な強化学習)

ボタンやテキストフィールドの見つけ方は分かりましたが、これだけではまだ動作がぎこちないかもしれません。正しいボタンをクリックしているつもりでも、理由が間違っていたり、「ログインを探して」と言われたときに別のボタンを押してしまうこともあります。

  • 比喩: これは、ドアの識別ができるようになった学生に対し、厳しい教師がいくつかの特定の、高品質なレッスンを与えるようなものです。
  • タスク: システムは、ごくわずかな(他のシステムが使用する量のわずか0.1%程度)高品質な人間によるラベル付きデータを使用します。
  • 報酬: ロボットは、特定の複雑なタスクに対してテストされます。成功すれば大きな報酬を得て、失敗すれば、具体的にどこが間違っていたのかを学びます。
  • 結果: ロボットは点と点を結びつける方法を学びます。単に「どこにボタンがあるか」だけでなく、「特定の目的のためにどのボタンをクリックすべきか」を理解するようになります。

3. 魔法の要素:「メタタスク」

「Amazonで『購入』ボタンをクリックして」「Gmailで『送信』ボタンをクリックして」といった、タスクごとに固有の指示を書く代わりに、GUICrafterはメタタスクを使用します。

  • 比喩: 1,000種類の異なるレシピを教える代わりに、「料理」という概念を教えるようなものです。「鍋を見つけたら、かき混ぜなさい」と教えるのです。
  • システムは、「クリック可能な領域をすべてクリックせよ」や「任意のテキストボックスに入力せよ」といった、汎用的なルールを作成します。これにより、ロボットはウェブサイトごとに新しいルールを人間が書くことなく、広大なラベルのないインターネットから学習することができます。

4. 結果:少ないデータで、大きな脳を

この論文は、この手法を用いることで以下のことが達成できると主張しています。

  • データ効率: GUICrafterは、トップクラスのシステム(UI-TARSなど)と同等、あるいはそれ以上の結果を、それらのシステムが必要とするデータの**わずか0.1%**だけで達成します。これは、学習時間のほんの一部で博士号を取得するようなものです。
  • 汎用性: ステージ1で「野生の」データ(何百万ものランダムなウェブサイト)から学んだため、未知のアプリやウェブサイトに対しても、従来のモデルよりはるかに優れた対応力を発揮します。
  • 堅牢性(ロバストネス): ステージ1の「ヒント」が多少乱雑であったり(例:ぼやけた写真)、ノイズが含まれていたりしても、ステージ2の微調整を経て、ロボットは効果的に学習を進めることができます。

まとめ

GUICrafterは、まずインターネットを自力で「読み取る」こと(ボタンやフィールドの識別を学ぶこと)を許容し、その後に、スキルを磨くための極めて高品質な「最終試験」を与えることで、AIエージェントにコンピュータの使い方を教える方法です。これは、人間によるラベル付きデータの不足という問題を、インターネット全体を無料の巨大なトレーニング場へと変えることで解決しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →