Grounding Computer Use Agents on Human Demonstrations
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、非常に賢いが視覚的に不器用なロボットにコンピュータの使い方を教えようとしていると想像してください。あなたには「ファイルを保存するために緑色のボタンをクリックしてください」といった言葉による指示を与えることができますが、ロボットはそのボタンがどこにあるのか全く分かりません。ロボットは間違った緑色のものをクリックしてしまうかもしれませんし、ボタンが小さすぎたり、別のものに見えたりするために、ボタンを外してしまうかもしれません。この問題は「グラウンディング(接地)」と呼ばれます。つまり、あなたの言葉を、ロボットが触れるべき画面上の正確な場所へと結びつける作業のことです。
この論文は、ロボットにこれをより上手く、より速く、そして無駄な労力を少なく教えるための新しい解決策を紹介しています。
問題点:アイコンの海で迷子になるロボット
デスクトップコンピュータは乱雑です。高解像度の巨大なスクリーンには、見た目がほとんど同じである小さなアイコン、メニュー、ボタンが詰め込まれています。従来のロボットへの学習方法では膨大なデータが使用されてきましたが、その多くは「ノイズ」を含んでいたり、人間ではなくコンピュータによって生成されたものでした。それは、まるで何百万枚ものぼやけたコンピュータ生成の車の写真を見せて運転を教えようとしているようなものです。理論は学べるかもしれませんが、現実の世界では衝突してしまうでしょう。
解決策:GROUNDCUA(「熟練の家庭教師」データセット)
著者らは、GROUNDCUAと呼ばれる新しい大規模なデータセットを作成しました。これは単なるランダムな写真の山ではなく、熟練したデモンストレーションのライブラリだと考えてください。
- 実在する人間、実在するタスク: 彼らは訓練を受けた専門家を雇い、87種類の異なるデスクトップアプリケーション(描画ツール、スプレッドシート、コーディングソフトなど)を実際に使用して、実際のタスクを実行してもらいました。
- 「X線」のような視力: 専門家が作業している間、システムはスクリーンショットを撮り、極めて重要なことに、画面上に表示されているあらゆる要素にラベルを付けました。もし専門家が小さな「保存」アイコンをクリックした場合、システムはそのアイコンが正確にどこにあり、どのような見た目をしており、専門家が何をしようとしていたのかを記録しました。
- 規模: 彼らは56,000枚のスクリーンショットと、350万件以上のラベル付けされた要素を収集しました。これは、すべての写真の中にあるすべてのオブジェクトに名前が付けられ、人間の教師によって説明されている教科書をロボットに与えるようなものです。
新しいモデル:GROUNDNEXT(「優秀な生徒」)
この高品質なデータセットを使用して、チームはGROUNDNEXTと呼ばれる新しいAIモデルのファミリーを構築しました。
- 2段階のトレーニング:
- 教師あり微調整(SFT): まず、彼らは70万件の最高品質の例を用いてモデルを教えました。イメージとしては、優秀な生徒が完璧な教科書を勉強している状態です。
- 強化学習(RL): 次に、モデルに練習させました。正解すると「よくできました」という報酬を与え、間違えると「やり直し」という信号を与えました。これにより、スキルをさらに洗練させました。
結果:小さなサイズ、大きな脳
驚くべきことはここからです。チームは、他のトップモデルが使用したデータの10分の1未満のデータを使用してモデルをトレーニングしました。
- 効率性: 彼らの30億パラメータのモデル(比較的小さな「脳」)は、より多くの乱雑なデータポイントでトレーニングされた、より大きなモデルと同等、あるいはそれ以上の性能を発揮しました。
- 「アンダードッグ(格下)」の勝利: AIがコンピュータのユーザーとして行動する(クリック、タイピング、ドラッグなど)テストにおいて、彼らの小さなモデルは、大手テック企業のモデルを含む巨大な競合モデルを打ち負かしました。それは、数百万冊の雑誌を読んだ生徒が、数冊の完璧な本を勉強した生徒に勝つようなものです。
- 汎用性: デスクトップコンピュータのみでトレーニングされたにもかかわらず、モデルはモバイルフォンやウェブサイトについても驚くほど優れた理解を示し、コンピュータ使用の「原理」を学んだことを証明しました。
なぜこれが重要なのか
この論文は、量よりも質が重要であると主張しています。問題に対してより多くのデータを投げ込むのではなく、高品質で人間によって検証されたデータがあれば、より少ないリソースで、より信頼性の高いコンピュータ操作エージェントを構築できることを彼らは示しました。
彼らは、他の研究者がより優れた、より信頼できる(アイコンの中で迷うことなく、実際に私たちのコンピュータ操作を助けてくれる)ロボットを構築できるように、データセット(GROUNDCUA)とモデル(GROUNDNEXT)の両方を公開しています。
要約すると: 彼らは、何千もの完璧な人間のデモンストレーション例を示すことでロボットにコンピュータの使い方を教え、高品質な教育がどれほど大きな成果をもたらすかを証明しました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。