← 最新の論文
💻 computer science

POINTS-GUI-G: GUI-Grounding Journey

本論文は、洗練されたデータエンジニアリング、改善された学習戦略、および検証可能な報酬を用いた強化学習を活用することで、空間認識能力が最小限のベースモデルから、複数のベンチマークにおいて優れた性能を達成する最先端のGUIグラウンディングモデルであるPOINTS-GUI-G-8Bを紹介するものである。

原著者: Zhongyin Zhao, Yuan Liu, Yikun Liu, Haicheng Wang, Le Tian, Xiao Zhou, Yangxiu You, Zilin Yu, Yang Yu, Jie Zhou

公開日 2026-02-09
📖 1 分で読めます☕ さくっと読める

原著者: Zhongyin Zhao, Yuan Liu, Yikun Liu, Haicheng Wang, Le Tian, Xiao Zhou, Yangxiu You, Zilin Yu, Yang Yu, Jie Zhou

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、テキストを読み、画像を見ることができる非常にスマートなロボットアシスタントを所有していると想像してください。あなたは、そのロボットに、あなたと同じようにコンピュータやスマートフォンを使えるよう教えてあげたいと考えています。しかし、問題があります。ロボットは指示(「赤いボタンをクリックしてください」など)を読むことはできますが、画面上のどこにその赤いボタンがあるのかを知りません。それは、街の地図を渡されたものの、自分が今どの通りに立っているのかを教えられていないようなものです。

この論文は、ついに画面を見て、「あ、ボタンが見つかりました!ちょうどこの座標にあります」と言えるようになった、新しいバージョンのロボットアシスタントであるPOINTS-GUI-Gを紹介しています。

以下に、研究者たちがどのようにしてこのロボットを画面の達人に育て上げたのかを、シンプルな比喩を用いて説明します。

1. 出発点:白紙の状態

他の多くの研究者は、すでに探し物が得意なロボット(熟練の探偵のようなもの)を取り上げ、そこに少しだけヒントを与えていました。しかし、この論文の著者たちは、探し物が苦手なロボットから始めることにしました。彼らは、単にティーンエイジャーの綴りを添削するのではなく、子供に読み書きを教えるように、基礎からスキルを構築したいと考えたのです。彼らは、画面上のものを見つける能力がほとんどない「POINTS-1.5」というベースモデルからスタートしました。

2. 成功のための3つの柱

この「盲目」なロボットを「視力のある」ものに変えるために、彼らは主に3つの戦略を用いました。

A. 教科書の整理と清掃(洗練されたデータエンジニアリング)

教科書の山を使って学生を教えようとしている場面を想像してみてください。ある本はインチ表記、ある本はセンチメートル表記、ある本は英語で書かれ、別の本はフランス語で書かれています。さらに、ページが破れていたり、落書きが書き込まれていたりすることもあります。それでは学習するのは悪夢です。

研究者たちは、これを修正するために3つのことを行いました:

  • 標準化: 彼らは、バラバラで乱雑なデータセットをすべて取り込み、単一のフォーマットに強制的に統合しました。これにより、すべての「座標(位置)」が同じ方法で測定されるようになり、すべてが標準的な定規に変換された状態になりました。
  • ノイズの除去: 彼らは厳格な編集者のように振る舞いました。特別なツール(OmniParser-v2と呼ばれます)を使用して教科書をチェックしました。もし教科書に「ボタンはここにある」と書いてあっても、画像では明らかにボタンが別の場所にある場合は、そのページを破棄しました。彼らは完璧な例だけを残したのです。
  • 難易度を上げる: ロボットが大きく分かりやすいボタンを見つけるのが得意になってくると、研究者は「ハードモード」のパズルを与え始めました。彼らは、小さなボタンが密集し、レイアウトが複雑な画面(書類が散乱した乱雑なデスクのようなもの)を作成し、ロボットの精度をより鋭くさせるように強制しました。

B. 「目」の調整(改善されたトレーニング戦略)

通常、これらのAIモデルをトレーニングする際、「目」(画像を処理する部分)は固定されたままになります。しかし、研究者たちは、画面上のボタンを見つけるためには、目が柔軟である必要があることに気づきました。

  • 視覚のアンフリーズ(解放): 彼らは、脳の他の部分が学習している間も、「目」が学習し、調整できるようにしました。これにより、ロボットは微細なディテールを捉える能力を高めることができました。
  • 解像度の整合性: バスケットボールの試合の練習を、5フィートの距離からシュートを打って行い、本番の試合では10フィートの距離のゴールに現れる場面を想像してください。それでは外れてしまいます。研究者たちは、ロボットが低解像度の小さな画像で練習し、高精細な大きなスクリーンでテストされていることに気づきました。彼らは、ロボットの「視覚」が実戦に備えられるよう、より大きく鮮明な画像でトレーニングを行うことで、この問題を解決しました。

C. ビデオゲームの報酬システム(強化学習)

これが最もユニークな部分です。通常、強化学習(RL)は、ロボットに「思考」や論理パズルを教えるために使用されます。ここでは、ロボットに「見る」方法を教えるためにこれを用いました。

これはビデオゲームのようなものです:

  • ロボットがボタンの位置を推測します。
  • コンピュータがチェックします:「ボタンを叩けましたか?」
  • はい? +100ポイント。
  • いいえ? 0ポイント。

答えは「正しい」か「間違い」かのどちらかであり(「おそらく」という中間はありません)、ロボットは非常に明確なフィードバックを受け取ります。研究者たちは、この「試す、スコアを得る、再び試す」というループが、単に例を見せて「これが正解です」と言うよりも、ロボットをはるかに正確にすることを発見しました。

結果

これら3つの手法を組み合わせることで、POINTS-GUI-Gモデルは画面上のものを見つけるチャンピオンとなりました。

  • 彼は、より巨大で高価な他の多くのモデルを打ち負かしました。
  • 電話、コンピュータ、ウェブサイト上のボタン、テキスト、アイコンをどれだけ上手く見つけられるかを測定するテストにおいて、驚異的なスコアを記録しました。

要約すると: トレーニングデータを清掃し、モデルの「目」を自由に学習させ、厳格な「正解か不正解か」の報酬システムを使用すれば、巨大で高価な代替品よりも優れた、効率的で小さなナビゲーション・ロボットを構築できることを、この論文は示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →