GUI-Primitives: Diagnosing Spatial Reasoning Failures in Vision-Language GUI Grounding
本論文は、視覚言語モデルが空間関係の理解よりも、むしろ候補となるインターフェース要素のローカライズにおいて主に失敗していることを明らかにするベンチマークであるGUI-Primitivesを紹介しており、これは、領域を正解に限定した場合には高い精度を示すものの、制約のない座標予測においては低い性能を示すことによって裏付けられている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ソフトウェアのスクリーンショットを観察し、「保存アイコンの右側にあるボタンをクリックしてください」といった文章を読み取り、マウスカーソルをまさにその場所へと動かすことができるコンピュータを想像してみてください。これは、私たちの代わりにコンピュータを操作するために設計された、新しい世代の人工知能エージェントが提示する約束です。これらのエージェントは、フォームへの入力から複雑なメニューの操作に至るまで、日常的に使用するグラフィカル・インターフェースを「見て」、相互作用できるデジタルアシスタントとして、さまざまなタスクを実行するために構築されています。これらのエージェントが機能するためには、「グラウンディング(接地)」と呼ばれる基本的なスキル、すなわち、文章内の特定の単語を画面上の特定の形状やボタンに結びつける能力を持たなければなりません。もしエージェントが「右側にあるボタン」を確実に特定できなければ、たとえ計画を立てたり文字を入力したりすることにどれほど長けていても、そのタスクを遂行することはできません。
研究者たちは、これらのコンピュータエージェントが時としてミスを犯すことを古くから知っていましたが、その正確な原因を突き止めるのに苦労してきました。コンピュータは画面上のテキストを読めないために失敗しているのでしょうか? それとも「右」という意味を誤解しているのでしょうか? あるいは、単にボタンを見つけることができていないのでしょうか? 既存のシステムテストは、これらのスキルをすべて混ぜ合わせてしまっていることが多く、エージェントが間違った場所をクリックしたときに、どの部分の「脳」が故障しているのかを判別することを不可能にしています。この謎を解くために、科学者チームは、単一の基本的な能力、すなわちコンピュータ・インターフェースにおける空間関係の理解を分離して検証するために設計された、高度に制御された新しいテストを作成しました。
研究チームは、GUI-PRIMITIVESと呼ばれるデータセットを構築しました。これは、約1,000組の質問ペアで構成されています。各ペアは全く同じスクリーンショットと全く同じ開始点(アンカー)を使用していますが、指示の中のたった一つの単語だけを変更しています。あるバージョンでは、特定のアイコンの「左」にある要素をクリックするようにコンピュータに求められます。一方、対となるバージョンでは、同じアイコンの「右」にある要素をクリックするように求められます。画像とアンカーが同一であるため、相違点は方向のみです。もしコンピュータが真に言語を理解しているのであれば、最初の質問では左側のボタンをクリックし、二番目の質問では右側のボタンをクリックするはずです。もし両方の質問に対して同じボタンをクリックしたり、全く別の領域をクリックしたりする場合、それは空間関係の理解における失敗を露呈しています。チームは、高価で強力な商用システムから小規模なオープンソース版に至るまで、19種類の人工知能モデルをこの課題でテストしました。
結果は衝撃的なものでした。最も高度なモデルでさえ性能が悪く、最高のシステムでも正解率はわずか約32パーセントでした。これは、人間がほぼ97パーセントの確率で正解するというパフォーマンスと比較すると、極めて大きな差です。研究者たちは、どこで失敗が起きているのかを理解するために、さらに深く掘り下げました。彼らは、問題の本質はモデルが「左」や「右」という言葉に混乱していることではなく、モデルがそもそも画面上の正しい領域を見つけられていないことにあると発見しました。エラーの60パーセントから92パーセントにおいて、コンピュータの予測クリックは、正しいターゲットとも間違ったディストラクター(妨害要素)とも異なる場所、つまり画像の全く空いている部分に着地していました。
研究者たちがこれらの「迷走した」予測を除外し、コンピュータが実際に2つの候補ボタンのいずれかを指し示した場合のみに注目すると、状況は変わりました。水平方向および垂直方向の指示については、候補を絞り込めていれば、モデルは正しい方を選ぶことが十分にできていました。しかし、あるアイテムがパネルの中に含まれているか、あるいはポップアップウィンドウの後ろに隠れているかといった、より複雑な関係性については、モデルは正しい候補を見ている場合であっても、ランダムに推測しているのと変わらない性能しか示しませんでした。これは、モデルが言葉を理解できていることはあっても、その言葉が画面上のどこに適用されるかを視覚的に特定するというタスクにおいて、著しく苦戦していることを示唆しています。
また、この研究では、これらの空間スキルが現実世界のパフォーマンスにどのように影響するかについてもテストしました。その結果、強い相関関係が見つかりました。基本的な空間テストにおいて優れた成績を収めたモデルは、実際のデスクトップアプリケーションをクリックするという、より複雑なベンチマークにおいても優れた成績を収めていたのです。これは、単純な空間指示を理解する能力が、より高度なコンピュータ操作のための基礎的な構成要素であることを裏付けています。研究者たちは、ステップ・バイ・ステップで思考させるよう指示したり、選択肢を強調するために画面上に視覚的なマーカーを追加したりするなど、モデルを助けるためのいくつかの手法も試みました。候補となるボタンの上に直接番号付きのタグを配置するという手法は、スコアを劇的に向上させ、一部のモデルを30パーセントから90パーセント近くまで引き上げました。しかし、これは診断用のツールであり、実用的な解決策ではありません。なぜなら、タグを配置するためには、コンピュータがすでにボタンの場所を把握していなければならないからです。
結局のところ、この研究は、現在の世代のコンピュータ使用エージェントが、パズルの決定的な欠片を失っていることを明らかにしています。彼らは言語について推論できないから失敗しているのではなく、画面を見ることができないからでもありません。彼らは、単純な空間指示を、混雑した複雑なインターフェース上の特定の場所へと確実にマッピングできていないために失敗しているのです。言葉と視覚的な位置を結びつけるこの根本的なスキルが修正されない限り、これらのデジタルアシスタントは、私たちのデジタル世界をナビゲートするという最も基本的なタスクにおいて、苦戦し続けることになるでしょう。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。