ROSE: Benchmarking the Perception-to-Action Gap in Multimodal Models
本論文は、マルチモーダル大規模言語モデルが視覚的な計数と文脈条件付きの行動との間に著しい性能格差に苦しんでいることを示す制御されたベンチマークであるROSEを導入しており、人間が高い性能を示すにもかかわらず、共有された視覚的証拠をタスク固有の振る舞いへと変換する際の明確なボトルネックが存在することを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、壁にある100個の全く同じに見えるステッカーが並んだ巨大なグリッドを見ていると想像してください。突然、そのうちの3つが少し異なっていることに気づきました。例えば、一つが逆さまになっていたり、小さな傷があったりします。
次に、あなたの隣にロボットが立っているところを想像してください。あなたは、そのロボットに対して、この「全く同じ壁」について3つの異なる質問を投げかけます。
- カウント(数): 「変なステッカーは全部でいくつありますか?」
- ゾーン(領域): 「左上のコーナーには、変なステッカーがいくつありますか?」
- アクション(動作): 「左上のコーナーにある、すべての変なステッカーを指差してください。」
ROSEという論文によれば、今日の最も賢いAIモデルの多くは、最初の2つの質問には答えることができますが、3番目の質問には非常に苦戦します。彼らは奇妙なステッカーの数を完璧に数えることができますが、特定のルールに基づいて「物理的に指し示す」よう求められると混乱し、間違った場所を指したり、ゾーンの外にあるステッカーを指したりしてしまいます。
以下に、簡単な比喩を用いて、この論文が発見した内容を詳しく説明します。
1. 問題点:「は見えているが、動けない」
研究者たちはこれを**「知覚と動作のギャップ(Perception-to-Action Gap)」**と呼んでいます。
AIを、棚にある赤い本の数を瞬時に教えられる非常に賢い司書だと考えてみてください。しかし、もしあなたが「3番目の棚に行って、赤い本を見つけて、それを取り出してください」と言ったら、彼らは立ち往生してしまうかもしれません。彼らは「何を探すべきか」は分かっていますが、その知識を、新しいルールに基づいた具体的かつ精密な動作へと変換することに苦労しているのです。
この論文では、たとえ最高峰のAIモデル(GPT-5.5やGeminiなど)であっても、「数える」ことから「特定の場所をクリックする」ことへとタスクが変わると、パフォーマンスが大幅に低下することが発見されました。あるモデルでは、単に「数を言う」ことから「場所を示す」ことに変わっただけで、精度が45%近くも低下しました。
2. テスト:「オッド・ワン・アウト(仲間外れ)グリッド・ゲーム」
これを証明するために、チームはROSEと呼ばれるベンチマークを構築しました。
- セットアップ: 彼らは、ほとんど同一のアイテム(非常によく似た漢字や、少しずつスタイルが異なる絵文字など)で満たされた、数千のグリッド画像を作成しました。
- ひねり: すべての画像には、「多数派」のアイテム(通常のアイテム)と、数個の「例外」(変なアイテム)が含まれています。
- チャレンジ: AIは、画像自体は同じまま、ルールが毎回変わるゲームをプレイします。
- ラウンド1: すべての変なものを数える。
- ラウンド2: 特定のボックスの中にある変なものだけを数える。
- ラウンド3: そのボックスの中にある変なものをクリックする。
- ラウンド4: そのボックスの「外」にある変なものをクリックする。
これは、「ウォーリーを探せ」のようなゲームですが、ルールが「ウォーリーを探せ」から「キッチンの中にいるウォーリーだけを探せ」、そして「キッチンの中にいるウォリーに触れ」へと変化していくようなものです。画像は変わりませんが、AIへの指示が変わります。
3. 結果:「カウント vs クリック」のギャップ
結果は驚くべきものでした。
- 人間: ほぼ完璧です。グリッドを見せて「数えて」と言われ、次に「クリックして」と言われた場合、人間はどちらもほぼ100%の正確さでこなすことができます。
- AIモデル: 正しく数えることは(知覚)できます。しかし、特定の場所をクリックするように(動作)求められると、頻繁に失敗します。
- 例: あるモデルは、「変なステッカーは3つあります」と正しく言えるかもしれません。しかし、「左上のコーナーにあるものをクリックしてください」と言われると、3つのステッカーをクリックしますが、その中には実際にはコーナーの外にあるものが含まれていたり、あるいは間違った3つをクリックしたりします。
この論文は、「答えを知っていること」と「答えを実行できること」は別物であることを示しています。AIは「全体像」に囚われてしまい、特定のローカルなルール(特定のボックスや除外ゾーンなど)を適用することを忘れてしまうのです。
4. なぜこのようなことが起こるのか?
研究者たちは、なぜAIが失敗するのかを掘り下げました。それは単にAIが数学に弱いとか、ピクセルが見えていないからではありません。
- フォーマットのエラーではない: AIは単に間違った言葉を打っているわけではありません。実際に間違った座標を選択しています。
- 「コンテキスト(文脈)」の問題: AIは、全体的な理解(「変なものが3つある」)を得た上で、それを特定のコンテキスト(「でも、私は青いボックスの中にあるものだけが欲しい」)に合わせて再調整することに苦労しています。
- 「アンカリング(固執)」の失敗: 時として、AIは総数に「アンカー(固定)」されてしまいます。もし全体で3つの変なものが見えた場合、ボックス内のものを求められても、依然として3つのものをクリックしようとしてしまうことがあります。元の数字を手放すことができないのです。
5. まとめ
この論文は、AIが世界を「見て」「記述する」ことには非常に長けてきていますが、ルールが変わった際に、その世界に対して精密に「行動する」ことには依然として苦戦していると結論付けています。
これは、1マイル先から赤信号を見つけることは得意だが(知覚)、信号が変わった瞬間に正確にブレーキを踏むこと(動作)に苦労するドライバーのようなものです。特に、周囲の車や看板が視界を混乱させている場合に顕著になります。
ROSEベンチマークは、まさにこのギャップを測定するために設計された新しいツールです。AIが真に現実世界のタスク(画面上のボタンをクリックしたり、部屋を移動したりすること)で役立つためには、見たものを、現在の状況における「正確な動き」へと変換する能力を高める必要があることを、この研究は示しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。