An Exam for Active Observers
本論文は、現在のマルチモーダル大規模言語モデルが、人間のパフォーマンスと比較して反復的な知覚を必要とするタスクにおいてほぼ完全に失敗していることに示されるように、能動的な視覚的観察を行う能力を根本的に欠いていることを示すベンチマークであるActiveVisionを導入するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
散らかった部屋を想像してみてください。カメラがその部屋の静止画を一枚、パシャリと撮ります。もしあなたがコンピュータに、その写真だけをもとに部屋の様子を説明するよう頼んだら、コンピュータは「床に服があり、棚に本があります」と言うかもしれません。しかし、もし青いジーンズの山の下に隠れた特定の赤い靴下を見つけ出したり、絡まったワイヤーの束の中を縫うように通る一本の紐を辿ったりする必要があったらどうでしょう? それをするには、一度見るだけでは不十分です。目を動かし、一点に焦点を合わせ、靴下がどこにあるか推測し、再び見て、探索方法を調整しなければなりません。これは「能動的観察(アクティブ・オブザベーション)」と呼ばれます。それは、単にスナップショットを撮ることと、答えを実際に「探し求める」ことの違いです。人間の視覚と思考を研究してきた科学者たちは、何十年もの間、私たちの脳は単に素早く一瞥するのではなく、手がかりを絶えず再検証する探偵のようなものであることを知っています。
現在、私たちはマルチモーダル大規模言語モデル(MLLM)と呼ばれる強力なコンピュータの脳を持っています。これらはテキストを読み、画像を見ることができるAIシステムであり、写真の描写や単純な質問への回答を求めるテストで完璧なスコアを叩き出すこともよくあります。しかし、ここで大きな疑問が生じます。これらのAIモデルは、本当に人間と同じように「見ている」のでしょうか? 彼らには、画像を何度も確認し、新たな仮説を立て、詳細を見つけ出すという、あの探偵のような能力があるのでしょうか? それとも、彼らは単に素早くスナップショットを撮り、推測を行い、たとえそれが間違っていたとしても、その推測に固執しているだけなのでしょうか? これこそが、新しい論文が解き明かそうとしている謎です。
「An Exam for Active Observers」と題されたこの論文は、「ActiveVision」と呼ばれる全く新しいテストを導入しています。これは、AIにその真の姿を見せつけるために特別に設計された、いわば「強化版の間違い探し」ゲームです。研究者たちは、一度の直感的な一瞥では解くことが不可能な、17種類の異なるパズルを作成しました。あるタスクでは、複雑なパターンの中に散らばった図形を数えることを求められ、別のタスクでは、迷路の中を曲がりくねった経路を迷わずに辿ることを求められ、また別のタスクでは、二つの似たような画像の間にある微細な違いを比較することを求められます。重要なのは、これらのパズルが単なる漫画のようなものではなく、(絡まったロープや航空写真のように)現実のMessy(散らかった)な写真に見えるようにレンダリングされている点です。そして、答えを出すためには、AIが何度も何度も画像に「立ち戻って見る」必要があるのです。
研究者たちが世界で最も賢いAIモデルをテストにかけたところ、結果は衝撃的なものでした。最も優れたモデルであるGPT-5.5(最高レベルの推論を行った場合)でさえ、パズルのわずか約10.6%しか解けませんでした。実際、17種類のタスクのうち11種類において、GPT-5.5は完璧な「ゼロ」を記録しました。もう一つの有力候補であるClaude Fable 5はさらに成績が悪く、わずか3.5%の課題を解決したに過ぎませんでした。一方で、テストを受けた一般の人々である人間の参加者は、平均で96.1%の課題を解決しました。その差は歴然でした。人間は最高のAIよりも約9倍優れていたのです。
研究者たちは、巧妙な回避策も試みました。彼らは、スクリプトが彼らの代わりに「見る」ことができるように、AIモデルに自らコンピュータコードを書いて実行させ、パズルを解かせようとしました。これは多少の効果はあったものの、根本的な解決にはなりませんでした。コードベースのエージェントは、最強のエージェントを用いた場合でも、最大で約50.6%のタスクを解決しましたが、それでも絡まったループを辿るような最も難しいパズルには苦戦しました。標準的なコンピュータビジョンのツールにとって、現実世界の風景のような画像はあまりにも乱雑すぎたため、コードは失敗することが多く、AIはコードがミスをしたことに気づくことができなかったのです。
論文は次のように結論付けています。現在のAIモデルは本質的に「受動的な知覚者」であるということです。彼らは写真を撮り、それをデータのリストに変換し、そのリストから答えを出そうとします。彼らには、注意を能動的に向け直し、仮説を立て、画像に戻って確認するという能力が欠けています。著者らは、AIに「何度も見る」ことを教え、見るという行為と考えるという行為の間のループを閉じるまで、AIは医療スキャンのチェック、工場の部品検査、あるいは複雑な環境のナビゲーションといった、細心の観察を必要とする実世界の仕事において信頼できないままとなるだろうと示唆しています。「ActiveVision」試験は、他のあらゆる知能において優れていても、今日のAIモデルは「真に注視する」という単純な人間の行為においては、依然として非常に拙いものであることを証明しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。