赤いリンゴを見ているところを想像してみてください。そこから遠ざかると、リンゴは小さく見えます。青い懐中電灯で照らすと、リンゴは紫色に見えます。横から見ると、円ではなく楕円形に見えます。
人間の脳は驚くべきものです。なぜなら、どのような変化があっても、そのリンゴが「依然として」大きく、赤くて、丸いリンゴであることを理解しているからです。脳は、距離による変化や、奇妙な光、あるいは角度に騙されることはありません。このスーパーパワーのことを**知覚恒常性(Perceptual Constancy)**と呼びます。
この論文は、155種類もの異なる「AIの脳」(ビジョン・ランゲージ・モデルと呼ばれます)に対して、彼らがこのスーパーパワーを持っているかどうかを確認するための、巨大な成績表のようなものです。研究者たちは、この能力をチェックするために、「ConstancyBench」という特別なテストを構築しました。このテストでは、3つの特定のスキルを検証しています。
1. テストされた3つのスキル
これらのスキルを、ビデオゲームの異なるレベルだと考えてください。
- 色彩恒常性(「照明」レベル): AIは、部屋が黄色いランプや青いネオンサインで照らされていても、白い壁が「白」であることを理解できるでしょうか?
- テスト内容: AIは、奇妙な照明の下にあるルービックキューブを見て、真ん中の正方形の本来の色を推測しなければなりません。
- 大きさの恒常性(「距離」レベル): AIは、遠くにある車が、画面上では小さく見えても、すぐ隣にある車と同じ大きさであることを理解できるでしょうか?
- テスト内容: AIは、1つは遠くに、もう1つは近くにある2本のミサイルを見て、それらが実際に異なるサイズなのか、それとも遠近法によって違って見えるだけなのかを判断しなければなりません。
- 形状恒常性(「角度」レベル): AIは、丸い皿が傾いて楕円形に見えても、それが依然として円であることを理解できるでしょうか?
- テスト内容: AIは、少し開いて傾いているドアを見て、それが台形に見えても、実際には長方形であることを理解しなければなりません。
2. 結果:誰が合格したのか?
研究者たちは、小型で軽量なものから、非常に賢い巨大なもの(GPT-4oなど)まで、155種類の異なるAIモデルをテストしました。その結果、以下のことが判明しました。
- 「形状」のスキルは簡単: AIモデルは、形状恒常性については驚くほど優秀でした。これは、彼らが物の「輪郭」を認識するのが得意であることを意味します。小さなモデルであっても、傾いた長方形が依然として長方形であることを理解できました。
- 「色」と「大きさ」のスキルは難しい: モデルは色彩と大きさにおいて、より苦戦しました。彼らは照明や距離に騙されることがよくありました。それはまるで、AIが平坦な写真を見ているだけで、世界が3Dであり、光が変化することを忘れてしまっているかのようです。
- 大きな脳ほど優秀: 明確なルールがありました。AIモデルが大きければ大きいほど、これらのテストにおいて優れた成績を収めるということです。
- 小さなモデルは、単純なトリックに混乱して失敗することがよくありました。
- 巨大なモデル(AI界の「巨人」たち)は、特にサイズや距離の理解において、より優れた成績を収めました。AIに「脳のパワー」(パラメータ)を与えるほど、3Dの世界を理解するのが上手くなるようです。
3. 大きな教訓
この論文は、AIはまだ人間のような完璧な視覚を持っていない、と結論付けています。代わりに、AIは**層状の(stratified)**視覚を持っています。
- 幾何学的な形状(形状)については得意です。
- スケールや照明(サイズと色)を理解することについては、モデルが巨大であればこそ、向上しつつあります。
著者たちは、これらのAIモデルは賢くなっているものの、人間と同じように世界を「見ている」わけではないかもしれない、と示唆しています。彼らは物理法則を真に理解しているのではなく、学習データの中で見たパターンに基づいて、非常に巧みに「推測」しているだけなのかもしれません。
要約すると: AIに形を特定させるのは通常得意です。しかし、照明や距離がトリッキーな状況で、ある物の「本当の」大きさや色を判断させようとすると、彼らはまだ学習の過程にあります。そして、AIが大きければ大きいほど、騙される可能性は低くなります。
技術要約:大規模視覚言語モデルにおける知覚恒常性のプロービング
問題提起
知覚恒常性(照明、距離、視野角などの感覚入力の変化にもかかわらず、物体の特性(色、大きさ、形状)の知覚を安定して維持する能力)は、人間の視覚における基本的な能力である。動的な環境における堅牢な相互作用には不可欠であるが、現在の視覚言語モデル(VLM)が真の知覚恒常性を備えているのか、あるいは単に訓練データ内の統計的な相関関係に依存しているのかは不明なままである。VLMが複雑な推論タスクにおいて人間と同等の性能へと進化するにつれ、その世界モデルの忠実度における限界を特定するために、これらの基本的な知覚メカニズムに関する認知能力を体系的に評価する必要がある。
メソドロジー
著者らは、VLMにおける知覚恒常性を評価するために設計された、CoreCognitionベンチマークから派生した大規模ベンチマークであるConstancyBenchを導入する。
- 範囲と規模: 本研究では、155のVLMを236の実験にわたって評価した。モデルの範囲は、軽量なオープンソースアーキテクチャから、最先端のシステム(GPT-4o、Gemini 1.5 Proなど)まで多岐にわたる。
- 評価ドメイン: 実験は、知覚恒常性の3つの主要な次元に焦点を当てた:
- 色彩恒常性(Color Constancy): 照明の変化にかかわらず、物体の固有の色を識別する能力を評価する(例:異なる照明下にあるルービックキューブ上の緑色の正方形を区別する)。
- 大きさの恒常性(Size Constancy): 距離や網膜像のサイズの変化にかかわらず、物体のサイズが安定していることを認識する能力を評価する(例:遠くにあるミサイルが近くにあるものと同じサイズであるかどうかを判断する)。
- 形状恒常性(Shape Constancy): 視野角やパースペクティブの変化にかかわらず、物体の形状が安定していることを認識する能力をテストする(例:遠近法によって台形に見える場合でも、長方形のドアを長方形として認識する)。
- データソース: データセットは、写真/ビデオ、古典的な認知心理学実験、映画/アニメーション、手描き作品、AI生成画像という6つのソースから抽出された253の認知実験(最終評価には236を使用)で構成されている。
- 実験プロトコル: モデルはゼロショット設定でテストされ、各プロンプトに対して回答とテキストによる説明を生成した。
- 分析フレームワーク:
- 統計分析: ドメイン間の性能を比較するために、一元配置分散分析(one-way ANOVA)および事後検定であるTukey HSDテストを用いた。
- スケーリング分析: モデルのパラメータ数(対数スケール)と性能精度の関係を回帰分析によって調査した。
- 項目応答理論(IRT): 個々のテスト項目の識別力と困難度を分析し、モデルの性能の潜在的な構造を特徴付けるために、2パラメータロジスティック(2PL)モデルを適合させた。
主要な結果
1. 性能の異質性とドメイン間の解離
VLMの性能には大きなばらつきがあり、小規模なモデルでは精度が0.20を下回る一方、最先端のシステムでは0.90を超える。決定的なのは、研究においてドメイン間の明確な解離が見られたことである:
- 形状恒常性: 最も高い平均精度(M = 0.723, SD = 0.170)を達成した。
- 色彩恒常性: 中程度の精度(M = 0.588, SD = 0.185)を達成した。
- 大きさの恒常性: 最も低い精度(M = 0.584, SD = 0.123)を達成した。
統計分析により、形状恒常性の性能は色彩および大きさの恒常性の両方よりも有意に優れていることが確認された(p<0.001)。一方で、色彩と大きさの恒常性の性能は統計的に同等であった(p=0.976)。著者らは、形状恒常性はより単純な幾何学的ショートカットを利用している可能性がある一方で、色彩や大きさの恒常性は高次元のフォトメトリック表現や3Dの世界モデルを必要としているためであると示唆している。
2. スケーリング則
すべてのドメインにおいて、モデルのサイズと知覚の安定性の間に強固な正の相関が存在する。
- 全体: パラメータ数が増加するにつれて精度が有意に向上する(R2=0.2804)。
- ドメイン別の詳細: スケーリング効果は大きさの恒常性で最も強く(R2=0.3080)、次いで形状、色彩の順であった。これは、幾何学的および空間的な推論がモデル容量の拡大から最も直接的な恩恵を受ける一方で、フォトメトリックな不変性はより緩やかに出現することを示唆している。
3. 項目応答理論(IRT)の知見
IRT分析により、課題の困難度と識別力における構造化された階層が明らかになった:
- 形状の項目は、最も低い困難度(bˉ=−1.27)と低い識別力を示し、ほとんどのモデルで解決可能であることを示している。
- 色彩の項目は、最も高い識別力(\bar{a} = 2.25})を示し、高能力モデルと低能力モデルを効果的に分離しており、困難度は中程度であった。
- 大きさの項目は、最も広い困難度の分布を示し、空間推論における要求の多様性を反映していた。
主な貢献
- ConstancyBench: 色彩、大きさ、形状のドメインをカバーする236の制御された実験を含む、大規模なVLMにおける知覚恒常性をプロービングするための初の体系的なフレームワークの確立。
- 経験的特性評価: 知覚恒常性がVLMにおいて統一された能力ではなく、層別化された能力であることを実証した。形状恒常性は小規模なモデルでも堅牢に出現するが、色彩および大きさの恒常性はモデルのスケールとマルチモーダルな統合能力に強く依存する。
- スケーリングに関する洞察: 知覚の堅牢性がモデルサイズとともに向上するという定量化可能なスケーリング則を特定した。特に大きさの恒常性が最も急激な性能向上を示しており、複雑な空間推論のための「創発的閾値」の存在を示唆している。
- 認知的整合性: VLMにおける恒常性の出現階層(形状 → 色彩/大きさ)が、幾何学的安定性が高次の文脈的不変性に先行するという、人間の知覚における発達段階を反映していることを観察した。
意義と主張
本論文は、知覚恒常性が基礎モデルの世界モデルの忠実度を評価するための重要な診断レンズとして機能すると断じている。著者らは、観察された層別化は、VLMが形状に対しては「最小限の恒常性」(蓄積された規則性を通じた表現の保持)を達成している可能性があるものの、色彩や大きさに対しては「文脈的恒常性」(照明、奥行き、パースペクティブに関する明示的な推論を必要とするもの)に苦慮していることを示唆している。
この研究は、予測不可能な現実世界の条件下で動作できる信頼性と適応性を備えたAIを進展させるためには、これらの限界を理解することが不可欠であると主張している。また、現在のモデルが機能的な恒常性(物理的変換に対する真の不変性)を備えているのか、それとも単なる相関的な恒常性(データ被覆の副産物)に過ぎないのかという概念的な問いを投げかけている。著者らは、視覚的知覚と真の物理的理解の間のギャップを埋めるには、単純なスケーリングを超えた、明示的な3Dプライア(事前知識)や因果シミュレーションモジュールのような、これらの不変性をメカニズムとしてモデル化する手法が必要になると結論付けている。
毎週最高の AI 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録