← 最新の論文
🤖 AI

Probing Perceptual Constancy in Large Vision-Language Models

本研究は、色、大きさ、および形状の恒常性に関する236件の実験を通じて155種類の視覚言語モデルを評価し、顕著な性能の変動と、形状の恒常性の能力と色および大きさの恒常性の能力との間の明確な解離を明らかにしている。

原著者: Haoran Sun, Bingyang Wang, Suyang Yu, Yijiang Li, Qingying Gao, Haiyun Lyu, Lianyu Huang, Zelong Hong, Jiahui Ge, Qianli Ma, Hang He, Yifan Zhou, Lingzi Guo, Lantao Mei, Maijunxian Wang, Dezhi Luo, Ho
公開日 2026-02-09
📖 1 分で読めます☕ さくっと読める

原著者: Haoran Sun, Bingyang Wang, Suyang Yu, Yijiang Li, Qingying Gao, Haiyun Lyu, Lianyu Huang, Zelong Hong, Jiahui Ge, Qianli Ma, Hang He, Yifan Zhou, Lingzi Guo, Lantao Mei, Maijunxian Wang, Dezhi Luo, Hokin Deng

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

赤いリンゴを見ているところを想像してみてください。そこから遠ざかると、リンゴは小さく見えます。青い懐中電灯で照らすと、リンゴは紫色に見えます。横から見ると、円ではなく楕円形に見えます。

人間の脳は驚くべきものです。なぜなら、どのような変化があっても、そのリンゴが「依然として」大きく、赤くて、丸いリンゴであることを理解しているからです。脳は、距離による変化や、奇妙な光、あるいは角度に騙されることはありません。このスーパーパワーのことを**知覚恒常性(Perceptual Constancy)**と呼びます。

この論文は、155種類もの異なる「AIの脳」(ビジョン・ランゲージ・モデルと呼ばれます)に対して、彼らがこのスーパーパワーを持っているかどうかを確認するための、巨大な成績表のようなものです。研究者たちは、この能力をチェックするために、「ConstancyBench」という特別なテストを構築しました。このテストでは、3つの特定のスキルを検証しています。

1. テストされた3つのスキル

これらのスキルを、ビデオゲームの異なるレベルだと考えてください。

  • 色彩恒常性(「照明」レベル): AIは、部屋が黄色いランプや青いネオンサインで照らされていても、白い壁が「白」であることを理解できるでしょうか?
    • テスト内容: AIは、奇妙な照明の下にあるルービックキューブを見て、真ん中の正方形の本来の色を推測しなければなりません。
  • 大きさの恒常性(「距離」レベル): AIは、遠くにある車が、画面上では小さく見えても、すぐ隣にある車と同じ大きさであることを理解できるでしょうか?
    • テスト内容: AIは、1つは遠くに、もう1つは近くにある2本のミサイルを見て、それらが実際に異なるサイズなのか、それとも遠近法によって違って見えるだけなのかを判断しなければなりません。
  • 形状恒常性(「角度」レベル): AIは、丸い皿が傾いて楕円形に見えても、それが依然として円であることを理解できるでしょうか?
    • テスト内容: AIは、少し開いて傾いているドアを見て、それが台形に見えても、実際には長方形であることを理解しなければなりません。

2. 結果:誰が合格したのか?

研究者たちは、小型で軽量なものから、非常に賢い巨大なもの(GPT-4oなど)まで、155種類の異なるAIモデルをテストしました。その結果、以下のことが判明しました。

  • 「形状」のスキルは簡単: AIモデルは、形状恒常性については驚くほど優秀でした。これは、彼らが物の「輪郭」を認識するのが得意であることを意味します。小さなモデルであっても、傾いた長方形が依然として長方形であることを理解できました。
  • 「色」と「大きさ」のスキルは難しい: モデルは色彩大きさにおいて、より苦戦しました。彼らは照明や距離に騙されることがよくありました。それはまるで、AIが平坦な写真を見ているだけで、世界が3Dであり、光が変化することを忘れてしまっているかのようです。
  • 大きな脳ほど優秀: 明確なルールがありました。AIモデルが大きければ大きいほど、これらのテストにおいて優れた成績を収めるということです。
    • 小さなモデルは、単純なトリックに混乱して失敗することがよくありました。
    • 巨大なモデル(AI界の「巨人」たち)は、特にサイズや距離の理解において、より優れた成績を収めました。AIに「脳のパワー」(パラメータ)を与えるほど、3Dの世界を理解するのが上手くなるようです。

3. 大きな教訓

この論文は、AIはまだ人間のような完璧な視覚を持っていない、と結論付けています。代わりに、AIは**層状の(stratified)**視覚を持っています。

  • 幾何学的な形状(形状)については得意です。
  • スケールや照明(サイズと色)を理解することについては、モデルが巨大であればこそ、向上しつつあります。

著者たちは、これらのAIモデルは賢くなっているものの、人間と同じように世界を「見ている」わけではないかもしれない、と示唆しています。彼らは物理法則を真に理解しているのではなく、学習データの中で見たパターンに基づいて、非常に巧みに「推測」しているだけなのかもしれません。

要約すると: AIに形を特定させるのは通常得意です。しかし、照明や距離がトリッキーな状況で、ある物の「本当の」大きさや色を判断させようとすると、彼らはまだ学習の過程にあります。そして、AIが大きければ大きいほど、騙される可能性は低くなります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →