← 最新の論文
🤖 AI

How Well Does GPT-4o Understand Vision? Evaluating Multimodal Foundation Models on Standard Computer Vision Tasks

本論文は、GPT-4o などの最先端のマルチモーダル基盤モデルを、新規のプロンプト連鎖フレームワークを用いて標準的なコンピュータビジョンタスクでベンチマークし、それらが強力な意味理解を備えた有能な汎用モデルとして機能する一方で、幾何学的タスクでは専門モデルに後れを取り、特定の失敗モードを示すことを明らかにする。

原著者: Rahul Ramachandran, Ali Garjani, Roman Bachmann, Andrei Atanov, Oğuzhan Fatih Kar, Amir Zamir

公開日 2026-05-04
📖 1 分で読めます☕ さくっと読める

原著者: Rahul Ramachandran, Ali Garjani, Roman Bachmann, Andrei Atanov, Oğuzhan Fatih Kar, Amir Zamir

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してください。非常に頭が良く、読書家である図書館員たちのグループがいます(これらは GPT-4o、Gemini、Claude などのマルチモーダル基盤モデル、つまり MFMs です)。これらの図書館員はインターネット上のほぼすべての本を読み、写真を美しく詩的な詳細で記述することができます。彼らは「この写真で何が起きているのか?」や「この犬についての物語を書いて」といった質問に答えることで有名です。

しかし、EPFL の研究者たちは異なる問いを投げかけました。「これらの図書館員は、実際にプロのフォトグラファーや 3D 建築家の仕事を行えるのでしょうか?」

その答えを探るため、彼らは単に図書館員に会話させるだけでなく、専門的なコンピュータビジョンロボットにのみ通常行われる一連の厳格な技術試験を彼らに課しました。彼らがどのように行い、何を見つけたのかを、簡単に説明します。

課題:「テキストのみ」の問題

主な問題は、これらの AI モデルは描画や測定ではなく、話すように訓練されていることです。標準的なビジョンロボットに「猫を見つけろ」と頼めば、その周りに枠を描きます。テキストベースの AI に頼めば、「猫が見えます」と言うかもしれません。

公平にテストするため、研究者たちは**「プロンプト連鎖(Prompt Chaining)」と呼ばれる翻訳ゲーム**を発明しました。

  • 比喩: あなたが盲目で、巨大な図書館内の特定の書籍を見つけなければならないと想像してください。あなたは見えませんが、ガイドに質問することはできます。
  • 手法: AI に「猫の周りに枠を描け」と頼む(それはネイティブにはできない)代わりに、研究者たちはタスクをテキストベースの小さなステップに分解しました。彼らは AI に尋ねました。「左上の隅に猫はいますか?」「いいえ。」「真ん中に猫はいますか?」「はい。」「では、真ん中の上半分にはいますか?」「はい。」
  • これらの小さな「はい/いいえ」の質問を連鎖させることで、AI は最終的に物体の位置の地図を構築し、テキストのみを実質的に「枠」や「マスク」を描くことになります。これにより、研究者たちは「話す者」と「行う者(専門モデル)」を、全く同じタスクで比較することができました。

試験:何をテストしたのか

研究者たちは、モデルに易しいものから非常に難しいものまで、6 種類の異なるテストを与えました。

  1. 分類: 「これは何ですか?」(シマウマを識別するなど)。
  2. 物体検出: 「シマウマはどこですか?」(その周りに枠を描く)。
  3. セグメンテーション: 「どのピクセルがシマウマに属しますか?」(シマウマを完璧に塗りつぶす)。
  4. グループ化: 「シマウマの耳をタップしたら、どの他のピクセルが同じシマウマに属しますか?」
  5. 深度予測: 「画像のどの部分がカメラに近いでしょうか?」(3D 距離マップを作成)。
  6. 表面法線: 「表面はどの方向を向いていますか?」(この壁は左、右、上、または下を向いていますか?)。

結果:「ジェネラリスト」対「スペシャリスト」

1. 彼らは優れた「ジェネラリスト」ですが、「スペシャリスト」ではありません。
AI モデルは、ジェネラリストとしては驚くほどよく機能しました。彼らは物体を識別し、一般的なシーンを理解する能力において、ランダムな推測よりも優れていました。しかし、彼らは依然として、これらの仕事のために特別に作られた専門ロボットに大きく遅れをとっています

  • 比喩: AI はあらゆることに少し詳しい、優れた一般開業医のようです。専門モデルは神経外科医のようです。一般開業医は頭痛を診断できますが、脳外科医ほど脳手術を上手に行うことはできません。

2. 「意味論的」対「幾何学的」のギャップ
モデルは、意味論的タスク(何が何かを理解する)において、幾何学的タスク(3 次元空間で何がどこにあるかを理解する)よりもはるかに優れていました。

  • 彼らは「あれはシマウマです」と簡単に伝えることができました。
  • しかし、「そのシマウマは 5 メートル先にあり、背中がわずかに左を向いています」と伝えるのに苦労しました。
  • 比喩: 彼らは映画のあらすじを説明するのは得意ですが、セットデザインを描いたり、爆発の物理計算をしたりするのは苦手です。

3. 「ぼやけた視力」の問題
研究者たちが AI に正確な輪郭線を描かせようとすると、モデルはしばしば微細な詳細で苦労しました。まるで彼らが「ぼやけた視力」を持っていたかのようでした。

  • これを修正するため、研究者たちは AI に画像の「拡大された」切り抜き(拡大鏡を通して見るような)を与え、端を明確に見せるように手助けしました。この助けなしでは、AI の輪郭線は乱雑でした。

4. 「推論」モデルがゲームを変えつつある
この論文は、「推論モデル(o1、o3、o4-mini など)」と呼ばれる新しいタイプの AI をテストしました。これらのモデルは回答する前に「考える」ために追加の時間を費やします。

  • 結果: これらの思考モデルは、標準モデルよりもはるかに高度な 3D 幾何学タスク(深度と表面法線)において優れていました。彼らは空間的な関係を理解するために論理を使っているように見えましたが、標準モデルはパターンに基づいて推測しているだけでした。

5. 「幻覚」の問題
研究者たちは、単に話すだけでなく実際に画像を生成(描画)できる最新の GPT-4o をテストしたところ、幻覚を起こしやすいことがわかりました。

  • 比喩: 「シマウマを描いて」と頼めば、シマウマを描くかもしれませんが、偶然ユニコーンの角を追加したり、シマウマの脚を間違った場所に配置したりするかもしれません。画像生成は有望ですが、現時点では正確なタスクには信頼できません。

結論

この論文は、これらの巨大な AI モデルは画像の意味を理解できる印象的な「ジェネラリスト」である一方で、エンジニアや科学者が正確な測定や 3D 再構成のために使用する専門的なツールをまだ代替する準備ができていないと結論付けています。

ただし、「推論」モデルはこのギャップを埋める最初の兆候を示しており、AI がより深く「考える」ことを学ぶにつれて、物理的な 3D 世界を理解する能力が、言語を理解する能力に追いつき始めていることを示唆しています。

重要な注意点: 研究者たちは、彼らの「プロンプト連鎖」法は実用的な使用方法ではなく、テストツールであることを強調しています。それはモデルの身長を測るために定規を使うようなものです。数値を得るための方法ですが、それで家を建てることはしないでしょう。目的は単に、これらのモデルが実際にどれほど優れているかを見ることであり、答えはこうです。「写真について話すのは非常に上手ですが、それを測定する方法はまだ学んでいる最中です。」

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →