← 最新の論文
💻 computer science

VISTAQA: Benchmarking Joint Visual Question Answering and Pixel-Level Evidence

本論文は、視覚的質問応答の正しさとピクセルレベルの証拠接地の精度を同時に評価するために設計された包括的なベンチマークVISTAQAと、GROVE評価指標を導入し、視覚的証拠と回答を整合させることに失敗している現在のマルチモーダルモデルにおいて顕著な性能格差が露呈していることを明らかにする。

原著者: Mozhgan Nasr Azadani, Yimu Wang, Yongpeng Zhu, Lihong Chen, Milan Ganai, Sean Sedwards, Marco Pavone, Krzysztof Czarnecki

公開日 2026-05-21
📖 1 分で読めます☕ さくっと読める

原著者: Mozhgan Nasr Azadani, Yimu Wang, Yongpeng Zhu, Lihong Chen, Milan Ganai, Sean Sedwards, Marco Pavone, Krzysztof Czarnecki

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

探偵を雇って、たった一枚の写真に基づいて謎を解かせる状況を想像してください。

過去には、探偵が犯人の名前を正しく言い当てれば、あなたは彼を雇いました。彼がどのようにそれを知ったかなど、気にしませんでした。ひらめき、ステレオタイプ、あるいは単なる幸運な推測に基づいて推測していたかもしれません。「それは執事だ」と言い、それが正しければ、彼には金メダルが与えられました。写真の中の間違った人物を指差して「ほら、あれが執事だ!」と言ったとしても、名前が正しければ、あなたは依然として彼に金メダルを与えました。

この論文は、AI をテストするこの古い方法が破綻していると主張しています。それは、正解を導き出すことはできても、その証拠を示すことができない探偵を雇うようなものです。

問題:「幸運な推測」AI

著者らは、現在の AI モデル(マルチモーダル大規模言語モデルと呼ばれる)は、正しい単語を推測することには長けていると述べています。しかし、なぜそれが正しいのかを証明することには極めて不得意です。

  • 「テキストのみ」の罠: AI が「あの犬には足が三本ある」と言っても、写真の中の犬が明らかに四本足であっても、AI は「三本」と言うかもしれません。それは、テキストから犬は通常四本足だと学習したためか、あるいは単に推測したためです。もし偶然に数字が正しければ、私たちはそれを評価します。
  • 「グラウンディングのみ」の罠: 逆に、一部の AI モデルは写真の中のものを指し示すこと(犬の周りに円を描くなど)には優れていますが、質問に答えることには劣ります。彼らは犬を完璧に指し示す一方で、「これは猫だ」と言うかもしれません。

この論文はこれを「モダリティのギャップ」と呼びます。AI の脳(テキスト)と目(視覚)が適切に連携していないのです。

解決策:VISTAQA(「作業過程を見せろ」テスト)

これを修正するために、著者らはVISTAQAと呼ばれる新しいテストを考案しました。

VISTAQA は、最終的な答えだけでなく、あなたの作業過程も評価する厳格な教師だと考えてください。

  • ルール: 合格点を得るためには、AI は同時に以下の二つのことを行わなければなりません。
    1. 質問に正しく答える(例:「その車は赤い」)。
    2. 画像内の赤い車の正確なピクセル上にマスク(ハイライトのようなもの)を描くことで、それを見たことを証明する。

AI が答えは正しくても、間違った車をハイライトすれば不合格です。正しい車をハイライトしても「青い」と言えば不合格です。高い評価を得るには、両方を完璧に行わなければなりません。

データセット:多様な課題の集合

このテストは単一タイプの質問だけではありません。著者らは、以下の内容を含む1,157 個の専門家によるキュレーションされたパズルのライブラリを構築しました。

  • 6 種類の思考: 「この色は何ですか?」(知覚)のような単純なものから、「ロボットアームに近い物体はどれか?」(推論)のような複雑なものまで。
  • 6 つの異なる世界: 屋内の部屋、屋外の通り、数学の図、科学のチャート、ロボット実験室、自動運転車のシーン。
  • 「トリック」質問: 質問の約 27% は罠です。それらは写真に存在しないものについて尋ねます(例:「このキッチンには何頭の赤い象がいるか?」)。賢明な AI は「存在しない」と答え、画像を空白のままにするべきです。「幻覚」を起こす AI は、存在しない赤い象を描こうとします。

成績表:GROVE

二つの異なる方法で正しくある必要があるテストをどのように評価しますか?単にスコアを足し合わせることはできません。テキストで 100% 獲得しても、画像で 0% なら、高い平均値を与えるべきではありません。

著者らはGROVEと呼ばれる新しい採点システムを考案しました。

  • 比喩: 二本脚の椅子を想像してください。一本の脚が折れていれば、椅子は倒れます。「まあ、もう一本の脚は完璧だから、椅子は大丈夫だ」とは言えません。
  • 仕組み: GROVE は「テキストスコア」と「画像スコア」を掛け合わせます。どちらかがゼロ(または非常に低い)場合、最終スコアは急落します。これにより、AI は両方に優れていないと悪い評価を受けることになります。

結果:AI はまだ学習中

著者らは、この新しく厳格なテストで、今日利用可能な最も賢い AI モデル(Google、OpenAI、その他からのモデルを含む)をテストしました。

結論は? 最良のモデルさえも苦労しました。

  • 彼らは正しい単語を推測することには長けていました。
  • 物事を指し示すことにはそこそこできました。
  • しかし、両方を同時に求められると、そのスコアは大幅に低下しました。

この論文は、AI は話すことについては賢くなっているが、まだ同時に「見る」ことと答えを「証明」することを完全に習得していないと結論付けています。AI が言うことと、実際に見ていることの間に、大きな隔たりがあります。

まとめ

  • 古い方法: 正解は得ましたか?はい?お疲れ様でした。(不正や推測かどうかは無視)。
  • 新しい方法(VISTAQA): 正解は得ましたか、そして画像内の証拠を指し示すことができますか?
  • スコア(GROVE): どちらかの部分を欠けば不合格です。
  • 発見: 現在の AI は、まだ答えの鍵を暗記できるが、レッスンを理解していない生徒のようです。彼らは作業過程を示すことを学ぶ必要があります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →