DRAGON: A Benchmark for Evidence-Grounded Visual Reasoning over Diagrams
本論文は、図内の特定の視覚的証拠に基づいて回答を裏付ける視覚言語モデルの能力を評価するために設計されたベンチマークデータセットおよび評価フレームワークであるDRAGONを導入し、信頼できる推論的根拠を欠いたまま高い精度を達成するという限界に対処するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
複雑な図(地図、回路図、または棒グラフなど)を見て、それに関する質問に答えるテストを受けていると想像してください。
過去には、コンピュータプログラム(AI)が正解を出せば、それは画像を「理解」したとみなされていました。しかし、この新しい論文「DRAGON」は、正解を出すだけでは不十分だと主張しています。AI は不正をしている可能性があります。質問の言葉やデータのパターンに基づいて答えを推測し、答えが真実であることを証明する画像の特定の部分を実際には見ていないかもしれません。
数学のテストを受ける学生を想像してください。
- 従来の方法: 学生が答えとして「42」と書けば、教師はチェックマークをつけます。計算をしたのか、ただ推測しただけなのかはわかりません。
- DRAGON の方法: 教師は学生の解答過程を見ることを要求します。学生は使用した特定の数字を丸で囲み、数式へ矢印を引き、「42」に至ったグラフの部分をハイライトする必要があります。証拠を指し示すことができれば、最終的な数値が正しくても、実際には問題を解いたことにはなりません。
DRAGON とは何か
DRAGON は、推測をしている AI モデルを捕捉するために設計された新しい「テスト」(ベンチマーク)です。これはシンプルながら困難な問いを投げかけます:「答えが見つかった場所を、画像のどこに正確に示してください。」
このテストに合格するには、AI は使用した特定の視覚的証拠を枠で囲む必要があります。これらの証拠には以下のようなものがあります:
- グラフ上の特定の棒。
- 地図上のラベル。
- 回路図上の配線。
- 凡例またはタイトル。
テストの構築方法
研究者たちは AI に推測させるだけでなく、6 種類の異なる図(グラフ、地図、回路など)から 11,000 件以上の質問を含む大規模なライブラリを構築しました。
すべての質問において、人間が「真実を語る者」として機能しました。彼らは図と正解を見て、その答えを証明するために必要な視覚的証拠の正確な枠を描きました。
- 比喩: 刑事が事件を解決すると想像してください。人間の注釈付け者は、「証拠は部屋全体ではなく、床にあるこの特定の泥の足跡だ」と言う人々です。AI はその同じ足跡を見つけなければなりません。
AI への 3 つの問いかけ方
研究者たちは、AI が解答過程を示すことを学べるかどうかを確認するために、タスクを依頼する 3 つの異なる「プロンプト(問いかけ方)」を試しました:
- EDGE(直接的アプローチ): 「これが画像と答えです。証拠の周りに枠を描いてください。」(学生に単に答えを書くように求めるようなもの)。
- SAGE(段階的アプローチ): 「まず、何を見る必要があるか(例:『赤い棒』と『2020 年』)を教えてください。その後、それらの周りに枠を描いてください。」(学生に解く前に手順をリストアップするように求めるようなもの)。
- VERGE(自己修正アプローチ): 「枠を描いてください。次に、描いたものを再度確認してください。何か見落としていませんか?枠は大きすぎませんか?修正してください。」(学生に解答を再確認するように求めるようなもの)。
発見されたこと(結果)
結果は、AI 界にとってある種の覚醒の呼びかけとなりました:
- AI は推測は得意だが、証明は苦手: 多くの AI モデルが正解を出しましたが、枠を描くように求められたとき、惨めに失敗しました。画像の誤った部分を指し示したり、重要な詳細を見落としたりすることがよくありました。
- 「ブラックボックス」問題: 最も賢い AI モデル(Claude Opus や Gemini など)でさえ、解答過程を示すことに苦労しました。「答えは 50 です」と言えても、グラフ上の「50」を確実に指し示すことはできませんでした。
- モデルによって差がある: 「クローズドソース」モデル(Anthropic や Google などの大手企業が提供する高価なモデル)は、オープンソースのモデルよりも証拠を見つけるのが上手でしたが、どのモデルも完璧ではありませんでした。
- 丁寧に頼むことは少し役立つ: 段階的(SAGE)または自己修正(VERGE)の方法を使用すると、AI が正しい場所を見つける頻度が少し上がりましたが、根本的な問題は解決しませんでした。AI は依然として証拠の一部を見落とすことがよくありました。
なぜこれが重要なのか
この論文は、AI が正解を出すからといって、図に関する推論を信頼できるわけではないと結論付けています。AI が医療チャート、財務グラフ、または安全図を分析するために使用される場合、なぜその決定を下したのかを知る必要があります。
DRAGON は、AI に推測を止め、「解答過程を示す」ことを強制するツールです。AI が画像を理解していると主張する際に、実際に証拠を指し示せることを保証するための新しい基準です。
限界
著者らは、彼らのテストが完璧ではないことを認めています。証拠のマーキングには単純な長方形の枠を使用しています。これは大きな棒やブロックには機能しますが、回路図の細く曲がりくねった配線や、地図上の曲がった矢印を枠でマークするのは困難です。また、時には異なる人間が、画像のどの部分が「最も重要な」証拠であるかについて意見が分かれることもあり、テストに少しの主観性が加わります。
要約すると:DRAGON は、「答えを渡すだけでなく、画像内の証拠を示せ」と言う新しい規則集です。そして現在、ほとんどの AI 学生はそのテストに不合格です。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。