← 最新の論文
💻 computer science

DO-Bench: An Attributable Benchmark for Diagnosing Object Hallucination in Vision-Language Models

本論文は、視覚言語モデル(VLM)における物体幻覚(Object Hallucination)の原因が「テキストの文脈的バイアス」か「視覚的な認識不足」かを切り分けて診断するために、介入実験に基づいた新たなベンチマーク「DO-Bench」を提案するものです。

原著者: JiYang Wang, Jiawei Chen, Mengqi Xiao, Yu Cheng, Yangfu Li, Zhaoxia Yin

公開日 2026-04-28
📖 1 分で読めます☕ さくっと読める

原著者: JiYang Wang, Jiawei Chen, Mengqi Xiao, Yu Cheng, Yangfu Li, Zhaoxia Yin

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

タイトル:AIの「思い込み」と「見落とし」を解剖する:DO-Bench

1. 背景:AIは「見て」いるのか、「勘違い」しているのか?

最近のAI(画像を見て言葉で答えるAI)はとても賢くなりました。しかし、一つ大きな弱点があります。それは**「存在しないものがあると言ったり、あるものを無いと言ったりする(ハルシネーション/幻覚)」**ことです。

これまでのテストでは、「AIが何問正解したか」という合計点数だけを見ていました。しかし、これでは問題の本質が見えません。

例えば、テストで間違えた生徒がいたとします。

  • パターンA: 単純に「見落とし」てしまった(視力の問題)。
  • パターンB: 問題文の「ヒント」に惑わされて、勝手に「こうに違いない!」と思い込んでしまった(思い込みの問題)。

これまでのAIテストは、この2つを区別せずに「点数が低い」と一括りにしていたのです。

2. DO-Benchのアイデア:AIを「追い込む」実験室

研究チームは、AIの弱点を正確に突き止めるために、**「DO-Bench」という新しい実験方法を作りました。これは、AIに対して「視覚的なヒント」「言葉によるプレッシャー」**を、別々に、かつ段階的に変化させていく実験です。

これを**「迷路の中で宝探しをする子供」**に例えてみましょう。

① 「思い込み」のテスト(Prior-Override)

子供に「この箱の中には絶対にリンゴが入っていないよ」と、何度も、強く言い聞かせます。

  • 実験内容: 画像は変えずに、言葉のプレッシャー(「絶対ないよ」「確信を持って、ないよ」)だけを強めていきます。
  • 何がわかるか: もしAIが、実際にはリンゴがあるのに「ありません」と言い出したら、それは**「言葉のプレッシャーに負けて、思い込みで答えてしまった」**ことが分かります。
② 「見落とし」のテスト(Perception-Limited)

今度は、リンゴがとても小さかったり、隠れていたりする状況を作ります。

  • 実験内容: 言葉のヒントは変えずに、次は「リンゴの周りだけを拡大した写真」、次は「リンゴそのもののドアップ写真」と、視覚的なヒントを段階的に分かりやすくしていきます。
  • 何がわかるか: もし、拡大写真を見せた瞬間にAIが「あ、ありました!」と正解できたら、それは**「能力はあるけれど、最初は見落としていただけ(視覚的な情報の不足)」**だったことが分かります。

3. この研究で分かったこと:AIの「成長のクセ」

色々なAIにこのテストをしてみたところ、面白いことが分かりました。

  • 「見る力」は上がっている: AIのモデルを大きく(高性能に)すると、拡大写真を見せれば正解できる「見落とし防止能力」はどんどん上がります。
  • 「思い込み」はなかなか治らない: しかし、言葉で強く「ないよ!」と言われると、高性能なAIであっても、つい流されてしまう傾向があります。つまり、「目(視覚)」は良くなっても、「心(判断力)」はまだ言葉に振り回されやすいのです。

4. まとめ:なぜこれがすごいの?

これまでのAI評価は「テストの点数」だけを見ていましたが、DO-Benchは**「なぜ間違えたのか?」という原因(診断)**を教えてくれます。

  • 「このAIは、もっと目を良くすべきだ(視覚強化)」
  • 「このAIは、もっと頑固になるべきだ(思い込み防止)」

このように、AIの弱点に合わせた「的確なトレーニングメニュー」を作れるようになることが、この研究の最大の貢献です。


一言で言うと:
「AIが間違えたとき、それが『単なる見落とし』なのか『言葉に騙された思い込み』なのかを、実験によってハッキリと見分けるための新しい診断キットを作った」というお話です。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →