← 最新の論文
🤖 AI

FINER: MLLMs Hallucinate under Fine-grained Negative Queries

この論文は、既存のベンチマークでは見落とされがちな画像内の細かな不一致に起因するマルチモーダル大規模言語モデルの幻覚現象を特定・分析するための「FINER」フレームワークとベンチマーク、およびそれに基づく DPO を活用した「FINER-Tuning」手法を提案し、幻覚の大幅な削減と汎用性能の向上を実現したことを示しています。

原著者: Rui Xiao, Sanghwan Kim, Yongqin Xian, Zeynep Akata, Stephan Alaniz

公開日 2026-03-19
📖 1 分で読めます☕ さくっと読める

原著者: Rui Xiao, Sanghwan Kim, Yongqin Xian, Zeynep Akata, Stephan Alaniz

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

この論文は、**「AI が画像を見て『あるもの』を『ないもの』と間違えて見たり、細かな違いに気づけなかったりする問題(幻覚)」**を解決しようとする新しい研究です。

タイトルは**「FINER」(より細かく、より鋭く見る)。
内容を、
「AI への『細かな嘘』を見抜くテスト」**という物語として解説します。


1. 問題:AI は「大きな嘘」には強いが、「小さな嘘」には弱い

これまでの AI(マルチモーダル大規模言語モデル)は、画像を見て「犬がいる?」「車がある?」といった大きな質問にはよく答えられます。

しかし、人間が日常的に使うような**「細かなニュアンス」**が含まれる質問になると、AI はつまずきます。
例えば、画像に「茶色い猫」がいるのに、AI は「黒い猫」がいると答えてしまったり、「ソファに座っている猫」を「椅子に座っている猫」と勘違いしたりします。

これまでのテストは、「猫がいるかいないか?」という**「粗い(おおざっぱな)」質問しかしていませんでした。しかし、現実の医療診断や精密な作業では、「この腫瘍は『左側』にあるのか『右側』にあるのか?」といった「細かな(ファイングラニュラー)」**違いを見抜く能力が求められます。

2. 解決策:「FINER」という新しいテストとトレーニング

研究者たちは、AI の弱点を突くために、**「FINER」**という新しいテストセットと、それを克服するためのトレーニング方法を開発しました。

🔍 FINER テスト:「AI に細かな嘘をついてみる」

このテストでは、AI に**「画像に存在しないもの」「間違った特徴」**を混ぜた質問をします。

  • 例: 画像には「赤いリンゴ」があるのに、「青いリンゴ」があるか?と聞く。
  • 例: 「犬がボールの後ろにいる」画像なのに、「犬がボールのにいる」という質問をする。

これまでのテストは「猫がいるか?」(Yes/No)だけでしたが、FINER は**「猫と犬がいるか?」「猫の耳は垂れているか?」「猫はソファの下にいるか?」**のように、複数の要素(物体・特徴・関係性)を同時に組み合わせた複雑な嘘を投げかけます。

結果:
多くの最新の AI でも、この「細かな嘘」には弱く、「あるはずのないもの」を「ある」と言ってしまい(偽陽性)、画像にないものを勝手に想像して答えてしまうことがわかりました。

🎓 FINER-Tuning:「嘘を見抜くトレーニング」

では、どうすれば AI は嘘を見抜けるようになるのでしょうか?
研究者たちは、**「DPO(直接選好最適化)」**という手法を使って、AI に特別なトレーニングを行いました。

  • 従来のトレーニング: 「正解」だけ教える。
  • FINER-Tuning: 「正解」と「細かな間違いが含まれた回答」の両方を比較させ、「どちらが正しいか」を AI に選ばせます。

アナロジー:
まるで、**「料理の味見テスト」**のようなものです。

  • 普通のトレーニング: 「これは美味しいスープだ」と教える。
  • FINER-Tuning: 「これは美味しいスープだ」と「塩が少し多すぎたスープ」を並べて、「どっちが本物か?」を判断させる。
    この「違い」を徹底的に学習させることで、AI は「塩の量(細かな特徴)」に敏感になり、嘘を見抜けるようになります。

3. 成果:AI が「賢い」になる

このトレーニングを行った結果、驚くべき変化が起きました。

  1. 嘘を見抜く力が劇的に向上:
    細かな嘘が含まれる質問に対する正解率が、最大で24.2% 向上しました。AI は「ないもの」を「ない」と言えるようになり、勝手に想像して答える癖が直りました。
  2. 他の能力も落ちない:
    通常、特定の能力を強化すると、他の能力が落ちる(トレードオフ)ことがありますが、FINER-Tuning は**「嘘を見抜く力」を上げても、「画像の説明力」や「一般的な知識」は維持、あるいは向上させました。**
  3. 幅広いテストで通用:
    今回作ったテストだけでなく、他の既存の「幻覚テスト」でも、AI の性能が全体的に上がりました。

4. まとめ:なぜこれが重要なのか?

この研究は、**「AI が単に『ある・ない』を答えるだけでなく、人間のように『細かな違い』を理解し、誤った前提(嘘)を正しく拒絶できること」**の重要性を証明しました。

イメージ:
これまでの AI は、**「大きな看板」は読めても、「小さな文字の誤字」には気づかない子供のようなものでした。
FINER という新しい「細かな嘘のテスト」と、それに対応するトレーニングによって、AI は
「細かい文字まで読み込み、嘘を見抜く大人」**へと成長しました。

これにより、医療診断や法廷での証拠分析など、**「ミスを許さない分野」**で、より信頼性の高い AI を使えるようになることが期待されています。


一言で言うと:
「AI に『細かな嘘』をたくさん見せて、それを『見抜く力』を鍛えたら、AI は幻覚(嘘)を見抜く天才になったよ!」というお話です。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →