← 最新の論文
💻 computer science

DeFacto: Counterfactual Thinking with Images for Enforcing Evidence-Grounded and Faithful Reasoning

本論文は、言語誘導型パイプラインを活用して専門的なデータセットを生成し、多面的な報酬に基づく GRPO 型強化学習を採用することで、マルチモーダル言語モデルの回答精度と証拠に基づく一貫性を大幅に向上させる、対照推論フレームワークである DeFacto を紹介する。

原著者: Tianrun Xu, Haoda Jing, Ye Li, Yuquan Wei, Jun Feng, Guanyu Chen, Haichuan Gao, Tianren Zhang, Feng Chen

公開日 2026-05-21
📖 1 分で読めます☕ さくっと読める

原著者: Tianrun Xu, Haoda Jing, Ye Li, Yuquan Wei, Jun Feng, Guanyu Chen, Haichuan Gao, Tianren Zhang, Feng Chen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが写真に関する質問に答えるテストを受けていると想像してください。ほとんどの賢いコンピュータプログラム(マルチモーダル大規模言語モデルと呼ばれる)は、本で読んだ内容に基づいて推測するのが非常に得意な生徒のようですが、目の前の実際の写真を見ようとしません。彼らは正しい答えを出すかもしれませんが、その理由は誤っていたり、写真の全く異なる部分を見ていたりする可能性があります。

この論文は、この問題を修正するための新しい手法「DeFacto」(「De Facto」の略で、「実際に」を意味する)を紹介しています。DeFacto は、生徒が実際に写真を見ていることを証明するまで回答を許さない、厳しい教師のようなものです。

以下に、簡単な比喩を用いて仕組みを分解して説明します。

1. 問題:「偽りの専門家」

現在の AI モデルは、しばしば以下の 3 つの特定の「不正」習慣に悩まされています。

  • 盲目の推測: 画像の誤った部分を見て、誤った答えを出す。
  • 幸運な推測: 画像の誤った部分を見るが、何らかの理由(運やテキストの暗記による)で偶然正しい答えを当てる。
  • 誠実な過ち: 画像の正しい部分を見るが、それでも答えを間違える(関連性を結びつけられないため)。

この論文は、「賢い」だけでは不十分だと主張しています。AI は忠実である必要があります。つまり、その答えは実際に何を見ているかに直接結びついていなければなりません。

2. 解決策:「欠けたピース」ゲーム

AI が不正を止めるように教えるため、研究者たちは反事実的思考と呼ばれる特別なトレーニングゲームを作成しました。「ウォーリーはどこ?」というゲームを、少しひねって遊んでいると想像してください。

  • ラウンド 1(正のケース): AI にヒントがはっきり見える完全な写真を見せます。AI はヒント(赤い帽子や特定の看板など)を見つけ、質問に答える必要があります。正解すれば、ゴールドスターが与えられます。
  • ラウンド 2(反事実的ケース): ここが魔法のパートです。研究者たちは、AI が必要とする正確なヒント(赤い帽子など)を取り出し、黒い箱で覆います(マスキング)。そして、AI に同じ質問をします。
    • AI がそれでも推測しようとした場合、大きなペナルティを受けます。
    • AI が**「わかりません、ヒントがありません」**と言う場合、ゴールドスターが与えられます。
    • これが重要な理由: これにより、証拠がない場合は答えを知ったふりをしてはいけないと AI に教えます。AI は幻覚を見るのではなく、無知を認めることを学びます。
  • ラウンド 3(ランダムマスキングケース): 研究者たちは、重要ではない部分(空や背景の木など)を覆います。AI はそれでも正しく答えなければなりません。これにより、AI が「黒い箱」=「答えない」と学習するのを防ぎます。AI は「欠けた証拠」と「無関係な背景」を区別することを学びます。

3. トレーニングプロセス:「評価された宿題」

研究者たちは、これらの質問を手作業で作成しませんでした(それは永遠にかかってしまいます)。代わりに、以下のロボットパイプラインを構築しました。

  1. 質問を読む。
  2. 画像の重要な部分(「シャツの文字」や「木の葉」など)を自動的に特定する。
  3. これらの「覆い隠し」バージョンの画像を数千枚作成する。

彼らは AI を訓練するためにDeFacto-100K(10 万の例)と呼ばれる大規模なデータセットを作成しました。

その後、GRPO(グループ相対方策最適化)と呼ばれる特別なトレーニング手法を使用しました。これは、AI がゲームを 4 回連続でプレイするのを見守るコーチのようなものです。もし AI が他の 3 ラウンドの平均よりも 1 ラウンドでうまくいけば、報酬が与えられます。これにより、AI は一貫して学習します。常に証拠を探し、それがなければ「わかりません」と言う。

4. 結果:より良い生徒

彼らがこの新しい「DeFacto」AI を他のトップモデルと比較してテストしたところ、以下の結果が得られました。

  • より多くの質問に正解した。
  • だますのがはるかに難しかった。 証拠が隠されたとき、DeFacto AI は他のモデルが推測し続ける中で、はるかに頻繁に正しく「わかりません」と答えました。
  • より正直だった。 答えの理由をでっち上げるのをやめました。もし答えを正当化するために画像の特定の部分を指し示したなら、その部分には実際に証拠が含まれていました。

まとめ

要約すると、DeFactoは、AI モデルに正直な探偵になるよう教えるトレーニング手法です。単に「あり得る」ことに基づいて答えを推測するのではなく、以下のように訓練されます。

  1. 具体的な視覚的証拠を見つける。
  2. 証拠が欠けている場合は、知らないことを認める。
  3. 証拠がある場合は、それを使って答えを証明する。

この論文は、これにより AI の推論がより信頼性があり、現実に根ざしたものになり、聞こえは良いが真実ではない物語を作り出すのを防げると主張しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →