← 最新の論文
💬 NLP

DECK: A Consistency x Confidence Taxonomy of LLM Hallucinations

本論文は、サンプル間の整合性とトークンレベルの確信度に基づく検出シグネチャによってLLMのハルシネーションを分類する新しい2x2のタクソノミーであるDECKを導入しており、特定の誤りタイプ(Drift、Entrenched、Confabulation、Knotted)が個別の検出手法を必要とすること、および知識の欠落がある入力に対して確信度が高く反復的な捏造が行われる際に、現在の出力レベルの不確実性定量化アプローチでは検出不可能となる普遍的な盲点が露呈していることを明らかにしている。

原著者: Mohit Singh Chauhan

公開日 2026-06-02✓ Author reviewed
📖 1 分で読めます☕ さくっと読める

原著者: Mohit Singh Chauhan

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢く、自信満々なロボットが質問に答えている場面を想像してください。時々、このロボットは作り話をすることがあります。私たちはこうした間違いを「ハルシネーション(幻覚)」と呼んでいます。

長い間、研究者たちは、何が間違っているのか(例:「事実を間違えた」や「推論が不適切だった」)によって、これらの間違いを分類しようとしてきました。しかし、この論文の著者であるMohit Singh Chauhan氏は、それは自動車事故を「木に衝突した」対「壁に衝突した」という形で分類するようなものだと述べています。それは「何が起きたか」は教えてくれますが、「衝突する前にどうやってドライバーを捕まえるか」までは教えてくれません。

この論文は、DECKと呼ばれる新しい分類法を紹介しています。間違いの「内容」を見るのではなく、その間違いが残す「信号(シグナル)」に注目します。それは、「どのタイプの検知器なら、この間違いを見つけ出せたか?」と問いかけるのです。

2つの検知器(2つの軸)

彼らはこのシステムを構築するために、ロボットを見守る2つのシンプルな「センサー」を使用しています。

  1. 一貫性センサー(「繰り返し」テスト): ロボットに同じ質問を10回したとき、毎回同じ答えを返しますか?
    • 高一貫性: 同じ答えを繰り返している。
    • 低一貫性: 毎回異なる答えを返している。
  2. 自信センサー(「確信」テスト): ロボットはどれくらい自信を持っているように聞こえますか? 100%の確信を持って答えていますか? それとも、ためらっているように聞こえますか?
    • 高自信: 「100%確実です」
    • 低自信: 「たぶん……だと思います」

DECKの分類学(4つのボックス)

これら2つのセンサーを組み合わせることで、著者らは2x2のグリッドによる4種類のミスを作成しました。彼らはそれぞれにキャッチーな名前を付けています。

1. Drift(ドリフト:迷走する漂流者)

  • 見た目: ロボットは自信満々ですが、質問するたびに異なる間違った答えを出します。
  • 例え: ガイドが非常に声が大きく自信たっぷりなのに、あなたが「博物館はどこですか?」と聞くたびに、毎回違う方向を指差している様子を想像してください。彼らは自信を持っていますが、漂流(ドリフト)しています。
  • 誰が捕まえるか? ブラックボックス型検知器(回答同士が一致するかどうかをチェックするもの)がこれを捉えます。なぜなら、回答が一致しないからです。

2. Entrenched(エントレンチド:頑固なラット)

  • 見た目: ロボットは自信満々で、毎回全く同じ間違った答えを出し続けます。
  • 例え: これは、間違った解答集を暗記してしまった学生のようなものです。「2+2は?」と聞けば、何度聞かれても自信たっぷりに「5です」と答えます。彼らは誤った概念に固執(エントレンチド)しています。
  • 誰が捕まえるか? これは最も難しいケースです。一貫性検知器は、答えが一致しているため「正しい」と判断してしまいます! これを捕まえられるのは、ジャッジ(判定役)、つまり事実を知っている独立した別のAIだけです。

3. Confabulation(コンファビュレーション:ためらう作り話)

  • 見た目: ロボットは自信がなく、質問のたびに異なる間違った答えを出します。
  • 例え: ロボットが「分かりませんが、こう推測します……あ、やっぱりこうかもしれません」と言っているようなものです。作り話をしているものの、自分でも推測であることを自覚しています。
  • 誰が捕まえるか? 誰もがこれを捕まえられます。自信が低く、一貫性もないため、すべての検知器がこれを「リスクが高い」とフラグ立てします。

4. Knotted(ノッテッド:絡まった茂み)

  • 見た目: ロボットは自信がなく(低自信)、しかし毎回全く同じ間違った答えを繰り返します。
  • 例え: ロボットが間違えることを恐れていて、「確信はありませんが、おそらくXだと思います」と言い続け、毎回「おそらくX」と繰り返している様子を想像してください。それは、安全で反復的な、しかし間違ったパターンの中に「結び目(ノット)」のように囚われています。
  • 誰が捕まえるか? ホワイトボックス型検知器(ロボットの内部的な計算を見るもの)がこれを捕まえます。なぜなら、ロボットの内部計算では、答えが繰り返されていても実際には確信を持っていないことが示されるからです。

大きな発見: 「ユニバーサル・ブラインドスポット(普遍的な盲点)」

論文は、すべての検知器が同時に失敗してしまう恐り高い状況を発見しました。

彼らは、誰も答えられない質問(例:「まだ存在しない国の首都は何ですか?」)を用いてロボットをテストしました。

  • ロボットは「分かりません」とは言いませんでした。
  • 代わりに、自信たっぷりに偽の答えを作り上げ、それを毎回繰り返しました。

これにより、完璧な罠が完成しました:

  • 一貫性センサーは、答えが繰り返されているのを見て、「素晴らしい、一貫している!」と判断しました。
  • 自信センサーは、自信たっぷりに聞こえるのを見て、「素晴らしい、自信がある!」と判断しました。
  • ジャッジも失敗しました。なぜなら、ジャッジ自身もその答えを知らない(国が存在しないため)からです。

著者らはこれを**「ユニバーサル・ブラインドスポット(普遍的な盲点)」**と呼んでいます。ロボットが、自分が何も知らない事柄について自信たっぷりに嘘を繰り返し、それを固定化させたとき、現在の検知器ではそれを捕まえることはできません。

解決策

この論文は、これらの特定の嘘を捕まえるためのより優れた検知器を作るのではなく、**「リフューザル・エンベロープ(拒絶の封筒)」**を構築すべきだと提案しています。これは、クラブの入り口に立つボディーガードのようなものです。もし質問が、ロボットが知るべきではないこと(知識の空白)に関するものであれば、ボディーガードはロボットが何かを作り出す前に、「その質問には答えられません」と制止し、回答自体を防ぐべきなのです。

まとめ

この論文は単に「AIは間違いを犯す」と言っているのではありません。「AIは4つの特定のパターンで間違いを犯す。いくつかのパターンは捕まえやすく、いくつかのパターンは難しい。そして、一つの特定のパターン(未知のことに対して自信たっぷりに嘘を繰り返すこと)は、現在、標準的なツールでは捕まえることが不可能である。私たちは、ロボットがそれらの質問に答える前に、回答を阻止する必要がある」と述べているのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →