← 最新の論文
🤖 AI

Entropy Distribution as a Fingerprint for Hallucinations in Generative Models

本論文は、トークンレベルのエントロピー分布を活用してLLMの幻覚を検出する軽量な単一パスのブラックボックス手法である較正エントロピースコア(CES)を導入するものであり、形式的な誤り保証を備え、計算コストの高い多サンプル手法と同等の性能を有する。

原著者: Mattia J. Villani, Pranav Deshpande, Akshay Seshadri, Romina Yalovetzky, Niraj Kumar

公開日 2026-05-28
📖 1 分で読めます☕ さくっと読める

原著者: Mattia J. Villani, Pranav Deshpande, Akshay Seshadri, Romina Yalovetzky, Niraj Kumar

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

物語を語る人の話を聞いていると想像してください。時には、完全に真実で自然に流れる物語を語ります。他の時には、「幻覚」を起こし始めます。つまり、事実を捏造したり、混乱したり、意味の通らないことを延々と話し始めたりするのです。

長らく、これらの嘘を見抜こうとするコンピューターは、以下の二つのいずれかを行わざるを得ませんでした。一つは、物語を5回から6回繰り返させて、詳細が一致するか確認すること(これは遅く、高価です)。もう一つは、物語を語る人の脳内を覗き込み、秘密のメモを確認することです(クローズドシステムでは、これがしばしば不可能です)。

本論文は、物語を1回だけ聞くだけで嘘を見抜く、新しく巧妙な手法を紹介しています。これは「較正エントロピースコア(Calibrated Entropy Score: CES)」と呼ばれます。

以下に、簡単な比喩を用いてその仕組みを説明します。

1. 「自信メーター」(エントロピー)

大規模言語モデル(LLM)が単語を書くたびに、次に何が出てくるかに対する「自信メーター」を持っています。

  • 高い自信: モデルは次に何を言うべきか正確に知っています。これはレシピを完璧に知っている料理人のようなものです。この場合、「エントロピー」(不確実性の尺度)は低いです。
  • 低い自信: モデルは推測しています。これは冷蔵庫が空っぽで、何を作ればいいか分からないでいる料理人のようなものです。この場合、「エントロピー」は高いです。

2. 従来の方法 vs 新しい方法

従来の方法(パープレキシティ):
以前の手法は、物語全体の「平均的な」自信を見ていました。

  • 比喩: 学生がテストを受ける場面を想像してください。従来の方法は、単にその学生の平均点を見ています。平均点が70%なら合格かもしれません。しかし、これは真実を隠しています。すべての問題で70%の正答率だったのでしょうか?それとも、10問は完璧(100%)で、10問は完全に間違っていた(0%)のでしょうか?平均点は同じですが、後者の学生の方がはるかに不安定です。

新しい方法(CES):
著者らは、自信メーターの平均値よりも、その形状の方が重要だと気づきました。

  • 比喩: モデルが真実を語っているとき、その自信メーターは安定しており予測可能です。しかし、幻覚を起こし始めると、メーターは暴れ出します。しばらくは落ち着いていても、突然混乱して急上昇し、再び急上昇することがあります。
  • 論文は、この「暴れたパターン」が嘘の指紋であると主張しています。たとえ平均的な自信が正常に見えても、急上昇(最大の不確実性)や曲線全体の形状がそれを露呈させます。

3. CES の仕組み(「指紋」チェック)

この手法は2段階で機能します。

  1. 「真実」のパターンを学習する: まず、システムは真実であることが知られている多くの物語を聞きます。そして、真実の物語の自信メーターがどのようなものかを示す「参照マップ」(統計的な曲線)を作成します。例えば、「真実の物語は通常、ここには小さな盛り上がりがあるが、あそこに巨大な急上昇が現れることは稀だ」と記録します。
  2. 1 回きりのテスト: 新しい物語が入ってきたとき、システムはそれを1 回だけ聞きます。二度目の意見を求めることはありません。その物語の自信メーターを「真実マップ」と照合します。
    • もし物語に奇妙な急上昇があったり、マップに合わない形状だったりする場合、システムは警告を発します。「これは幻覚のようです!」

4. これが画期的な理由

  • 速度: テキストを1 回だけ通過させるだけで済みます。物語を5回繰り返させるのではなく、一度話すのを聞くだけで嘘つきを見抜くようなものです。
  • ブラックボックス対応: モデルの内部コードや隠された思考を見る必要はありません。単語を選ぶ前にモデルが出力する「ロジット(生の自信数値)」だけでよく、これはほとんどの API が提供しています。
  • 統計的証明: 著者らは単にこれが機能すると推測したわけではありません。数学を用いて証明しました。物語が長くなるにつれて、嘘を見逃す確率はほぼゼロに近づき、真実の物語を誤って非難する確率もほぼゼロに近づきます。

まとめ

CESを、ポリグラフ検査機や2回目の面接を必要としない嘘発見器だと考えてください。それは単に、テキスト内の不確実性のリズムを聞くだけです。リズムが安定していれば、それは真実である可能性が高いです。リズムに不規則で激しい跳躍がある場合(平均値が正常に見えても)、それは幻覚である可能性が高いです。

この論文は、10 種類の異なる AI モデルと、数学から雑学まで 8 種類の異なる質問タイプでこの手法をテストしました。その結果、この「1 回通過」方式は、高価で複数回通過が必要な手法と同等に嘘を見抜けることが分かりましたが、はるかに高速で低コストです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →