← 最新の論文
🤖 machine learning

Integrating Local and Global Entropy for Uncertainty Quantification in LLMs

本論文は、トークンレベルのエントロピーと隠れ状態の幾何学的エントロピーを融合させることで、局所的な信号のみでは捉えきれない「自信満々な誤答(confident-but-wrong hallucinations)」をはじめとする明確な失敗レジームを効果的に捉える、教師なしのシングルパス手法であるGlobal-Local Uncertainty (GLU) を提案する。

原著者: Johanne Medina, Tianyi Zhou, Keivin Isufaj, Aristides Gionis, Sanjay Chawla

公開日 2026-06-10
📖 1 分で読めます☕ さくっと読める

原著者: Johanne Medina, Tianyi Zhou, Keivin Isufaj, Aristides Gionis, Sanjay Chawla

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大きな問題:自信満々な嘘つき

想像してみてください。あなたは、とても自信に満ち溢れ、話し方も上手い友人に質問をしました。その友人は、完璧な文法と落ち着いた声で、即座に答えを返してきます。しかし、その内容は完全に間違っていました。

これが、今日の大型言語モデル(LLM)が抱える最大の問題です。彼らは「ハルシネーション(幻覚)」、つまり作り話をしている最中であっても、まるで100%確信を持っているかのような口調で話します。現在のツールは、モデルが次にどの言葉を選ぶかという「言葉の選択」に耳を傾けることで、これを検知しようと試みています。もしモデルが次の単語に対して迷っているようであれば、それはリスクがあると判定します。

欠陥: 時として、モデルは一つ一つの単語については非常に自信を持っているのに、物語全体としては嘘をついていることがあります。現在のツールでは、こうした「自信満々な嘘つき」を見逃してしまうのです。

新しい解決策:GLU(グローバル・ローカル不確実性)

この論文の著者たちは、AIが真実を語っているかどうかを確認するための新しい方法を提案しています。彼らはこの手法を GLU と呼んでいます。

AIの脳を、2つの異なる部門を持つ工場だと考えてみてください。

  1. 「言葉選び部門」(ローカル): 次に来る単語を決定する部門です。
  2. 「ストーリー設計部門」(グローバル): 構築されている物語の全体的なマップを保持している部門です。

論文では、嘘つきを見つけるためには、「言葉選び部門」だけでなく、両方の部門をチェックする必要があると主張しています。

1. ローカル・チェック(言葉選び部門)

  • 仕組み: これは、個々の単語に対するモデルの自信度を見ます。もしモデルが「猫」か「犬」かで迷っていれば、それは局所的(ローカル)に不確実であると言えます。
  • 比喩: シェフがスープを味見している場面を想像してください。塩が足りているかどうか確信が持てず、ためらっている状態。それが「ローカル」な不確実性です。
  • 問題点: 「自信満々な嘘つき」は、たとえ料理全体に毒が入っていたとしても、一つ一つの材料に対して「完璧だ!」と言うシェフのようなものです。ローカル・チェックでは、一つ一つの単語が完璧に見えてしまうため、この嘘を見逃してしまいます。

2. グローバル・チェック(ストーリー設計部門)

  • 仕組み: これは、モデルの「隠れ状態(hidden states)」を見ます。これらは、モデルが概念を理解するために使用する内部的な数学的マップです。著者たちは、これらのマップの「幾何学的複雑性」を測定します。
  • 比喩: シェフがキッチンの中を歩き回っている様子を想像してください。
    • 一貫性がある(真実): もしシェフが本物のスープを作っているなら、冷蔵庫からコンロ、そして鍋へと、効率的で集中した直線的な動きを見せます。その経路は無駄がなく、目的が明確です。
    • 一貫性がない(ハルシネーション): もしシェフが架空のレシピをでっち上げているなら、あてもなく彷徨うかもしれません。冷蔵庫へ行き、次に庭へ行き、それからガレージへ行き、また冷蔵庫へ戻ってくる……といった具合です。あちこちの方向に同時に動こうとしているのです。
  • 洞察: たとえシェフが各ステップで「完璧だ!」と言ったとしても(ローカル)、もしキッチンの中を彷徨い歩いている(グローバル)のであれば、何かがおかしいのです。論文ではこれを「幾何学的ドリフト(geometric drift)」と呼んでいます。

GLUの仕組み:「乗算ゲート」

この論文の主な革新は、これら2つのチェックをどのように組み合わせるかという点にあります。

  • 従来の方法(加算): スコアを加算していくセキュリティガードを想像してください。「単語の自信度:9/10。キッチンの彷徨い度:2/10。合計:11/20」。もし単語の自信度が十分に高ければ、ガードマンは彷徨いの存在を無視して、その人を通過させてしまいます。
  • GLUの方法(乗算): 著者たちは、スコアを掛け合わせる「ゲート」を使用しています。
    • もしキッチンの彷徨い(グローバル)が大きい場合、それは「ボリュームノブ」のように機能し、単語の自信度に対するアラームを大きく鳴らします。
    • 結果: たとえモデルがすべての単語に対して自信を持っていたとしても、その内部的な「経路」が彷徨っている場合、GLUスコアは急上昇し、その回答は信頼できないものとしてフラグが立てられます。

研究の結果

研究者たちは、3つの異なるAIモデルと、6種類の異なる質問タイプ(トリビア、数学、アラビア語のタスクなど)を用いてテストを行いました。

  1. 「自信はあるが間違い」を捉える: 標準的な手法(ローカルのみ)では、自信たっぷりに聞こえる誤答の多くを見逃してしまうことが分かりました。しかし、GLUはモデルの脳内の「彷徨う経路」を検知することで、これらを捉えることができました。
  2. 他よりも優れている: GLUは、他のすべての「教師なし(unsupervised)」手法(事前に人間によるラベル付けを必要としない手法)よりも優れた性能を示しました。GLUはエラーを特定し、AIが悪答を出す前に「立ち止まって考える」ように指示することに長けていました。
  3. 効率的: AIに回答を何度も生成させたり、余分な計算リ力を使わせたりする必要はありません。回答を一度生成する際に、言葉と内部経路の両方をチェックするだけです。

まとめ

この論文は、AIを信頼するためには、単にその言葉を聞くだけではなく、その「考え方」を見守る必要があると主張しています。単語レベルの自信度のチェックと、概念レベルの彷徨いのチェックを組み合わせることで、GLUはAIが自信満々に嘘をつくという特定のエラーを防ぐためのセーフティネットを作り出します。しかも、追加の学習データを必要とせず、AIの速度を落とすこともありません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →