← 最新の論文
💬 NLP

Token-Level Density-Based Uncertainty Quantification Methods for Eliciting Truthfulness of Large Language Models

本論文は、複数の層にわたるトークンレベルの埋め込みに対してマハラノビス距離を適用する大規模言語モデル向けの新しい教師あり不確実性定量化手法を提案し、真実性の誘発におけるシーケンスレベル生成および事実確認タスクの両方において、既存のアプローチを上回る精度と汎化性能を実証する。

原著者: Artem Vazhentsev, Lyudmila Rvanova, Ivan Lazichny, Alexander Panchenko, Maxim Panov, Timothy Baldwin, Artem Shelmanov

公開日 2026-04-29
📖 1 分で読めます☕ さくっと読める

原著者: Artem Vazhentsev, Lyudmila Rvanova, Ivan Lazichny, Alexander Panchenko, Maxim Panov, Timothy Baldwin, Artem Shelmanov

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢く、教養豊かなロボット(大規模言語モデル、または LLM)が、物語を書いたり、質問に答えたり、ニュースを要約したりできると想像してください。問題点は、このロボットが時々「幻覚」を見ることです。つまり、テストで答えを推測しているが実際には間違っている学生のように、自信を持って事実を捏造したり、嘘をついたりします。

この論文の著者たちは、このロボットのための「嘘発見器」を構築したいと考えました。ロボットに信頼する前に、ロボットが本当に不確実なのか、それとも単に虚勢を張っているのかを知る方法が必要だったのです。

以下に、彼らがどのように行ったかを簡単に説明します。

旧来の方法の問題点

以前、科学者たちはロボットが嘘をついているのを発見するために、主に 2 つの方法を試みました。

  1. 「再度尋ねる」方法: 同じ質問をロボットに 10 回尋ねます。もし 10 回とも異なる答えが出れば、おそらく混乱しているでしょう。欠点: これは遅く、高価です。友人に同じ話を 10 回聞いて、話が変化するかどうかを確認するようなものです。
  2. 「信頼度スコア」方法: ロボットがどれほど自信を持っているかを観察します。欠点: ロボットは完全に間違っている場合でも、自信満々に聞こえるのが得意です。

新しいアイデア:「トークンレベル密度」探偵

著者たちは、ロボットの「脳」(内部層)に不確実性に関する手がかりが潜んでいることに気づきました。彼らは、**マハラノビス距離(MD)**と呼ばれる数学的なツールを使用することにしました。

比喩:「通常の群衆」と「外れ値」
ロボットには、トレーニング中に学んだ「良い、正しい答え」のメンタルライブラリがあると想像してください。

  • 旧来の方法(シーケンスレベル): ロボットが文全体を書き終えたとき、旧来の方法は文全体を 1 つの大きな塊として扱い、「この塊全体は『良い』答えに似ていますか?」と問いかけました。問題点は、文に 1 つだけ奇妙な単語が含まれていて全体を台無しにしていても、「塊」はそれでもまだ大丈夫に見える可能性があることです。
  • 新しい方法(トークンレベル): 著者たちは、ロボットが書く**すべての単語(トークン)**を、1 つずつ調べることにしました。
    • 彼らは問いかけます。「この特定の単語は、ロボットの『良い』ライブラリにある単語に似ていますか?」
    • もしロボットが、正しい単語のライブラリから非常に遠く、奇妙な単語を書いた場合、その単語は高い「疑いスコア」を獲得します。
    • 彼らは文内のすべての単語に対してこれを行い、スコアを平均化して、回答全体に対する最終的な「不確実性スコア」を取得します。

構築方法(レシピ)

  1. 「良い」例の収集: 彼らは質問とロボットの回答のセットを収集しました。これらの回答をフィルタリングし、間違いなく正しいもの(教師がテストを採点して A+ の答案のみを保持するような)のみを保持しました。
  2. 「良い」単語のマッピング: 彼らは、それらの A+ 答案に含まれる単語の内部数学(埋め込み)を調べ、ロボットの脳の各層にとって「正しい」ものがどのようなものかを示すマップを作成しました。
  3. 「疑い」テスト: ロボットが新しい回答を生成するとき、システムは各単語をその「正しい」マップに対してチェックします。
    • 単語が「正しい」マップから遠く離れている場合、高い距離スコア(高い不確実性)が与えられます。
    • 近い場合は、低いスコア(低い不確実性)が与えられます。
  4. 「コーチ」(線形回帰): ロボットの脳のすべての層を調べるのは複雑であるため、彼らは単純な「コーチ」(線形回帰モデル)を訓練しました。このコーチは、異なる層からのすべての疑いスコアと、ロボット自身の信頼度を見て、「これらの手がかりに基づいて、この回答が真実である可能性はどれくらいか?」と言います。

彼らが発見したこと

彼らは、ニュース記事の要約からトリッキーな科学問題への回答まで、11 の異なるタスクでこの新しい「トークンレベル探偵」をテストしました。

  • 高速: 「再度尋ねる」方法とは異なり、ロボットを複数回実行する必要はありません。ロボットが通常通り回答を書くのとほぼ同じ速度です。
  • 賢明: 以前の手法よりもはるかに効果的に嘘を捉えました。多くのテストで、利用可能な最良の手法でした。
  • 未知のものにも機能: トレーニング中に遭遇したことのないトピック(ニュース要約から医療質問への回答への切り替えなど)でロボットをテストしても、この手法はうまく機能しました。
  • 「ハイブリッド」ブースト: 彼らは、新しい手法をロボットの自身の信頼度スコアと組み合わせる(「ハイブリッド」アプローチ)ことで、嘘を見抜く能力がさらに向上することを見つけました。

結論

この論文は、ロボットが書くすべての単語を調べ、ロボットのトレーニングと比較してそれがどれほど「奇妙」かを確認することで、ロボットが真実を語っているのか、それとも捏造しているのかを判断する、非常に高速で正確かつ安価な方法を作成できると主張しています。まるで、ロボットに鏡を与えて、何か奇妙なことを言う前に、自分が奇妙なことを言いかけようとしているのを自分で見られるようにするのと同じです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →