← 最新の論文
🤖 machine learning

Hallucination Is Linearly Decodable from Mid-Layer Hidden States in Quantized LLMs

本論文は、4ビット量子化されたオープンソースLLMの中間層の隠れ状態には、幻覚をエンコードした線形分離可能な真実性信号が強く存在しており、これにより単純な線形プローブを用いてほぼ完璧なAUROCスコアでの検出が可能である一方、サンプリングに基づく手法は同一の評価プロトコル下では著しく劣ることを実証している。

原著者: Aizierjiang Aiersilan

公開日 2026-06-03
📖 1 分で読めます☕ さくっと読める

原著者: Aizierjiang Aiersilan

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、非常に賢いけれど、少し信頼性に欠けるロボットの助手を持っていると想像してください。時々、ロボットは真実を語りますが、時にはもっともらしく聞こえるものの、完全に間違った事実をでっち上げることがあります(これらは「ハルシネーション(幻覚)」と呼ばれます)。

この論文は、探偵の報告書のようなものです。目的は、**「どうすればロボットが嘘をついているかを見抜けるのか、そしてその嘘は『脳』のどこに隠れているのか?」**を突き止めることです。

研究者たちは、これをLlama、Mistral、Qwenという3つの人気のあるオープンソースのロボットの脳に対してテストしました。これらの脳は、標準的な家庭用コンピュータでも動作するように、サイズを縮小されています(これは、高画質の映画を、品質を大きく損なうことなく小さなファイルに圧縮する「4ビット量子化」と呼ばれる手法です)。

研究結果を分かりやすく説明します:

1. 「真実の探知機」は単純な一本の線である

研究者たちは、ロボットの嘘を見破るために主に2つの方法を試しました。

  • 「ギャンブラー」アプローチ(サンプリング): ロボットに同じ質問を10回投げかけます。もし10通りに異なる答えが返ってきたら、ロボットは混乱しているか、嘘をついている可能性があります。もし毎回同じ答えを返すなら、真実を言っている可能性があります。
  • 「X線」アプローチ(プロービング): ロボットが考えている最中に、その脳の内部を直接覗き見ます。具体的には、「隠れ状態(脳のレイヤー間の電気信号)」を観察し、「真実」か「嘘」かを示すパターンがあるかどうかを確認しました。

結果: 「X線」アプローチが圧倒的な勝利を収めました。ロボットの脳の中ほどにある特定の1つのレイヤーを見るだけで、単純な数学ツール(線形プローブ)を用いることで、90%から100%の精度でロボットが嘘をついているかどうかを判別できました。

「ギャンブラー」アプローチ(10回質問する手法)は、今回の特定のテストにおいてはほとんど役に立たず、コイン投げ(的中率約50%)と変わらない結果でした。

2. 脳のどこに嘘があるのか?

研究者たちは、「真実の信号」はどこにでもあるわけではないことを発見しました。それは、超高層ビルの特定の部屋に、真実が壁に書かれているようなものです。

  • LlamaMistral のロボット(32階建て)の場合、真実は13階から18階の間で最も明確に見えます。
  • Qwen のロボット(28階建て)の場合、真実は19階から25階の間で最も明確に見えます。

ロボットの脳のこれらの特定の「階数」をチェックすれば、それが正直であるかどうかをほぼ瞬時に知ることができます。

3. なぜ「ギャンブラー」アプローチは失敗したのか?

「なぜ同じ質問を10回繰り返す方法ではダメだったのか?」と疑問に思うかもしれません。
論文では、この理由を巧妙な区別によって説明しています。

  • **プローブ(X線)*は、特定の答え(例:「フランスの首都はパリである」)を与えられ、「あなたの脳はこの文章を真実だと認識しているか?」と問われました。つまり、その特定の*文章に対するロボットの内部反応を見たのです。
  • **ギャンブラー(サンプリング)*は、単に質問を投げられ、「10通りの異なる物語を書いてください」と命じられました。これは、特定の答えが真実であるかどうかではなく、ロボットがその質問に対してどれほど混乱しているか*を測定していました。

テストの設定が「特定の答え」を検証するためのものだったため、「ギャンブラー」は間違った場所を探していました。それは、文書内の特定の誤字を見つけようとしているのに、文書を一度読むのではなく、作者に文書を最初から10回書き直させるようなものです。

4. 「単純な線」 vs 「複雑な機械」

研究者たちは、より賢いものを見つけられると考えて、非常に複雑な数学ツール(MLP)を使って嘘を探そうとしました。
驚きの結果: 複雑なツールを使っても、単純なツールと大差ありませんでした。「真実」はロボットの脳内において非常に明快であり、それはまるで一本の直線のようなものです。それを見つけるのにスーパーコンピュータは必要ありません。単純な定規があれば十分なのです。

5. 「アテンション(注意)」の手がかり

もう一つ、うまく機能したテクニックがありました。ただし、それはロボットが特定のテキスト(Wikipediaの記事など)を読んでいる場合に限られます。
彼らは、最初のステップにおけるロボットの「アテンション(何に注目しているか)」を観察しました。

  • もしロボットがテキストに基づいて真実を述べているなら、そのアテンションは集中しており、落ち着いていました。
  • もしハルシネーション(幻覚)を起こしているなら、そのアテンションは散漫で混乱していました。
    これは、追加の計算や時間をかけることなく、非常に強力な手がかり(最大94%の精度)を与えてくれました。

まとめ

もし、小型化・圧縮されたAIロボットが事実について嘘をついているのを見破りたいなら:

  1. やってはいけないこと: 同じ質問を10回繰り返すこと(これは時間の無駄であり、ここでの効果も低いです)。
  2. やるべきこと: 中間のレイヤー(15層目や20層目あたり)で、その脳の中を覗き見ること。
  3. 非常に単純で高速な数学的チェックを用いることで、ほぼ完璧な精度で嘘を見抜くことができます。

この論文は、このような特定の種類のテストにおいては、ロボットに何度も繰り返させるよりも、ロボットの脳の内部を覗き見る方がはるかに速く、かつ正確であると結論付けています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →