Analyzing the Correlation Between Hallucinations and Knowledge Conflicts in Large Language Models
本論文は、異なる層における内部表現を分析することにより、大規模言語モデルにおける知識の衝突とハルシネーションの間の相関関係を調査し、これら二つの現象は概念的に関連しているものの、ハルシネーションのパターンは知識の衝突の表現によって完全に説明できるわけではないことを明らかにし、それによってLLMの挙動を理解するためのきめ細かな解釈可能性ツールの価値を強調している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
大規模言語モデル(LLM)を、膨大な図書室の本をすべて暗記している、驚くほど博識な司書だと想像してみてください。しかし、一つ問題があります。彼らは自分の棚を更新することができないのです。もし図書室の本が古くなっていたり、記憶している内容と矛盾する新しいメモを渡されたりすると、彼らは混乱してしまうかもしれません。
この論文では、この混乱がどのように誤作動するか、2つの特定の方法を調査しています。
- 「ハルシネーション(幻覚)」: 司書が自信満々に事実を捏造したり、もっともらしく聞こえるが実際には間違っている答えを出したりすること。
- 「知識の衝突」: 司書が「空は緑色である」というメモ(コンテキスト)を渡されましたが、彼らの記憶では「空は青い」となっています。彼らはどちらを信じるべきか判断しなければなりません。
大きな問い
研究者たちは知りたいと考えていました。これら2つの問題は同じものなのでしょうか?
彼らは、司書が「ハルシーション」を起こすとき、それは内部で「知識の衝突」と戦っているからではないかと疑っていました。言い換えれば、司書が嘘をつく直前に、脳内で混乱(衝突)による「ざわつき」が生じているのではないかと考えたのです。もしこれが真実であれば、シンプルなアラームシステムを作ることができます。つまり、「混乱のざわつき」を検知できれば、嘘が来ることを予知できるのです。
検証方法
これをテストするために、研究者たちは「脳スキャナー」(プロービングと呼ばれる手法)として振る舞いました。彼らは司書(モデル)自体を作り変えるのではなく、思考の異なる段階(隠れ層、アテンション層、論理層)を覗き込み、混乱や嘘の兆候を見つけられるかどうかを確認しました。
彼らは2つの異なる「司書」(AIモデル)を使用しました。
- LLaMA-3-8B: この司書の「混乱信号」を使って、いつ嘘をつくかを予測できるかを検証しました。
- Falcon-7B: この司書の「嘘の信号」を使って、いつ混乱しているかを予測できるかを検証しました。
分かったこと
結果は少し意外なものでした。それはまるで、煙探知器をチェックしたところ、「火災」のアラームが「トーストを焦がした時」には鳴らず、逆に「トーストを焦がした時のアラーム」が「火災が発生した時」に作動しないことを発見したようなものです。
- 混乱 ≠ 嘘: モデル内部の「混乱」信号を見たとき、モデルがいつハルシネーションを起こすかを予測することはできませんでした。混乱している時の内部パターンは、物事を捏造している時のパターンとは異なっていました。
- 嘘 ≠ 混乱: 逆に、モデルが嘘をついていることを示す信号を用いても、モデルが知識の衝突に直面しているときを見つけることはできませんでした。
結論: ハルシネーションは知識の衝突によって引き起こされると感じられますが、この論文は、モデルの内部ではこれらは2つの異なるプロセスであることを示しています。一方が他方を予測するために、もう一方の信号を使うことはできないのです。これらは別個の現象です。
朗報
彼らが探していた結びつきは見つかりませんでしたが、彼らの「脳スキャナー」(プロービングツール)が非常に一貫して機能するということは分かりました。このツールは、英語だけでなく、イタリア語、スペイン語、中国語、その他の多くの言語においても同様にうまく機能します。これは、特定の理論(衝突とハルシネーションの関連性)は証明されなかったものの、ツール自体は信頼できるものであることを意味しています。
要約
研究者たちは、AIモデルにおける混乱と嘘の両方を捉えることができる、単一の「煙探知器」を見つけたいと考えていました。しかし、AIの脳内では、これら2つの問題は別々に処理されていることが判明しました。現実の世界ではこれらは関連していますが、コンピュータのコード内では、見た目が異なります。このことは、AIのミスを理解し修正するためには、単一の単純な原因を探すのではなく、より複雑なツールが必要であることを教えてくれます。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。