Hallucination Detection in LLMs with Topological Divergence on Attention Graphs
本論文は、プロンプトと応答の注意グラフ間のトポロジカルな発散を測定することで事実的に誤った出力を特定し、最小限のデータと計算資源で最先端のパフォーマンスを達成する、検索拡張生成システム向けのトポロジベースの幻覚検出器であるTOHAを導入する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
大規模言語モデル(LLM)を、非常に才能があるが時として過剰に自信に満ちた物語語り手だと想像してみてください。質問を投げかけると、それは単に「言葉」で考えるのではなく、これまで見たすべての単語とこれから言うすべての単語の間に存在する、巨大で目に見えないつながりの網を覗き込みます。この網はアテンションマップと呼ばれます。
本論文は、この物語語り手が作り話(ハルシネーション)を始めようとしたときにそれを捉えるための新しいツール、TOHA(TOpology-based HAllucination detector、トポロジーに基づくハルシネーション検出器)を紹介しています。その仕組みを簡単に説明しましょう。
1. 物語語り手の網(アテンショングラフ)
LLM のアテンションマップを都市の地図だと考えてください。
- プロンプト(あなたの質問): 地図の左側にある建物群です。
- レスポンス(回答): 右側で建設されている新しい建物群です。
- 線: 建物同士をつなぐ線は、ある単語を書いているときにモデルがどの程度強く「注目」しているかを示します。モデルが真実を語っている場合、新しい建物(回答)は古い建物(質問に含まれる事実)と密接につながっているはずです。
2. 「ハルシネーション」の問題
モデルがハルシネーションを起こすと、元の都市とはうまくつながっていない新しい構造物を作り始めます。まるで、質問の中に存在しない建物へ橋を架けようとしているかのようです。
- 真実の回答: 新しい建物は、古い建物へと強く、短い橋でつながっています。
- ハルシネーションした回答: 新しい建物は空中に浮いているか、非常に長く、弱く、あるいは存在しない橋でつながっています。
3. TOHA 探偵(トポロジカル・ダイバージェンス)
TOHA は、これらのつながりの形状を測定する探偵です。これは「トポロジカル・ダイバージェンス」と呼ばれる数学的概念を用います。
- 比喩: あなたが質問に含まれる単語の石の山を持ち、その横に新しい石の山(回答)を作ろうとしていると想像してください。
- 忠実なコピーを作っている場合、新しい石を古い石に結びつけるために短いロープを使います。必要なロープの総長は短くなります。
- 作り話をしている場合、新しい石は遠く離れたり、浮いたりしています。それらを古い山につなぐには、非常に長く、高価なロープが必要になります。
- スコア: TOHA はこれらの「ロープ」の総長(数学的には最小全域森の長さ)を計算します。
- ロープの総長が短い = 回答は事実に根ざしている(ハルシネーションスコアが低い)。
- ロープの総長が長い = 回答は事実から乖離している(ハルシネーションスコアが高い)。
4. 「特別な目」(ハルシネーション認識ヘッド)
LLM には多くの「ヘッド」(テキストを見る脳の異なる部分)があります。本論文では、すべてのヘッドが同じように嘘を見抜くわけではないことが発見されました。
- 一部のヘッドはコピー機のように働きます。混乱すると、文の最初の単語を注視する傾向があります。
- 研究者たちは、特定の「ヘッド」が、トピックに関係なくモデルが嘘をつくたびに、一貫して長いロープの長さ(高いダイバージェンス)を示すことを発見しました。
- TOHA は脳全体をチェックするのではなく、これらの少数の「特別な目」に意見を求めます。もし彼らが「おい、これらのつながりは長すぎるぞ」と言えば、TOHA はそれをハルシネーションとしてフラグを立てます。
5. これが重要である理由
- 追加学習不要: 「嘘」の例を数千個必要として学習する他の方法とは異なり、TOHA は「トレーニングフリー」です。リアルタイムでつながりの数学的性質を眺めるだけで済みます。
- 超高速: 他の方法は、回答が一致するか確認するためにモデルに 10 回や 20 回物語を語らせることが多いです(証人に話を繰り返させるようなもの)。TOHA は物語を一度だけ見るだけで済みます。これらは遅い方法に比べて最大 70 倍高速です。
- どこでも機能する: 研究者たちは、異なるモデル(Llama や Mistral など)や異なるタスク(質問応答、ニュース要約など)でこれをテストしました。モデルが全く異なるトピックについて話していたとしても、一貫して良好に機能しました。
まとめ
TOHA は、AI の物語に対する品質管理検査員のようなものです。物語を読んで事実を確認するのではなく、設計図(アテンションマップ)を眺めます。もし設計図が、物語の新しい部分が元の事実から遠く離れて浮いていることを示していれば、TOHA は赤旗を上げます。これは、嘘の辞書を暗記する必要もなく、迅速かつ安価に行われます。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。