← 最新の論文
💬 NLP

D-Score: A Spectral Hidden-State Signal for Hallucination Detection in Large Language Models

本論文は、外部の検証器や複数回の生成を必要とせず、単一のフォワードパスにおける隠れ状態の活性化のスペクトル幾何学を分析することで、生成されたテキストとモデルの内部知識との間の不整合を特定する、大規模言語モデルのためのハルシネーション検出手法であるD-Scoreを導入するものである。

原著者: Bianca Raimondi, Davide Evangelista, Maurizio Gabbrielli, Elena Loli Piccolomini

公開日 2026-07-28
📖 1 分で読めます☕ さくっと読める

原著者: Bianca Raimondi, Davide Evangelista, Maurizio Gabbrielli, Elena Loli Piccolomini

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、非常に有能だが、時々いたずら好きになるロボットが書いた本が並ぶ図書館に足を踏み入れたところだと想像してください。このロボットは「大規模言語モデル(LLM)」と呼ばれ、物語を書いたり、質問に答えたり、まるで人間のようにあなたとチャットしたりすることができます。しかし、ここには一つ落とし穴があります。ロボットは時々、作り話をすることがあるのです。月は緑色のチーズでできていると言ったり、有名な歴史的事件が間違った日に起こったと言ったりすることもあります。これは、ロボットが意図的に嘘をついているのではなく、単に自分自身の作り話に対して自信満々であるために起こります。私たちはこれを「ハルシネーション(幻覚)」と呼んでいます。

長い間、これらの嘘を見破る唯一の方法は、ロボットの回答を別のロボットや人間の司書に送り、事実のデータベースと照らし合わせて確認させることでした。それは、生徒にエッセイを書かせた後、別の教師を雇って採点させるようなものでした。しかし、もし生徒自身の脳が手がかりを与えてくれるとしたくはないでしょうか? もし、ロボットが何かを作り上げ始めた瞬間に、文章を書き終える前であっても、その内部的な「思考プロセス」が変化し、それが私たちに見えるとしたらどうでしょう? これが、科学者たちが問い続けている疑問です。「第二の意見を必要とせずに、目の前で嘘をついている瞬間を察知するために、ロボットの心の中を覗き見ることはできるのだろうか?」

これこそが、この論文の研究者たちが成し遂げようとしたことです。彼らは、「D-Score」と呼ばれる巧妙な新しいツールを導入しました。ロボットの心を、巨大で多次元的なダンスフロアだと考えてみてください。ロボットが言葉を処理するたびに、このフロア全体に信号が送られます。ロボットがよく知っていて確信を持っていることについて話しているとき、ダンサーたち(信号)は非常に組織化され、同期した動きを見せます。彼らは皆、同じ方向に整然と進みます。まるで、よくリハーサルされたパレードのように。これが「コヒーレント(一貫性のある)」な経路を生み出します。

しかし、ロボットが知らないことや作り話をしようとしているとき、ダンスフロアは混沌としたものになります。ロボットはあること(作り話の事実)を言おうとしていますが、その内部メモリが「待て、これは何かがおかしい」とか「これについては自信がない」と囁いています。この葛藤によって、ダンサーたちは散らばってしまうのです。一つのタイトな列で進む代わりに、彼らは一度に多くの異なる方向へと広がっていきます。混乱しているダンサーもいれば、間違いを修正しようとしているダンサーもおり、あるいは単に確信が持てないダンサーもいます。

D-Scoreは、これらダンサーたちがどれほど多くの異なる方向に動いているかを数える、単純な数学的トリックです。もしダンサーたちが皆、一つの直線に向かって行進していれば、スコアは低くなります。しかし、もし彼らが乱雑な群衆となって広がっていれば、スコアは上がります。研究者たちは、D-Scoreが高いとき、それはロボットがハルシネーションを起こしている強力なサインであることを発見しました。

チームは、3つの異なるロボットの脳(Llama-2、Llama-3、Vicunaと呼ばれます)を用い、2種類のトリッキーな質問を用いてこのアイデアをテストしました。その結果、D-Scoreは、ロボットがどれほど「驚いた」か、あるいはどれほど回答を繰り返したかといった他の手法よりも、嘘を見抜く能力においてはるかに優れていることが分かりました。実際、いくつかのテストでは、D-Scoreは従来の最高の手法よりも、ハルシネーションを捉える精度が10パーセントポイント近く高かったのです。

これがこれほどまでにエキサイティングな理由は、そのシンプルさにあります。D-Scoreは、データベースを確認する必要も、ロボットに同じ質問を5回答えさせる必要も、第二のロボットを助けとして呼ぶ必要もありません。ただ、単一の会話におけるロボットの内部信号を見るだけでよいのです。研究者たちは、これはロボット自身の「不確実性」や「葛藤」が、その思考プロセスに目に見える指紋を残すからだと示唆しています。

もちろん、この論文は、これがすべての嘘を捕まえる魔法の杖ではないという点についても慎重に述べています。もしロボットが、内部メモリに全く存在しない事実を作り上げている場合、ダンスフロアは混沌とせず、D-Scoreは低いままかもしれません。しかし、ロボットが内部的に感知している嘘に対しては、この新しい「スペクトル」信号は、ロボット自身の内部のリズムを聴き取ることで、犯行現場を押さえるための強力な手段となるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →