← 最新の論文
💻 computer science

Forecasting the Onset of Hallucination: Causal, Token-Level, Black-Box Survival Analysis During Generation

本論文は、テキストの新規性のドリフトを検出することで、従来の事後的な検知器よりも約11トークン早く警告を発し、0.777のAUROCを達成して、大規模言語モデルにおけるハルシネーションの発生を発生前に予測することに成功した、因果的なトークンレベルの生存分析フレームワークを導入するものである。

原著者: Igor Itkin

公開日 2026-07-10
📖 1 分で読めます☕ さくっと読める

原著者: Igor Itkin

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、魔法使い(巨大なAI)が物語を語っているマジックショーを見ていると想像してください。通常、魔法使いが嘘をつき始めたとき(スクリプトに存在しない事実を作り上げたとき)、私たちはそれを「ハルシネーション(幻覚)」と呼びます。

長い間、その魔法使いを捕まえる唯一の方法は、彼が実際に嘘をついた瞬間に指をさして、「おい、止まれ!それは偽物だ!」と言うことでした。しかし、その時にはすでに観客は嘘を聞いてしまっています。それは、花瓶が床に落ちて割れた後に、破片を片付けるようなものです。片付けることはできても、割れた花瓶を元に戻すことはできません。

この論文は、大胆な問いを投げかけます。魔法使いが口を開いて嘘をつく「前」に、その嘘を予測することはできるのでしょうか?

クリスタルボール vs 煙感知器

著者たちは、AIが物語を書き進めるのを、単語一つひとつのレベルで監視する「クリスタルボール(予測ツール)」を作り上げました。彼らはこれを、「嘘が起きるのを待つだけ」という古い手法である「煙感知器」と比較しました。

ここで彼らが発見した魔法のような現象があります。AIは「真実」から「嘘」へと唐突に切り替わるわけではないということです。代わりに、AIはまるで岩に衝突する前のボートがコースを外れていくように、ゆっくりと真実から離れていき始めます。

  • 旧来の手法(検知器): このツールは、AIが作り事をし始めたのを待ってから作動します。テストでは、嘘が始まってから15トークン(約15単語)にアラームを鳴らしました。これは速い方ですが、常に一歩遅れています。
  • 新しい手法(予測器): このツールは、AIの「漂流(ドリフト)」を監視します。AIが嘘をつき始める前に、テキストが奇妙に新しくなり、元の情報源から切り離されていくことに気づきます。この「漂流」を察知することで、嘘が実際に起こる11トークン前にアラームを鳴らすことができるのです。

これは極めて重要なことです。つまり、テキストがまだ「真実」であるうちに警告を発することができるため、AIが偽りの内容を口にする前に止めるチャンスが得られるのです。

クリスタルボールはどうやって「漂流」を見るのか?

AIが嘘をつく直前に、緊張したり混乱したりすると考えるかもしれません。ツールの役割は、AIの「驚き(Surprise)」のレベル(AIが自分の言葉に対してどれほど驚いているか)を見ることだと予想されるかもしれません。

しかし、論文はこの可能性を否定しています。 著者らは、嘘をつく前にAIが驚いているわけではないことを突き止めました。代わりに、警告信号は**テキストの新規性(Novelty)**から来るのです。

これは、歌詞を完璧に知っている歌手を想像してみてください。彼らが偽の歌へと逸脱し始めるとき、突然緊張するわけではありません。ただ、元の楽譜とはますます異なる音符を歌い始めるのです。ツールは、言葉が元の物語と比較してどれほど「新しく」、かつ「文脈から外れて」いるかを測定します。言葉が「新鮮すぎる」と感じられ、元の物語から離れすぎたとき、ツールは嘘が来ることを察知します。

このツールが「できないこと」(現実的な検証)

著者らは、自分たちの発明を過大評価しないよう、非常に慎重に記述しています。以下は、このツールが**明確に「そうではない」**としている事項です。

  • これは汎用的な翻訳機ではありません: もしこのツールを詳細な長文記事(Wikipediaの要約など)で学習させ、それを短い素早い質問(トリビアゲームなど)に使おうとした場合、完全に失敗します。実際、ランダムに推測するよりも成績が悪くなります。「漂流」の見え方は、テキストの種類によって異なります。このツールは、監視対象となるテキストの種類に合わせて特別に学習させた場合にのみ機能します。
  • これは嘘を止めるための魔法の解決策ではありません: 著者らは、アラームが鳴った瞬間にAIに「話すのをやめて」と指示するシミュレーションを行いました。その結果、古い「煙感知器(嘘が発生するのを待つもの)」の方が、言葉の節約には優れていることが分かりました。なぜなら、新しいツールは時として、少し「漂流」しているという理由だけで、正しい文章まで早すぎるタイミングで止めてしまうことがあるからです。リードタイム(予兆時間)は、単に文章を削除するのではなく、文章を「修正(書き直し)」する方法がある場合にのみ有用となります。
  • これはAIの心を読んでいるのではありません: このツールは、AIの内部的な脳のコードを見る必要はありません。出力される言葉だけを見るため、あらゆるAIで使用可能な「ブラックボックス」型のツールです。

魔法の背後にある数字

著者らは、RAGTruthという大規模なデータセットを用いてテストを行いました。結果は以下の通りです。

  • 次の3単語以内の嘘を予測する場合、ツールの正解率は77.7%(スコア0.777)でした。
  • AIが嘘をついている特定の文書のみに注目した場合でも、ツールは**68.7%**の確率で直後の嘘を予見できました。これは、ツールが単に「質の悪い文書」を推測しているのではなく、実際に「嘘が始まる瞬間」を捉えていることを証明しています。
  • ツールは、嘘が起こる11トークン前に警告することに成功しましたが、旧来の検知器は嘘が起きた15トークン後に反応しました。

結論

この論文は、ハルシネーションは予測可能であることを証明しています。ただし、それはAIの混乱を見るのではなく、テキストの「漂流」を監視した場合に限られます。それは、衝突が起きるのを待つのではなく、車が衝突する前に車線からわずかに蛇行していることに気づくようなものです。

しかし、これはまだ解決された問題ではありません。このツールは学習したテキストの種類に非常に特化しており、警告が出た際に単にAIを止めることは、必ずしも最善の解決策とは限りません。しかし、初めて私たちは、物語がまだ真実であるうちに、嘘が来るのを予見する方法を手に入れたのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →