← 最新の論文
💬 NLP

CORTEX: Token-Level Hallucination Detection in RAG via Comparative Internal Representations

本論文は、検索拡張生成におけるトークンレベルのハルシネーション検出手法であるCORTEXを提案しており、これは情報の伝播とスパン一貫性平滑化を活用することで、モデルの内部表現を検索されたドキュメントがある場合とない場合で比較し、ハルシネーションの微細な局在化を実現することで、根拠のないコンテンツを特定するものである。

原著者: Kazuaki Furumai, Shuichiro Haruta, Kazunori Matsumoto, Daisuke Kamisaka

公開日 2026-07-01
📖 1 分で読めます☕ さくっと読める

原著者: Kazuaki Furumai, Shuichiro Haruta, Kazunori Matsumoto, Daisuke Kamisaka

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたは非常に賢く、博識なアシスタント(AI)に質問をしています。回答の正確性を期すために、あなたはアシスタントが書きながら参照できるように、一冊の参考書(検索された文書)を渡しました。

時として、アシスタントは本に忠実に従い、素晴らしい仕事を見せます。しかしまたある時には、たとえ目の前に本があるにもかかわらず、事実を捏造したり、詳細を混同したりしてしまうことがあります。これを「ハルシネーション(幻覚)」と呼びます。

問題は、長く詳細な回答において、AIが本に基づいた事実を90%正しく記述していても、わずか1、2文でミスを犯す可能性があることです。現在のほとんどのツールは、レポート全体を最後にまとめてチェックする警備員のようなものです。もしレポートが大部分において良好であれば、彼らは「問題なさそうだ!」と言ってしまい、その中に隠れた小さな嘘を見逃してしまうかもしれません。

この論文では、AIがどこで作り話をしているのかを特定するために、回答を**単語ごと(あるいはトークンごと)**に精査する「顕微鏡」として機能する新しいツール、CORTEXを紹介します。

CORTEXがどのように機能するかを、3つのシンプルな比喩を用いて説明します。

1. 「有無による比較」テスト(比較内部表現)

あなたが、学生が実際に教科書を読んでいるのか、それとも単に推測しているのかを見極めようとしていると考えてください。

  • 従来の方法: 学生の回答を見て、彼が本を読んだかどうかを推測しようとします。
  • CORTXの方法: あなたは同じ質問を学生に2回投げかけます。
    1. 1回目: 彼に教科書を読んで与えます。
    2. 2回目: 教科書を取り上げ、記憶に基づいて答えさせます。

CORTEXは、これら2つのシナリオにおけるAIの「脳の活動(内部的な思考)」を比較します。

  • もしAIが本の中にある事実について話しているなら、本が存在する時にその「脳」は大きく変化します。それは、テキストの中に答えを見つけたために学生の目が輝くようなものです。
  • もしAIが作り話(ハルシネーション)をしているなら、本があってもなくても、その「脳」はほとんど同じ状態に見えます。なぜなら、それは単に自身の記憶から引き出しているだけだからです。

これら2つの状態を比較することで、CORTEXは、どの言葉が本によって変化したのか(正しい部分)、そしてどの言葉が変わらずにそのままだったのか(誤った部分)を正確に特定できるのです。

2. 「思考の連鎖」の探偵(文脈的残差)

時として、AIは回答の早い段階で本から事実を読み取り、その事実を利用してその後の文章を構築するという、賢い動きを見せることがあります。

  • 問題点: もしあなたが後の文章だけを見た場合、そこには本が直接言及されていないため、AIがもう本を使っていないように見えることがあります。これにより、検出器は、その文章が実際には先ほど見つけた真実に基づいているにもかかわらず、嘘であると誤認してしまう可能性があります。
  • CORTEXの解決策: CORTEXは、足跡を追う探偵のように振る舞います。「おや、この文章は、AIが2文前に読んだ事実に依存しているぞ」と気づくのです。CORTEXはその「間接的な影響」を差し引くことで、混乱を防ぎます。これにより、AIが単に真実の物語を継続しているだけなのに、嘘をついていると誤って告発することを防ぎます。

3. 「ノイズフィルター」(ラベル永続性スムージング)

あなたが、ノイズの多いラジオ局を聴いていると考えてみてください。時として、そのノイズのせいで、文章全体は正しいのに、たった一つの単語が嘘のように聞こえてしまうことがあります。

  • 問題点: 生の検出ツールは、動きが不安定(ジッターがある)になることがあります。ある単語を嘘だとフラグ立てした後、次の単語は真実、その次は嘘、というように、バラバラで散漫なパターンを作り出すことがあります。しかし現実には、AIが嘘をつくときは、単一の孤立した単語ではなく、フレーズや文章全体に対して嘘をつくものです。
  • CORTEXの解決策: CORTEXは「スムージング(平滑化)」フィルターを適用します。もし一つの単語が嘘であれば、そのすぐ隣にある単語も同じ嘘の一部である可能性が高い、と仮定します。点と点を結びつけることで、散漫な「おそらく嘘」の集まりを、明確で固まった「確実な嘘」のブロックへと変えるのです。これにより、最終的な結果が人間にとってはるかに読みやすく、理解しやすいものになります。

結果

著者らは、2つの異なる質問セットと3つの異なるAIモデルを用いてCORTEXのテストを行いました。その結果、以下のことが判明しました。

  • CORTEXは、他の手法と比較して、作り話をしている正確な単語を見つけ出す能力が非常に高い。
  • CORTEXは、中身が見えない「ブラックボックス」であるAPIモデルであっても、背後で別のオープンなAIモデルを「探偵」として使うことで機能する。
  • システムのあらゆる部分(比較、思考の連鎖のチェック、およびスムージング)が、検出の精度向上に貢献している。

要約すると、CORTEXは、AIの回答が全体として良いか悪いかを単に推測するのではなく、AIがどこで作り話をしているのかをピンポイントで特定することで、私たちがAIの回答をより信頼できるようにするためのツールなのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →