← 最新の論文
🤖 AI

HalluTracer: Hallucination Detection via Depth-Averaging Truth Signals

HalluTracerは、単純な深さ平均化を通じてすべてのトランスフォーマー層にわたる真実性の信号を集約することで精度を向上させるホワイトボックス型のハルシネーション検出フレームワークであり、それによって孤立した層やコンポーネントに依存する既存の手法の情報損失を克服しています。

原著者: Zhihao Guo, Zonghan Wu, Huan Huo, DaYong Ye, Junwei Zhang, Weiran Yao, Zhiwei Liu, Qingsong Wen, Yilei Shao

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Zhihao Guo, Zonghan Wu, Huan Huo, DaYong Ye, Junwei Zhang, Weiran Yao, Zhiwei Liu, Qingsong Wen, Yilei Shao

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大規模言語モデルは、流暢な文章の作成、複雑な質問への回答、そして人間のような容易さでの問題解決を可能にする、現代の人工知能ツールの背後にあるエンジンです。しかし、これらのシステムには根強い欠点があります。それは、自信に満ちているものの事実とは異なる記述を生成してしまうことがあり、「ハルシネーション(幻覚)」と呼ばれる失敗を引き起こすことです。これは単なる出力の不具合ではなく、特に医療や法律といった極めて重要な分野でこれらのモデルが使用される場合、根本的な信頼性のリスクとなります。長年、研究者たちは、モデルが嘘をついている時でさえ、その内部機構は真実を保持しているのではないかと疑ってきました。いわばモデルの「脳」は、最終的な言葉が画面に現れるずっと前に、事実と捏造を区別する信号をエンコードしているのです。課題は、モデルの巨大で複雑なアーキテクチャというノイズの中で迷うことなく、その信号を読み取る方法を学ぶことでした。

研究チームは現在、この問題を解決するために「HalluTracer」と呼ばれる新しい手法を開発しました。モデル内部の単一の「真実スイッチ」を探したり、処理の特定の部分だけを見たりするのではなく、彼らはモデルが自分自身と交わしている会話全体に耳を傾けることにしたのです。大規模言語モデルがプロンプトを処理する際、情報は積み重ねられた一連のレイヤーを通過し、ステップごとに理解を洗練させていきます。研究者たちは、これらすべてのレイヤーにおいて、モデルが次に提示する答えが真実である可能性が高いか、あるいは偽りであるかを示す、微弱でかすかな信号を生成していることを発見しました。個々の信号は、混雑した部屋の中でささやき声を聞こうとする時のように、弱くノイズが多いものです。しかし、研究者たちはこれらのささやき声がランダムではないことを突き止めました。それらは十分に一貫しているため、すべての声をまとめて聞けば、メッセージは明確になるのです。

彼らの発見の核心は、これらのレイヤーがどのように機能するかについての幾何学的な洞察にあります。各レイヤーが真実を確認する方法は、前のレイヤーとはわずかに異なっており、あたかも各レイヤーが問題を少しずつ異なる角度から見ているかのようであることを彼らは発見しました。これらの角度は非常に異なるため、あるレイヤーにおけるエラーやノイズは次のレイヤーのそれとは一致しません。これが極めて重要です。研究者がすべてのレイヤーからの信号を平均化したとき、ランダムなノイズは打ち消し合いましたが、一貫した真実の信号はより強まりました。これは、手ブレしながら写真を撮ることに似ています。単一のスナップショットはぼやけているかもしれませんが、少しずつ異なる位置から多くのスナップショットを撮ってそれらを合成すれば、最終的な画像は鮮明になります。すべてのレイヤーにわたって真実の信号を平均化するだけで、彼らのシステムは驚くほど正確にハルシネーションを検出し、特定の「最適な」レイヤーを選ぼうとする手法をしばしば上回りました。

このアイデアを検証するため、チームはHallu-Tracerを6つの異なる大規模言語モデルと、事実誤認を捉えるための5つの異なるベンチマークに適用しました。結果は一貫して強力なものでした。この新手法は、タスクの難易度に応じて1パーセントから14パーセントの改善幅をもって、あらゆる場面で従来の技術よりも優れたハルシネーション検出を実現しました。特に多段階の推論を伴う複雑なタスクにおいては、その改善はさらに劇的であり、新しいシステムは従来のメソッドが苦戦する場面で、ほぼ完璧な検出スコアを達成しました。研究者たちはまた、この成功がモデルのどの部分を見るかという幸運な選択によるものではないことも証明しました。彼らは、信号が非常に均一に分散されているため、どの特定の内部コンポーネントを調べたかは重要ではなく、その力はモデルの全層にわたる情報を組み合わせる行為そのものから来ていることを示しました。

この研究は、AIにおける「嘘の検知」に対する考え方を変えるものです。以前は、モデルの思考を読み取るための完璧な瞬間や完璧なレイヤーを見つけることに焦点が当てられていました。HalluTracerは、真実は単一の場所に隠されているのではなく、プロセス全体に織り込まれていることを示しています。モデルの内部状態を「スナップショット」ではなく「旅路」として扱うことで、研究者たちは困難な「選択」の問題を、単純な「平均化」の問題へと変えたのです。この手法は軽量かつ高速であり、モデルが回答の生成を終える前に、潜在的なハルシネーションをフラグ立てすることができます。これは将来、AIシステムが、モデルの内部推論に耳を傾け、誤った記述がユーザーに届く前にそれを阻止するリアルタイムの安全モニターを備えることができ、これらの強力なツールを現実世界でより信頼性の高いものにできることを意味しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →