Mixture-of-Expert Blocks Contain Strong Hallucination Detection Signals
本論文は、ルーターのエントロピーやエキスパート間の不一致といったMixture-of-Experts(MoE)アーキテクチャ特有の内部信号を活用することで、単一のフォワードパスのみで複数のデータセットにわたる優れた性能を実現する、新しいトークン単位のハルシネーション検出手法であるInnerExpertを提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
大規模言語モデルは、エッセイを執筆し、問題を解決し、驚くほど人間らしく感じられる会話を行うことができる、新しい世代の人工知能のエンジンです。しかし、この流暢さの裏には、根強い欠点が存在します。それは、これらの機械が時として、全くの自信を持って事実を捏造してしまうことです。「ハルシネーション(幻覚)」として知られるこの現象は、モデルがもっともらしく聞こえるものの、完全に誤った内容を生成するときに起こります。これらのエラーは、日常的なチャットにおいては無害なことが多いですが、モデルが医療のアドバイス、法的調査、あるいはニュース報道に使用される場合には危険となります。科学者にとっての核心的な課題は、単に事後に対処することではなく、嘘が吐かれる瞬間を捉えること、理想的には、真実が崩れ始める正確な単語を特定することです。
長年、研究者たちは、モデルに答えを何度も繰り返させたり、異なるバージョンのストーリーが互いに一致しているかを確認したりすることで、この問題を解決しようとしてきました。これらの手法は機能しますが、コンピュータがたった一つの間違いを見つけるために同じ作業を何度も繰り返す必要があるため、時間がかかりコストもかかります。より新しいアプローチは、モデルが思考している最中にその「脳」の内部を覗き込み、内部計算における微細な不確実性の兆候を探すものです。しかし、これらの内部チェックの多くは、標準的なモデルに限定されています。より強力で効率的な「混合エキスパート(Mixture-of-Experts)」と呼ばれる異なるタイプのアーキテクチャが、最近では高速かつ効率的であるため普及しています。この設計は、中央のマネージャーが、生成される各単語に対してどの特定の専門家(エキスパート)を呼び出すかを決定する、チームのスペシャリストのような仕組みになっています。これまで、このチームのダイナミクスから得られる信号は、嘘を見逃さないための目的としては、ほとんど無視されてきました。
新しい研究において、ポルトガルの研究者たちは、これらの内部的なチームの信号をついに活用する「InnerExpert」と呼ばれる手法を開発しました。モデルに繰り返し答えさせたり、文の終わりまで待ってエラーを確認したりする代わりに、InnerExpertはモデルの内部ルーティング・プロセスをリアルタイムで監視します。モデルが回答を生成する際、小さなルーターが、現在の単語をどの「エキスパート」ネットワークに処理させるかを決定します。研究者たちは、モデルがハルシネーションを起こそうとしているとき、このルーターに混乱の兆候が見られることを発見しました。エキスパート同士が意見を異にしたり、あるいはルーターがどのスペシャリストがそのタスクに最適かを判断するのに苦慮したりすることがあります。これらの躊躇や不一致の瞬間を、モデルが注意(アテンション)を向けている標準的な信号とともに追跡することで、InnerExpertは生成されるすべての単語に対して信頼度スコアを割り当てることができます。
チームは、巧妙で自動化されたアプローチを用いてこのシステムを訓練しました。彼らはモデルに数千の質問を入力し、別の非常に有能な人工知能に、回答が真実であるか捏造されたものであるかをラベル付けする「審判」としての役割を行わせました。これにより、人間が手動でデータを読み取ったり修正したりすることなく、ハルシネッションに先立つ内部信号の特定のパターンをInnerExpertに認識させることが可能になりました。一度訓練されると、システムはメインモデルの傍らで動作する軽量な検出器として機能し、結果を出すためにデータのシングルパス(一回の通過)のみを必要とします。モデルを低速化させたり、余分なテキストを生成させたりする必要はありません。
5つの異なるデータセットと2種類の異なる大規模モデルを用いてテストした際、InnerExpertは極めて効果的であることが証明されました。このシステムは、文レベルで最大0.91、単語レベルで0.76の精度スコアで、ハルシネーションによる回答を特定することに成功しました。これらの数値は、既存の手法がしばしば嘘がどこから始まるのかを正確に特定することに苦慮していることを考えると、大幅な改善を意味します。システムは優れた汎用性を示し、モデルが元々学習した後に発生した出来事に関する質問に対しても、強力に機能しました。これはハルシネーションが最も頻繁に起こる一般的なシナリオです。決定的なことに、この高い検出能力を達成しながら、計算コストの増加を最小限に抑えており、実世界での使用に適しています。
また、この研究により、モデルの内部チームからの単一の信号だけでは、すべての嘘を捉えることはできないことも明らかになりました。ある信号はあるタイプのモデルでのエラー検出には優れている一方で、別のタイプのモデルでは別の信号がより効果的に働くといった具合です。InnerExpertの真の力は、これらすべての異なる信号(ルーターの混乱、エキスパート間の不一致、および使用パターン)を、単一の統一されたスコアへと組み合わせることにありました。この組み合わせにより、システムは単一の指標よりも明確なモデルの信頼性の全体像を把握することができたのです。研究者たちは、モデルのエキスパートたちの内部的な「チャット(雑談)」に耳を傾けることで、システムを低速化させることなく、以前は不可能であった精度で不確実性を検知できることを示しました。
この研究は、より信頼性の高い人工知能への道が、必ずしもより大きなモデルやより複雑な検証システムを構築することによって開かれるのではないことを示唆しています。むしろ、モデルがすでに生成しているものの、無視されている信号にもっと注意を払うことにあるのかもしれません。モデルの内部的な意思決定における微細な躊躇のサインを読み取ることを学ぶことで、モデルがいつ推測しており、いつ確信しているのかを知るシステムを構築できるのです。研究者たちは、この手法は非常に効果的ではあるものの、完璧な解決策ではないとし、将来の研究では、これらの技術が異なる言語やより多様なタスクにどの程度適応できるかを探る必要があると述べています。しかし、現時点では、この研究はハルシネーションが発生した瞬間にそれを捉えるための、明確かつ効率的な方法を提供しており、人工知能の出力をより信頼できるものにするための実用的なツールとなっています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。