← 最新の論文
💻 computer science

Hallucination Span Detection with Input-Side Evidence Alignment

本論文は、入力された根拠からの忠実なトークンの予測可能性を利用することで、ハルシネーション(幻覚)の特定とそれらのソースへの紐付けを同時に行うことにより、LLMが生成したテキスト内のハルシネーション・スパンを検出するための新しいタスクおよびエンコーダーベースの手法を導入するものである。

原著者: Miyu Yamada, Yuki Arase

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Miyu Yamada, Yuki Arase

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大規模言語モデルは、ニュースを要約したり、複雑な質問に答えたり、文書をドラフトしたりできる強力なエンジンとして機能し、コンピュータとの対話のあり方を変貌させました。これらのシステムは、膨大な量のテキストから学習したパターンに基づき、文章内の次の単語を予測することによって動作します。しかし、ある執拗な欠陥がその信頼性を損なっています。それは、モデルが事実を捏造してしまうことがあるという点です。「ハルシネーション(幻覚)」として知られるこの現象は、モデルがもっともらしく聞こえるものの、元の資料に裏付けられていないか、あるいはそれと直接矛盾する情報を生成するときに起こります。これらのツールを重要なタスクのために利用しているユーザーにとって、役立つ要約と捏造された物語を見分けることは困難です。核心となる課題は、単にエラーが存在することを知るだけでなく、どの単語が間違っているのかを正確に特定し、その間違いを証明する元のテキストの特定の部分を見つけ出すことにあります。この粒度の高い詳細がなければ、長い文書の真実性を検証することは、退屈で手作業の多いプロセスであり続けます。

東京科学大学の研究者たちは、この問題を解決するために、テキスト全体を判定することから個々の単語を検証することへと焦沢を移す、新しいアプローチを開発しました。彼らの手法は、コンピュータにパラグラフ全体を真か偽であるとラベル付けさせるのではなく、生成された出力を一単語ずつスキャンし、それがソース(情報源)に遡ることができるかどうかを確認する「虫眼鏡」のように機能します。研究チームは、シンプルながらも強力な観察に基づいています。もし要約の中の単語が元のテキストに対して忠実であれば、コンピュータは元のテキストのみをガイドとして用いて、その単語を予測できるはずである、という点です。逆に、もし単語がハルシネーションであるならば、その情報は単にそこに存在しないため、ソースから予測することは不可能になります。この予測可能性をテストするようにモデルを訓練することで、研究者たちは、捏造された単語をフラグ立てするだけでなく、正しい情報を裏付ける入力側の具体的な証拠をハイライトするシステムを作り上げました。

プロセスは、生成されたテキストを単一のブロックとして扱うのではなく、フレーズや節といった意味のある塊に分解することから始まります。次に、システムはこれらの塊から一つの単語を取り出し、それを一時的に隠します。そして、元の入力テキストのみに基づいて、その隠された単語が何であるべきかを推測するようにモデルに求めます。もしモデルがソースを用いて自信を持って隠された単語を推測できれば、システムはその単語を「忠実」であるとマークします。もしモデルが推測に苦労したり、確信度が低かったりする場合、システムはその単語を潜在的なハルシネーションとしてフラグ立てします。決定的なのは、モデルが推測を行うためにソーステキストを参照する必要があったため、自然と出力された単語と、その根拠となった入力の特定の部分との間にリンクが生じることです。これにより、モデルがどこから情報を得たのか、あるいはエラーの場合にどこでサポートを見つけられなかったのかをユーザーに正確に示す「証拠のマップ」が作成されます。

このアイデアを検証するため、研究者たちは、生成された回答のどの部分が事実として不正確であるかを人間がすでに特定している、数千の例を含むデータセットを使用しました。彼らは、巨大で複雑なモデルを用いてテキストを読み取り判断する既存の技術と比較しました。その結果、彼らのより軽量で焦点の絞られたアプローチは、エラーを見つける上で非常に優れていることが示されました。他の手法がミスを見逃してしまうことがあった一方で、この新しいシステムは、特に完全に作り上げられた情報の大部分を特定することに成功しました。また、要約内の正しい単語をソース内の正しい文章へと結びつけることにも効果的であり、ユーザーが辿るべき明確な証拠の跡を提供しました。

しかし、この研究はまた、特定の種類の誤りを検出する際のシステムの弱点も明らかにしました。この手法は、例えば数字を「4」から「20」に変えるような、文法や文脈的には元のテキストと似ているものの、直接的な矛盾となるハルシネーションに対して苦戦しました。このようなケースでは、モデルは周囲の文脈があまりに似通っているため、予測に対して自信を持ち続けてしまい、微妙な意味の変化を認識できませんでした。研究者たちは、このシステムはソースに全く存在しない情報を特定することには長けているものの、より巧妙で矛盾を孕むエラーを捉えるためにはさらなる洗練が必要であると指摘しました。こうした限界はあるものの、この研究は、あらゆる主張を直接そのソースへと結びつけることで、人工知能の透明性を高めるための実用的な方法を提示し、AIをより透明性の高いものにするための大きな一歩を示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →