← 最新の論文
💻 computer science

DeMTS: Denoising Trajectories as Multivariate Time Series for Hallucination Detection in Diffusion Language Models

本論文は、デノイジング・トラジェトリを多変量時系列として扱うことでトークンのステップにおける完全な構造的情報を保持し、不整合な収束やトークン間の誤りの伝播といった複雑なパターンを効果的に捉えることにより、既存の手法を凌駕するDiffusion Large Language Model向けの新しいハルシネーション検出フレームワークであるDeMTSを提案している。

原著者: Xin Zhang, Yili Wang, Yue Tan, Xin He, Yanyu Qian, Yixin Liu, Yi Chang, Shirui Pan, Xin Wang

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Xin Zhang, Yili Wang, Yue Tan, Xin He, Yanyu Qian, Yixin Liu, Yi Chang, Shirui Pan, Xin Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

急速に進化する人工知能の世界において、次世代のテキスト生成マシンが登場しました。これらは、単語を一つずつ順番に書き進めるという従来の方式から脱却しています。代わりに、「拡散大規模言語モデル(diffusion large language models)」として知られるこれらのモデルは、反復的な洗練プロセスを通じてテキストを生成します。ぼやけた画像が徐々にピントを合わせていく様子を想像してみてください。同様に、これらのモデルは、バラバラでノイズの多い単語のシーケンスから始まり、一貫した文章が出現するまで、ステップ・バイ・ステップで段階的にクリーンアップしていきます。このアプローチは速度と柔軟性において独自の利点を提供しますが、前身のモデルと共通する重大な欠陥、すなわち「ハルシネーション(幻覚)」を引き起こす傾向があります。これは、機械が夢を見ているわけではなく、事実確認の失敗であり、モデルが流暢で自信に満ちた響きの文章を作成しながら、その内容が完全に誤っていたり、根拠のない情報であったりする現象を指します。最終的な出力はしばしば完璧に見えるため、制作過程の中間段階で行われた混乱の中で発生した間違いを見つけ出すことは困難です。

研究者たちは、最終的な回答を確認したり、特定の瞬間におけるモデルの不確実性をチェックしたりすることで、長年これらのエラーを捉えようとしてきました。しかし、新しい研究によれば、これらの手法では最も重要な手がかりを見逃してしまうことが多いことが示唆されています。問題は、既存の検出ツールが、モデルによるテキスト生成の複雑な履歴を平坦化してしまう傾向にあることです。それらは、生成プロセスのタイムラインのみを見るか、あるいは個々の単語のみを見るかのどちらかであり、時間と形成される特定の単語の両方にわたって不確実性がどのように進化したかという、豊かな二次元的なマップを事実上破棄してしまっています。このデータを圧縮することで、文の一部分における間違いがどのように他の部分へと波及して全体を損なうのか、あるいは異なる単語が同時に自信を持った真実に落ち着くことができないといった現象を見極める能力が失われてしまうのです。

これを解決するために、科学者チームは、文章の生成プロセス全体を単純なステップのリストとしてではなく、複雑で多層的な信号として扱う「DeMTS」と呼ばれる新しいフレームワークを開発しました。モデルの内部信号を一本の線に押し込める代わりに、研究者たちは、すべての単語とすべての生成プロセスの瞬間との関係性を保持するようにデータを整理しました。彼らは、文における単語の生のポジションは、同じ位置が文によって異なる意味を持つ可能性があるため、信頼性を持って追跡するには不安定すぎると考えました。これを修正するために、彼らはモデルからのノーイで変化する信号を、安定した一貫性のあるカテゴリーへとグループ化するシステムを作成しました。これは、混沌とした混ざり合ったパズルのピースを、元の混乱した順序で追跡しようとするのではなく、形や色に基づいて明確にラベル付けされた箱へと仕分けしていくようなものです。

これらの安定したグループが形成されると、研究者たちは動的モデリング技術を適用し、これらのグループが時間の経過とともにどのように相互作用し、変化するかを観察しました。その結果、ハルシネーションはこのプロセスの中に独特の指紋を残すことが分かりました。真実の回答においては、文章の様々な部分が共に自信を持った状態へと落ち着く傾向があります。しかし、ハルシネーションが発生している回答では、モデルが「不整合な収束(inconsistent convergence)」を示すことが多く、一部の単語は非常に高い確信度を持つ一方で、他の単語は不安定で不確実なまま残ります。さらに、ある不安定または誤った単語が隣接する単語を真実から逸脱させ、文章全体に広がるエラーの連鎖反応を引き起こす「クロス・トークン・フォールト伝播(cross-token fault propagation)」も観察されました。これらの不安定性と相互作用の特定のパターンを追跡することで、この新しいシステムは、嘘が完全に語られる前にそれを察知することができるのです。

研究者たちは、一般的な知識から複雑な推論タスクに至るまで、3つの異なる質問回答データセットを用いて、2つの異なる大規模言語モデルに対してこのアプローチをテストしました。その結果、この新手法は既存の技術を大幅に上回り、誤った情報をはるかに高い精度で特定できることが示されました。決定的なことに、このシステムは効率的かつ堅牢であり、特定のトピックごとに再学習させることなく、新しいタイプの質問に対してもその知見を一般化できることが証明されました。この研究は、モデルの思考における完全な二次元構造(タイムラインと単語の関係性の両方)を尊重することで、現代の人工知能を悩ませる微細で自信に満ちたエラーに対する、より優れた防御策を構築できることを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →