Eliciting Intrinsic Hallucinations in LLMs via Semantically Equivalent Adversarial Attacks
本論文は、意味的に等価な敵対的攻撃を用いたフレームワークを導入することで、意味を保持したクエリの摂動が、検索された根拠を忠実に活用する能力を著しく低下させるという、最先端のLLMが内在的なハルシネーションに対して依然として非常に脆弱であることを実証する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、宇宙にあるほぼすべての本を読んだことのある、超スマートなロボット司書に話しかけているところだと想像してください。あなたは質問をする際、念のために、その答えの鍵として使う特定の本のページをそのロボットに手渡します。このセットアップは「検索拡張生成(RAG)」と呼ばれます。これは、ロボットが自分の記憶だけで推測しなくて済むように、参照シートを与えるようなものです。期待されるのは、ロボットがその参照シートに厳格に従い、もし二つの内容が一致しない場合は、自分自身の内部知識を無視することです。しかし、ここに落とし穴があります。たとえ手元に参照シートがあっても、ロボットが混乱したり、読んでいる内容を忘れたり、あるいは勝手に作り話を始めてしまうことがあります。これは「内在的ハルシネーション(幻覚)」と呼ばれます。ロボットが悪意を持って嘘をついているのではなく、目の前にある証拠に忠実であり続けるには、その脳が少しばかり「落ち着きなさすぎる」のです。
ここで、あなたは探偵になって、そのロボットがどれほど「落ち着きがない」のかを見極めようとしていると考えてください。同じ質問を100通りの方法で投げかけることもできますが、もし質問の意味を変えてしまったら、ロボットは新しいトピックによって混乱してしまうかもしれません。その集中力を真にテストするには、全く同じ質問を、さまざまなアクセントや方言、あるいは文章構造を用いて、意味を変えずに囁く必要があります。もし、あなたが「今、何時ですか?」と言う代わりに「現在の時刻を教えていただけますか?」と言っただけで、ロボットが異なる(そして間違った)答えを出してしまったとしたら、そのロボットには深刻な問題があるということです。つまり、一貫性の問題です。この論文は、ロボットがプレッシャーに負けてしまうかどうかを確かめるために、それらの意味を保持したままのトリッキーなバリエーションを囁く仕組みを構築することについて書かれています。
研究者たちは、この巧妙な新しいフレームワークを使用して、これらのAIシステムをストレス・テストすることに決めました。彼らは単にモデルに安全規則を破らせる(これはAIをテストする一般的な方法です)のではなく、モデル自身の「誠実さ」を破らせようとしました。彼らは、数学を用いて言葉を微調整するもの、遺伝的アルゴリズムを用いて新しい文章を進化させるもの、あるいは他のAIを使って質問を書き換えるものといった、デジタルな「攻撃者」のチームを使用し、意味を保持したままの完璧な言い換えを見つけ出しました。目標は、質問の意味がオリジナルと全く同じであるにもかかわらず、提供されたコンテキストを無視して物語を作り上げるように、モデルを騙せるかどうかを確認することでした。
結果は、かなりの衝撃的なものでした。チームは、最新鋭の高度なモデルであっても、驚くほど脆弱であることを発見しました。これらの意味的に等価な攻撃を用いたとき、モデルの事実に忠実である能力は劇的に低下しました。特定のモデル、例えば特定のデータセットにおけるGPT-5-miniのようなケースでは、忠実度が最大50%も低下しました。例えば、FaithEvalデータセットにおいて、GPT-5-miniの忠実度は0.72から0.22へと、41.7%減少しました。質問の言い回しがわずかに変わっただけで、意味は全く変わっていないにもかかわらず、突然正解できなくなったのです。
この論文は、単にモデルを大きくしたり賢くしたりするだけでは、この問題を解決するには不十分であることを示唆しています。研究者たちは、小規模なオープンソースモデルから、巨大なクローズドソースの巨人まで、あらゆるものをテストしましたが、それらはすべて、意味を保持したままのトリックに直面するとつまずきました。攻撃は非常に効果的で、質問が論理的に同一であるにもかかわらず、モデルに「回答不能」と言わせたり、テキストに含まれていない詳細を捏造させたりすることさえできました。
興味深いことに、攻撃の種類によって結果が異なりました。単に単語を類義語に置き換える(例えば「大きい」を「巨大な」に変えるなど)手法は、しばしば質問を奇妙で不自然なものにし、モデルはそれを容易に見抜くことができました。しかし、他のAIを使用して文章全体を自然に書き換える手法は、流れと意味を完璧に保ちながらも、真の厄介者となりました。これらの自然な響きの攻撃こそが、最大のパフォーマンス低下を引き起こしたのです。これは、モデルが単に奇妙な支離滅裂な言葉に対してだけでなく、人間の言語の自然な多様性に対しても脆いことを証明しています。
研究では、モデルが「どのように」失敗したのかについても調査しました。時には回答を拒否することもありましたが、多くの場合、事実を誤ったり、コンテキストを読み間違えたり、あるいは不適切な論理的飛躍を行ったりしました。これは、問題が単にモデルが頑固であることではなく、提供されたテキストに根ざして回答する能力が根本的に不安定であるということを物語っています。研究者たちは、モデルがどのような質問のされ方をしても、証拠に基づいた回答を強制できるような、新しいアーキテクチャや訓練方法を構築する必要があると結論付けています。それまでは、たとえ最もスマートなAI司書であっても、わずかに異なる一文によって、全く新しい歴史を作り上げてしまう可能性があるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。