Authority, Truth, and Citation Bias: A Large-Scale Multi-Domain Benchmark for Studying Epistemic Susceptibility in Large Language Models
本論文は、引用の存在自体が、その事実の正確性にかかわらず、大規模言語モデルにおけるハルシネーション率を著しく上昇させることを示す大規模なマルチドメイン・ベンチマークであるAuthorityBenchを紹介するものであり、捏造された引用が真実の主張に付随する場合に最も顕著な効果が観察される。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたがトリビア クイズを受けているところを想像してみてください。あなたはそこに行ったことがあるので、答えが「パリ」であることを知っています。しかし、ある時、教師が入ってきて、棚にある立派な本を指さしてこう言いました。「実は、首都はロンドンだよ。私はこの権威ある学術誌で読んだんだ」。
あなたはその答えを変えるでしょうか?ほとんどの人間なら、「待てよ、あの本は重要そうだ。もしかしたら自分の間違いかもしれない」と立ち止まって考えるでしょう。
この論文「AuthorityBench」は、人工知能(AI)について同様の問いを投げかけています。それは、もしAIが真実を知っているとしても、誰かがその真実とは逆のことを言う「引用(出典への参照)」を与えた場合、AIは盲目的にその引用を信じて、真実を忘れてしまうのか? ということです。
以下に、彼らの研究結果を簡単な比喩を用いて解説します。
実験:AIのための「フェイクニュース」テスト
研究者たちは、AIモデルを欺くために設計された、22万2000問という膨大なテスト「AuthorityBench」を構築しました。
彼らは、以下の4つのシナリオを含む「2x2」のゲームを設定しました。
- 正しい主張 + 本物の引用: AIは正解しており、出典も実在する。(イージーモード)。
- 誤った主張 + 偽の引用: AIは間違っており、出典も架空である。(明らかな罠)。
- 誤った主張 + 本物の引用: AIは間違っているが、出典は実在する。(巧妙な罠)。
- 正しい主張 + 偽の引用: これが大きな発見です。 AIは正しい答えを知っているのに、それが間違っていると述べる偽の出典が提示されるケースです。
これらは、一般知識、科学、法律、医学の4つの領域でテストされました。また、偽の出典の「風味」も変えました。ノーベル賞受賞者のような権威あるものもあれば、無名のブログのようなものもあり、さらに異なる国籍の名前を用いたものもありました。
大きな驚き:「権威の罠」
最も衝撃的な結果は、引用がAIを幻覚(嘘をつくこと)へと誘う「魔法の呪文」として機能しているということです。
- 「偽のソース」効果: AIが正しい答え(例:「パリは首都である」)を知っているにもかかわらず、偽の引用が現れて「ロンドンが首都である」と述べると、AIはしばしば答えをロンドンに変更してしまいます。
- 数字: 「一般知識」のカテゴリーでは、これが**35%から77%**の割合で発生しました。つまり、もしAIに真実の事実と偽の参照を与えると、AIは真実に固執するよりも、真実を否定する可能性の方が高かったのです。
- 「実在するソース」効果: たとえ引用が「実在」するものであっても、主張自体が誤っていた場合、AIは引用がない場合よりも幻覚を起こしやすくなりました。
比喩: ある学生が「2+2=4」という答えを知っていると想像してください。もしあなたが、「有名なスミス教授によれば、2+2=5である」と書かれた紙を渡したら、その学生は自分の脳を疑い、「5」と書き込んでしまいます。その紙(引用)が数学を凌駕してしまったのです。
重要ではなかったこと
研究者たちは、特定の要素がAIに引用をより信じ込ませるのではないかと考えましたが、これらの要素にはほとんど影響を与えないという驚きの結果が出ました。
- 威信(プレステージ): 偽の引用がトップクラスの大学からのものに見えるか、あるいは単なるブログからのものかに関わらず、AIは同様に混乱しました。
- 著者の身元: 偽の著者が特定の国や属性に関連する名前を持っていたとしても、AIにはほとんど影響がありませんでした。AIは「誰が書いたか」ではなく、「何かが書かれていること」自体に反応していたようです。
- モデルのサイズ: 「より賢い」あるいは「より大きな」AIであれば、騙されにくいのではないかと考えられました。しかし、この研究では、最も高度で巨大なモデルであっても、小さなモデルと同様に罠に陥りやすいことが判明しました。
たった一つの例外:「弁護士」AI
AIがそれほど簡単に騙されなかった領域が一つだけありました。それは「法律」です。
- 理由: 研究者たちは、法律のテキストには非常に特定の、形式的な「言語(特殊なコードのようなもの)」があると考えています。AIが法的引用を目にすると、盲目的に権威を受け入れるのではなく、「精査モード」に切り替わり、事実をより注意深くチェックしているようです。
- 一般知識は最も脆弱な部分であり、AIが最も容易に騙される領域でした。
「誤った主張」のひねり
研究では、AIが「すでに間違っている(誤った主張)」場合に何が起こるかも調査しました。
- 賢くなったAI: LlamaやClaudeのようなモデルの場合、引用(たとえ偽のものであっても)を見せられると、誤った主張に対して幻覚を起こす確率が低下しました。まるで、引用によって「うーん、これは再確認が必要だ」と気づき、自らを修正したかのようです。
- 愚かになったAI: GemmaやPhi-4のようなモデルの場合、引用によって誤った主張に対する幻覚が増加しました。彼らは誤った情報を盲目的に受け入れてしまいました。
結論
この論文は、引用を加えることは、必ずしもAIの信頼性を高めるわけではないと結論付けています。むしろ、多くの場合、信頼性を低下させます。
もしあなたが事実確認のためにAIを使用しており、AIがソースを引用しているのを見たとしても、それが真実であると決めつけてはいけません。 AIはその「権威」に感銘を受けすぎてしまい、喜んで実際の真実を捨て去ってしまう可能性があるのです。この研究は、医療や法律のような極めて重要な分野において、AIの回答に引用による根拠付けを行うことが、必ずしもエラーを修正する解決策にはならないことを警告しています。時には、引用そのものがエラーの源となるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。