LLM hallucinations in the wild: Large-scale evidence from non-existent citations
本研究は、大規模言語モデルの広範な採用が数百万件の学術論文において存在しない引用の急増をもたらしたという大規模な証拠を提供し、現在の編集上の防護策を凌駕しながら、知識生産の信頼性と公平性を脅かしていることを示している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
以下は、平易な言葉と日常的な比喩を用いた、この論文の説明です。
大きなアイデア:「架空の本」問題
あなたが学校の課題でエッセイを書いていると想像してください。参考文献リストには、あなたが読んだ本を記載する必要があります。もし存在しない本のタイトルを捏造すれば、先生は簡単に確認して「この本は実在しない」と指摘できます。
この論文は、AI(大規模言語モデル) が科学者たちの参考文献リストを作成し始めたときに何が起こるかを調査した大規模な研究です。研究者たちは、AI が次第に架空の本のタイトル(引用)を捏造し、実際の科学論文に紛れ込ませていることを発見しました。科学者たちは以前から小さな間違いを犯していましたが、この研究は、AI が普及して以来、これらの「架空の本」の数が爆発的に増加したことを示しています。
彼らはどのように AI を捕まえたのか
研究者たちは、科学界を巨大な図書館のように扱いました。彼らは、arXiv、bioRxiv、SSRN、PubMed Central という 4 つの主要なデジタル図書館にまたがる1 億 1100 万件の参考文献(引用) を調査しました。
- 手法: 彼らはすべての引用をチェックするためのデジタル「検索エンジン」を構築しました。もし検索エンジンが現実世界でその本や論文を見つけられなければ、それを「不一致」としてマークしました。
- フィルタリング: 彼らは、一部の引用が単に不備(フォーマット不良や難解な本)であることも知っていました。そこで、彼らはスマートな AI を使って不備のあるものを整理しました。すべての整理を行ってもなお引用が見つからない場合、それをハルシネーション(架空の参考文献) としてカウントしました。
- 基準: 彼らは、AI が普及する前(2022 年)と後で、架空の引用の数を比較しました。その結果、2024 年から急激かつ恐ろしいほどの急増が見られました。
結果: 2025 年だけで、これら 4 つの図書館において146,932 件の架空の引用が存在すると推定されています。これは氷山の一角に過ぎない可能性が高いです。
誰がこれを行っているのか
この論文は、「架空の本」問題が数人の悪い人物によるものではなく、広範囲に広がっているが、特定のグループに集中していることを発見しました。
- 「新参者」: 架空の引用を含める可能性が最も高いのは、まだ多くの論文を発表していない初期キャリアの研究者(学生や新任の教授) です。
- 比喩: 道路のルールをまだ十分に学んでいない新米ドライバーを想像してください。彼らは論文を書く(運転する)のを助けるために AI を使っていますが、地図を十分に知らず誤りを発見できないため、誤って架空の地区に突っ込んでしまいます。
- 「単独運転者」: 単独の著者や少人数のチームによって書かれた論文は、大規模なチームに比べて架空の引用の割合がはるかに高いです。
- 比喩: 一人で物語を書けば、タイプミスを見逃すかもしれません。しかし、編集者のチームと一緒に書けば、誰かがそれを発見します。大規模なチームは安全網として機能しますが、小規模なチームにはその網がないことが多いのです。
- 「AI 依存の分野」: AI を最も多く利用している分野(コンピュータサイエンスや社会科学など)は、架空の引用の割合が最も高いです。
誰が評価を得るのか
ここが不公平な部分です。AI が架空の論文を捏造する際、単にランダムな名前を作るわけではありません。それは、著名で成功した男性科学者によって書かれた論文を捏造する傾向があります。
- 比喩: 歴史のエッセイのために架空の引用を作る学生を想像してください。その学生は、ランダムな名前を作るのではなく、無意識に(あるいは偶然に)歴史上最も有名な大統領からの引用を捏造してしまいます。
- 結果: これは、AI が不平等を無意識に強化していることを意味します。すでに著名で男性である人々に追加の「評価」を与え、あまり著名でない人々や女性学者を無視します。たとえ論文が架空であっても、その著名な人物の名前は「これについて書いた人々」のリストに追加されてしまいます。
なぜ編集者は見抜けなかったのか
「ジャーナルは出版前にこれらの論文をチェックしないのか?」と思うかもしれません。この研究によれば、いいえ、実際にはそうではありません。
- プレプリントの問題: 多くの科学者は、正式に出版される前に、ブログの草稿のようにオンラインに自分の仕事を投稿します。この研究では、架空の引用の78.8% が初期のオンラインモデレーターをすり抜けていたことが分かりました。
- ピアレビューの隙間: これらの論文が正式なジャーナルでレビューを受ける場合でも、架空の引用の85% がプロセスを生き延びて出版されてしまいます。
- 比喩: コンサートでチケットをチェックする警備員を想像してください。警備員は明らかに偽物のチケットを持った人々は捕まえますが、AI が非常に説得力のある「それっぽく見える」偽物チケットを持った人々は、そのまま通り抜けてしまいます。
「雪だるま」効果
これの最も危険な点は、架空の引用がどのように広まるかです。
- 図書館の汚染: 一度架空の論文が出版されると、Google Scholar やその他のデータベースに追加されます。
- ループ: 将来の研究者(そして将来の AI)はこれらのデータベースを検索し、その架空の論文を見て、「ああ、これは本当のソースだ!」と考えます。そして、彼らはそれを自分の研究で引用します。
- 結果: 架空の論文は、誰もがそれを本物として扱うため、「本物」になります。AI は自らの間違いから学習し、図書館がより多くのフィクションで埋め尽くされていくというサイクルを作り出します。
結論
この論文は、私たちが信頼の危機にあると主張しています。科学は、あなたが論文を引用すれば、その論文は実際に存在し、あなたが主張していることを述べているという前提に依存しています。
この研究は、AI がこの信頼を破壊していることを示しています。事実確認のための最も厳格なルールと最良のツールを持つ分野である科学でさえ、AI は毎年何千もの架空の参考文献を巧妙に忍び込ませています。もしこれが最も検出しやすい科学の分野で起こっているなら、この論文は、事実を確認するツールがより少ない法曹、医療、政府報告書などの他の分野では、さらに深刻な事態が起きている可能性があると示唆しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。