CiteCheck: Retrieval-Grounded Detection of LLM Citation Hallucinations in Scientific Text
本論文は、学術的検索と構造化された大規模言語モデルによる検証を組み合わせ、科学文献における引用の幻覚を正確に検出するハイブリッドフレームワーク「CiteCheck」を導入し、既存のベースラインと比較して新たに構築された物理学ベンチマークにおいて優れた性能を達成したことを報告する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
非常に自信に満ちて、非常に高速なロボットが書いた科学レポートを読んでいると想像してください。そのロボットは美しく文章を書きますが、引用した書籍や論文のリストを作成する際、時には事実を捏造してしまいます。書名をでっち上げたり、著者の名前を混同したり、あるいは存在しない論文そのものを創作したりすることさえあります。これを「引用幻覚」と呼びます。
ご提供いただいた論文は、これらの誤りを検出するための新しいツール「CITECHECK」を紹介しています。CITECHECK を推測するロボットではなく、特定の任務を持つ「超・探偵図書館員」と考えてください。その任務とは、参照が実在するものか、詳細が正確かを確認することです。
以下に、CITECHECK の仕組みを簡単なステップに分解して示します。
1. 「図書館検索」(検索)
CITECHECK が引用(例:「Smith, 2023, The Physics of Stars」)を目にすると、ロボットの記憶をそのまま信じるわけではありません。代わりに、図書館員が即座に棚(あるいはインターネット)へ駆け寄り、実際の書籍を見つけるように行動します。
- クロスリファース(CrossRef)、セマンティック・シュガー(Semantic Scholar)、arXiv などの複数のデータベースを検索し、タイトルに一致する実際の論文を見つけます。
- 一致するものが見つからない場合、その引用はおそらく偽物であると即座に判断します。
2. 「違いを見つけよう」ゲーム(検証)
図書館員が実際の書籍を見つけると、CITECHECK はロボットの引用と、実際の書籍の表紙および詳細を並べて比較します。
- 賢い AI の「審査員」を使って、それらを比較します。
- スコア: 審査員は引用に 0 から 10 までのスコアを与えます。
- 10(完全一致): ロボットはすべて正しく記述しました。
- 6 または 7(軽微な幻覚): 書籍は存在しますが、ロボットは年を間違えたり、著者の名前をスペルミスしたり、URL をわずかに変更したりしています。ピザを注文してトッピングは正しいのに、生地(クラスト)が間違っているようなものです。
- 0 または 1(重大な幻覚): 書籍は全く存在しないか、ロボットは全く異なる書籍を記述しています。ピザを注文して、存在しないサンドイッチが届けられたようなものです。
3. 「第二の意見」(レビューパス)
時には、ロボットが巧妙な手口を使うこともあります。実在する URL(実際の論文へのリンクなど)を提供しつつ、偽のタイトルや著者を組み合わせるのです。これは、実在する住所を教えながら、そこに住んでいる人物を間違って伝えるようなものです。
- CITECHECK には、こうした疑わしいケースのための「レビュー」ステップがあります。2 番目の AI が詳細に確認し、リンクそのものだけでなく、タイトルと著者が実際にリンクと一致しているかを確認します。
「トレーニング場」(ベンチマーク)
自らのツールが機能することを証明するため、著者たちはシステムのための「トレーニングジム」を構築しました。彼らは982 の実在する物理学の引用を取り上げ、2 種類の偽バージョンを作成しました。
- 軽微な偽物: 実在する論文に、小さなこっそりとした誤り(例:「2023」を「2024」に変更するなど)を加えたもの。
- 重大な偽物: 一見説得力があるが、実際には存在しない完全に捏造された論文。
結果:探偵の勝利
CITECHECK を GPT、Claude、Gemini などの他の大規模 AI モデルと比較してテストした結果は明確でした。
- CITECHECK が最優秀でした。 実在する引用と偽の引用を正しく識別する割合は、**約 89%**でした。
- 勝った理由: 他の AI モデルは記憶からの推測や、単にテキストを読むことで判断しようとしていました。CITECHECK が勝ったのは、決定を下す前に実際に実在するデータベースと照合して事実を確認したからです。
- 他の AI に「カンニングペーパー」(何に注意すべきかの例)を与えたり、インターネットの使用を許可したりしても、CITECHECK の「まず検索し、その後比較する」という方法には勝てませんでした。
結論
この論文は、AI がソースについて嘘をつくのを防ぐためには、単に AI に「正直であれ」と求めるだけでは不十分であると主張しています。実在する証拠をまず検索し、その後、構造化された比較を用いて嘘を摘発するシステムが必要です。CITECHECK はまさにそれを行い、科学論文のための信頼できるファクトチェック機能として機能します。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。