What Citations Get Wrong: A Full-Corpus Audit of Reference Existence and Claim Support in a Major NLP Conference
本論文は、ACL 2026の会議録を監査した結果、引用された参考文献のほぼすべては存在するものの、単一実行による自動化された主張検証が記録されていないモデル構成のために再現に失敗したことを明らかにしており、厳格な引用検証には再現性を確保するための厳密な運用ログが必要であることを示している。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
現代科学という広大な図書館において、引用は単なるリストの中の名前以上のもの、すなわち「約束」である。著者が一文を書き、別の論文を指し示すとき、彼らは二つの明確なコミットメントを行っている。第一に、指し示した論文が実際に存在し、見つけられるものであるという約束である。第二に、より検証が困難なものとして、その論文が著者の主張するところ通りの内容であることを保証するという約束である。数十年にわたり、科学界は主にこの第一の約束について懸念を抱いてきた。特に人工知能の台頭に伴い、コンピュータプログラムが架空の論文を捏造し、存在しないタイトルや著者で参考文献リストを埋め尽くし、学術的記録を事実上のフィクションで汚染しているのではないかという不安が高まっている。この不安の声は大きいが、それを裏付ける証拠は乏しい。一方で、第二の約束、すなわち主張自体の正確性については、科学者が自身の情報源について真実を述べているかどうかの、より古く、より根本的なテストであるにもかかわらず、これまでほとんど注目されてこなかった。
タオ・アンという研究者は、これら両方の約束を同時に、しかも小規模なサンプルではなく、主要なコンピュータサイエンスの会議における一年分全体の論文を用いてテストすることに決めた。研究チームは、Association for Computational Linguistics(ACL)の2026年度のプロシーディングス(約4,500本の論文と20万件以上の参考文献を含むコレクション)に含まれるすべての参考文献を監査し、それらが実在する文書を指しているかどうかを調査した。さらに、抽出された比較的小さなサブセットに対しては、その文書が引用された文章を実際に支持しているかどうかもチェックした。目的は、AIによる偽の参考文献生成への恐怖が現実に基づいているのか、そして著者が情報源の内容をどの程度誤認しているのかを測定することであった。
調査は、第一の約束である「存在」から始まった。研究者たちは、すべての参考文献が実在し、取得可能な著作を指しているかを確認するシステムを構築した。その結果、大多数の参考文献、すなわち約91パーセントは、実在する文献へと正しく解決されることが判明した。一致しなかった少数の参考文献は、決して偽の論文ではなく、ブログ記事やソフトウェアのドキュメント、あるいはコンピュータがテキストを誤読したことによる解析エラーといったものであった。疑わしいと思われる極めて少数の参考文献をチームが手作業で精査したところ、約21万件のうち、論文が完全に存在しないことが確認されたのはわずか2例であった。この結果は、この主要なプラットフォームにおいて、AIが文献を捏造した論文で埋め尽くしているという懸念は、大部分において根拠がないことを示唆している。参考文献は、ほとんどの場合、実在しているのである。
しかし、研究者が第二の約束、すなわち「引用された論文が実際にその主張を支持しているか」に移ると、物語は一変した。これは、引用された論文を読み、それを参照している文章と比較するという、はるかに困難な作業である。チームは、コンピュータモデルを用いた二段階のプロセスを用いて、情報源を誤認していると思われる引用をフラグ立てした。最初の試行では、システムはごく少数のエラーを検出し、著者は概ね正確であるという結果を示した。しかし、研究者が全く同じコンピュータコードと全く同じ論文を使用して、全く同じプロセスを再度実行したところ、結果は劇的に異なった。二回目と三回目の実行では、初回よりも約6倍多い数のエラーが検出された。
この不一致こそが、本研究における最も重要な発見となった。研究者たちは、その原因を隠れた変数に突き止めた。すなわち、初期の判断を下した特定のコンピュータモデルが記録されていなかったことである。最初の実行では、システムはログに残らない形で、多くのエラーを見逃してしまう弱いモデルを密かに使用していた。その後の実行では、異なる強力なモデルが使用され、より多くの問題を捉えた。最初の実行で使用されたモデルが記録されていなかったため、研究者たちはその最初の結果が実際に何を測定したものなのかを確信を持って言うことができなかった。教訓は峻烈であった。プロセスが全く同じツールを用いて再現可能でない限り、どれほど入念に手作業でチェックされたとしても、単一の自動監査を信頼することはできない。測定そのものが不安定だったのである。
研究者が再現性のあるデータを確認した際、エラーは実在していたが、人々が恐れていたような機械生成のナンセンスではなかった。確認された間違いは、微妙な「人間のミス」であった。著者が実在する論文を取り上げ、その論文が実際に論じていることとは逆のことを主張していたり、論文が限定的な知見しか示していないにもかかわらず、広範な発見として引用したりしていたのである。これらは人工知能が生み出した幻覚ではなく、原稿を仕上げるために急いでいた疲れ切った研究者が犯しがちな種類のミスであった。これらのエラーは、参考文献が存在するかどうかのみをチェックするツールには見えない。なぜなら、論文自体は実在しており、主張と情報源との間の「つながり」が壊れているだけだからである。
また、この研究は、出版前に他の科学者が論文をチェックする査読プロセスが、これらのサポートに関するエラーを捉えられていないことも明らかにした。チームが公開された会議論文と、未査読のドラフト(草稿)のセットを比較したところ、引用エラーの割合に統計的な差は見られなかった。このことは、現在の査読制度が、すべての引用をその情報源と照らし合わせてチェックするように設計されていないことを示唆している。そのような作業は、ボランティアの査読者にとってあまりにも時間がかかりすぎるからである。したがって、引用が実際に主張を支持していることを保証する責任は、おそらく論文を提出する前の著者自身にある。
結局のところ、この監査は問題がどこにあるのかという明確な絵を提供した。科学的記録が架空の、存在しない論文で溢れかえっているという恐怖は、データによって支持されない。参考文献はほとんどの場合、実在している。真の問題は、それらの参考文献に付随する「主張の正確性」にある。これらのエラーは微細で、人間によるものであり、使用されるツール自体がまだ安定した信頼できる数値を出すほど成熟していないため、自動的に検出することが困難である。本研究は、機械が科学の誠実さを監視することを信頼できるようになる前に、まず機械自体が一貫性を持ち、そのエラー自体が十分に理解されていなければならないと結論づけている。残されている欠陥は、人工知能の重圧の下でシステムが崩壊している兆候ではなく、むしろ、人間による学問の根強い複雑さを思い出させるものである。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。