← 最新の論文
💻 computer science

Is Misinformation More Open? A Study of robots.txt Gatekeeping on the Web

この研究は、信頼できるニュースサイトがrobots.txtや積極的な措置を通じてAIクローラーをますますブロックしている一方で、誤情報を扱うサイトは概して開かれたままの状態にあり、大規模言語モデルが利用可能な学習データを歪める可能性があるという、ウェブにおけるゲートキーピングの増大する非対称性を明らかにしている。

原著者: Nicolas Steinacker-Olsztyn, Devashish Gosain, Ha Dao

公開日 2026-08-13
📖 1 分で読めます☕ さくっと読める

原著者: Nicolas Steinacker-Olsztyn, Devashish Gosain, Ha Dao

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

インターネットを、あらゆる本、記事、ブログ投稿が読み解かれるのを待っている情報の断片である、巨大で賑やかな図書館だと想像してみてください。長年、「ロボット」(特殊なコンピュータプログラム)はこのデジタル世界の司書として、検索エンジンが情報を見つけやすくするために、静かに通路を歩き回り、本をコピーしてきました。しかし最近、新しい種類の司書が登場しました。人工知能(AI)ロボットです。これらは単に一冊の本を探しているのではなく、書き方、答え方、そして私たちとチャットする方法を学ぶために、すべてを同時に読もうとしています。これを管理するために、ウェブサイトの所有者は、ドアに掲げることができる「robots.txt」という、シンプルで自発的な看板を持つことができます。これは、デジタル世界の司書に対する「立ち入り禁止」または「どうぞお入りください」という看板のようなものです。もしウェブサイトの所有者が、この看板に「AI禁止」と書けば、礼儀正しいAIロボットはそれに従い、近づかないはずです。しかし、ここで大きな疑問が生じます。すべてのウェブサイトがこれらの看板を掲げているのでしょうか?そして、もし掲げているとしたら、同じ理由で掲げているのでしょうか?AIがより賢く強力になるにつれ、誰がドアを開け、誰がドアを閉めているのかを理解することは極めて重要になります。なぜなら、それがAIがどのような情報を学習するかを決定するからです。

「Is Misinformation More Open?(誤情報はより開かれているのか?)」と題されたこの論文は、これら2つの非常に異なるグループのウェブサイトが、これらの「立ち入り禁止」の看板をどのように扱っているかを調査する、デジタル探偵物語のようなものです。研究者たちは2つのグループを調査しました。それは、「信頼できる」ニュースサイト(真面目にファクトチェックを行うジャーナリストたち)と、「誤情報」サイト(虚偽や誤解を招く物語を広めている場所)です。彼らは、真面目なニュース組織が、偽ニュースのサイトと比較して、AIロボットに対して立ち入り禁止を伝えるのがより上手いかどうかを調べようとしました。

調査結果は、驚くべき、そして鮮明な対照を明らかにしています。研究者たちは、信頼できるニュースサイトの方が、AIロボットに対して「立ち入り禁止」の看板を掲げる傾向がはるかに高いことを発見しました。実際、これらの信頼できるサイトの60.0%が、少なくとも一つのAIクローラーに対して、そのrobots.txtファイルから立ち入りを禁止するという明確な指示を出していました。これとは対照的に、誤情報サイトが同様のことを行ったのは、わずか9.1%でした。それはまるで、真面目な図書館は新しいAIの学生たちのためにドアに鍵をかけている一方で、偽ニュースのパンフレット配布者たちはドアを大きく開け放しているかのようです。平均して、信頼できるニュースサイトは、訪問してほしくない15.5種類もの異なるAIロボットをリストアップしていましたが、誤情報サイトは1つ未満でした。

この研究では、これらのウェブサイトが実際に看板を「執行」しているのか、それとも単に書き留めているだけなのかについても調査しました。その結果、信頼できるニュースサイトはルールを書くだけでなく、侵入しようとするAIロボットを積極的にブロックしており、書かれたルールと行動を一致させていることがわかりました。誤情報サイトは一貫性に欠けていました。一部のサイトはブロックを行っていましたが、多くのサイトはルールを書き留めることさえしませんでした。研究者たちは、2023年9月から2025年5月までのスナップショットを見て、時間の経過とともにどのように変化したかも観察しました。彼らは、信頼できるニュースサイトが迅速にドアを閉める方法を学んでいることを目にしました。AIをブロックするサイトの数は、わずか数年で**23%から60%**近くまで急増しました。しかし、誤情報サイトは依然として主に受動的であり、看板を更新することはほとんどありませんでした。

著者らは、この広がりつつある格差が奇妙な状況を生み出していると示唆しています。すなわち、「良質な」情報源がコンテンツを保護するためにドアを閉め始めるにつれて、AIロボットは、依然として広く開かれている「悪い」情報源をより多く読むようになる可能性があるということです。これは、誤情報サイトの方がアクセスしやすいため、AIが正確なニュースよりも誤情報から多くを学んでしまう可能性があることを意味します。この論文は、これがすでにAIを台無しにしたと主張しているのではなく、現実的なリスクを強調しています。つまり、誰がドアを開けているのかに注意を払わなければ、AIの未来は虚偽の基礎の上に築かれることになるかもしれない、ということです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →