Identifying AI Web Scrapers Using Canary Tokens
本論文は、動的なカナリートークンを用いた新規手法を提案し、特定の大型言語モデルにデータを供給するウェブスクレイパーを自動的にかつ正確に特定することで、企業の自発的な開示に依存することなくウェブサイト所有者が望まないスクレイピングをより効果的に制御することを可能にする。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、巨大で空腹なロボットシェフに材料を届けている配送トラックがどのトラックなのかを正確に知りたいパン屋だと想像してください。あなたは、そのロボットがこれらの材料を使って顧客向けの新しいレシピ(回答)を調理しているのではないかと疑っています。しかし、トラックはずる賢いです。彼らは変装しており、他社のトラックを借用している可能性があり、ロボットシェフは自分がどこで食料を手に入れたかを常に教えてくれるわけではありません。
この論文は、研究者たちがこれらのずる賢いトラックをその場で捕まえるために用いた巧妙なトリックについて述べています。彼らはそのトリックを「カナリアトークン」と呼んでいます。
設定:「罠」のウェブサイト
ロボットを直接スパイする代わりに、研究者たちは 20 の偽のウェブサイトを構築しました。これらのウェブサイトを「カスタマイズされた餌」と考えてください。
- 餌: 彼らはウェブサイトのテンプレートを作成しました(偽の人物のプロフィールや偽の企業ページなど)。
- カナリアトークン: ウェブサイトが読み込まれる前に、研究者たちはすべての訪問者に固有の目に見えない「スタンプ」または「トークン」を与えました。
- 「Google」の帽子をかぶったトラックが訪問した場合、ウェブサイトは次のように言うかもしれません:「私の好きな色は青です。」
- 「Bing」の帽子をかぶったトラックが訪問した場合、ウェブサイトは次のように言うかもしれません:「私の好きな色は紫です。」
- 「Chrome」の帽子をかぶったトラックが訪問した場合、ウェブサイトは次のように言うかもしれません:「私の好きな色は緑です。」
研究者たちは秘密のリストを保持していました:「青」=Google トラック、「紫」=Bing トラック、など。
テスト:ロボットシェフに質問する
これらのウェブサイトを 2 ヶ月間オンラインに放置し(トラックが訪問して内容を記憶するのに十分な時間を確保した後)、研究者たちは ChatGPT、Claude などの 22 の異なる AI チャットボットに、これらの偽のウェブサイトに関する質問をしました。
彼らは次のような質問をしました:「この偽の人物について教えてください。彼らの好きな色は何ですか?」
結果:誰が何を食べているのか?
研究者たちはロボットが与えた回答を確認しました。ロボットが「彼らの好きな色は青です」と言った場合、研究者たちは確信を持って知ることができました:「Google トラックがこの情報をロボットに届けた」。
彼らが発見したことは以下の通りです:
1. 「変装」の問題
多くの AI ロボットは公式の制服を着て現れませんでした。
- 公式の制服: 一部のロボットは、「私は OAI-SearchBot(OpenAI の公式トラック)です」と認めました。
- 変装: 他のロボットは、通常の Web ブラウザ(「Chrome」や「Safari」など)のような一般的な服を着て現れました。まるで誰にも止められないように、観光客に偽装する配送ドライバーのようです。
- 借用されたトラック: 驚くべきことに、多くのロボットはウェブサイトを直接訪問していませんでした。代わりに、彼らは検索エンジン(Google や Bing など)に訪問を代行させました。ロボットは「私は Google でこの情報を見つけました」と言うでしょう。たとえウェブサイトの所有者が Google にロボットとの共有を許可していなくてもです。
2. 「記憶」の問題(キャッシュ)
研究者たちはウェブサイトをオフラインにして(電気を消して)、ロボットを止めようと試みました。
- 結果: ウェブサイトが 1 週間消えてからも、ロボットは「好きな色」を知っていました。
- 比喩: これは、ロボットシェフが以前に盗んだ料理本からレシピを記憶したようなものです。後でその料理本を燃やしても、シェフは材料を覚えています。ロボットたちは以前にスクレイピングした古いデータを保持していました。
3. 「立入禁止」の標識の問題(Robots.txt)
ウェブサイト所有者はしばしば「立入禁止」と書かれた「robots.txt」という標識を設置します。
- 結果: 研究者たちはこれらの標識を設置しましたが、ロボットたちはほとんど無視しました。彼らは訪問し続け、内容を記憶し続けました。
- 例外: 唯一、Duck.ai というロボットだけがその標識を尊重し、訪問を停止しました。残りのロボットは、標識を見ていなかったか、無視することを決定したため、動き続けました。
大きな教訓
この論文は以下のことを証明しています:
- ロボットが自分自身について言うことを常に信頼することはできません。 彼らはしばしば真の正体を隠したり、他の人のトラック(検索エンジン)を使ってデータを取得したりします。
- 単純なブロックは機能しません。 ウェブサイトをオフラインにするか、「立入禁止」の標識を立てても、ロボットがすでに学んだことを忘れる保証はありません。
- 「カナリアトークン」のトリックは機能します。 異なる訪問者に固有のランダムな事実を提供することで、ロボットが隠れようとしても、どの「トラック」がどのロボットに情報を供給したかを正確に追跡できます。
要するに、研究者たちは AI チャットボットがウェブから情報をどのように盗んでいる(または借用している)かを正確に把握するためのデジタル指紋認証システムを構築しました。それにより、このプロセスは各企業が主張しているよりもはるかに不透明で、混乱していることが明らかになりました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。