Quantifying Geospatial in the Common Crawl Corpus
本論文は、Common Crawl コーパスにおける地理空間情報の存在度を定量化するために Gemini 1.5 を活用し、英語と非英語の言語間で最小限の差異しか見られない形で、ウェブドキュメントの 18.7% がそのようなデータを含んでいると推定することで、大規模言語モデルにおける地理空間的バイアスを研究するための基盤を確立する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
インターネットを、数十億冊の書籍、記事、ウェブページを含む巨大で混沌とした図書館だと想像してください。この図書館はCommon Crawlと呼ばれます。これは、チャットボットを駆動するもののような「スーパーブレイン」(大規模言語モデル、LLM)が、話し方や思考を学ぶために「幼少期」に摂取する、生テキストの巨大な山です。
最近、科学者たちは、これらのスーパーブレインが地理の理解において驚くほど優れていることに気づきました。彼らはロンドンからパリまでの距離を教えたり、都市がどのように見えるかを記述したりできます。しかし、大きな疑問が残っていました:彼らはこれをどこで学んだのでしょうか? 彼らが学んだ図書館には、彼らを教育するのに十分な地図や住所が含まれていたのでしょうか?
この論文は、まさにその巨大な図書館に入り込み、位置情報を含むページが正確に何枚あるかを数えようとする図書館員チームのようです。
任務:「どこ」を数える
研究者たちは知りたいと考えていました:この巨大な図書館にあるウェブページのうち、実際に特定の場所を言及しているのは何ページでしょうか?
彼らは「特定の場所」を、以下の 2 つのシンプルな方法で定義しました:
- 座標: 地図上の特定の場所をピン留めする正確な数値(緯度と経度など)。
- 住所: 手紙を送ったり建物を発見したりするために使える、通り名、都市、番号(例:「123 メイン通り」)。
彼らは、地図上で特定できるほど正確な場所であることを確実なものにするため、住所が付随していない限り、「エッフェル塔」のような曖昧な言及は数えないことにしました。
探偵作業:スーパースキャナーの使用
図書館はあまりにも巨大で、人間がページを一枚ずつ読むことはできません。そこで、研究者たちはGemini 1.5と呼ばれる強力な AI ツールを「スーパースキャナー」として使用しました。
Gemini を、非常に速く非常に賢いインターンだと考えてください。研究者は、ランダムなウェブページの束をそれに見せ、「ねえ、このページに住所や一組の地図座標はありますか?もしあれば、例を見せてください」と尋ねました。
図書館があまりにも大きいため、すべてのページをチェックすることはできませんでした。代わりに、彼らは統計的なトリック(世論調査員が 1,000 人の人々に質問して一国全体の意見を推測するような)を用いて、3 つの異なる時期(2019 年、2021 年、2024 年)から約12 万ページの代表的なサンプルを選びました。
大発表
AI がページをスキャンし、人間が AI が「幻覚」(作り話)を起こしていないかを確認した結果、いくつかの興味深い数値が見つかりました:
- 金鉱: 図書館内のすべてのウェブページの約18.7%が、何らかの具体的な位置データを含んでいます。これはおよそ5 枚に 1 枚の割合です。
- 構成:
- 住所のみを含むページ(16.1%)。
- 座標のみを含むページ(7.0%)。
- 両方を含むページ(4.3%)。
- 言語のバランス: 驚くべきことに、ページが英語か他の言語かは関係ありませんでした。「位置密度」は両者でほぼ同じでした。ページがスペイン語、中国語、英語のいずれであっても、住所や座標を持っている確率はほぼ等しかったです。
- 「Google マップ」効果: 見つかった座標の多くは、単に Google マップへのリンクでした。これは、Google マップが主要なマップアプリではない国(中国やロシアなど)では、座標リンクの数が少ないことを意味し、それらの言語では位置データがやや少ない理由を説明するかもしれません。
「スーパーブレイン」への意味
この論文は、AI が学んだ図書館は実際には地理で満ちていると結論付けています。空っぽではありません。
AI が住所や座標を含む多くのページを摂取したため、空間、方向、距離を理解するようになったのは当然です。しかし、研究者たちはまた、図書館に「味の偏り」があることも指摘しました:
- 英語と.com ウェブサイトは過剰に代表されています(図書館の巨大な部分を占めています)。
- これは、AI が英語話者中心、アメリカ中心のウェブサイトを通じて見られた世界に「バイアス」がかかり、世界の他の部分のニュアンスを見逃している可能性があることを意味します。
結論
研究者たちは新しい地図や新しいアプリを構築したわけではありません。彼らは単にインターネットの生データを取り、国勢調査を行いました。彼らは、AI の訓練に使用されるデータの中に地理が至る所に存在することを発見しました。これが AI が地理に優れている理由を説明しますが、同時に、AI の「世界観」が、彼らが学んだ図書館で最も一般的だったウェブサイトによって大きく形作られているという警告でもあります。
この論文は、この位置データの巨大なコレクション(約 460 億ページ!)が、地理タスクに特化して AI を訓練したい将来の研究者にとって「金鉱」になり得ると示唆して終わりますが、それはこの研究ではなく、将来の研究の仕事です。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。