← 最新の論文
💬 NLP

Auditing Chinese Web-scale Corpora via Sampled BPE Token Statistics

本論文は、少量のサンプルでBPEトークナイザーを学習させることで、大規模な中国語コーパスにおける汚染を効率的に特定する軽量なトークンレベルの監査パイプラインであるSampled-BPEを導入し、オープンデータセット全体にわたる広範かつ流動的な汚染を明らかにしつつ、さらなる分析のための階層的なデータセットを提供するものである。

原著者: Qingjie Zhang, Ziqi Tang, Jie Zhang, Gelei Deng, Jinfeng Li, YueFeng Chen, Yitong Yang, Hui Xue, Tianwei Zhang, Han Qiu

公開日 2026-08-12
📖 1 分で読めます☕ さくっと読める

原著者: Qingjie Zhang, Ziqi Tang, Jie Zhang, Gelei Deng, Jinfeng Li, YueFeng Chen, Yitong Yang, Hui Xue, Tianwei Zhang, Han Qiu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

インターネットを、あらゆる本、ブログ、壊れたウェブページがたった一ページのテキストとして存在する、巨大で終わりのない図書館だと想像してみてください。長年、科学者たちはコンピュータにこの図書館を読み、理解させる方法を教え、チャットなどで使うような超スマートなAIアシスタントである「大規模言語モデル(LLM)」を構築しようと試みてきました。しかし、ここに問題があります。インターネットは単なる清潔な図書館ではなく、スパム、詐欺、不適切なコンテンツに満ちた、乱雑で混沌とした市場でもあるのです。AIがこの乱雑な図書館から学習すると、オンラインギャンブルについて書いたり、奇妙で不適切なフレーズを生成したりといった「悪い癖」を誤って身につけてしまうことがあります。これは「コーパス汚染(corpus pollution)」と呼ばれます。これを修正するために、研究者たちは図書館を監査する必要がありますが、図書館があまりにも巨大(数兆ページ!)であるため、すべてのページを読み込むには人間の寿命よりも長い時間がかかってしまいます。彼らは、すべてのページをチェックすることなく、中を覗き見て「悪いリンゴ」を見つけ出す方法を必要としているのです。

これこそが、論文「Auditing Chinese Web-scale Corpora via Sampled BPE Token Statistics」が取り組んでいる課題です。清華大学などのチームである著者らは、中国のインターネット全体をスキャンして不適切なコンテンツを探そうとすることは、あまりにも遅く、コストがかかりすぎると気づきました。そこで、彼らはSAMPLED-BPEと呼ばれる巧妙なショートカットを考案しました。これは、広大な海がどれほど汚染されているかを知りたい海洋生物学者のようなものです。あらゆる水をすくい上げる代わりに、異なる場所からいくつかの小さなサンプルを取り、それらを分析することで、海全体の汚染レベルを推定します。この場合、「海」は中国のウェブであり、「汚染」はAIモデルに組み込まれてしまう有害な言葉やスパム的な言葉(トークン)です。

彼らの手法は驚くほどシンプルですが強力です。彼らは膨大な中国語テキストデータのごく一部(全体のわずか0.25%程度)を取り出し、その小さな断片に対して特別な「トークナイザー」(テキストをトークンと呼ばれる小さな塊に分解するツール)を学習させ、どのトークンが最も頻繁に現れるかを確認します。もし、その小さなサンプルの中で特定のテキストの塊が絶えず出現する場合、それはデータセット全体における共通のパターンである可能性が高いといえます。次に、彼らはスマートなAIアシスタントを使用して、ウェブ検索を通じてそれらの頻出する塊が実際に何を意味しているのかを調べます。もし、ある塊がギャンブルサイトやポルノグラフィのフレーズであると判明した場合、それをフラグ立て(警告)します。

彼らの発見は衝撃的です。彼らは11種類のオープンソースの中国語テキストコレクションと、2021年から2026年までの6つの中国ウェブのスナップショットを監査しました。その結果、汚染はいたるところに存在していますが、一様に広がっているわけではないことが分かりました。比較的クリーンなデータセットもあれば、不適切なコンテンツに完全に溺れているものもあります。例えば、「OSCAR」と呼ばれるデータセットは83%以上が汚染されており、その大部分が成人向けコンテンツであることが判明しました。また、「mC4」はオンラインギャンブルの用語でひどく汚染されていました。さらに興味深いことに、彼らは「Chinese Common Crawl」(膨大な生のウェブのダンプ)が高度に汚染されており、その汚染の種類は時間の経過とともに変化していることを発見しました。2026年には、スナップショット内のコンテンツの約69%が成人向け素材でしたが、ギャンブル関連のコンテンツは2021年以降大幅に減少していました。これは、ウェブ上の「悪いもの」は動く標的であることを示唆しています。ある種のスパムがブロックされると、すぐに別の種類が登場するのです。

この論文は、単に「悪い言葉」の固定リストを作ってフィルタリングすればよいという考えにも異を唱えています。なぜなら、汚染は非常に速く変化し、しばしば巧妙な略語や組み合わせられた言葉(例えば、2つの普通の言葉を組み合わせてギャンブル用語を作るなど)を使用するため、静的なリストはすぐに役に立たなくなるからです。代わりに、著者らは彼らが行ったように、定期的にウェブを監査し続ける必要があると提案しています。他の人々がこれを行えるよう、彼らは63万件以上の汚染されたトークンを含む新しい大規模なデータセットを公開しました。これは、短い悪い言葉がいかにして長く複雑な悪いフレーズへと成長していくかを示す「ツリー(木構造)」形式で整理されています。

要するに、この論文は、海が汚れているかどうかを知るために、海全体を読む必要はないということを証明しています。スマートで小さなサンプルがあれば、明確な全体像を把握できるのです。彼らは、中国のウェブが現在、AI学習にとって非常に汚染された場所であること、そしてその汚染が急速に変化し進化していることを示しました。彼らの新しいツールであるSAMPLED-BPEは、これらの膨大なデータセットを数ヶ月ではなく数時間でチェックすることを可能にし、研究者がインターネットのあまりの大きさに圧倒されることなく、AIモデルをクリーンに保つための手段を提供しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →