← Derniers articles
💬 NLP

Auditing Chinese Web-scale Corpora via Sampled BPE Token Statistics

Cet article présente Sampled-BPE, un pipeline d'audit au niveau des tokens léger qui identifie efficacement la pollution dans les corpus chinois à l'échelle du web en entraînant des tokeniseurs BPE sur de petits échantillons, révélant une contamination généralisée et changeante à travers les jeux de données ouverts tout en fournissant un jeu de données hiérarchique pour des analyses plus approfondies.

Auteurs originaux : Qingjie Zhang, Ziqi Tang, Jie Zhang, Gelei Deng, Jinfeng Li, YueFeng Chen, Yitong Yang, Hui Xue, Tianwei Zhang, Han Qiu

Publié 2026-08-12
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Qingjie Zhang, Ziqi Tang, Jie Zhang, Gelei Deng, Jinfeng Li, YueFeng Chen, Yitong Yang, Hui Xue, Tianwei Zhang, Han Qiu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez l'internet comme une bibliothèque géante et infinie où chaque livre, chaque blog et chaque page web cassée est une simple page de texte. Pendant des années, des scientifiques ont essayé d'apprendre aux ordinateurs à lire et à comprendre cette bibliothèque pour construire des « modèles de langage de grande taille » (LLM) — des assistants IA ultra-intelligents comme ceux avec lesquels vous pourriez discuter. Mais voici le problème : l'internet n'est pas seulement une bibliothèque propre ; c'est aussi un marché désordonné et chaotique rempli de spam, d'arnaques et de contenus inappropriés. Lorsque l'IA apprend de cette bibliothèque désordonnée, elle peut accidentellement acquérir de mauvaises habitudes, comme apprendre à écrire sur les jeux d'argent en ligne ou générer des phrases étranges et offensantes. C'est ce qu'on appelle la « pollution de corpus ». Pour corriger cela, les chercheurs doivent auditer la bibliothèque, mais la bibliothèque est si vaste (des billions de pages !) que lire chaque page prendrait plus longtemps qu'une vie humaine. Ils ont besoin d'un moyen de jeter un coup d'œil à l'intérieur et de trouver les mauvais spécimens sans avoir à vérifier chaque page.

C'est exactement ce que traite l'article « Auditing Chinese Web-scale Corpora via Sampled BPE Token Statistics ». Les auteurs, une équipe de l'Université Tsinghua et d'autres institutions, ont réalisé que tenter de scanner l'intégralité de l'internet chinois pour trouver du contenu malveillant était trop lent et coûteux. Ils ont donc inventé un raccourci ingénieux appelé SAMPLED-BPE. Imaginez cela comme un biologiste marin qui veut savoir à quel point un océan massif est pollué. Au lieu de récolter chaque goutte d'eau, il prélève quelques petits échantillons à différents endroits, les analyse, et utilise cela pour estimer le niveau de pollution de l'océan tout entier. Dans ce cas, l'« océan » est le web chinois, et la « pollution » est constituée de mots toxiques ou indésirables (tokens) qui sont intégrés dans les modèles d'IA.

La méthode de l'équipe est étonnamment simple mais puissante. Ils prennent une infime tranche des données textuelles chinoises massives (aussi peu que 0,25 % du total), entraînent un « tokenizer » spécial (un outil qui décompose le texte en petits morceaux appelés tokens) sur seulement cette tranche, puis regardent quels tokens apparaissent le plus souvent. Si un morceau de texte apparaît constamment dans leur petit échantillon, il est probable qu'il s'agisse d'un motif courant dans l'ensemble du jeu de données. Ils utilisent ensuite un assistant IA intelligent pour vérifier ce que ces morceaux fréquents signifient réellement en effectuant des recherches sur le web. Si un morceau de texte s'avère être un site de jeux d'argent ou une phrase pornographique, ils le signalent.

Leurs conclusions sont un choc. Ils ont audité 11 collections de textes chinois en open-source et 6 instantanés du web chinois de 2021 à 2026. Ils ont découvert que la pollution est partout, mais qu'elle n'est pas répartie uniformément. Certains jeux de données sont relativement propres, tandis que d'autres sont absolument noyés sous le contenu malveillant. Par exemple, un jeu de données appelé OSCAR s'est avéré être pollué à plus de 83 %, la majorité de cette pollution étant du contenu pour adultes. Un autre, mC4, était lourdement pollué par des termes liés aux jeux d'argent en ligne. Plus intéressant encore, ils ont découvert que le « Chinese Common Crawl » (un immense dépôt brut du web) est hautement pollué, et que le type de pollution change au fil du temps. En 2026, près de 69 % du contenu de leur instantané était du matériel pour adultes, alors que le contenu lié aux jeux d'argent avait considérablement diminué depuis 2021. Cela suggère que le « mauvais contenu » sur le web est une cible mouvante ; dès qu'un type de spam est bloqué, un autre apparaît.

L'article soutient également l'idée qu'on ne peut pas simplement créer une liste fixe de « mauvais mots » pour les filtrer. Parce que la pollution change très vite et utilise souvent des mots détournés, abrégés ou combinés (comme le mélange de deux mots normaux pour créer un terme de jeu d'argent), une liste statique deviendrait rapidement inutile. Au lieu de cela, les auteurs suggèrent que nous devons continuer à auditer le web régulièrement, tout comme ils l'ont fait. Pour aider les autres à le faire, ils ont publié un nouvel ensemble de données massif contenant plus de 630 000 enregistrements de ces tokens pollués, organisés en « arbres » qui montrent comment de courts mots malveillants se transforment en phrases plus longues et plus complexes.

En résumé, l'article prouve que vous n'avez pas besoin de lire tout l'océan pour savoir qu'il est sale ; un échantillon intelligent et réduit suffit à obtenir une image claire. Ils ont montré que le web chinois est actuellement un lieu très pollué pour l'entraînement de l'IA, et que la pollution évolue et se déplace rapidement. Leur nouvel outil, SAMPLED-BPE, permet de vérifier ces jeux de données massifs en quelques heures au lieu de plusieurs mois, offrant aux chercheurs un moyen de garder les modèles d'IA propres sans être submergés par la taille phénoménale d'internet.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →