← Nieuwste papers
💬 NLP

Auditing Chinese Web-scale Corpora via Sampled BPE Token Statistics

Dit artikel introduceert Sampled-BPE, een lichtgewicht audit-pipeline op token-niveau die efficiënt vervuiling in web-schaal Chinese corpora identificeert door BPE-tokenizers te trainen op kleine steekproeven, waarbij wijdverspreide en verschuivende contaminatie in open datasets wordt onthuld terwijl een hiërarchische dataset voor verdere analyse wordt geboden.

Oorspronkelijke auteurs: Qingjie Zhang, Ziqi Tang, Jie Zhang, Gelei Deng, Jinfeng Li, YueFeng Chen, Yitong Yang, Hui Xue, Tianwei Zhang, Han Qiu

Gepubliceerd 2026-08-12
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Qingjie Zhang, Ziqi Tang, Jie Zhang, Gelei Deng, Jinfeng Li, YueFeng Chen, Yitong Yang, Hui Xue, Tianwei Zhang, Han Qiu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je het internet voor als een gigantische, eindeloze bibliotheek waar elk boek, elke blog en elke kapotte webpagina een enkele pagina tekst is. Jarenlang hebben wetenschappers geprobeerd computers te leren lezen en deze bibliotheek te begrijpen om "Large Language Models" (LLM's) te bouwen—superintelligente AI-assistenten zoals de modellen waarmee je misschien chat. Maar hier is het probleem: het internet is niet alleen een schone bibliotheek; het is ook een rommelige, chaotische marktplaats vol spam, oplichting en ongepaste inhoud. Wanneer AI leert van deze rommelige bibliotheek, kan het per ongeluk slechte gewoonten aanleren, zoals leren schrijven over online gokken of het genereren van vreemde, beledigende zinnen. Dit wordt "corpusvervuiling" genoemd. Om dit op te lossen, moeten onderzoekers de bibliotheek auditeren, maar de bibliotheek is zo enorm groot (biljoenen pagina's!) dat het lezen van elke afzonderlijke pagina langer zou duren dan een menselijk leven. Ze hebben een manier nodig om naar binnen te gluren en de slechte appels te vinden zonder elke pagina te hoeven controleren.

Dit is precies waar het artikel "Auditing Chinese Web-scale Corpora via Sampled BPE Token Statistics" zich mee bezighoudt. De auteurs, een team van de Tsinghua Universiteit en andere instellingen, realiseerden zich dat het proberen te scannen van het gehele Chinese internet op slechte inhoud te traag en te duur was. Daarom hebben ze een slimme afkorting uitgevonden genaamd SAMPLED-BPE. Denk aan een marien bioloog die wil weten hoe vervuild een enorme oceaan is. In plaats van elke druppel water op te scheppen, neemt hij een paar kleine monsters uit verschillende plekken, analyseert deze, en gebruikt dat om het vervuilingsniveau van de hele oceaan in te schatten. In dit geval is de "oceaan" het Chinese web, en de "vervuiling" zijn giftige of spammy woorden (tokens) die in AI-modellen worden ingebakken.

De methode van het team is verrassend eenvoudig maar krachtig. Ze nemen een piepklein deel van de enorme Chinese tekstdata (slechts 0,25% van het totaal), trainen een speciale "tokenizer" (een hulpmiddel dat tekst opbreekt in kleine stukjes genaamd tokens) op slechts dat deel, en kijken vervolgens welke tokens het vaakst voorkomen. Als een stuk tekst constant verschijnt in hun kleine steekproef, is het waarschijnlijk een veelvoorkomend patroon in de hele dataset. Ze gebruiken vervolgens een slimme AI-assistent om te controleren wat die veelvoorkomende stukjes eigenlijk betekenen door op het web te zoeken. Als een stukje tekst een gokwebsite of een pornografische frase blijkt te zijn, markeren ze het.

Hun bevindingen zijn een schok. Ze hebben 11 verschillende open-source Chinese tekstcollecties en 6 snapshots van het Chinese web van 2021 tot 2026 geaudit. Ze ontdekten dat vervuiling overal aanwezig is, maar dat het niet gelijkmatig verspreid is. Sommige datasets zijn relatief schoon, terwijl andere absoluut verdrinken in slechte inhoud. Zo bleek bijvoorbeeld één dataset genaamd OSCAR voor meer dan 83% vervuild te zijn, waarbij het merendeel bestond uit volwassen inhoud. Een andere, mC4, was zwaar vervuild met termen gerelateerd aan online gokken. Nog interessanter is dat ze ontdekten dat de "Chinese Common Crawl" (een enorme, ruwe dump van het web) zeer vervuild is, en dat het type vervuiling in de loop van de tijd verandert. In 2026 was bijna 69% van de inhoud in hun snapshot volwassen materiaal, terwijl de inhoud met betrekking tot gokken sinds 2021 aanzienlijk was gedaald. Dit suggereert dat het "slechte spul" op het web een bewegend doelwit is; zodra één type spam wordt geblokkeerd, duikt er weer een ander type op.

Het artikel voert ook argumenten aan tegen het idee dat je gewoon een vaste lijst van "slechte woorden" kunt maken om te filteren. Omdat de vervuiling snel verandert en vaak gebruikmaakt van sluwe, afgekortte of gecombineerde woorden (zoals het mengen van twee normale woorden om een gokterm te maken), zou een statische lijst snel nutteloos worden. In plaats daarvan stellen de auteurs voor dat we het web regelmatig moeten blijven auditeren, net zoals zij deden. Om anderen hiermee te helpen, hebben ze een enorme nieuwe dataset uitgebracht met meer dan 630.000 records van deze vervuilde tokens, georganiseerd in "bomen" die laten zien hoe korte, slechte woorden uitgroeien tot langere, complexere slechte frases.

Kortom, het artikel bewijst dat je niet de hele oceaan hoeft te lezen om te weten dat deze vuil is; een slimme, kleine steekproef is genoeg om een duidelijk beeld te krijgen. Ze lieten zien dat het Chinese web momenteel een zeer vervuilde plek is voor AI-training, en dat de vervuiling snel verschuift en evolueert. Hun nieuwe hulpmiddel, SAMPLED-BPE, maakt het mogelijk om deze enorme datasets in uren in plaats van maanden te controleren, waardoor onderzoekers een manier hebben om AI-modellen schoon te houden zonder overweldigd te raken door de enorme omvang van het internet.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →