Auditing Chinese Web-scale Corpora via Sampled BPE Token Statistics
Este artigo apresenta o Sampled-BPE, um pipeline de auditoria em nível de token leve que identifica eficientemente a poluição em corpora chineses de escala web ao treinar tokenizadores BPE em pequenas amostras, revelando uma contaminação generalizada e mutável em conjuntos de dados abertos, ao mesmo tempo em que fornece um conjunto de dados hierárquico para análises posteriores.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine a internet como uma biblioteca gigante e infinita onde cada livro, blog e página da web quebrada é uma única página de texto. Durante anos, cientistas têm tentado ensinar computadores a ler e entender essa biblioteca para construir "Grandes Modelos de Linguagem" (LLMs) — assistentes de IA superinteligentes como os com os quais você pode conversar. Mas aqui está o problema: a internet não é apenas uma biblioteca limpa; é também um mercado bagunçado e caótico cheio de spam, golpes e conteúdo inapropriado. Quando a IA aprende com essa biblioteca bagunçada, ela pode acidentalmente adquirir maus hábitos, como aprender a escrever sobre jogos de azar online ou gerar frases estranhas e ofensivas. Isso é chamado de "poluição de corpus". Para corrigir isso, os pesquisadores precisam auditar a biblioteca, mas a biblioteca é tão enorme (trilhões de páginas!) que ler cada página levaria mais tempo do que uma vida humana. Eles precisam de uma maneira de espiar o interior e encontrar as maçãs podres sem ter que verificar cada uma delas.
É exatamente isso que o artigo "Auditing Chinese Web-scale Corpora via Sampled BPE Token Statistics" aborda. Os autores, uma equipe da Universidade de Tsinghua e outras instituições, perceberam que tentar escanear toda a internet chinesa em busca de conteúdo ruim era muito lento e caro. Então, eles inventaram um atalho inteligente chamado SAMPLED-BPE. Pense nisso como um biólogo marinho que quer saber o quão poluído está um oceano massivo. Em vez de coletar cada gota de água, eles pegam algumas pequenas amostras de diferentes pontos, analisam-nas e usam isso para estimar o nível de poluição de todo o oceano. Neste caso, o "oceano" é a web chinesa, e a "poluição" são palavras (tokens) tóxicas ou de spam que são incorporadas aos modelos de IA.
O método da equipe é surpreendentemente simples, mas poderoso. Eles pegam uma fatia minúscula dos enormes dados de texto chineses (tão pequena quanto 0,25% do total), treinam um "tokenizador" especial (uma ferramenta que divide o texto em pequenos pedaços chamados tokens) apenas nessa fatia e, em seguida, observam quais tokens aparecem com mais frequência. Se um pedaço de texto aparece constantemente em sua pequena amostra, é provável que seja um padrão comum em todo o conjunto de dados. Eles então usam um assistente de IA inteligente para verificar o que esses pedaços frequentes realmente significam, pesquisando na web. Se um pedaço de texto se revela um site de jogos de azar ou uma frase pornográfica, eles o sinalizam.
As descobertas deles são um choque. Eles auditaram 11 coleções diferentes de textos chineses de código aberto e 6 instantâneos da web chinesa de 2021 a 2026. Eles descobriram que a poluição está em toda parte, mas não está espalhada uniformemente. Alguns conjuntos de dados são relativamente limpos, enquanto outros estão absolutamente submersos em conteúdo ruim. Por exemplo, um conjunto de dados chamado OSCAR foi considerado mais de 83% poluído, com a maior parte sendo conteúdo adulto. Outro, o mC4, estava fortemente poluído com termos de jogos de azar online. Mais interessante ainda, eles descobriram que o "Chinese Common Crawl" (um despejo bruto e massivo da web) é altamente poluído, e o tipo de poluição muda ao longo do tempo. Em 2026, quase 69% do conteúdo em seu instantâneo era material adulto, enquanto o conteúdo de jogos de azar havia caído significativamente desde 2021. Isso sugere que o conteúdo ruim na web é um alvo móvel; assim que um tipo de spam é bloqueado, outro surge.
O artigo também argumenta contra a ideia de que você pode simplesmente criar uma lista fixa de "palavras ruins" para filtrar. Porque a poluição muda muito rápido e frequentemente usa palavras furtivas, abreviadas ou combinadas (como misturar duas palavras normais para criar um termo de jogo de azar), uma lista estática rapidamente se tornaria inút util. Em vez disso, os autores sugerem que precisamos auditar a web regularmente, exatamente como fizeram. Para ajudar outros a fazer isso, eles lançaram um novo conjunto de dados massivo contendo mais de 630.000 registros desses tokens poluídos, organizados em "árvores" que mostram como palavras curtas e ruins crescem em frases mais longas e complexas.
Em resumo, o artigo prova que você não precisa ler o oceano inteiro para saber que ele está sujo; uma amostra inteligente e pequena é suficiente para obter uma imagem clara. Eles mostraram que a web chinesa é atualmente um lugar muito poluído para o treinamento de IA, com a poluição mudando e evoluindo rapidamente. Sua nova ferramenta, SAMPLED-BPE, torna possível verificar esses enormes conjuntos de dados em horas em vez de meses, dando aos pesquisadores uma maneira de manter os modelos de IA limpos sem ficarem sobrecarregados pelo tamanho colossal da internet.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.