← Últimos artigos
💬 NLP

Wiki Dumps to Training Corpora: South Slavic Case

Este artigo apresenta uma metodologia independente de idioma para transformar despejos brutos da Wikimedia em corpora de treinamento de alta qualidade e ricos linguisticamente para sete línguas eslavas do sul, extraindo sistematicamente texto de múltiplos projetos wiki e empregando filtragem baseada em n-gramas para remover artigos de baixa qualidade e repetitivos.

Autores originais: Mihailo Škorić

Publicado 2026-04-29
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Mihailo Škorić

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você deseja construir uma biblioteca massiva de histórias, poemas e artigos de notícias para ensinar um robô a falar e compreender sete línguas eslavas do sul diferentes (como sérvio, croata, búlgaro e outras). Você decide usar a Wikipedia e seus sites irmãos (como Wikisource ou Wikinews) como material de origem, porque são gratuitos e cheios de texto.

No entanto, se você apenas pegar os arquivos brutos desses sites, não estará obtendo uma biblioteca de histórias. Você estará recebendo um armazém caótico repleto de:

  • Entulho de construção: Códigos de computador ocultos, instruções de formatação e "plantas" que dizem ao site como deve parecer, mas que não fazem parte da história.
  • Vidro quebrado: Links quebrados e seções vazias.
  • Clones fabricados em série: Milhares de artigos que parecem quase idênticos porque foram gerados automaticamente a partir de bancos de dados, em vez de serem escritos por humanos.

Este artigo é um guia sobre como limpar esse armazém bagunçado e transformá-lo em uma biblioteca imaculada. O autor, Mihailo Škorić, divide o processo em duas fases principais: A Grande Limpeza e O Filtro de Qualidade.

Fase 1: A Grande Limpeza (Extração de Texto)

Pense nos dados brutos da Wikipedia como uma casa que ainda está em construção. Há andaimes, latas de tinta e plantas por toda parte. Você ainda não pode morar nela.

O autor criou uma "equipe de construção" especializada (um programa de computador) para desmontar a casa até suas paredes nuas e habitáveis.

  • Removendo os Andaimes: O programa usa uma ferramenta chamada mwparserfromhell (um nome extravagante para uma ferramenta que entende a linguagem secreta da Wikipedia) para arrancar todo o código de computador, modelos e tags de formatação.
  • Eliminando o Ruído: Ele exclui as listas de "Categorias" (como etiquetas em um arquivo de gabinete), remove descrições de imagens e elimina as seções de "Referências" que parecem notas de rodapé, mas não fazem parte da história principal.
  • Aplainando as Tabelas: A Wikipedia frequentemente usa tabelas para organizar dados. O programa transforma essas grades complexas em frases simples e legíveis, para que o robô não se confunda com as linhas da grade.
  • O Resultado: Após esta fase, você tem uma pilha de texto limpo e simples. Não é mais um site; são apenas palavras.

Fase 2: O Filtro de Qualidade (Removendo os Clones)

Agora que você tem texto limpo, há um novo problema. Alguns dos artigos são textos "zumbis". São artigos que parecem ter sido escritos por um humano, mas que na verdade foram gerados automaticamente por um computador. São repetitivos, chatos e dizem a mesma coisa uma e outra vez, de formas ligeiramente diferentes.

Se você alimentar esses artigos "zumbis" ao seu robô, ele aprenderá a falar em um loop robótico e repetitivo. Para corrigir isso, o autor usa uma Estratégia de Detetive:

  1. Agrupamento por Bairro: O programa agrupa artigos por seu tópico (por exemplo, todos os artigos sobre "História" vão para um quarto, todos sobre "Esportes" para outro). É mais fácil encontrar duplicatas se você comparar apenas maçãs com maçãs.
  2. A Varredura de "Impressão Digital": O programa transforma cada artigo em uma "impressão digital" matemática (um vetor). Ele analisa as primeiras palavras do artigo para ver se correspondem ao padrão de um modelo.
  3. O Teste de Similaridade: Ele compara essas impressões digitais entre si usando um truque matemático chamado MinHashing. Imagine que você tem dois livros. Se eles compartilharem muitas frases idênticas na mesma ordem, é provável que sejam clones.
  4. O Limite: O programa calcula uma "pontuação de similaridade". Se um artigo for muito semelhante aos outros (acima de um determinado limite), ele é expulso da biblioteca. É como um porteiro de um clube que diz: "Você se parece exatamente com todos os outros na fila; você não vai entrar".

Os Resultados

O artigo testou esse método em sete línguas eslavas do sul. Os resultados foram dramáticos:

  • Sérvio: Tinha a maior bagunça para limpar. Antes da filtragem, tinha mais de 500.000 artigos. Após o trabalho do "porteiro", quase metade foi removida porque eram duplicatas ou geradas automaticamente. A contagem de palavras caiu quase 60%.
  • Búlgaro e Esloveno: Estes já eram bastante limpos, então perderam menos artigos.
  • O Retorno: O resultado final é uma biblioteca menor, mas de qualidade muito superior. As palavras nessas novas bibliotecas correspondem à forma como os humanos reais realmente falam, em vez de como um banco de dados gera texto.

Por Que Isso Importa

O autor argumenta que, para um robô aprender bem uma língua, ele precisa ler escrita humana real, não preenchimento gerado por computador. Ao realizar esse processo de dois passos (limpar o código e depois filtrar os clones), o artigo fornece um conjunto confiável e de alta qualidade de livros para treinar modelos de IA em línguas eslavas do sul.

Em resumo: O artigo nos ensina como pegar um despejo bagunçado e cheio de código da Wikipedia, limpá-lo de lixo de computador e, em seguida, descartar os artigos de "copiar e colar", deixando para trás uma coleção pura de linguagem humana pronta para um robô aprender.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →