← Últimos artigos
💬 NLP

Corpora deduplication or duplication in Natural Language Processing of few resourced languages ? A case of study: The Mexico's Nahuatl

Este artigo investiga se a duplicação controlada de dados pode beneficiar o Processamento de Linguagem Natural em línguas com poucos recursos, demonstrando que a técnica de duplicação incremental aplicada ao corpus de Nahuatl resulta em uma melhoria moderada no desempenho de tarefas de similaridade semântica.

Autores originais: Juan-José Guzman-Landa, Juan-Manuel Torres-Moreno, Graham Ranger, Miguel Figueroa-Saavedra, Martha-Lorena Avendaño-Garrido, Elvys Linhares-Pontes, Luis-Gil Moreno-Jiménez

Publicado 2026-04-09
📖 4 min de leitura☕ Leitura rápida

Autores originais: Juan-José Guzman-Landa, Juan-Manuel Torres-Moreno, Graham Ranger, Miguel Figueroa-Saavedra, Martha-Lorena Avendaño-Garrido, Elvys Linhares-Pontes, Luis-Gil Moreno-Jiménez

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um chef de cozinha tentando ensinar um robô a cozinhar a receita tradicional de um prato mexicano muito especial: o Náuatle (a língua falada por milhões de pessoas no México).

O problema? Você só tem uma única página de receita escrita à mão.

Para um robô (que, no mundo da tecnologia, chamamos de "Inteligência Artificial" ou "Modelo de Linguagem") aprender a cozinhar bem, ele precisa de milhares de receitas, milhões de ingredientes e horas de prática. Se você der apenas uma página, o robô vai ficar confuso e não vai aprender nada de verdade.

É exatamente esse o dilema que os autores deste artigo enfrentaram. Eles queriam ensinar uma Inteligência Artificial a entender o Náuatle, mas havia um obstáculo gigante: falta de dados.

Aqui está a explicação do que eles fizeram, usando analogias simples:

1. O Problema: A "Fome" de Dados

A maioria das línguas (como Inglês ou Espanhol) é como um supermercado gigante cheio de livros, filmes e sites. A Inteligência Artificial pode "comer" tudo isso e aprender muito rápido.

Mas o Náuatle é como uma pequena horta isolada. Existem poucos textos escritos, e eles estão espalhados. A Inteligência Artificial moderna precisa de "bilhões de palavras" para funcionar bem. Com apenas alguns milhões (o que é pouco para esses robôs), ela não consegue entender a estrutura complexa da língua, que é cheia de "palavras-frase" (uma única palavra que contém o que em português seria uma frase inteira).

2. A Solução Maluca: Copiar e Colar (Duplicação Controlada)

Geralmente, na tecnologia, copiar e colar o mesmo texto várias vezes é considerado um erro. É como se você tentasse aprender inglês lendo a mesma página do jornal 100 vezes. Os especialistas dizem: "Não faça isso! Você vai ficar chato e não vai aprender nada novo". Isso se chama deduplicação (remover cópias).

Mas os autores tiveram uma ideia diferente:
Eles pensaram: "E se, para línguas que têm pouquíssimo material, a repetição for o segredo?"

Eles pegaram o pequeno conjunto de textos Náuatle que tinham (chamado de corpus π-YALLI) e começaram a duplicá-lo.

  • Primeiro, eles usaram o texto original (1x).
  • Depois, fizeram 2 cópias (2x).
  • Depois 4, 8, 10... até chegar a 30 cópias do mesmo texto.

Imagine que você tem um único desenho de um gato. Para ensinar uma criança a desenhar gatos, você não tem mais desenhos. Então, você cola o mesmo desenho 30 vezes em uma folha gigante. A criança vai olhar para aquele gato tantas vezes que, no final, vai memorizar cada detalhe da orelha, do bigode e da cauda, mesmo que seja a mesma imagem.

3. O Experimento: Quem Aprendeu Melhor?

Eles ensinaram três tipos de "robôs" (algoritmos) com esses textos duplicados e viram o que aconteceu:

  • O Robô "FastText" (O Estudante Ágil): Ele foi o campeão. Quando viu o texto repetido cerca de 10 vezes, ele aprendeu muito bem a entender o significado das frases. Foi como se a repetição tivesse ajudado a fixar o conhecimento na memória dele.
  • O Robô "Word2Vec" (O Estudante Persistente): Ele precisou de mais repetição (cerca de 22 vezes) para brilhar, mas no final, melhorou muito sua performance (mais de 35% de melhoria!).
  • O Robô "Glove" (O Estudante Confuso): Ele não gostou da repetição. Quanto mais cópias ele via, menos ele aprendia. Parece que ele precisa de variedade, não de repetição.

4. O Resultado Final

A descoberta principal é que, para línguas raras como o Náuatle, repetir o pouco que temos pode ser melhor do que não ter nada.

Ao duplicar o texto de forma controlada, eles conseguiram criar "mapas mentais" (chamados de embeddings) que a Inteligência Artificial usa para entender o significado das palavras.

  • Antes da duplicação, o robô entendia o Náuatle de forma muito básica.
  • Depois da duplicação, ele conseguiu entender frases com muito mais precisão, quase como um falante nativo.

Por que isso é importante?

Isso é uma vitória para a diversidade linguística. O Náuatle é falado por mais de 2 milhões de pessoas. Se a tecnologia não consegue entender essa língua, essas comunidades ficam excluídas do mundo digital (não podem usar tradutores, assistentes de voz, etc.).

A lição do artigo é: Às vezes, para salvar o pouco que temos, precisamos ser criativos e "esticar" a realidade. Em vez de jogar fora as cópias (como fazemos com línguas ricas), para línguas raras, as cópias são o nosso tesouro.

Resumo em uma frase:
Os autores provaram que, para línguas com poucos recursos, copiar e colar o mesmo texto várias vezes ajuda a Inteligência Artificial a aprender a língua muito melhor do que tentar usar apenas o texto original, quebrando uma regra antiga da tecnologia.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →