NE-BERT: A Multilingual Language Model for Nine Northeast Indian Languages
O artigo apresenta o NE-BERT, um modelo de linguagem multilíngue treinado em 8,3 milhões de sentenças em nove línguas do Nordeste da Índia e duas línguas âncora, que supera significativamente modelos existentes como o IndicBERT-V2 e o MuRIL em perplexidade e eficiência de tokenização, ao mesmo tempo em que aborda a fragmentação crítica de vocabulário em línguas de baixos recursos.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Resumo Técnico: NE-BERT
Declaração do Problema
Os sistemas modernos de Processamento de Linguagem Natural (PLN) exibem uma disparidade de desempenho significativa entre línguas de alto recurso e de baixo recurso, reforçando as desigualdades digitais. Enquanto modelos multilingues gerais como o mBERT e modelos regionais como o IndicBERT-V2 oferecem uma cobertura ampla, eles falham em atender adequadamente às línguas indígenas do Nordeste da Índia. Esta região, lar de mais de 200 línguas distintas, enfrenta desafios únicos, incluindo escassez extrema de recursos (algumas línguas possuem menos de 1.000 sentenças digitalizadas), estruturas morfológicas aglutinantes e diversidade de escrita (Latim e Bengali-Assamês). Os modelos existentes frequentemente sofrem de "fragmentação de vocabulário" nestes contextos, onde palavras raras são divididas em unidades de subpalavras subótimas, degradando severamente a eficiência de inferência e a coerência semântica.
Metodologia
O autor apresenta o NE-BERT, um modelo de codificador multilingue específico para o domínio baseado na arquitetura ModernBERT, projetado especificamente para nove línguas do Nordeste da Índia e duas línguas âncoras (Hindi e Inglês).
1. Construção do Conjunto de Dados
O corpus de treinamento compreende aproximadamente 8,3 milhões de sentenças cobrindo:
- 9 Línguas do Nordeste da Índia: Assamês, Garo, Khasi, Meitei, Mizo, Naga, Nyishi, Pnar e Kokborok.
- 2 Línguas Âncoras: Hindi e Inglês.
- Fontes: Os dados foram curados de documentos governamentais, arquivos de notícias, materiais educacionais e textos culturais. Corpora paralelos específicos para Nyishi e Kokborok foram obtidos da WMT 2025 Shared Task.
2. Estratégia de Amostragem Ponderada
Para lidar com o desequilíbrio extremo de dados (variando de 1.002 sentenças para Pnar a 3,4 milhões para o Hindi), o autor empregou uma amostragem ponderada agressiva durante o treinamento do tokenizador:
- Línguas de ultra-baixo recurso (ex: Pnar, Kokborok) receberam um peso de reamostragem de 100× para garantir representação vocabular adequada e evitar fragmentação de caracteres.
- Línguas âncoras foram penalizadas (Hindi 0,05×, Inglês 0,2×) para priorizar o vocabulário das línguas do Nordeste, mantendo a capacidade de transferência translinguística.
- Nota: Estas contagens virtuais aplicaram-se apenas ao treinamento do tokenizador; o treinamento real de Modelagem de Linguagem Mascarada (MLM) utilizou as contagens de sentenças brutas para evitar o sobreajuste (overfitting).
3. Tokenização
O artigo utiliza um tokenizador SentencePiece Unigram personalizado (50.368 tokens) em vez do mais comum Byte-Pair Encoding (BPE).
- Racional: A abordagem probabilística do Unigram preserva melhor as estruturas linguísticas de línguas aglutinativas em comparação com a estratégia de fusão gananciosa (greedy) do BPE.
- Configuração: O tokenizador foi treinado sobre as contagens virtuais ponderadas para garantir que palavras comuns em línguas de baixo recurso formem tokens únicos, reduzindo o comprimento da sequência e melhorando a coerência semântica.
4. Arquitetura do Modelo e Treinamento
- Base: ModernBERT-base (Warner et al., 2025) com 149M de parâmetros (22 camadas, dimensão oculta de 768, 12 cabeças de atenção).
- Recursos: Embeddings de Posição Rotativos (RoPE), Flash Attention 2 e unpadding para melhoria de throughput.
- Treinamento: Treinado usando MLM com 15% de probabilidade de mascaramento e mascaramento dinâmico ao longo de 10 épocas.
- Eficiência: O modelo foi treinado em uma única GPU NVIDIA A40 (48GB VRAM) por cerca de 17 horas, com um custo de US$ 7,31.
Principais Resultados
Desempenho de Perplexidade
O NE-BERT foi avaliado em conjuntos de teste retidos (500 sentenças por língua) contra o IndicBERT-V2, MuRIL e mBERT.
- Desempenho Geral: O NE-BERT alcançou uma perplexidade média de 2,21 nas 9 línguas do Nordeste, superando significativamente o IndicBERT-V2 (35,29) e o MuRIL (16,88), e superando o mBERT (2,76).
- Melhoria Média: O NE-BERT alcançou uma perplexidade média 15,97× e 7,64× menor respectivamente em comparação ao IndicBERT-V2 e MuRIL nas 9 línguas do Nordeste da Índia.
- Ganhos em Ultra-Baixo Recurso: As melhorias mais dramáticas foram observadas em línguas com dados mínimos. Para Pnar (1.002 sentenças) e Nyishi (55.870 sentenças), o NE-BERT reduziu a perplexidade para 2,92 e 4,33 respectivamente, enquanto o IndicBERT-V2 exibiu falha catastrófica com pontuações de perplexidade de 66,92 e 187,20.
- Desempenho em Alto Recurso: Em línguas com extensa cobertura na Wikipedia (Assamês, Meitei), o mBERT permaneceu competitivo, mas o NE-BERT ainda alcançou resultados superiores ou comparáveis.
Eficiência de Tokenização
- Fertilidade: O NE-BERT alcançou uma fertilidade de tokenização média de 1,68 tokens/palavra para as línguas do Nordeste, comparado a 2,08 para o IndicBERT-V2, 2,14 para o MuRIL e 2,51 para o mBERT. Isso representa uma melhoria de 1,50× sobre o mBERT.
- Bits Por Caractere (BPC): O NE-BERT alcançou um BPC médio de 0,347, demonstrando superior eficiência de compressão em comparação ao IndicBERT-V2 (1,497) e MuRIL (1,271).
Avaliação de Tarefas Downstream
Nas tarefas de marcação de classes gramaticais (POS tagging) em Khasi, Mizo e Nagamese:
- O NE-BERT alcançou uma acurácia média de 82,4%, superando o mBERT (73,3%) em 9,1 pontos percentuais e o IndicBERT-V2 (59,2%) em 23,2 pontos percentuais.
Significância e Alegações
O artigo postula que o NE-BERT demonstra que modelos específicos de domínio com tokenização apropriada podem servir efetivamente línguas de ultra-baixo recurso com tão somente 1.000 sentenças de treinamento.
- Otimização de Vocabulário sobre Escala: Os resultados desafiam a noção de que escalar apenas o tamanho do modelo é suficiente para o desempenho em baixo recurso. O autor argumenta que a otimização cuidadosa do vocabulário (via tokenização Unigram ponderada) e os dados de treinamento direcionados são mais críticos do que a contagem bruta de parâmetros para estes contextos linguísticos específicos.
- Custo-Efetividade: O sucesso no treinamento de um modelo competitivo em uma única GPU por menos de US$ 10 fornece um roteiro prático para o desenvolvimento de modelos de linguagem para línguas sub-representadas em todo o mundo.
- Inclusão Digital: Ao abordar a "maldição da multilinguidade" e a fragmentação do vocabulário, o NE-BERT visa apoiar a pesquisa de PLN e a inclusão digital para as comunidades do Nordeste da Índia, que têm sido amplamente ausentes na pesquisa de PLN convencional.
O autor libera explicitamente o modelo, o tokenizador, o corpus de treinamento e os conjuntos de teste sob uma licença CC-BY-4.0 para facilitar a reprodutibilidade e aplicações impulsionadas pela comunidade. Eles reconhecem limitações, incluindo a arquitetura apenas de codificador (inadequada para tarefas de geração) e a necessidade de mais avaliações de tarefas downstream em diversas tarefas e em todas as nove línguas.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.