← Últimos artigos
💬 NLP

NorBERTo: A ModernBERT Model Trained for Portuguese with 331 Billion Tokens Corpus

O artigo apresenta o NorBERTo, um modelo moderno apenas de codificador para português do Brasil treinado no maior corpus monolingue aberto disponível (Aurora-PT) com 331 bilhões de tokens, que alcança desempenho de última geração em vários benchmarks semânticos e oferece uma solução eficiente e implantável para tarefas de PLN subsequentes.

Autores originais: Enzo S. N. Silva, Pablo B. Costa, Raphael C. Vlasman, Rosimeire P. Costa, Henrique L. P. Silva, Lucas F. A. O. Pellicer, Guilherme Rinaldo, Renato A. Almeida, Darian S. R. Rabbani, Cinthya O. Oestreic
Publicado 2026-05-04
📖 4 min de leitura☕ Leitura rápida

Autores originais: Enzo S. N. Silva, Pablo B. Costa, Raphael C. Vlasman, Rosimeire P. Costa, Henrique L. P. Silva, Lucas F. A. O. Pellicer, Guilherme Rinaldo, Renato A. Almeida, Darian S. R. Rabbani, Cinthya O. Oestreich, Vinicius F. Caridá

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô a entender a língua portuguesa. Por muito tempo, os melhores robôs eram como estudantes que haviam lido alguns bons livros, mas não haviam visto toda a biblioteca. Este artigo apresenta um novo robô chamado NorBERTo e uma nova biblioteca massiva chamada Aurora-PT que o ajuda a aprender.

Aqui está a história de como eles fizeram isso, explicada de forma simples:

1. O Problema: O Robô Precisava de uma Biblioteca Maior

Antes disso, os melhores robôs de língua portuguesa (como BERTimbau e Albertina) foram treinados em bibliotecas contendo cerca de 2 a 3 bilhões de "palavras" (tokens). Embora bons, é como tentar aprender um idioma lendo alguns romances e um dicionário.

Os autores perceberam que, para criar um robô verdadeiramente inteligente, precisavam de uma biblioteca do tamanho de uma cidade enorme. Eles queriam construir um robô que pudesse entender as nuances do português brasileiro sem precisar ser um supercomputador gigante e caro que gera histórias intermináveis (que são propensas a inventar coisas, ou "alucinar").

2. A Nova Biblioteca: Aurora-PT

A equipe construiu a Aurora-PT, uma coleção totalmente nova de textos.

  • A Escala: Ela contém 331 bilhões de tokens. Para colocar isso em perspectiva, se as bibliotecas antigas fossem uma única estante, a Aurora-PT seria um armazém inteiro. Atualmente, é a maior biblioteca aberta desse tipo para o português.
  • A Limpeza: Eles não apenas jogaram tudo dentro. Agiram como bibliotecários rigorosos, usando ferramentas automatizadas para descartar lixo, páginas duplicadas e conteúdo tóxico. Eles mantiveram apenas o texto de alta qualidade e limpo de diversas fontes, como Wikipedia, blogs e páginas da web.

3. O Novo Robô: NorBERTo

Usando essa biblioteca massiva, eles treinaram um novo robô chamado NorBERTo.

  • O Design: Em vez de usar o design antigo e padrão para robôs, eles usaram um projeto moderno chamado ModernBERT. Pense nisso como uma atualização de uma bicicleta para uma bicicleta elétrica de alta velocidade. Ele possui recursos especiais que permitem ler frases mais longas sem se confundir e processar informações muito mais rápido.
  • O Tamanho: Eles construíram duas versões: um modelo "Base" (cerca de 150 milhões de "células cerebrais" ou parâmetros) e um modelo "Grande" (cerca de 395 milhões).
  • O Treinamento: Eles ensinaram o robô do zero usando apenas texto em português. Ele não trapaceou começando com conhecimento do inglês; aprendeu português puramente a partir da biblioteca Aurora-PT.

4. O Teste de Estrada: Como Ele Desempenhou?

A equipe submeteu o NorBERTo a uma série de testes de direção (benchmarks) para ver o quão bem ele entendia o português em comparação com os antigos campeões.

  • O Teste de "Lógica" (Entailment Textual): Imagine mostrar ao robô duas frases e perguntar: "A segunda frase segue logicamente da primeira?"
    • Resultado: O NorBERTo (Grande) venceu nesta categoria, superando os modelos anteriores mais bem avaliados. Isso provou que um design moderno + uma biblioteca enorme = melhor lógica.
  • O Teste de "Significado" (Semelhança Semântica): Imagine perguntar: "Essas duas frases estão dizendo a mesma coisa?"
    • Resultado: O antigo campeão, BERTimbau, ainda manteve a liderança aqui. Os autores explicam que isso provavelmente ocorre porque o BERTimbau começou com uma vantagem do treinamento em inglês, enquanto o NorBERTo teve que aprender tudo do zero.
  • O Teste de "Paráfrase" (MRPC): O robô consegue dizer se duas frases são apenas maneiras diferentes de dizer a mesma coisa?
    • Resultado: O NorBERTo (Grande) esmagou a competição, alcançando a maior pontuação já registrada para essa tarefa específica em português.

5. A Grande Conclusão

O artigo conclui que você não precisa de um "super-robô" gigante e caro (como os modelos massivos de IA que escrevem histórias) para realizar tarefas específicas bem.

Ao combinar uma biblioteca enorme e limpa (Aurora-PT) com um design moderno e eficiente (ModernBERT), eles criaram um robô "Cachinhos Dourados":

  • Não é muito pequeno (é mais inteligente que os modelos antigos).
  • Não é muito grande (é mais barato e rápido de executar do que a IA massiva).
  • É o tamanho certo para tarefas do mundo real, como classificar e-mails, entender perguntas de clientes ou ajudar mecanismos de busca a encontrar as respostas certas.

Em resumo: Eles construíram uma biblioteca maior e mais limpa e um robô mais inteligente e eficiente, provando que, para entender o português, você não precisa ser a maior IA na sala — você apenas precisa das ferramentas certas e dos dados certos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →