← Últimos artigos
💬 NLP

moBERTo: A Modern Encoder for Portuguese via Continued Pretraining of ModernBERT

O artigo apresenta o moBERTo, um modelo de codificação exclusiva para português de alto desempenho criado através da continuação do pré-treinamento do ModernBERT em 60 bilhões de tokens, que alcança resultados de estado da arte em tarefas de recuperação, classificação e NER, ao mesmo tempo em que demonstra a superioridade do pré-treinamento contínuo sobre o treinamento do zero para preservar as capacidades de contexto longo.

Autores originais: Thiago Laitz, Thales Sales Almeida, João Guilherme Alves Santos, Giovana Kerche Bonás

Publicado 2026-06-23
📖 4 min de leitura☕ Leitura rápida

Autores originais: Thiago Laitz, Thales Sales Almeida, João Guilherme Alves Santos, Giovana Kerche Bonás

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um bibliotecário brilhante, altamente instruído, que fala um inglês perfeito e leu 2 trilhões de livros. Este bibliotecário é incrivelmente rápido, lembra de histórias longas sem se confundir e é ótimo em encontrar fatos específicos ou classificar livros por tópico. No entanto, ele não fala uma palavra de português.

O artigo apresenta o moBERTo, um projeto que pega este bibliotecário falante de inglês e lhe dá um curso intensivo de português para que ele possa trabalhar efetivamente em uma biblioteca brasileira.

Aqui está como eles fizeram e o que descobriram, explicado de forma simples:

1. A Estratégia: "Pretreinamento Continuado" (Não Comece do Zero)

Em vez de contratar um novo bibliotecário e ensinar tudo do zero (o que levaria uma eternidade e custaria uma fortuna), a equipe pegou o especialista em inglês existente e o alimentou com 60 bilhões de palavras em português (cerca de 5 anos de material de leitura).

  • A Analogia: Pense nisso como pegar um mestre chef que conhece perfeitamente a culinária francesa e dar a ele uma pilha enorme de livros de receitas portugueses para estudar. Ele não esquece como cozinhar; ele apenas aprende como aplicar suas habilidades a novos ingredientes.
  • O Resultado: Isso foi muito melhor do que treinar um novo modelo do zero. O "velho" bibliotecário manteve seus superpoderes (como lembrar de histórias longas) enquanto aprendia o novo idioma.

2. O Kit de Ferramentas: Atualizações Modernas

O bibliotecário com o qual começaram não era apenas um modelo qualquer; eles usaram o ModernBERT. Esta é uma versão de "próxima geração" do assistente de biblioteca clássico.

  • Velhos Bibliotecários (como o BERTimbau): Conseguiam ler apenas 512 palavras por vez antes de se confundirem. Eles usavam métodos antigos e desajeitados para lembrar onde estavam em uma frase.
  • moBERTo: Consegue ler até 8.192 palavras de uma só vez sem perder o lugar. Ele usa velocidade "flash" e períodos de atenção inteligentes para lidar com documentos longos sem esforço.

3. Os Experimentos: Testando Diferentes Métodos de Ensino

Os pesquisadores testaram algumas maneiras diferentes de ensinar o bibliotecário português para ver o que funcionava melhor:

  • Método A: O "Dicionário Original" (Tokenizer Original)
    Eles ensinaram o bibliotecário usando o dicionário de inglês original, apenas substituindo as palavras por termos em português onde cabiam.

    • Resultado: Isso funcionou surpreendentemente bem para ler documentos longos porque o "mapa de memória" do bibliotecário permaneceu intacto.
  • Método B: O "Novo Dicionário" (Tokenizer de Português)
    Eles deram ao bibliotecário um dicionário totalmente novo construído especificamente para o português.

    • Resultado: Isso foi ótimo para tarefas pequenas, como identificar nomes em uma frase (Reconhecimento de Entidades Nomeadas) ou entender frases curtas. No entanto, confundiu o bibliotecário ao ler textos muito longos, fazendo com que ele perdesse o fio da meada.
  • Método C: A "Ponte Híbrida" (Correspondência de Subpalavras)
    Esta foi a estratégia vencedora. Eles construíram um novo dicionário de português, mas usaram uma "ponte" especial para conectar as novas palavras à antiga memória em inglês do bibliotecário.

    • Resultado: Isso deu a eles o melhor dos dois mundos. O bibliotecário podia entender as nuances do português e manter seus superpoderes de memória longa.

4. Os Resultados: Quem Ganhou?

A equipe testou o moBERTo em várias tarefas, como encontrar documentos específicos, classificar artigos de notícias e identificar nomes em textos.

  • O Campeão: O modelo moBERTo-SWM-8k (aquele com a "Ponte Híbrida" e treinamento de história longa adicional) foi o vencedor claro.
    • Ele superou o antigo campeão (BERTimbau) na busca de documentos relevantes.
    • Foi o melhor em entender o significado de textos em português.
    • Foi excelente em identificar nomes e lugares em frases.
  • A Surpresa das Histórias Longas: Embora o bibliotecário tenha sido treinado principalmente em histórias curtas (1.024 palavras), ele ainda conseguia ler e entender documentos massivos de 8.000 palavras melhor do que qualquer outro modelo de português. Isso provou que a arquitetura "moderna" é muito poderosa.

5. A Conclusão

O artigo conclui que você não precisa construir um modelo gigante e caro do zero para obter ótimos resultados em português. Ao pegar um modelo de inglês moderno e eficiente e fazer o "ajuste fino" (fine-tuning) com muitos bons dados em português, você obtém um modelo que é:

  1. Mais rápido e barato de operar do que chatbots massivos.
  2. Mais inteligente para encontrar informações e entender textos do que modelos antigos de português.
  3. Capaz de ler documentos muito longos sem se perder.

A equipe compartilhou seu "bibliotecário" (os pesos do modelo) e seus "livros da biblioteca" (os dados de treinamento) para que qualquer pessoa possa usar, esperando ajudar todos no mundo de língua portuguesa a construir melhores ferramentas de IA.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →