← Últimos artigos
💬 NLP

Should We Still Pretrain Encoders with Masked Language Modeling?

Através de extensos experimentos controlados, este artigo demonstra que, embora a Modelagem de Linguagem Mascarada (MLM) geralmente produza representações de texto superiores, uma estratégia de pré-treino bifásica que aplica primeiro a Modelagem de Linguagem Causal (CLM) e depois a MLM alcança desempenho ótimo sob orçamentos computacionais fixos, particularmente ao aproveitar modelos CLM pré-treinados existentes.

Autores originais: Hippolyte Gisserot-Boukhlef, Nicolas Boizard, Manuel Faysse, Duarte M. Alves, Emmanuel Malherbe, André F. T. Martins, Céline Hudelot, Pierre Colombo

Publicado 2026-05-06
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Hippolyte Gisserot-Boukhlef, Nicolas Boizard, Manuel Faysse, Duarte M. Alves, Emmanuel Malherbe, André F. T. Martins, Céline Hudelot, Pierre Colombo

Artigo original dedicado ao domínio público sob CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô a entender a linguagem humana. Por anos, o método padrão tem sido jogar um jogo de "preencher a lacuna". Você mostra ao robô uma frase com algumas palavras ocultas (mascaradas) e pede que ele adivinhe quais são com base nas palavras antes e depois do local faltante. Isso é chamado de Modelagem de Linguagem Mascarada (MLM). É como um jogo de palavras cruzadas onde você tem dicas de ambas as direções.

Recentemente, uma nova abordagem tornou-se popular: ensinar o robô a prever a próxima palavra em uma frase, uma palavra de cada vez, exatamente como um preenchimento automático de mensagens de texto. Isso é chamado de Modelagem de Linguagem Causal (CLM). É como ler uma história e adivinhar o que acontece a seguir, mas você não pode olhar adiante.

A grande pergunta que este artigo faz é: "Ainda precisamos ensinar os robôs pelo antigo método de 'preencher a lacuna', ou o novo método de 'prever a próxima palavra' é realmente melhor?"

Aqui está o que os pesquisadores descobriram, explicado através de analogias simples:

1. O "Especialista" vs. O "Generalista"

Os pesquisadores treinaram 38 diferentes cérebros de robô (variando de pequenos a muito grandes) usando ambos os métodos.

  • O Robô MLM (O Especialista): Quando treinado apenas no jogo de "preencher a lacuna", este robô tornou-se um mestre em entender o contexto completo de uma frase. Foi o melhor em tarefas como responder a perguntas complexas ou classificar o tom de um texto. É como um detetive que pode examinar uma cena do crime de todos os ângulos para resolver o caso.
  • O Robô CLM (O Generalista): Quando treinado apenas no jogo de "prever a próxima palavra", este robô foi surpreendentemente bom em algumas coisas (como encontrar nomes específicos em um texto) e aprendeu muito rapidamente. No entanto, teve mais dificuldade em tarefas que exigiam uma compreensão profunda e bidirecional de uma frase.

O Veredito: O método de "preencher a lacuna" (MLM) ainda é o rei para construir a melhor compreensão geral de texto. O método de "prever a próxima palavra" (CLM) sozinho não é suficiente para criar o melhor "codificador" (uma ferramenta que transforma texto em significado).

2. A Vantagem do "Início Rápido"

É aqui que fica interessante. O robô CLM aprendeu muito mais rápido no início.

  • Analogia: Imagine dois estudantes se preparando para uma maratona.
    • Estudante A (MLM) estuda lenta e constantemente, construindo uma base profunda. Começa devagar, mas fica muito forte mais tarde.
    • Estudante B (CLM) começa a correr imediatamente e fica em forma muito rapidamente. Ele fica à frente do Estudante A nas primeiras milhas.
  • A Descoberta: Se você parar o treinamento cedo (porque tem pouco tempo ou dinheiro), o robô CLM é realmente bastante competitivo. É mais "eficiente em dados", o que significa que obtém bons resultados com menos tempo de treinamento.

3. A "Base Estável"

Os pesquisadores também descobriram que o robô CLM era mais fácil de ajustar fino (ajustar para trabalhos específicos).

  • Analogia: Pense no robô CLM como uma casa construída sobre uma laje de concreto muito sólida e plana. É fácil construir um cômodo específico (como uma cozinha para uma tarefa específica) em cima dela sem que a casa balance.
  • O robô MLM, embora mais forte no geral, ficou um pouco mais "instável" quando você tentou ajustá-lo para tarefas específicas. Exigia um ajuste mais cuidadoso para obter o resultado perfeito.

4. A Estratégia Vencedora: O Treinamento em "Duas Etapas"

A maior descoberta do artigo é uma nova receita para treinar esses robôs que supera fazer apenas um método.

  • A Receita: Comece treinando o robô com o método de "prever a próxima palavra" (CLM) para obter um início rápido e estável. Em seguida, mude para o método de "preencher a lacuna" (MLM) para aprofundar sua compreensão.
  • O Resultado: Esta abordagem de "Duas Etapas" criou os robôs mais fortes de todos. Combinou a velocidade e a estabilidade do início CLM com a compreensão profunda do final MLM.
  • Bônus: Você pode até pegar um robô que alguém já treinou com o método de "prever a próxima palavra" (que é muito comum e barato de obter) e apenas dar a ele um treinamento de "recarga" com o método de "preencher a lacuna". Isso é muito mais barato do que treinar um robô do zero.

Resumo

O artigo conclui que, embora o antigo método de "preencher a lacuna" (MLM) ainda seja essencial para os melhores resultados, não devemos ignorar o novo método de "prever a próxima palavra" (CLM).

O melhor caminho a seguir é um híbrido:

  1. Comece com o treinamento rápido e estável de "prever a próxima palavra" (ou use um modelo pré-treinado que já tenha isso).
  2. Termine com o treinamento profundo de "preencher a lacuna".

Esta estratégia economiza dinheiro e poder de computação enquanto produz as ferramentas de compreensão de texto mais inteligentes disponíveis. Os autores liberaram todo o seu código e modelos para que outros possam tentar essa receita de "duas etapas" por conta própria.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →