← Últimos artigos
🤖 machine learning

Data Augmentations for Data-Constrained Language Model Pretraining

Este artigo propõe que a combinação de ruído ao nível de token, permutações de sequência e previsão de deslocamento de alvo como técnicas de aumento de dados mitiga eficazmente o sobreajuste no pré-treinamento de modelos de linguagem autorregressivos, permitindo um treinamento multi-época produtivo em corpora fixos e com restrição de dados.

Autores originais: Michael K. Chen, Xikun Zhang, Zhen Wang

Publicado 2026-06-16
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Michael K. Chen, Xikun Zhang, Zhen Wang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um aluno brilhante, mas com muita fome, a escrever histórias. No passado, a melhor maneira de ensinar esse aluno era dar a ele uma biblioteca enorme de livros para ler. Quanto mais livros o aluno lia, mais inteligente ele ficava.

Mas agora, batemos em um muro. Ficamos sem livros de alta qualidade na internet. Enquanto isso, nossos computadores (os professores) estão se tornando incrivelmente poderosos e rápidos. Estamos em uma situação de excesso de poder computacional, mas falta de novos dados.

O Problema: O Aluno "Super-Lido"

Porque não temos novos livros, temos que fazer o mesmo aluno ler as mesmas 75 milhões de palavras repetidas vezes.

Na forma antiga de treinamento (chamada de "Autorregressiva" ou AR), se você fizer o aluno ler o mesmo texto muitas vezes, ele para de aprender a história e começa a memorizar as palavras exatas.

  • A Analogia: Imagine ler uma única página de um livro 100 vezes. Eventualmente, você não conhece apenas a história; você sabe exatamente onde cada vírgula está. Se você for testado em uma nova página que não viu, você falha porque apenas memorizou a antiga.
  • O Resultado: A IA fica muito boa com os dados de treinamento, mas seu desempenho em novos dados não vistos piora cada vez mais conforme ela treina. Ela sofre "overfitting" (sobreajuste).

A Solução: Aumentação de Dados (O Método do "Giro")

Os autores deste artigo perguntaram: Como podemos fazer o aluno ler o mesmo livro 100 vezes sem que ele apenas memorize o texto?

A resposta deles é a Aumentação de Dados. Em vez de dar ao aluno o mesmo texto exato todas as vezes, eles "giram" ou "embaralham" levemente o texto antes do aluno ler. Isso força o aluno a realmente entender o significado e o contexto, em vez de apenas memorizar a sequência de palavras.

Eles tentaram três formas principais de girar o texto:

1. O Jogo da "Venda nos Olhos" e da "Palavra Errada" (Ruído ao Nível de Token)

  • Mascaramento (A Venda nos Olhos): Eles cobrem algumas palavras com uma caixa preta (um token ``). O aluno tem que adivinhar a palavra ausente baseando-se no restante da frase.
  • Substituição Aleatória (A Palavra Errada): Em vez de uma caixa preta, eles trocam uma palavra por uma palavra diferente que faz sentido gramatical, mas é factualmente errada.
    • Exemplo: Alterar "O gato sentou no tapete" para "O gato sentou no chapéu".
    • A Descoberta: Surpreendentemente, o jogo da "Palavra Errada" funcionou melhor do que a "Venda nos Olhos". Por quê? Porque adivinhar uma palavra ausente é fácil se você vê um espaço em branco. Mas perceber que "chapéu" é a palavra errada quando a frase parece correta é um exercício mental muito mais difícil. Isso força o aluno a prestar mais atenção.

2. O Jogo de "Rebobinar" e "Preencher a Lacuna" (Permutações de Sequência)

  • Direita para a Esquerda (Rebobinar): Eles fazem o aluno ler a frase de trás para frente, da última palavra para a primeira.
  • Preencher o Meio: Eles pegam uma frase, cortam a parte do meio e pedem ao aluno para prever o meio com base no início e no fim.
    • A Descoberta: Ler de trás para frente funcionou muito bem como um regularizador (impediu a memorização). No entanto, o jogo de "Preencher o Meio" na verdade piorou as coisas para textos gerais. Os autores sugerem que isso ocorre porque o formato de "Preencher" é tão diferente de como costumamos ler (da esquerda para a direita) que confundiu o aluno em vez de ajudá-lo.

3. O Jogo da "Bola de Cristal" (Predição de Deslocamento de Alvo)

  • Em vez de perguntar "Qual é a próxima palavra?", eles perguntam "Qual é a palavra três passos à frente?".
  • A Descoberta: Isso funciona bem, mas apenas se for feito com cuidado. Se pedirem palavras muito distantes no futuro com muita frequência, o aluno fica confuso. Se pedirem principalmente a próxima palavra, mas ocasionalmente pedirem uma palavra mais adiante, isso funciona como um currículo de treinamento perfeito.

A Estratégia Vencedora: A "Tempestade Perfeita"

Os autores não apenas escolheram um jogo; eles os combinaram. No entanto, descobriram que alguns jogos conflitam entre si.

  • O Conflito: Se você cobrir as palavras (Mascaramento) e pedir palavras muito à frente no futuro, o aluno fica sobrecarregado. O contexto fica muito quebrado para fazer um bom palpite.
  • A Harmonia: Se você usar Substituição Aleatória (trocando palavras) + Leitura de Trás para Frente + Olhar ocasionalmente para frente, o aluno permanece atento.

O Resultado:
Ao usar essa combinação específica de "giros", a IA foi capaz de treinar por 100 épocas (lendo os dados 100 vezes) sem perder sua capacidade de generalização.

  • Sem os truques: A IA atingiu o pico na época 16 e depois piorou.
  • Com os truques: A IA continuou melhorando, alcançando uma taxa de erro muito menor (melhor desempenho) do que qualquer método individual poderia alcançar sozinho.

A Conclusão Principal

O artigo prova que, quando ficamos sem novos dados, não precisamos parar o treinamento. Só precisamos mudar como apresentamos os dados. Ao adicionar pequenas e inteligentes "distorções" ao texto, podemos manter computadores poderosos aprendendo de forma eficaz por muito mais tempo, evitando que eles simplesmente memorizem o conjunto de treinamento.

Lição Fundamental: Trocar palavras aleatoriamente (tornando o texto levemente "errado") foi o truque individual mais eficaz, e combiná-lo com a leitura de trás para frente e o olhar para o futuro criou o melhor desempenho geral.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →