← Últimos artigos
💬 NLP

Learning is Forgetting: LLM Training As Lossy Compression

O artigo propõe que o treinamento de Grandes Modelos de Linguagem (LLMs) é essencialmente um processo de compressão com perdas, onde a otimização da representação de dados para a previsão de sequências futuras não apenas se aproxima do limite teórico do "Gargalo de Informação", mas também permite prever o desempenho do modelo em diversas tarefas com base na qualidade e estrutura de sua compressão.

Autores originais: Henry C. Conklin, Tom Hosking, Tan Yi-Chern, Julian Gold, Jonathan D. Cohen, Thomas L. Griffiths, Max Bartolo, Seraphina Goldfarb-Tarrant

Publicado 2026-04-10
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Henry C. Conklin, Tom Hosking, Tan Yi-Chern, Julian Gold, Jonathan D. Cohen, Thomas L. Griffiths, Max Bartolo, Seraphina Goldfarb-Tarrant

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem uma biblioteca gigante com trilhões de livros, contendo quase tudo o que a humanidade já escreveu. Agora, imagine que você precisa ensinar um robô a falar como um humano, mas você só tem um pequeno caderno de anotações para guardar o conhecimento dele. Como você faria isso?

Você não poderia copiar cada livro palavra por palavra, senão o caderno explodiria. Em vez disso, você teria que ser inteligente: esquecer o que é irrelevante e guardar apenas o que é essencial.

É exatamente isso que este novo estudo, publicado na conferência ICLR 2026, diz que os Grandes Modelos de Linguagem (como o ChatGPT ou o Gemini) estão fazendo. Os autores chamam esse processo de "Aprendizagem é Esquecimento".

Aqui está a explicação do estudo, usando analogias do dia a dia:

1. O Modelo é um "Compressor de Arquivos" (Mas Perde Dados)

Pense em como você salva uma foto no seu celular. Se você salvar em "alta qualidade", o arquivo é gigante. Se você salvar como um "JPEG" (comprimido), o arquivo fica pequeno, mas perde alguns detalhes que o olho humano nem nota.

  • A analogia: O modelo de linguagem é como esse arquivo JPEG. Ele foi treinado com uma quantidade de texto maior do que um humano ouviria em 200 vidas. Para caber tudo na sua "memória" (os parâmetros do modelo), ele precisa comprimir essa informação.
  • A descoberta: O estudo mostra que, durante o treinamento, o modelo não apenas memoriza; ele aprende a esquecer o que não é importante para a tarefa de prever a próxima palavra. Ele descarta o "ruído" e guarda apenas o padrão que ajuda a prever o futuro.

2. A Jornada em Duas Fases: Encher a Mala e Depois Compactar

O estudo descreve o treinamento do modelo como uma viagem em duas etapas:

  • Fase 1: A Bagunça (Encher a Mala): No começo, o modelo tenta guardar tudo. Ele fica confuso, tentando aprender cada detalhe, cada exceção e cada palavra. É como alguém tentando colocar 500 roupas em uma mala pequena sem dobrar nada. A "complexidade" (o tamanho da bagunça) aumenta.
  • Fase 2: A Compactação (O Esquecimento): Depois de um tempo, o modelo percebe que não consegue carregar tudo. Ele começa a dobrar as roupas, a tirar o que não serve e a organizar o essencial. Ele começa a comprimir a informação. Ele esquece detalhes específicos (como a cor exata de um céu em uma foto específica) para guardar a regra geral (céus são azuis).

O estudo mostra que os modelos mais inteligentes são aqueles que conseguem chegar ao ponto perfeito de compactação: guardam o máximo de significado possível com o mínimo de "espaço" (memória).

3. O "Limite de Ouro" da Inteligência

Os pesquisadores criaram uma espécie de "mapa" (chamado de Plano de Informação) para ver onde os modelos estão nesse processo.

  • A analogia: Imagine uma linha de chegada em uma corrida. Essa linha representa a compactação perfeita.
  • O que eles viram: Modelos grandes e bem treinados (como o OLMo 7B ou 32B) conseguem correr até essa linha e parar bem perto dela. Eles aprenderam a ser eficientes.
  • O problema dos pequenos: Modelos muito pequenos (com menos de 7 bilhões de parâmetros) tentam correr, mas não conseguem chegar perto da linha. Eles ficam "oscilando", tentando guardar coisas demais e não conseguindo compactar bem. É como tentar carregar uma mala gigante em uma mochila de criança.

4. O Que Sobrou no Caderno? (Contexto vs. Palavras)

Uma das descobertas mais legais é o que exatamente o modelo decide guardar.

  • Palavras soltas vs. Contexto: O estudo mostra que os modelos que performam melhor não são necessariamente os que memorizam mais palavras soltas. Eles são os que entendem melhor o contexto.
  • A analogia: Pense em um detetive. Um detetive ruim memoriza a lista de suspeitos (palavras). Um detetive bom entende a história, a motivação e como as pistas se conectam (contexto).
  • Resultado: Modelos que conseguem comprimir bem o contexto (entender que "banco" pode ser onde você senta ou onde você guarda dinheiro, dependendo da frase) são os que têm melhor desempenho em testes de raciocínio e matemática.

5. O "Gosto Humano" (Alinhamento)

O estudo também olhou para como os modelos aprendem a agradar os humanos (a parte de "alinhamento" que faz o chatbot ser educado).

  • A analogia: Imagine que o treinamento inicial é como aprender a cozinhar (aprender a receita). O alinhamento é como aprender a cozinhar para um cliente exigente (saber o que ele gosta).
  • Descoberta: A parte de "aprender a cozinhar" (pré-treinamento) é sobre compressão eficiente. A parte de "agradar o cliente" (pós-treinamento) adiciona uma camada extra de informação sobre o que os humanos preferem. O estudo mostrou que quanto mais essa informação de "preferência" o modelo guarda, melhor ele se sai em tarefas de seguir instruções.

Resumo Final: Por que isso importa?

Este estudo nos dá uma nova lente para entender a Inteligência Artificial. Em vez de ver o modelo como uma "caixa preta" misteriosa, podemos vê-lo como um arquivista mestre.

  • A lição: A inteligência não é sobre saber tudo. É sobre saber o que esquecer.
  • O futuro: Se conseguirmos medir o quão bem um modelo está "comprimindo" a informação, podemos prever se ele será inteligente antes mesmo de testá-lo em tarefas difíceis. Isso pode ajudar a criar modelos melhores, mais rápidos e mais baratos, sabendo exatamente quando parar o treinamento (quando a "mala" já está perfeitamente organizada).

Em suma: Para aprender de verdade, você precisa saber o que deixar para trás. E os melhores modelos de IA são aqueles que aprenderam a esquecer o que não importa.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →