← Últimos artigos
🔢 mathematics

Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less

Este artigo introduz o conceito de "consistência otimizador-modelo", demonstrando que o uso do mesmo otimizador tanto para pré-treinamento quanto para ajuste fino completo reduz o esquecimento catastrófico e melhora o compromisso entre aprendizado e esquecimento em comparação com outros otimizadores ou LoRA, ao mesmo tempo que revela que otimizadores específicos, como o Muon, podem ter desempenho inferior em tarefas de raciocínio devido a uma tendência à memorização mecânica.

Autores originais: Yuxing Liu, Jianyu Wang, Tong Zhang

Publicado 2026-05-08
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Yuxing Liu, Jianyu Wang, Tong Zhang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um aluno brilhante que passou anos lendo cada livro de uma biblioteca massiva (isso é Pré-treinamento). Ele aprendeu conhecimento geral, gramática e como pensar sobre o mundo. Agora, você quer ensinar-lhe uma nova habilidade específica, como resolver problemas matemáticos ou escrever código de computador (isso é Ajuste Fino Supervisionado ou SFT).

O grande desafio é: como ensinar essa nova habilidade sem fazê-lo esquecer tudo o que aprendeu na biblioteca? Se ele se concentrar demais na nova matemática, pode começar a esquecer como escrever uma história simples. Isso é chamado de "compromisso entre aprendizado e esquecimento".

Este artigo descobre uma regra surpreendente sobre como ensinar esse aluno da melhor forma, e isso tem a ver com como você o ensina, não apenas o que você ensina.

A Principal Descoberta: "O Mesmo Professor, Mesmo Estilo"

Os autores descobriram que a melhor maneira de ensinar a nova habilidade é usar o mesmo estilo de ensino exato (otimizador) que foi usado durante os anos de leitura na biblioteca.

  • A Analogia: Imagine que o aluno aprendeu a ler usando um método específico, digamos, "Método A" (como uma maneira específica de destacar texto e fazer anotações). Se você tentar ensinar-lhe matemática usando o "Método B" (uma maneira completamente diferente de destacar e fazer anotações), o aluno fica confuso. Ele pode aprender a matemática, mas começa a esquecer suas habilidades de leitura porque o novo método entra em conflito com a forma como seu cérebro foi configurado após anos de prática.
  • A Descoberta: Se você se mantiver com o "Método A" para a aula de matemática, o aluno aprende a matemática e mantém suas habilidades de leitura intactas. O artigo chama isso de "Consistência Otimizador-Modelo".

Por Que Isso Acontece? (A Teoria da "Forma do Cérebro")

O artigo explica que diferentes métodos de ensino realmente moldam o cérebro do aluno (os pesos internos do modelo) de maneiras diferentes.

  1. Formas Diferentes: Alguns métodos de ensino (como AdamW, o mais comum) treinam o cérebro para ser "esparso" ou "eficiente", como uma biblioteca onde os livros estão organizados de forma ordenada com espaço vazio entre eles. Outros métodos (como Muon, um método novo e sofisticado) treinam o cérebro para ser "denso", como uma biblioteca onde os livros estão empacotados firmemente juntos.
  2. O Descompasso: Se você treina o cérebro para ser "esparso" por anos e, em seguida, muda abruptamente para um método de ensino "denso" para a matemática, o cérebro precisa se desdobrar para reorganizar toda a sua estrutura. Essa reorganização faz com que ele deixe cair livros antigos (esquecimento).
  3. O Combinação: Se você continuar usando o método "esparso" para a matemática, o cérebro apenas adiciona novos livros às prateleiras existentes. Ele não precisa reconstruir a biblioteca, então esquece menos.

A Surpresa do LoRA

Existe um atalho popular chamado LoRA (Adaptação de Baixo Rango). Pense no LoRA como dar ao aluno um caderno pequeno e separado para escrever respostas de matemática, sem tocar nos livros principais da biblioteca. Muitas pessoas pensavam que essa era a melhor maneira de evitar o esquecimento.

O Relevo do Artigo: Os autores descobriram que, embora o LoRA seja bom, o re-treinamento completo (reescrevendo todo o cérebro) usando o mesmo método de ensino de antes é, na verdade, ainda melhor.

  • A Analogia: O LoRA é como carregar um caderno separado. Funciona, mas se você usar o mesmo estilo de ensino para reescrever seu cérebro principal, você pode encaixar a nova matemática e manter as habilidades de leitura antigas de forma ainda mais eficaz do que apenas usando um caderno lateral.

O Caso do "Memorizador de Cor" (Muon)

O artigo também examinou um método de ensino específico e avançado chamado Muon.

  • O Bom: Muon é excelente na fase de biblioteca (Pré-treinamento). Ajuda o aluno a memorizar fatos incrivelmente bem.
  • O Ruim: Quando se trata de aprender novas habilidades de raciocínio (como matemática) com muito poucos dados, o Muon tende a ser um "memorizador de cor". Ele tenta memorizar os problemas matemáticos específicos que vê, em vez de aprender os padrões subjacentes.
  • O Resultado: Se você usar Muon para toda a jornada (biblioteca + matemática), o aluno pode ser ótimo em recitar fatos, mas ter dificuldade em resolver novos problemas matemáticos nunca vistos. Ele memorizou os exemplos, mas não aprendeu a lógica.

Resumo em Português Simples

  1. Consistência é a Chave: Para aprender uma nova habilidade sem esquecer as antigas, continue usando o mesmo algoritmo de aprendizado (otimizador) que você usou para treinar o modelo originalmente.
  2. Não Mude de Estilo: Mudar o algoritmo de aprendizado no meio do caminho força o modelo a reorganizar seu "cérebro", o que faz com que ele perca conhecimento antigo.
  3. Re-treinamento Completo > Atalhos: Às vezes, fazer um re-treinamento completo com o algoritmo correto é melhor do que usar atalhos como o LoRA, porque se alinha melhor com a forma como o cérebro do modelo foi originalmente construído.
  4. Cuidado com a Excessiva Memorização: Alguns algoritmos avançados (como o Muon) são ótimos em memorizar, mas podem ser piores em aprender novos padrões quando os dados são escassos.

O artigo conclui que, se você quer o melhor equilíbrio entre aprender coisas novas e lembrar das antigas, mantenha-se com o mesmo professor com quem você começou.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →