← Últimos artigos
📊 statistics

ScheduleFree+: Scaling Learning-Rate-Free & Schedule-Free Learning to Large Language Models

Este artigo apresenta o ScheduleFree+, um método livre de taxa de aprendizado e livre de cronograma que escala com êxito a Aprendizagem Livre de Cronograma para modelos de linguagem grandes, superando significativamente cronogramas de treinamento de última geração como Warmup-Stable-Decay, particularmente em cenários de treinamento de longa duração.

Autores originais: Aaron Defazio

Publicado 2026-05-20
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Aaron Defazio

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô gigante e superinteligente (um Modelo de Linguagem Grande) a falar a língua humana. Para fazer isso, você mostra a ele bilhões de frases e o deixa adivinhar a próxima palavra, corrigindo seus erros repetidamente.

Por muito tempo, a maneira padrão de ensinar esse robô foi usar um Cronograma de Taxa de Aprendizado. Pense nisso como um professor rigoroso que começa a aula com uma voz muito alta e energética (alta taxa de aprendizado) para chamar a atenção do robô, mas depois sussurra lentamente e se apaga (baixa taxa de aprendizado) conforme a aula termina. O problema? Você precisa adivinhar exatamente quando começar a sussurrar e quão rápido se apagar. Se você adivinhar errado, o robô aprende mal.

Este artigo apresenta um novo método chamado ScheduleFree+. Em vez de um professor que muda o volume da voz ao longo do tempo, este método usa uma técnica de "média inteligente" que permite que o robô aprenda a um ritmo constante e confiante, sem precisar de um cronograma complexo.

Veja como o artigo explica a magia por trás do ScheduleFree+, usando analogias simples:

1. O Truque da "Média Inteligente" (A Ideia Central)

No treinamento tradicional, o robô atualiza seu cérebro com base no último coisa que viu. Isso é como um aluno que só se lembra da última pergunta feita na aula.

O Schedule-Free muda isso. Ele mantém duas versões do cérebro do robô:

  • O Cérebro "Ativo" (zz): Este é o robô atualizando-se em tempo real, aprendendo com os erros mais recentes.
  • O Cérebro "Médio" (xx): Esta é uma versão calma e estável que lembra da média de tudo o que o robô aprendeu até agora.

A mágica acontece porque o robô não olha apenas para o cérebro "Ativo" para decidir o que fazer a seguir. Ele olha para uma mistura do cérebro "Ativo" e do cérebro "Médio".

  • Analogia: Imagine que você está navegando um navio. O cérebro "Ativo" é o capitão olhando para as ondas agora (muito reativo). O cérebro "Médio" é o navegador olhando para o mapa de toda a jornada até agora (muito estável). O novo método diz ao capitão para governar com base numa mistura de ambos. Isso impede que o navio desvie violentamente quando bate numa onda pequena, levando a uma jornada muito mais suave e rápida.

2. Por Que Falhou Antes (O Problema do "Lote Grande")

Os autores descobriram que, embora essa "Média Inteligente" funcionasse muito bem para robôs pequenos, ela quebrava quando tentavam treinar robôs gigantes com lotes enormes de dados.

  • O Problema: Quando você alimenta o robô com muitos dados de uma vez (um "lote" grande), o cérebro "Ativo" fica confuso e começa a oscilar, fazendo o treinamento colapsar.
  • A Correção: Eles adicionaram Momento Interno. Pense nisso como dar ao robô um pouco de "inércia" ou "momento". Assim como um caminhão pesado é mais difícil de parar e virar do que uma bicicleta, adicionar momento ajuda o robô a manter o curso mesmo quando os dados são enormes e ruidosos. Isso permitiu que eles escalassem o método para modelos massivos.

3. A Velocidade "Autoajustável" (Sem Mais Adivinhações)

Geralmente, os humanos precisam ajustar manualmente a velocidade com que o robô aprende. O artigo introduz um Tamanho de Passo Polyak, que é como um velocímetro de carro autônomo.

  • Como funciona: Em vez de um humano definir a velocidade, o robô olha para o quão "confuso" ele está (o tamanho de seus erros) e ajusta automaticamente sua velocidade. Se os erros forem grandes, ele diminui a velocidade para pensar com cuidado. Se os erros forem pequenos, ele acelera.
  • O Resultado: Você não precisa mais adivinhar a taxa de aprendizado. O método é "livre de taxa de aprendizado", o que significa que ele descobre a velocidade perfeita por conta própria.

4. Corrigindo os Pesos "Desviados"

O artigo descobriu um efeito colateral estranho: ao usar esse novo método, os "pesos" internos do robô (a força de suas conexões) às vezes cresciam demais ou encolhiam demais, tornando o robô instável.

  • A Analogia: Imagine que as células cerebrais do robô estão ficando grandes demais, esticando os fios até que eles arrebentem.
  • A Correção: Eles aplicaram uma correção especial de "gradiente inverso". Pense nisso como um regulador inteligente que aperta os parafusos sempre que as células cerebrais do robô tentam ficar grandes demais, mantendo tudo estável e impedindo que os fios arrebentem. Isso permite que o robô treine por muito mais tempo sem quebrar.

5. Os Ajustes de "Aquecimento" e "Resfriamento"

Para fazer isso funcionar perfeitamente em sessões de treinamento longas, eles adicionaram dois toques finais:

  • Início Aquecido: No início, eles deixaram o robô aprender normalmente, sem o truque de "média", por um curto período. Isso é como deixar um corredor fazer algumas voltas de trote antes de começar a corrida, para que ele não tropece na linha de partida.
  • Annealing de Beta: À medida que o treinamento avança, eles mudam lentamente a "mistura" entre os cérebros Ativo e Médio. No início, eles ouvem mais o cérebro Ativo (para aprender rápido). Mais tarde, ouvem mais o cérebro Médio (para ser preciso). Isso é como um aluno que começa a tomar notas freneticamente, mas no final do semestre, confia mais em seu guia de estudos bem organizado.

O Grande Resultado

Quando testaram o ScheduleFree+ em modelos de linguagem massivos:

  • Foi mais rápido: Para atingir o mesmo nível de inteligência, levou 31% menos tempo do que os melhores métodos existentes.
  • Foi mais estável: A curva de aprendizado foi suave e previsível, ao contrário das curvas irregulares e acidentadas dos métodos antigos.
  • Funciona para treinamento "A Qualquer Momento": Você pode parar o treinamento a qualquer segundo, e o robô estará no melhor estado possível para aquele momento. Você não precisa esperar por um "fim de cronograma" específico para obter um bom modelo.

Em resumo: O artigo mostra que, ao misturar os pensamentos atuais do robô com seus pensamentos médios, adicionando um pouco de momento para estabilidade e deixando o robô ajustar sua própria velocidade, podemos treinar modelos de IA gigantes mais rápido, mais suavemente e sem precisar que humanos ajustem constantemente as configurações.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →