← Últimos artigos
📊 statistics

Anytime Pretraining: Horizon-Free Learning-Rate Schedules with Weight Averaging

Este artigo demonstra que combinar a média de pesos com cronogramas de taxa de aprendizado simples e independentes de horizonte (como o decaimento polinomial ou 1/t1/\sqrt{t}) alcança um desempenho final comparável aos cronogramas de cosseno ajustados para grandes modelos de linguagem, oferecendo uma alternativa prática e teoricamente fundamentada para o treinamento em cenários de horizonte aberto onde o horizonte total é desconhecido.

Autores originais: Alexandru Meterez, Pranav Ajit Nair, Depen Morwani, Cengiz Pehlevan, Sham Kakade

Publicado 2026-08-26
📖 7 min de leitura🧠 Leitura aprofundada

Autores originais: Alexandru Meterez, Pranav Ajit Nair, Depen Morwani, Cengiz Pehlevan, Sham Kakade

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

No mundo da inteligência artificial, os grandes modelos de linguagem são os motores que impulsionam tudo, desde assistentes de escrita até ferramentas de raciocínio complexo. Para fazer esses motores funcionarem, os pesquisadores devem ensiná-los alimentando-os com vastas quantidades de texto, um processo conhecido como pré-treinamento. Esse ensino exige um equilíbrio cuidadoso entre velocidade e precisão, controlado por uma configuração chamada taxa de aprendizado. Pense nesta taxa como o ritmo com o qual o modelo ajusta seu conhecimento interno com base em novas informações. Se o ritmo for muito rápido, o modelo ultrapassa a verdade; se for muito lento, ele não aprende nada. Durante anos, o método padrão para gerenciar esse ritmo tem sido um cronograma conhecido como decaimento de cosseno. Este método inicia o modelo em uma velocidade moderada, reduzindo-a gradualmente em uma curva suave e parando em um momento preciso. No entanto, essa abordagem padrão possui uma falha significativa: ela exige saber exatamente quanto tempo o treinamento durará antes que o primeiro passo seja dado. Em um mundo onde os dados chegam continuamente e a quantidade total de informação é desconhecida, esse requisito é como tentar dirigir um carro com um mapa que mostra apenas o destino, não a distância para chegar lá.

Pesquisadores da Universidade de Harvard e do Instituto Kempner abordaram este problema desenvolvendo uma nova maneira de treinar esses modelos que não precisa de uma data de término pré-definida. O trabalho deles, que combina teoria matemática com experimentos de larga escala, demonstra que os modelos podem ser treinados efetivamente sem nunca saber quando o treinamento irá parar. Eles descobriram que, ao usar um ritmo simples e constante que naturalmente desacelera ao longo do tempo, e ao fazer a média do progresso do modelo ao longo da jornada, poderiam alcançar resultados tão bons quanto o método tradicional. Esta descoberta sugere que os cronogramas rígidos e pré-planejados do passado não são necessários para construir a inteligência artificial mais avançada, abrindo as portas para o treinamento de sistemas que podem aprender continuamente à medida que novos dados se tornam disponíveis.

O cerne do problema reside na natureza dos dados modernos. Ao contrário dos conjuntos de dados fixos do passado, o fluxo de informações de hoje entra incessantemente. Um modelo pode ser treinado por uma semana, depois por um mês, ou potencialmente por anos, dependendo de quanta informação estiver disponível. O cronograma de decaimento de cosseno tradicional é "dependente de horizonte", o que significa que deve ser ajustado especificamente para uma duração conhecida. Se um pesquisador ajustar um cronograma para uma execução de um mês, mas o projeto se estender para três meses, o desempenho do modelo sofre porque a taxa de aprendizado foi projetada para desacelerar cedo demais. Os pesquisadores buscaram uma alternativa "livre de horizonte", um método que funcione bem independentemente de o treinamento parar amanhã ou no próximo ano. Eles propuseram que, em vez de uma curva complexa, um cronograma simples que decai lentamente ao longo do tempo, combinado com uma técnica chamada média de pesos, poderia resolver este problema. A média de pesos é um processo onde o modelo final não é apenas a última versão criada, mas uma mistura de muitas versões de todo o processo de treinamento, suavizando o ruído e estabilizando o resultado.

Para testar essa ideia, a equipe primeiro recorreu à teoria matemática. Eles analisaram o comportamento de um modelo simplificado de aprendizado, usando regressão linear em dados que mimetizam os padrões complexos encontrados na linguagem. Sua análise mostrou que, para certos tipos de dados, uma taxa de aprendizado que diminui lentamente ao longo do tempo, especificamente seguindo um padrão onde a taxa cai conforme a raiz quadrada do tempo aumenta, é teoricamente ideal. Crucialmente, eles provaram que quando este decaimento específico é pareado com a média de pesos, o método alcança a melhor velocidade possível de aprendizado sem precisar saber o tempo total de treinamento com antecedência. Essa descoberta teórica forneceu uma base sólida, sugerindo que uma abordagem simples e constante poderia superar curvas complexas e pré-planejadas em um cenário de horizonte aberto.

Os pesquisadores então passaram da teoria para a prática, treinando grandes modelos de linguagem com 150 milhões e 300 milhões de parâmetros. Eles treinaram esses modelos em um conjunto massivo de dados de texto, levando-os a aprender até 32 vezes a quantidade de dados tipicamente usada para modelos de seu tamanho. Esta escala é significativa porque espelha as condições sob as quais os sistemas de IA mais avançados do mundo são construídos. Eles compararam seus novos cronogramas livres de horizonte contra o padrão de decaimento de cosseno, que havia sido cuidadosamente ajustado para cada duração específica de treinamento. Os resultados foram impressionantes. Os novos métodos, que usavam ou uma taxa de aprendizado constante com média ou uma taxa que decai lentamente com média, acompanharam o desempenho dos melhores cronogramas de cosseno ajustados quase perfeitamente. Em todo o intervalo de treinamento, desde execuções curtas até as durações mais longas possíveis, os métodos livres de horizonte alcançaram resultados finais virtualmente indistinguíveis da abordagem tradicional.

Um dos aspectos mais convincentes deste trabalho é sua praticidade. Os pesquisadores mostraram que um único conjunto de configurações, escolhido no início do treinamento, pode ser usado durante toda a duração de um projeto, mesmo que esse projeto se expanda subitamente. Eles demonstraram que, se um modelo for ajustado para um ponto intermediário específico, como quatro vezes a quantidade de dados padrão, essas mesmas configurações continuariam a funcionar bem conforme o treinamento se estendesse para 32 vezes esse valor. Isso elimina a necessidade de interromper e reajustar o modelo toda vez que o horizonte de treinamento muda. Além disso, eles testaram um método alternativo popular conhecido como warmup-stable-decay, que tenta imitar o melhor dos dois mundos mantendo a taxa constante durante a maior parte do treinamento e depois realizando o decaimento no final. Embora este método tenha tido um bom desempenho, ele ainda exigia saber quando iniciar a fase de decaimento, tornando-o menos flexível do que a abordagem verdadeiramente livre de horizonte proposta pelos autores.

O estudo também explorou como esses métodos se comportam quando o conjunto de dados de treinamento é muito grande, um cenário onde o ruído no processo de aprendizado é naturalmente menor. Nessas condições, os pesquisadores descobriram que a taxa de aprendizado não precisava decair de forma alguma. Uma taxa de aprendizado constante, combinada com a média de pesos, era suficiente para alcançar o desempenho máximo. Isso se alinha com a previsão teórica de que, quando a variância, ou ruído, nos dados é pequena, o modelo se beneficia mais de manter um ritmo constante para reduzir o viés, ou erro, em vez de desacelerar. Essa percepção sugere que, à medida que o poder computacional cresce e os modelos podem processar lotes de dados maiores, a necessidade de cronogramas de decaimento complexos pode diminuir inteiramente, sendo substituída por estratégias mais simples e robustas.

Em última análise, esta pesquisa fornece um caminho claro para o futuro do treinamento de inteligência artificial. Ela sugere que os cronogramas rígidos e pré-calculados que dominaram o campo por anos não são a única maneira, ou talvez nem a melhor maneira, de treinar modelos em uma era de dados contínuos. Ao provar que cronogramas simples, livres de horizonte, combinados com a média de pesos, podem igualar o desempenho dos métodos tradicionais mais cuidadosamente ajustados, os autores ofereceram uma solução prática para o aprendizado de horizonte aberto. Esta abordagem permite que os modelos se adaptem a qualquer quantidade de dados disponível, tornando o processo de treinamento mais flexível e eficiente. As descobertas indicam que o futuro do treinamento de grandes modelos de linguagem pode não residir em algoritmos de agendamento mais complexos, mas em estratégias mais simples e resilientes que podem aprender continuamente sem um fim predeterminado.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →