← Últimos artigos
📊 statistics

Seesaw: Accelerating Training by Balancing Learning Rate and Batch Size Scheduling

Este artigo apresenta o Seesaw, um framework fundamentado que acelera o pré-treinamento de modelos de linguagem de grande escala ao escalar simultaneamente o tamanho do lote e ajustar a taxa de aprendizado para preservar a dinâmica da perda, reduzindo assim o tempo de treinamento de relógio em aproximadamente 36% em comparação com cronogramas padrão de decaimento de cosseno, enquanto iguala o desempenho com iguais FLOPs.

Autores originais: Alexandru Meterez, Depen Morwani, Jingfeng Wu, Costin-Andrei Oncescu, Cengiz Pehlevan, Sham Kakade

Publicado 2026-07-28
📖 3 min de leitura☕ Leitura rápida

Autores originais: Alexandru Meterez, Depen Morwani, Jingfeng Wu, Costin-Andrei Oncescu, Cengiz Pehlevan, Sham Kakade

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô gigante e superinteligente a entender o mundo, alimentando-o com uma montanha de livros. Esse processo é chamado de "treinamento", e é o ingrediente secreto por trás dos chatbots de IA e ferramentas que vemos hoje. Para aprender bem, o robô precisa de duas coisas principais: uma "taxa de aprendizado" (learning rate), que é o quanto ele muda de ideia após ler uma única página, e um "tamanho de lote" (batch size), que é quantas páginas ele lê antes de parar para pensar e se ajustar.

Por muito tempo, os cientistas pensaram que a melhor maneira de acelerar isso era apenas alimentar o robô com mais páginas de uma vez (um tamanho de lote maior) para que ele pudesse processar os dados mais rápido. Mas há uma pegadinha: se você alimentar o robô com muitas páginas de uma vez sem mudar a forma como ele pensa, ele fica confuso e para de aprender de forma eficiente. É como tentar aprender um idioma lendo uma enciclopédia inteira de uma só vez; você pode até obter os fatos, mas não entenderá a gramática. A grande questão que os pesquisadores têm feito é: Como equilibramos o ato de ler mais páginas com o ato de pensar cuidadosamente para aprender mais rápido, sem que o robô se perca?

Este artigo apresenta uma nova estratégia inteligente chamada Seesaw para resolver esse jogo de equilíbrio. Os pesquisadores descobriram uma regra matemática que atua como uma gangorra perfeita: sempre que você dobra o número de páginas que o robô lê de uma vez (o tamanho do lote), você não deve apenas manter a taxa de aprendizado igual ou cortá-la pela metade. Em vez disso, você deve ajustar a taxa de aprendizado por um valor muito específico — dividindo-a pela raiz quadrada de dois (cerca cerca de 1,41).

Pense da seguinte forma: se você dobrar o tamanho do seu grupo de estudos (tamanho do lote), você não precisa diminuir a velocidade da sua conversa (taxa de aprendizado) tanto quanto imagina. Ao usar esse ritmo "Seesaw", o robô pode processar a mesma quantidade de informação em menos etapas. Os autores provaram isso matematicamente para tarefas de aprendizado simples e depois testaram em modelos de linguagem massivos com 150 milhões, 300 milhões e 600 milhões de parâmetros. Eles descobriram que, ao usar o Seesaw, poderiam treinar esses modelos cerca de 36% mais rápido em tempo real (tempo de relógio/wall-clock time) em comparação aos métodos padrão, enquanto ainda alcançavam exatamente o mesmo nível de inteligência.

O artigo também alerta explicitamente contra ser ganancioso demais. Se você tentar aumentar o tamanho do lote de forma muito agressiva sem ajustar a taxa de aprendizado corretamente, o processo de aprendizado do robô torna-se instável e ele para de melhorar. Os autores mostraram que existe um "ponto de ruptura" onde a matemática falha, e o método Seesaw permanece seguramente do lado certo dessa linha. Em resumo, o Seesaw não é apenas um palpite; é uma receita matematicamente fundamentada que permite que os modelos de IA aprendam as mesmas lições em significativamente menos tempo, aproximando-nos de construir IAs mais inteligentes sem ter que esperar meses para o treinamento terminar.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →