← Últimos artigos
🤖 machine learning

Gefen: Optimized Stochastic Optimizer

O artigo apresenta o Gefen, um otimizador eficiente em termos de memória que reduz a pegada de memória do AdamW em aproximadamente 8x por meio do compartilhamento automático do segundo momento e da quantização aprendida do primeiro momento, permitindo tamanhos de lote maiores e melhor throughput enquanto mantém o desempenho equivalente.

Autores originais: Nadav Benedek, Tomer Koren, Ohad Fried

Publicado 2026-06-15
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Nadav Benedek, Tomer Koren, Ohad Fried

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está treinando um robô gigante (um modelo de deep learning) para aprender uma nova habilidade. Para fazer isso, o robô precisa de um "treinador" (um otimizador) que diga a ele como ajustar suas configurações internas após cada sessão de prática. O treinador mais popular atualmente é chamado de AdamW.

O AdamW é um ótimo treinador, mas ele carrega uma mochila pesada. Para cada configuração do robô, o AdamW carrega dois cadernos extras (chamados de "estados de primeiro e segundo momento") para lembrar dos erros passados e de quão rápido as coisas estão mudando. Se o seu robô tiver 1 bilhão de configurações, a mochila do AdamW adiciona o peso de outros 2 bilhões de configurações. Isso torna a mochila tão pesada que você não consegue colocar um robô grande em um computador de treinamento padrão, ou tem que fazer o robô praticar em passos minúsculos e lentos.

O artigo apresenta um novo treinador chamado Gefen. O Gefen é um otimizador "eficiente em memória" que encolhe essa mochila pesada em 8 vezes, mantendo a velocidade e a qualidade de aprendizado do robô exatamente iguais às do AdamW.

Aqui está como o Gefen faz isso, usando algumas analogias simples:

1. A Estratégia do "Abraço Coletivo" (Compartilhando Notas)

O Problema: O AdamW escreve uma nota separada para cada número no cérebro do robô.
A Solução do Gefen: O Gefen percebe que muitos desses números são, na verdade, "melhores amigos". Eles reagem ao mundo de maneiras muito semelhantes. Em vez de escrever uma nota única para cada amigo, o Gefen agrupa eles em equipes (blocos) e dá a toda a equipe um caderno compartilhado.

  • Como ele sabe quem agrupar? Normalmente, você precisaria de um mapa super complexo (chamado matriz Hessiana) para ver quem é amigo de quem, mas esse mapa é grande demais para ser desenhado para robôs gigantes.
  • O Truque do Gefem: O Gefen observa a primeiríssima sessão de prática do robô. Ele vê quais números se moveram juntos em um padrão semelhante. Ele assume: "Se vocês se moveram juntos no início, provavelmente se moverão juntos mais tarde". Ele então agrupa esses números automaticamente. Nenhum humano precisa dizer a ele quais grupos formar; ele descobre por conta própria.

2. A Estratégia do "Retratista" (Quantização)

O Problema: Mesmo com cadernos compartilhados, os números dentro deles ainda são escritos com alta precisão (como 10 casas decimais), o que ocupa espaço.
A Solução do Gefen: O Gefen usa uma abordagem de "retratista". Em vez de anotar o número exato (ex: 0,123456789), ele o arredonda para o "valor padrão" mais próximo de uma lista pré-fabricada (um código/codebook).

  • A Lista Inteligente: A maioria dos otimizadores usa uma lista de valores genérica e fixa (como uma régua com marcas fixas). O Gefen, porém, observa o robô específico que está treinando e aprende a lista de marcas perfeita apenas para aquele robio. Ele utiliza um método matemático inteligente (Programação Dinâmica) para criar uma régua personalizada que se ajuste perfeitamente aos dados, minimizando erros.
  • Estabilidade: Uma vez que ele aprende essa lista no início, ele continua usando a mesma lista durante todo o processo. Ele não precisa redesenhar a régua todos os dias, o que economiza tempo e mantém as coisas estáveis.

Os Resultados: Uma Mochila Mais Leve, Mesmo Desempenho

Os autores testaram o Gefen em vários modelos, desde pequenos classificadores de imagem até grandes modelos de linguagem (como o Llama 3).

  • Memória: O Gefen reduziu a memória necessária para o otimizador em cerca de 8 vezes em comparação ao AdamW. Para um modelo de 13 bilhões de parâmetros, isso economiza cerca de 97 GB de memória, reduzindo para apenas 1,5 GB.
  • Velocidade: Como a mochila é mais leve, o robô pode carregar um "micro-lote" (grupo de prática) maior de uma só vez. Em testes usando múltiplos computadores (FSDP e DDP), isso permitiu que o treinamento rodasse 56% mais rápido porque os computadores não estavam esperando a memória liberar espaço.
  • Qualidade: Apesar da compressão pesada e do compartilhamento, o robô aprendeu tão bem quanto aprendeu com a mochila pesada do AdamW. O desempenho final (acurácia ou perda) foi idêntico.

Por Que Isso Importa

Pense nisso como arrumar as malas para uma viagem. O AdamW é como arrumar uma mala onde cada meia recebe sua própria caixa individual. O Gefen é como perceber que você pode enrolar todas as suas meias em um único pacote apertado e colocá-las em um pequeno estojo. Você economiza um espaço enorme, mas ainda tem todas as suas meias e consegue chegar ao seu destino com a mesma rapidez.

O artigo afirma que o Gefen é um "substituto direto" (drop-in replacement), o que significa que você pode trocá-lo em seu código de treinamento existente sem alterar nenhuma configuração, e ele imediatamente economizará memória e potencialmente acelerará seu treinamento.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →