← Últimos artigos
🤖 machine learning

FORGE: Fused On-Register Gradient Elimination for Memory-Efficient LLM Training

FORGE é um método de treinamento de LLM eficiente em memória que funde a etapa do otimizador na passagem de retropropagação para eliminar gradientes materializados ao processá-los inteiramente em registradores, reduzindo assim pela metade o uso de memória do otimizador, acelerando o treinamento e preservando a fidelidade de precisão total sem alterar a lógica de atualização subjacente.

Autores originais: Dikshant Kukreja, Kritarth Prasad, Avinash Anand, Zhengkui Wang, Erik Cambria, Timothy Liu, Aik Beng Ng, Simon See, Bapi Chatterjee

Publicado 2026-06-23
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Dikshant Kukreja, Kritarth Prasad, Avinash Anand, Zhengkui Wang, Erik Cambria, Timothy Liu, Aik Beng Ng, Simon See, Bapi Chatterjee

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Grande Problema: A "Oficina Bagunçada"

Imagine que você está treinando um modelo de IA gigante (como o cérebro de um robô) em um computador. Para ensinar este robô, o computador precisa realizar uma quantidade massiva de cálculos matemáticos.

Na forma padrão de fazer isso (chamada de "Diferenciação de modo reverso"), o computador segue um processo rigoroso de duas etapas:

  1. Calcular os Erros: Ele analisa os dados, descobre onde o robô errou e escreve uma lista gigante de "notas de correção" (gradientes) para cada parte do cérebro do robô. Ele escreve essas notas em um quadro branco gigante (a memória do computador).
  2. Aplicar os Ajustes: Somente após todo o quadro branco estar cheio é que o computador pega uma borracha e um marcador para realmente atualizar o cérebro do robô com base nessas notas.

O Gargalo: O problema é que o computador tem que manter esse quadro branco gigante de notas em sua memória enquanto também está segurando o cérebro do robô e as notas para o próximo passo. Este "quadro branco" ocupa tanto espaço que muitas vezes preenche a memória do computador antes mesmo de o treinamento começar. É como tentar consertar um carro em uma garagem, mas você precisa manter o projeto inteiro do carro, as ferramentas e o manual de reparo espalhados pelo chão ao mesmo tempo. Se a garagem for pequena demais, você não consegue colocar o carro lá dentro.

A Solução: FORGE (O Método do "Ajuste Instantâneo")

Os autores deste artigo, FORGE (Fused On-Register Gradient Elimination), dizem: "Por que escrever as notas no quadro branco?"

Eles argumentam que a lista gigante de notas é apenas um artefato de como fazemos a matemática, não algo que o processo de aprendizado realmente necessita.

Como o FORGE funciona:
Em vez de escrever as notas e depois lê-las novamente, o FORGE faz a matemática e o ajuste ao mesmo tempo, na área de armazenamento mais rápida e pequena do computador (chamada de "registradores").

  • A Analogia: Imagine um mestre cuca preparando um prato complexo.
    • Jeito Antigo: O chef pica uma cebola, escreve "cebola picada" em um bloco de notas, coloca a cebola em uma tigela e então passa para o próximo ingrediente. Depois que todos os ingredientes estão picados e listados, o chef lê o bloco de notas e mistura tudo. O bloco de notas ocupa espaço na bancada.
    • Jeito FORGE: O chef pica uma cebola e a joga imediatamente na panela. Depois, ele pica uma cenoura e a joga imediatamente. Ele nunca escreve nada. Ele nunca precisa de um bloco de notas. A bancada permanece limpa.

Por que isso é um Grande Avanço

O artigo afirma três grandes benefícios deste método de "sem notas":

1. Economiza Espaço Massivo (Memória)
Como o computador nunca escreve a lista gigante de notas na memória principal, ele libera uma enorme quantidade de espaço.

  • O Resultado: Em um chip de computador padrão (H200), eles conseguiram treinar um modelo de 8 bilhões de parâmetros usando 53% menos memória.
  • A Analogia: É como ser capaz de colocar uma mesa de jantar para 10 pessoas em um estúdio pequeno porque você parou de precisar armazenar as cadeiras extras no corredor.

2. É Realmente Mais Rápido
Como o computador não precisa parar para escrever notas, esperar e depois lê-las novamente, todo o processo acelera.

  • O Resultado: As etapas de treinamento rodam cerca de 1,5 vezes mais rápido.
  • A Analogia: É a diferença entre um entregador que deixa um pacote, corre de volta para o caminhão para pegar o próximo e repete o processo (Jeito Antigo), versus um motorista que tem uma esteira rolante que carrega o pacote diretamente no caminhão enquanto ele o pega (FORGE).

3. Não Perde a Precisão
Geralmente, quando você tenta economizar espaço pulando etapas, você perde precisão (o robô aprende um pouco menos bem). Os autores provam que, como estão fazendo a matemática nos "registradores" de maior qualidade do computador (precisão total) antes de descartar os dados, o aprendizado é matematicamente idêntico ao método antigo e lento.

  • O Resultado: O robô aprende tão bem quanto, mas de forma muito mais eficiente.

O Truque do "Tile" (Ladrilho)

Como eles fazem isso sem causar o caos? Eles dividem o grande problema matemático em pequenos pedaços gerenciáveis chamados "tiles" (como quadrados de 128x128).

  • Eles processam um tile: Calcula o erro, ajusta o cérebro e descarta o erro imediatamente.
  • Depois, passam para o próximo tile.
  • Como fazem isso tile por tile, o computador nunca precisa segurar a lista inteira de erros ao mesmo tempo.

O Que Isso Nos Permite Fazer

O artigo mostra que com o FORGE:

  • Você pode treinar modelos maiores no mesmo computador.
  • Você pode usar "lotes" (batches) maiores (ensinando mais exemplos ao robô de uma só vez) sem ficar sem memória.
  • Em um teste específico, eles foram capazes de treinar um modelo em quatro GPUs que exigiria oito GPUs usando o método antigo.

Resumo

FORGE é uma nova maneira de treinar IA que impede o computador de entulhar sua memória com "notas de correção" temporárias. Ao calcular os erros e ajustar o modelo instantaneamente na parte mais rápida do chip, ele corta o uso de memória pela metade e acelera o treinamento, tudo sem tornar a IA menos inteligente. Ele transforma uma oficina lotada e lenta em uma linha de montagem ágil e de alta velocidade.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →