← Últimos artigos
🤖 machine learning

Runtime-Orchestrated Second-Order Optimization for Scalable LLM Training

O artigo apresenta a Asteria, um sistema de tempo de execução que viabiliza a otimização de segunda ordem prática e escalável para grandes modelos de linguagem, distribuindo dinamicamente os estados do otimizador através de hierarquias de memória heterogêneas e desacoplando os cálculos caros de pré-condicionamento do caminho crítico de treinamento em GPU, a fim de reduzir a sobrecarga e acelerar a convergência.

Autores originais: Yishun Lu, Junhao Zhang, Zeyu Yang, Wes Armour

Publicado 2026-05-18
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Yishun Lu, Junhao Zhang, Zeyu Yang, Wes Armour

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô gigante e superinteligente (um Modelo de Linguagem de Grande Escala) a escrever histórias. Para fazer isso, você precisa de um "professor" (um otimizador) que observe os erros do robô e lhe diga como melhorar.

Atualmente, a maioria dos professores usa um método simples chamado AdamW. É como um aluno que verifica seu dever de casa, vê algumas respostas erradas e faz correções pequenas e rápidas. É rápido e funciona bem, mas exige muita prática (milhões de exemplos) para ficar realmente bom.

Existe um método de professor mais inteligente e avançado chamado Otimização de Segunda Ordem (como SOAP ou Shampoo). Este professor não olha apenas o que estava errado; ele analisa a forma dos erros para entender o problema profundamente. Aprende muito mais rápido e precisa de menos exemplos. No entanto, há um grande problema: este professor inteligente é incrivelmente pesado. Requer quantidades massivas de memória e poder de computação para fazer sua matemática complexa, frequentemente fazendo o computador travar ou funcionar tão lentamente que o professor simples termina o trabalho primeiro.

Apresentamos a Asteria: O "Gerente Logístico Inteligente"

Os pesquisadores de Oxford construíram um novo sistema chamado Asteria. Pense na Asteria não como um novo professor, mas como um brilhante gerente logístico que reorganiza toda a sala de aula para que o professor inteligente finalmente possa fazer seu trabalho sem quebrar a escola.

Veja como a Asteria resolve os três maiores problemas, usando analogias simples:

1. O Problema dos "Móveis em um Quarto Minúsculo" (Memória)

O Problema: O professor inteligente precisa manter enormes e complexos gráficos (matrizes) em sua cabeça (a memória da GPU). Em um computador padrão, não há espaço suficiente. É como tentar caber uma cama de casal, uma mesa de jantar e um guarda-roupa em um apartamento estúdio. O quarto fica cheio e o professor é obrigado a desistir.
A Solução da Asteria: A Asteria age como um especialista em móveis dobráveis. Ela percebe que o professor não precisa segurar tudo nas mãos ao mesmo tempo.

  • Mantém as partes mais ativas dos gráficos na GPU (a mesa).
  • Move as partes pesadas e menos frequentemente usadas para a CPU (o corredor) ou até mesmo para um disco rígido (a garagem).
  • Crucialmente, ela traz as partes pesadas de volta à mesa exatamente quando são necessárias. Isso permite que o professor inteligente trabalhe em um laptop pequeno tão bem quanto em um supercomputador.

2. O Problema do "engarrafamento" (Velocidade)

O Problema: A cada poucos passos, o professor inteligente precisa realizar um cálculo massivo e complexo (como resolver um quebra-cabeça gigante) para atualizar seus gráficos. Isso leva muito tempo e interrompe toda a classe de trabalhar. É como um caminhão de entregas bloqueando toda a rodovia enquanto descarrega um único pacote. A GPU (o cérebro do computador) fica ociosa, esperando.
A Solução da Asteria: A Asteria introduz uma linha de montagem paralela.

  • Em vez de parar a aula principal para fazer a matemática pesada, a Asteria envia o "trabalho pesado" para uma equipe de trabalhadores no escritório de trás (a CPU).
  • Enquanto a aula principal (a GPU) continua ensinando o robô, os trabalhadores do escritório de trás resolvem silenciosamente os quebra-cabeças complexos em segundo plano.
  • Quando a aula precisa dos novos gráficos, o escritório de trás já os terminou e os deslizou para lá. A aula principal nunca precisa parar. O "engarrafamento" desaparece.

3. O Problema do "Chat de Grupo" (Treinamento Distribuído)

O Problema: Ao treinar com muitos computadores ao mesmo tempo, todos geralmente precisam parar e concordar com exatamente as mesmas informações antes de avançar para o próximo passo. É como um chat de grupo onde todos precisam esperar a pessoa mais lenta responder antes que alguém possa digitar novamente.
A Solução da Asteria: A Asteria usa uma política de "Bom o Suficiente".

  • Em vez de esperar que todos estejam perfeitamente sincronizados, ela permite que os computadores trabalhem com informações ligeiramente "desatualizadas" por um curto período.
  • Ela envia atualizações apenas quando são verdadeiramente necessárias.
  • Isso mantém o grupo avançando rapidamente, como uma equipe que confia uns nos outros para continuar trabalhando enquanto atualizações são recuperadas depois, em vez de parar todo o projeto a cada cinco minutos.

Os Resultados: O Que Eles Descobriram?

Os pesquisadores testaram a Asteria em hardware real, incluindo um único computador poderoso (Nvidia DGX Spark) e um grande cluster de computadores (Nvidia GH200).

  • Funciona em máquinas pequenas: Eles conseguiram treinar um modelo de linguagem grande (1 bilhão de parâmetros) em uma única máquina que anteriormente não conseguia lidar com os requisitos de memória deste professor inteligente.
  • É mais rápido em tempo real: Como esconde os "engarrafamentos", o treinamento termina em menos tempo de relógio real, mesmo que a matemática seja mais difícil.
  • Economiza energia: Ao manter o cérebro do computador (GPU) ocupado e não deixá-lo ocioso esperando por cálculos, a Asteria na verdade usa menos energia total para alcançar o mesmo resultado em comparação com os métodos antigos e pesados.
  • Não perde qualidade: O modelo aprende tão bem quanto aprenderia com o professor inteligente "nativo" (não otimizado), mas chega lá muito mais rápido e barato.

Em Resumo:
A Asteria não inventa uma nova fórmula matemática. Em vez disso, ela repensa como o computador executa essa matemática. Ela separa o trabalho pesado do trabalho principal, usa todo o espaço de armazenamento disponível com sabedoria e permite que os computadores trabalhem de forma assíncrona. Isso transforma um método "teoricamente ótimo, mas praticamente impossível" em uma ferramenta prática para treinar a próxima geração de IA.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →