← Últimos artigos
🤖 machine learning

DMuon: Efficient Distributed Muon Training with Near-Adam Overhead

O artigo apresenta o DMuon, uma implementação distribuída de código aberto do otimizador Muon que se integra perfeitamente em pipelines de treinamento existentes para reduzir drasticamente a latência do passo do otimizador e alcançar eficiência próxima à do AdamW, permitindo assim o uso escalável de otimização baseada em ortogonalização de matrizes em grandes modelos de fundação.

Autores originais: Vincent Chen, Starrick Liu, Regis Cheng, Dance Yang, Shalfun Li, Ryan Yu, Lucy Liang, Hang Su, Roy Gan, Hao Wang, Qian Wang

Publicado 2026-06-26
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Vincent Chen, Starrick Liu, Regis Cheng, Dance Yang, Shalfun Li, Ryan Yu, Lucy Liang, Hang Su, Roy Gan, Hao Wang, Qian Wang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está treinando o cérebro de um robô gigante (um Modelo de Linguagem de Grande Escala ou uma IA incorporada) para aprender. Para ensiná-lo, você precisa de um "otimizador" — um treinador que observa os erros do robô e ajusta suas conexões internas (pesos) para torná-lo mais inteligente.

Por anos, o treinador padrão foi o AdamW. É como uma equipe de milhares de pequenos trabalhadores, cada um consertando um pequeno parafuso do robô de cada vez. É rápido e eficiente, mas trata cada parafuso de forma independente.

Recentemente, um treinador mais inteligente chamado Muon foi descoberto. Em vez de consertar parafusos um por um, o Muon olha para painéis inteiros do robô (matrizes completas de dados) e os ajusta todos juntos. Essa abordagem de "terapia de grupo" ajuda o robô a aprender mais rápido e a atingir um desempenho mais alto. No entanto, há um porém: o Muon é incrivelmente lento para rodar em um sistema distribuído (um cluster de muitos computadores trabalhando juntos).

O Problema: O Gargalo da Reunião de "Todos à Mão"
Em uma configuração de treinamento distribuído, o cérebro do robô é dividido entre muitos computadores (GPUs).

  • AdamW funciona como uma equipe remota: o Computador A conserta seus parafusos, o Computador B conserta os dele, e eles não precisam conversar muito entre si.
  • Muon funciona como um comitê: Para consertar um painel, cada computador precisa ver o painel inteiro primeiro.

Em uma implementação ingênua do Muon, cada computador tem que parar o que está fazendo, baixar os dados completos de todos os outros, realizar a matemática complexa e então enviar os resultados de volta. Isso é como realizar uma reunião massiva onde todos leem um relatório de 1.000 páginas antes de tomar uma única decisão. Leva tanto tempo que a "reunião" (o passo do otimizador) demora mais do que o próprio trabalho (os passos de aprendizado). Na verdade, o artigo observa que isso pode custar 2x mais tempo do que o próprio aprendizado!

A Solução: DMuon (Distributed Muon)
A Equipe de Robôs X Square construiu o DMuon, um novo sistema que faz o Muon rodar quase tão rápido quanto o AdamW. Eles fizeram isso mudando como a equipe trabalha, não mudando a matemática do treinador.

Aqui está como eles resolveram o gargalo usando três truques principais:

1. A Estratégia do "Especialista Designado" (Execução Centrada no Proprietário)

Em vez de todos tentarem consertar todos os painéis, o DMuon atribui um computador específico para ser o "Proprietário" de cada painel.

  • Antes: Todos reuniam os dados, todos faziam a matemática, todos perdiam tempo.
  • Agora: Apenas o computador "Proprietário" reúne os dados e faz a matemática pesada. Os outros computadores apenas esperam ou fazem outro trabalho.
  • Analogia: Imagine um canteiro de obras. Em vez de cada trabalhador tentar construir a casa inteira, um especialista é designado para o telhado, outro para o encanamento. Os outros não tentam construir o telhado; eles apenas entregam as ferramentas que o especialista precisa. Isso impede que todos façam o mesmo trabalho duas vezes.

2. O Sistema de "Esteira de Produção" (Sobreposição de Comunicação)

Enquanto o "Proprietário" está fazendo a matemática, os outros computadores não ficam apenas parados. O DMuon cria um pipeline:

  • Passagem Direta (Forward Pass): Enquanto o robô está "pensando" (processando dados), o sistema envia silenciosamente o próximo conjunto de ferramentas para os especialistas em segundo plano.
  • Passagem Reversa (Backward Pass): Enquanto o robô está "aprendendo com os erros", o sistema já está reunindo o próximo lote de dados para os especialistas.
  • Analogia: É como a cozinha de um restaurante. O chef (o Proprietário) está cortando vegetais. Em vez de esperar o chef terminar antes de o garçom trazer o próximo pedido, o garçom traz o próximo pedido enquanto o chef ainda está cortando. O tempo de espera é escondido dentro do tempo de corte.

3. A "Linha de Montagem Inteligente" (Loteamento e Ajuste)

A matemática que o Muon faz é complexa. Às vezes, as peças são enormes (como uma parede gigante) e, às vezes, são minúsculas (como um pequeno azulejo).

  • O Problema: Se você tentar processar um azulejo minúsculo em uma máquina gigante, a máquina ficará ociosa. Se você processar uma parede gigante, levará uma eternidade.
  • A Correção: O DMuon agrupa muitos azulejos minúsculos em um único "lote" para que a máquina permaneça ocupada. Ele também usa um "ajustador" que encontra automaticamente a maneira mais rápida de cortar cada formato específico de azulejo.
  • Analogia: Em vez de enviar um caminhão de entrega para um único envelope, o DMuon espera até ter uma carga completa de envelopes e os envia todos de uma vez. Ele também altera a rota do caminhão dependendo se o destino é uma cidade ou uma fazenda.

Os Resultados

O artigo testou o DMuon em modelos do mundo real, incluindo um modelo de treinamento de robô (Wall-OSS) e um modelo de linguagem (Qwen2.5).

  • Velocidade: O DMuon tornou o "passo do otimizador" (a reunião) de 6 a 163 vezes mais rápido do que a antiga forma ingênua.
  • Eficiência: O tempo total para treinar um passo é agora apenas 2% mais lento do que o método padrão AdamW.
  • Conclusão: O DMuon permite que as equipes usem o estilo de aprendizado superior de "terapia de grupo" do Muon sem pagar a enorme penalidade de tempo. Ele transforma um processo lento e desajeitado em um processo suave e eficiente, tornando-o pronto para uso em produção em modelos de IA massivos.

Em resumo, o DMuon é o sistema de controle de tráfego que permite que o treinador mais inteligente (Muon) rode em uma rodovia de computadores sem causar um congestionamento, finalmente tornando prático o treinamento da próxima geração de IA.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →