← Últimos artigos
💬 NLP

Delving into Muon and Beyond: Deep Analysis and Extensions

Este artigo analisa o otimizador Muon através de uma perspectiva espectral unificada, introduzindo uma família de transformações espectrais e uma iteração de Newton acoplada eficiente para demonstrar que, embora o Muon atue como um método eficaz de normalização espectral, ele não supera consistentemente o Adam e é mais estável quando aplicado a atualizações normalizadas por RMS em vez de atualizações de primeiro momento.

Autores originais: Xianbiao Qi, Marco Chen, Jiaquan Ye, Yelin He, Rong Xiao

Publicado 2026-02-05
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Xianbiao Qi, Marco Chen, Jiaquan Ye, Yelin He, Rong Xiao

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô gigante e complexo (uma rede neural) a falar a linguagem humana. Para fazer isso, você precisa ajustar milhões de pequenos botões (parâmetros) dentro do cérebro do robô. O "otimizador" é o professor que decide o quanto girar cada botão após cada lição.

Por muito tempo, o melhor professor foi o Adam. O Adam é inteligente: ele ouve os erros do robô, lembra dos erros passados (momentum) e ajusta o volume de cada botão individualmente com base no quão alto foi o erro (normalização). É como um professor que sabe exatamente o quanto pressionar cada botão específico.

Recentemente, um novo professor chamado Muon tornou-se muito popular. O Muon é diferente. Em vez de ajustar os botões individualmente, o Muon olha para grupos de botões organizados em uma grade (uma matriz) e os força a se mover de uma forma perfeitamente equilibrada, "ortogonal". É como um instrutor de dança que diz a uma linha inteira de dançarinos para se moverem em perfeito uníssono, ignorando se um dançarino é barulhento ou silencioso.

Este artigo pergunta: O Muon é realmente melhor que o Adam, ou é apenas um estilo diferente de dançar?

A Grande Ideia: A "Família Espectral"

Os autores perceberam que o Muon não é apenas um truque isolado. Eles descobriram que ele é, na verdade, o extremo final de uma família inteira de métodos. Imagine um controle deslizante que controla o quanto você "achata" a importância de diferentes direções no céreamente do robô:

  • Controle em 1.0 (O Padrão): Você não faz nada de especial. Isso é como o Adam padrão ou o Momentum. Você mantém a "intensidade" original de cada direção.
  • Controle em 0.5 ou 0.25 (O Meio Termo): Você suaviza gentilmente as diferenças. Erros grandes são atenuados um pouco; erros pequenos recebem um pequeno impulso.
  • Controle em 0.0 (Muon): Você achata tudo completamente. Você diz ao robô: "Não importa se uma direção foi enorme ou minúscula; trate cada direção como igualmente importante". O movimento central do Muon é a Ortogonalização.

Para testar isso, os autores construíram uma calculadora super rápida (usando um truque matemático inteligente chamado "Newton-Schulz Acoplado") que permite que eles testem essas diferentes configurações de controle sem precisar de matemática lenta e impossível em computadores gigantes.

Os Experimentos: Uma Corrida Controlada

Os autores organizaram uma corrida muito justa. Eles treinaram um modelo de linguagem pequeno ("nanoGPT") usando oito versões diferentes desses professores.

  • Eles desligaram todos os "códigos de trapaça" (como estabilizadores especiais) que outros artigos usavam com o Muon.
  • Eles garantiram que cada professor recebesse a mesma quantidade de tempo e recursos.
  • Eles testaram dois tipos de entradas: uma onde o professor apenas olha para o momentum bruto (como um empurrão simples) e uma onde o professor primeiro normaliza o ruído (como o Adam faz).

Os Resultados: O Que Eles Encontraram

1. Muon é um Estabilizador, Não um Super-Otimizador
Quando o professor está usando apenas o momentum bruto (o "empurrão simples"), o Muon é incrível. Ele impede que o robô enlouqueça e caia de um precipício. Ele torna o treinamento muito estável.

  • Analogia: Se você está tentando equilibrar uma vassoura na mão, o Muon é como um grampo rígido que segura a vassoura perfeitamente reta. Ele evita que ela balance, mas não necessariamente ajuda você a caminhar mais rápido.

2. O Adam Ainda Vence a Corrida
No entanto, quando o professor já está fazendo o trabalho inteligente de "cancelamento de ruído" (como o Adam faz), o Muon não vence. Na verdade, o Adam padrão (ou uma leve variação dele) teve um desempenho igual ou melhor.

  • Analogia: Se você já tem um giroscópio de alta tecnologia mantendo a vassoura estável (Adam), adicionar o grampo rígido do Muon não faz você caminhar mais rápido. Às vezes, até faz você tropeçar porque força você a tratar um pequeno desequilíbrio da mesma forma que uma queda gigante.

3. O Problema do "Achatamento"
Os autores descobriram que o principal truque do Muon — achatar tudo para ser igual — tem um lado negativo.

  • O Bom: Ele impede que erros enormes e perigosos dominem o treinamento.
  • O Ruim: Ele também impede que sinais minúsculos, mas úteis, sejam ignorados. Se uma direção tem um sinal pequeno, mas importante, o Muon a trata da mesma forma que uma direção ruidosa e inútil.
  • Analogia: Imagine um rádio. O Adam reduz o volume do estático e aumenta o volume da música. O Muon gira o botão de volume de todas as estações para o exato mesmo nível. Se uma estação está tocando uma música suave e bela e outra é apenas estática, o Muon faz com que ambas fiquem com o mesmo volume, abafando a música com o ruído.

A Conclusão Final

O artigo conclui que o Muon é uma ferramenta poderosa para estabilização, especialmente quando você está começando ou usando métodos simples. Ele atua como uma rede de segurança que evita que o treinamento sofra um colapso.

No entanto, o Muon não é uma bala mágica que substitui o Adam. Quando você já está usando um otimizador inteligente como o Adam, achatar tudo (p=0) não faz o robô aprender mais rápido. Na verdade, uma abordagem de "meio termo" (achatar levemente o espectro, como p=1/4) às vezes funciona melhor do que ir totalmente para o Muon.

Em resumo: O Muon é um ótimo cinto de segurança, mas não é um motor melhor. Se você já tem um bom motor (Adam), você não precisa achatar a estrada para fazê-lo andar mais rápido.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →