← Últimos artigos
🤖 machine learning

Muown: Row-Norm Control for Muon Optimization

O artigo apresenta o Muown, um otimizador plug-and-play que controla explicitamente os vetores de magnitude das linhas para evitar a deriva da norma espectral no Muon, melhorando assim a estabilidade do treinamento, reduzindo a sensibilidade ao decaimento de pesos e alcançando perplexidade superior em diversas escalas de modelos.

Autores originais: Kai Lion, Florian Hübler, Bingcong Li, Antonio Orvieto, Niao He

Publicado 2026-05-12
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Kai Lion, Florian Hübler, Bingcong Li, Antonio Orvieto, Niao He

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está treinando um cérebro digital gigante (um Modelo de Linguagem de Grande Escala) para escrever histórias, resolver problemas de matemática ou conversar com você. Para fazer isso, o cérebro precisa aprender ajustando milhões de pequenos botões (pesos) dentro de seus circuitos.

Por muito tempo, a melhor maneira de girar esses botões foi um método chamado AdamW. Recentemente, um novo método mais rápido chamado Muon chegou. Foi como trocar uma bicicleta por um carro esportivo; ele aprendeu mais rápido e melhor. Mas havia uma pegadinha: o carro esportivo tinha uma tendência a acelerar fora de controle.

O Problema: O Motor "Derivando"

O artigo identifica um problema específico com o Muon. À medida que o modelo treina, o "tamanho" de suas conexões internas (especificamente, a força das linhas em suas matrizes de pesos) começa a crescer descontroladamente.

Pense nisso como um balão sendo inflado.

  • O Muon é ótimo em descobrir para qual direção soprar o balão (a direção).
  • No entanto, ele continua bombeando mais ar do que o necessário, fazendo o balão ficar cada vez maior até que possa estourar (erros numéricos) ou se tornar instável.
  • A correção padrão era amarrar um barbante ao redor do balão e puxá-lo firme toda vez que ficasse grande demais (Decaimento de Peso). Mas os autores descobriram que isso era como usar um martelo para quebrar uma noz: isso desacelerava o processo de aprendizado porque apertava todo o balão, até mesmo as partes que estavam bem.

O Diagnóstico: Duas Partes do Problema

Os autores, liderados por Kai Lion, decidiram olhar dentro do balão para ver o que realmente estava crescendo. Eles perceberam que o "tamanho" da conexão é composto por duas partes distintas:

  1. A Magnitude (O Volume): Quão grande é a linha de números no geral.
  2. A Coerência (A Forma): Como os números dentro dessa linha estão dispostos em relação uns aos outros.

Eles descobriram que apenas a Magnitude estava derivando fora de controle. A Forma (Coerência) estava, na verdade, comportando-se perfeitamente e permanecendo estável. O balão não estava mudando sua forma; estava apenas ficando maior.

A Solução: Muown (A Bomba Inteligente)

Os autores criaram um novo otimizador chamado Muown.

Em vez de tratar toda a conexão como um grande bloco, o Muown divide o trabalho em duas tarefas separadas:

  1. A Equipe de Direção (Muon): Esta equipe continua fazendo o que o Muon faz de melhor: descobrir a direção perfeita para atualizar os pesos. Eles deixam esta parte inalterada.
  2. A Equipe de Volume (Nova): Esta é a parte nova. Eles pegam a "Magnitude" (o volume) e a tratam como uma variável separada e explícita. Eles dão a esse volume um conjunto especial de regras (uma geometria matemática específica chamada \ell_\infty) para impedir que cresça muito rápido.

A Analogia:
Imagine que você está dirigindo um carro onde o volante e o pedal do acelerador estão presos juntos. Se você virar o volante, o pedal do acelerador também é pressionado, fazendo o carro acelerar descontroladamente.

  • O Muon era como aquele carro travado.
  • O Muown é como desacoplar o volante do pedal do acelerador. Você ainda pode dirigir perfeitamente (usando a lógica do Muon), mas agora tem um controle de cruzeiro separado e inteligente para o pedal do acelerador (a magnitude) que mantém a velocidade exatamente onde precisa estar, sem desacelerá-lo.

Os Resultados

O artigo testou isso em modelos que variavam de pequenos (124 milhões de parâmetros) a muito grandes (2,7 bilhões de parâmetros). Eis o que eles descobriram:

  • Melhor Desempenho: O Muown produziu consistentemente melhores resultados (menor "perplexidade", que é uma medida de quão confuso o modelo está) do que o Muon, o AdamW e outros concorrentes.
  • Mais Perdoável: Com o Muon, você precisava ter muito cuidado com suas configurações (taxa de aprendizado). Se você escolhesse a errada, o modelo falharia. O Muown é muito mais robusto; funciona bem em uma ampla gama de configurações, como um carro com uma "zona ideal" de direção mais ampla.
  • Sem Custo Extra: Geralmente, adicionar um novo sistema de controle desacelera um carro. Mas, como os autores integraram esse novo "controle de volume" diretamente ao fluxo de trabalho existente do motor, isso adicionou quase nenhum tempo extra ao processo de treinamento.
  • Estabilidade: O "balão" parou de derivar. A norma espectral (o tamanho das conexões) permaneceu estável, prevenindo os erros numéricos que afligiam o Muon original.

Resumo

O artigo argumenta que a instabilidade no popular otimizador Muon não era uma falha em sua capacidade de encontrar a direção, mas sim uma falta de controle sobre o "volume" de suas atualizações. Ao separar o "volume" da "direção" e controlá-los com ferramentas diferentes e especializadas, o Muown mantém o treinamento rápido e estável sem precisar de correções pesadas como o decaimento de peso. É uma substituição direta que torna o processo de treinamento mais suave, rápido e confiável.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →