← Últimos artigos
🤖 machine learning

Muonp^p: Muon with Fractional Spectral Powers

O artigo apresenta o Muonp^p, um otimizador inovador que interpola entre o Muon e o gradiente descendente ao aplicar potências espectrais fracionárias aos valores singulares do gradiente, utilizando recorrências bivariadas eficientes para aproximar essas atualizações e demonstrando desempenho aprimorado no ajuste fino de modelos de escala de bilhões enquanto preserva informações valiosas do espectro singular.

Autores originais: Yihe Dong, Will Sawin

Publicado 2026-06-15
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Yihe Dong, Will Sawin

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um robô gigante e superinteligente (uma rede neural) a falar, escrever código ou resolver problemas matemáticos. Para ensiná-lo, você precisa mostrar exemplos e corrigir seus erros. O "otimizador" é o método do professor para decidir como ajustar o cérebro do robô após cada erro.

O Problema: O Professor "Tudo ou Nada" (Muon)

Recentemente, um método de ensino popular chamado Muon tornou-se famoso. Veja como ele funciona:

Imagine que os erros do robô vêm em diferentes "direções" ou "frequências". Algumas direções são muito altas e óbvias (modos dominantes), enquanto outras são sussurros baixos (pequenos valores singulares).

  • Os professores antigos (como o Gradiente Descendente padrão) gritariam as correções nas direções altas e ignorariam as direções baixas.
  • O Muon decidiu ser um professor "plano". Ele olhou para todas as direções e disse: "Vamos tratar todas exatamente da mesma forma!" Ele achatou o volume de cada correção para que os sussurros baixos recebessem a mesma atenção que os gritos altos.

A Armadilha: Embora isso seja ótimo para ensinar o robô do zero (pré-treinamento), isso joga fora uma informação crucial: a força de cada direção. Às vezes, as direções altas são as que realmente importam, e achatar essas direções é como abaixar o volume de uma sirene só porque você quer ouvir um sussurro.

A Solução: O Professor "Na Medida Certa" (Muonp)

Os autores deste artigo apresentaram o Muonp. Pense no Muonp como um professor que encontra a zona "Goldilocks" (o ponto ideal).

Em vez de achatar o volume completamente (como o Muon) ou manter a intensidade original (como os professores padrão), o Muonp abaixa o volume apenas um pouco. Ele usa um "dimmer" matemático (representado por um número chamado p) para manter parte da força original das direções altas, enquanto ainda dá um reforço às direções baixas.

  • Se p = 0: É o Muon original (achatamento total).
  • Se p = 1: É o professor padrão (sem alteração).
  • Se p estiver em algum lugar entre esses valores (como 1/3): É o Muonp. Ele mantém a "forma" das correções, mas as suaviza.

A Parte Difícil: O Truque Matemático Mágico

Você pode pensar: "Ok, basta abaixar o volume um pouco". Mas, no mundo das matrizes gigantes (o cérebro do robô), fazer essa matemática é incrivelmente difícil. Normalmente, para mudar o volume dessas direções, você tem que desmontar o cérebro, medir cada parte e montá-lo novamente. Isso é lento e caro.

Os autores provaram que você não pode fazer esse "controle de volume" com uma receita simples de um passo. Você precisa de uma receita de dois passos mais complexa que lembre a estrutura original do cérebro enquanto ajusta o volume.

Eles inventaram uma nova receita rápida (usando algo chamado "recurrências polinomiais bivariadas") que atua como um atalho mágico. Ela permite que o computador calcule essas correções "com volume ajustado" usando apenas multiplicação de matrizes padrão — os mesmos chips de computação rápida (GPUs) para os quais já foram construídos. Isso significa que o Muonp é tão rápido quanto o Muon, mas mais inteligente.

O Que Eles Descobriram: Depende do Trabalho

Os autores testaram este novo professor em modelos de escala de bilhões e descobriram uma divisão fascinante de desempenho:

  1. Ao construir um novo cérebro (Pré-treinamento):
    Se você está ensinando um robô do zero, o professor "plano" (Muon) é na verdade melhor. Você quer explorar todas as direções possíveis igualmente para construir uma base sólida. O Muonp, que mantém as antigas direções "altas", foi ligeiramente pior aqui.

  2. Ao refinar um especialista (Fine-tuning):
    Se você pega um robô que já é inteligente e o ensina uma nova habilidade específica (como codificação ou matemática), o Muonp é o vencedor.

    • Por quê? Nesta fase, o robô já conhece o básico. As direções "altas" são as que importam para a nova tarefa. O Muonp mantém o foco nessas direções importantes enquanto ainda ajuda as direções baixas.
    • Resultados: Em tarefas como raciocínio matemático, codificação e compreensão de linguagem, o Muonp tornou o robô mais inteligente, mais rápido e mais preciso do que tanto o antigo Muon quanto os professores padrão.

A Ideia do "Currículo"

Os autores também tentaram um truque inteligente: eles usaram o professor "plano" (Muon) durante a maior parte do treinamento e depois mudaram para o professor de "dimmer" (Muonp) nos últimos passos. Isso funcionou incrivelmente bem. É como ensinar um aluno o básico com um pincel largo e, depois, mudar para uma caneta de ponta fina para os detalhes finais.

Resumo

Muonp é uma versão mais inteligente e flexível do otimizador Muon popular. Ele não força todas as direções de aprendizado a serem iguais; em vez disso, ele ajusta suavemente a importância de cada uma.

  • A Matemática: Ele usa um atalho rápido e inteligente para calcular esses ajustes sem desacelerar o computador.
  • O Resultado: É a melhor ferramenta para o ajuste fino (fine-tuning) de grandes modelos de IA, ajudando-os a dominar habilidades específicas como codificação e matemática melhor do que antes. No entanto, para o treinamento do zero, o Muon "plano" original ainda é o campeão.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →