← Últimos artigos
🤖 AI

Optimizer-Induced Mode Connectivity: From AdamW to Muon

Este artigo demonstra que otimizadores como AdamW e Muon induzem variedades distintas, frequentemente desconectadas, de soluções com perda zero em redes neurais, revelando que a conectividade de modos depende fundamentalmente do otimizador específico e de sua regularização implícita, e não de uma propriedade universal da paisagem de perda.

Autores originais: Fangzhao Zhang, Sungyoon Kim, Erica Zhang, Yiqi Jiang, Mert Pilanci

Publicado 2026-05-12
📖 4 min de leitura☕ Leitura rápida

Autores originais: Fangzhao Zhang, Sungyoon Kim, Erica Zhang, Yiqi Jiang, Mert Pilanci

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando encontrar o ponto mais baixo em uma vasta paisagem montanhosa. Essa paisagem representa a "função de perda" de uma rede neural: quanto mais alto você está, pior seu modelo performa; quanto mais baixo você está, melhor.

Por muito tempo, pesquisadores acreditaram que, se você treinasse dois modelos diferentes para alcançar o fundo desse vale (o estado de "perda zero"), você poderia traçar um caminho simples e suave entre eles sem nunca precisar subir uma colina de volta. Essa ideia é chamada de Conectividade de Modos. É como dizer: "Se dois caminhantes encontraram o fundo do mesmo vale, deve haver uma trilha plana conectando-os."

No entanto, este artigo faz uma nova pergunta: O caminho depende de como os caminhantes andaram?

Os autores introduzem dois diferentes "estilos de caminhada" (otimizadores):

  1. AdamW: O caminhante clássico e confiável.
  2. Muon: Um caminhante mais novo e especializado, que se move de forma diferente.

Eis o que o artigo descobriu, explicado através de analogias simples:

1. A "Impressão Digital Espectral"

Cada modelo possui uma "impressão digital" única feita de números chamados valores singulares (pense neles como o " tônus muscular" ou "forma" interna do modelo).

  • Modelos AdamW tendem a ter alguns músculos muito fortes e muitos fracos (valores atípicos no espectro).
  • Modelos Muon tendem a ter músculos que são todos aproximadamente do mesmo tamanho (um espectro mais equilibrado e "isotrópico").

O artigo descobriu que, se você pegar dois modelos treinados com AdamW, pode caminhar entre eles e seu "tônus muscular" permanece consistente. Se você pegar dois modelos Muon, o mesmo é verdade. Eles permanecem em seus próprios "bairros".

2. A Rodovia do Mesmo Otimizador (Conectividade Intra-Otimizador)

O artigo prova matematicamente que, se a rede neural for suficientemente larga (tiver neurônios suficientes), todas as soluções encontradas pelo AdamW estão conectadas por um caminho suave e de baixa perda. O mesmo é verdade para o Muon.

  • Analogia: Imagine um grande prado plano. Se você e seu amigo usarem as mesmas botas de caminhada (AdamW), podem caminhar do seu ponto até o ponto do seu amigo sem nunca pisar em uma pedra ou subir uma colina. Vocês permanecem na mesma zona de "pegada de bota".

3. A Barreira entre Otimizadores (Desconectividade Inter-Otimizador)

Esta é a parte mais surpreendente. O que acontece se você tentar caminhar de um modelo AdamW para um modelo Muon?

  • A Teoria: Em uma rede pequena e simples, os autores provaram que o "vale AdamW" e o "vale Muon" podem estar separados por uma alta crista montanhosa. Você não pode caminhar de um para o outro sem subir e perder desempenho. Eles estão em diferentes "ilhas" do espaço de soluções.
  • A Realidade (Modelos Grandes): Em seus experimentos em grande escala (usando GPT-2, um modelo de linguagem), eles descobriram que, embora você possa conectá-los, o caminho é especial. À medida que você caminha do AdamW para o Muon, o "tônus muscular" (espectro) do modelo não apenas permanece o mesmo; ele se transforma suavemente.
    • Analogia: Imagine caminhar de uma floresta de pinheiros (AdamW) para uma floresta de carvalhos (Muon). Você não apenas se teletransporta; você atravessa uma zona de transição onde as árvores mudam gradualmente de pinheiro para carvalho. O caminho existe, mas passa por uma paisagem única "híbrida" que nenhum otimizador criaria naturalmente sozinho.

4. O Efeito "Smoothie" (Generalização)

O artigo testou o que acontece se você pegar um modelo a meio caminho entre uma solução AdamW e uma solução Muon.

  • O Resultado: Esses modelos "híbridos" frequentemente performaram melhor em dados que não haviam visto antes (generalização fora da distribuição) do que os modelos originais.
  • Analogia: Se você misturar um café (AdamW) e um chá (Muon), obtém uma nova bebida que pode ter um gosto melhor para algumas pessoas do que apenas o café ou apenas o chá. A "mistura" explora partes da paisagem que os otimizadores individuais perderam.

Resumo das Afirmações

  • Mesmo Otimizador: Se você usar o mesmo otimizador duas vezes, as soluções estão conectadas por um caminho suave que mantém a estrutura interna do modelo consistente.
  • Otimizadores Diferentes: Se você usar otimizadores diferentes, as soluções podem estar separadas por uma barreira em redes pequenas, ou conectadas por um caminho que transita suavemente a estrutura interna do modelo em redes grandes.
  • O Benefício: Caminhar entre essas soluções de otimizadores diferentes cria modelos "híbridos" que podem generalizar melhor para dados novos e não vistos.

O artigo não afirma que isso funciona para diagnóstico médico, direção autônoma ou aplicações futuras específicas de IA. Foca estritamente na geometria matemática de como esses modelos se conectam e na observação empírica de que misturá-los melhora a generalização no treinamento de modelos de linguagem.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →