← Últimos artigos
💻 computer science

Same Architecture, Different Capacity: Optimizer-Induced Spectral Scaling Laws

Este artigo demonstra que a escolha do otimizador altera fundamentalmente as leis de escala espectral dos modelos Transformer, revelando que otimizadores como o Muon podem alcançar uma utilização significativamente melhor da capacidade espectral em regimes de difícil aprendizado em comparação com o AdamW, estabelecendo assim a otimização como um eixo crítico e independente de escalonamento de representações que rivaliza com o design arquitetônico.

Autores originais: Nandan Kumar Jha, Brandon Reagen

Publicado 2026-05-22
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Nandan Kumar Jha, Brandon Reagen

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está construindo uma biblioteca massiva (um Modelo de Linguagem de Grande Escala) para armazenar e recuperar o conhecimento humano. Você tem um projeto para as prateleiras da biblioteca (a Arquitetura) e tem um bibliotecário que organiza os livros (o Otimizador).

Durante anos, os pesquisadores acreditaram que, se você simplesmente tornasse a biblioteca maior (adicionando mais prateleiras/parâmetros) e alimentasse com mais livros (dados), o trabalho do bibliotecário melhoraria automaticamente de forma previsível. Eles assumiram que o tipo de bibliotecário não importava muito, desde que estivesse fazendo o trabalho.

Este artigo argumenta que quem é o bibliotecário importa tanto quanto o tamanho da biblioteca. Na verdade, o bibliotecário determina como as novas prateleiras são realmente usadas.

Aqui está a análise das descobertas do artigo usando analogias simples:

1. Os Dois Tipos de "Capacidade da Biblioteca"

Os pesquisadores analisaram como o modelo usa seu "espaço cerebral" interno (especificamente as Redes Feed-Forward, ou FFNs). Eles mediram isso de duas maneiras:

  • Rank Suave (A "Dispersão"): Imagine uma biblioteca onde os livros estão espalhados uniformemente por cada prateleira. O espaço é usado amplamente, mas talvez não profundamente. Esta é uma capacidade "difusa".
  • Rank Rígido (O "Foco"): Imagine uma biblioteca onde os livros mais importantes, raros e complexos estão empacotados firmemente em prateleiras específicas e de alta qualidade, enquanto outras prateleiras estão vazias. Esta é uma capacidade "dominante". Trata-se de ter algumas maneiras muito fortes de representar ideias complexas.

2. O Problema do "Bibliotecário Padrão" (AdamW)

O bibliotecário mais comum, AdamW, é bom em espalhar os livros. Quando você lhe dá uma biblioteca maior (mais largura), ele preenche as prateleiras amplamente (o Rank Suave aumenta).

No entanto, quando se trata dos livros raros e difíceis (os tokens "Cauda" — como fatos obscuros ou conceitos complexos), o AdamW luta para organizá-los em prateleiras fortes e focadas.

  • O Resultado: Mesmo que você dobre o tamanho da biblioteca, o AdamW não dobra sua capacidade de lidar com as coisas difíceis. Ele apenas espalha a confusão por mais espaço. O artigo chama isso de "escalabilidade fraca de rank rígido".

3. O "Super Bibliotecário" (Muon)

Os pesquisadores testaram um bibliotecário diferente chamado Muon.

  • O Resultado: Quando o Muon recebe uma biblioteca maior, ele não apenas espalha as coisas. Ele ativamente constrói prateleiras fortes e focadas para os livros raros e difíceis.
  • A Magia: O Muon transforma espaço adicionado em poder utilizável muito mais rápido. Se a capacidade do AdamW de lidar com conceitos difíceis cresce lentamente (como uma caminhada lenta), a capacidade do Muon cresce em linha reta (como um sprint). Nos termos do artigo, o Muon alcança escalabilidade linear onde o AdamW fica preso em um padrão de crescimento "fraco".

4. A "Armadilha da Perplexidade" (Por que não notamos isso antes)

Você pode perguntar: "Se o Muon é tão melhor na organização, por que não notamos antes? Não é apenas que ele obtém pontuações de erro menores?"

O artigo revela uma armadilha: Você pode ter a mesma pontuação final com estruturas internas totalmente diferentes.

  • Se você treinar o "Bibliotecário Padrão" (AdamW) por um tempo muito longo, ele eventualmente pode igualar a pontuação final do teste (perplexidade) do "Super Bibliotecário" (Muon).
  • No entanto: Dentro do cérebro, eles são completamente diferentes. O Bibliotecário Padrão tem uma estrutura bagunçada e difusa. O Super Bibliotecário tem uma estrutura nítida e organizada.
  • A Conclusão: Apenas porque dois modelos obtêm a mesma pontuação no teste não significa que eles "pensam" da mesma maneira. O Super Bibliotecário está, na verdade, construindo um mapa interno melhor do mundo, mesmo que a nota final pareça semelhante.

5. O Problema do "Livro Raro"

A linguagem é como uma distribuição da Lei de Zipf: algumas palavras são usadas constantemente (como "o" ou "é"), mas a maioria das palavras é rara.

  • AdamW está ok com as palavras comuns, mas se perde com as raras.
  • Muon brilha especificamente com o conhecimento raro e de cauda longa. Ele escala sua capacidade de lidar com esses tokens raros quase perfeitamente à medida que o modelo fica maior.

6. O Bibliotecário vs. O Projeto (Arquitetura)

Os pesquisadores perguntaram: "O bibliotecário é mais importante do que o projeto da biblioteca?"
Eles testaram mudar o projeto da biblioteca (como mudar o número de cabeças de atenção ou remover sinais posicionais).

  • A Descoberta: Mudar o Bibliotecário (o otimizador) teve um impacto maior na forma como o modelo aprendeu do que mudar o Projeto (a arquitetura).
  • Na verdade, um "Super Bibliotecário" poderia fazer um projeto de biblioteca padrão funcionar melhor do que um "Bibliotecário Padrão" poderia fazer um novo projeto sofisticado funcionar. O bibliotecário e o projeto são uma equipe; você não pode apenas escolher um projeto e assumir que qualquer bibliotecário servirá.

Resumo

O artigo conclui que a Otimização é um cidadão de primeira classe no design de IA.

  • Visão Antiga: "Faça o modelo maior, e ele ficará mais inteligente."
  • Nova Visão: "Faça o modelo maior, mas escolha o otimizador certo para garantir que esse tamanho extra se transforme realmente em inteligência útil e focada, especialmente para as coisas difíceis e raras."

Se você quer um modelo que realmente entenda a "cauda longa" do conhecimento humano, você não pode depender apenas das ferramentas padrão. Você precisa de um otimizador que saiba como construir prateleiras fortes e focadas para os livros difíceis, não apenas para preencher espaço vazio.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →