← Últimos artigos
🤖 machine learning

When to use what Schatten-pp norm in deep learning?

Este artigo resolve observações conflitantes sobre otimizadores de norma Schatten-pp ao demonstrar que, embora métodos Schatten-\infty como o Muon se destaquem em configurações de alta dimensão, geometrias Schatten-pp menores são, na verdade, ótimas em regimes de baixa dimensão, como o escalonamento Chinchilla, um achado sustentado por novos resultados de aceleração robustos ao ruído para p>2p>2 que também explicam a ausência de requisito de warmup do Muon e sua preferência por lotes grandes.

Autores originais: Thomas Pethick

Publicado 2026-06-16
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Thomas Pethick

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Grande Questão: Qual "Régua" Devemos Usar?

Imagine que você está tentando encontrar o ponto mais baixo em um vasto vale nebuloso (este é o modelo de IA tentando aprender). Para fazer isso, você precisa de uma "régua" para medir o quão íngreme é o terreno e decidir em qual direção dar o próximo passo.

No mundo do aprendizado profundo (deep learning), existem diferentes tipos de réguas, chamadas normas Schatten-p.

  • Schatten-2 (Euclidiana): Esta é a régua padrão, de linha reta, que costumamos usar (como o otimizador chamado Adam).
  • Schatten-∞ (A régua "Muon"): Esta é uma régua especial e rígida que só se importa com o único penhasco mais íngreme do cenário. Recentemente, um método chamado Muon (usando esta régua) tornou-se muito popular porque parecia funcionar incrivelmente rápido em alguns testes.
  • Schatten-p (As réguas "Goldilocks"): Estas são réguas intermediárias, que medem a inclinação de uma forma que não é nem muito suave, nem muito rígida.

A Confusão:
As pessoas estavam discutindo sobre qual régua é a melhor.

  • Alguns diziam: "Muon (Schatten-∞) é incrível! É o mais rápido!"
  • Outros diziam: "Não, Muon é superestimado. Métodos padrão funcionam melhor quando treinamos com enormes quantidades de dados."

A Resposta do Artigo:
O autor, Thomas Pethick, diz: "Vocês estão ambos certos, mas estão olhando para tamanhos diferentes de vale."

A melhor régua depende inteiramente do tamanho do problema em relação à quantidade de dados que você tem.


Os Dois Regimes: Pequenas Piscinas vs. Grandes Oceanos

O artigo divide o mundo em dois cenários principais:

1. O Regime "Baixa-Dimensionalidade" (A Pequena Piscina)

  • O que é: Isso acontece quando você tem um modelo relativamente pequeno ou uma execução de treinamento curta (como os "speedruns" em jogos pequenos mencionados no artigo). O número de passos que você dá (dados) é muito maior do que a complexidade do modelo.
  • A Analogia: Imagine que você está caminhando por um pequeno jardim bem iluminado. Você consegue ver todo o caminho.
  • A Melhor Régua: Neste cenário, a régua Schatten-∞ (Muon) não é, na verdade, a melhor. Surpreendentemente, uma régua p menor (mais próxima da régua euclidiana padrão) é mais rápida.
  • Por quê? Porque em um jardim pequeno, você não precisa estar hiperfocado no único penhasco mais íngreme. Você precisa de uma abordagem mais suave e equilibrada para acelerar rapidamente. O artigo prova que usar uma régua "mais suave" aqui proporciona um aumento de velocidade.

2. O Regime "Alta-Dimensionalidade" (O Grande Oceano)

  • O que é: Estas são as execuções de treinamento massivas usadas para grandes modelos de IA (como LLMs), onde o modelo é incrivelmente complexo e os dados são vastos.
  • A Analogia: Imagine que você está navegando em um oceano enorme e escuro com milhares de ilhas. Você não consegue ver o mapa inteiro.
  • A Melhor Régua: Aqui, a régua Schatten-∞ (Muon) brilha. Ela é projetada para lidar com a "rugosidade" específica desses cenários massivos e complexos.
  • A Armadilha: Para fazer o Muon funcionar neste grande oceano, você precisa de um tamanho de lote (batch size) enorme (olhando para uma fatia muito larga do oceano de uma só vez). Se você tentar usar o Muon com um tamanho de lote pequeno neste regime, ele falhará.

O Segredo do "Tamanho de Lote" (Batch Size)

Uma das principais descobertas do artigo é sobre o Tamanho de Lote (quantos exemplos a IA observa antes de dar um passo).

  • A Regra: O artigo deriva uma regra matemática mostrando que, conforme você muda sua régua (de p=2p=2 para p=p=\infty), o tamanho de lote ideal também deve mudar.
  • A Metáfora: Pense na régua como um barco.
    • Um barco pequeno (Régua Padrão) pode navegar com uma tripulação pequena (tamanho de lote pequeno).
    • Um navio de cruzeiro massivo (Muon/Schatten-∞) precisa de uma tripulação enorme (tamanho de lote massivo) para manter a estabilidade e se mover rápido. Se você tentar navegar um navio de cruzeiro com apenas duas pessoas, ele apenas girará em círculos.
  • O Insight: Isso explica por que o Muon funciona bem para "speedruns" (onde as pessoas usam lotes massivos em modelos pequenos), mas tem dificuldades em alguns benchmarks de larga escala (onde o tamanho do lote pode não ter sido escalado o suficiente para a geometria específica).

Por que Precisamos de "Warmups"?

Você já deve ter ouvido falar que alguns treinadores de IA precisam de um "warmup" (começar devagar e depois acelerar).

  • A Descoberta do Artigo: A régua Schatten-∞ (Muon) é tão robusta que não precisa de um warmup. Ela pode começar na velocidade máxima imediatamente.
  • O Contraste: Se você usar uma régua pp menor no regime de baixa dimensionalidade, você realmente se beneficia de uma fase de warmup para iniciar a aceleração.

A Conexão com o "Chinchilla"

O artigo conecta isso a uma regra famosa em IA chamada escalonamento Chinchilla, que diz: "À medida que você obtém mais dados, você deve tornar seu modelo maior."

  • A Reviravolta: O artigo argumenta que, mesmo com o escalonamento Chinchilla, muitas vezes ainda estamos no "Regime de Baixa Dimensionalidade" (o pequeno jardim).
  • O Resultado: Como muitas vezes estamos nesse regime de "pequeno jardim", usar o Muon padrão (Schatten-∞) pode ser, na verdade, menos eficiente do que usar um otimizador de norma pp finita (como HTMuon ou Soft-Muon). Isso explica por que novos métodos que usam réguas "mais suaves" estão começando a vencer o Muon em alguns testes de larga escala.

Resumo: Como Escolher Sua Régua

O artigo conclui com um guia simples:

  1. Se você estiver em um regime de "Baixa Dimensionalidade" (modelos pequenos, ou quando a quantidade de dados é enorme em relação ao tamanho do modelo):

    • Não use automaticamente o extremo Schatten-∞ (Muon).
    • Considere usar uma norma Schatten-pp finita (uma régua "mais suave"). Ela acelera mais rápido e lida melhor com o ruído.
    • Nota: Você pode até querer trocar de régua enquanto treina! Comece com uma régua "dura" e mude para uma "mais suave" mais tarde.
  2. Se você estiver em um regime de "Alta Dimensionalidade" (complexidade massiva):

    • O Schatten-∞ (Muon) é provavelmente a escolha certa, MAS você deve usar um tamanho de lote muito grande para fazê-lo funcionar.

A Conclusão Final: Não existe um otimizador único que seja o "melhor". A melhor ferramenta depende do tamanho do problema e de quanta data você tem. A confusão na comunidade existiu porque as pessoas estavam testando as ferramentas em diferentes "regimes" sem perceber.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →