← Ultimi articoli
🤖 machine learning

When to use what Schatten-pp norm in deep learning?

Questo articolo risolve le osservazioni contrastanti sugli ottimizzatori della norma di Schatten-pp dimostrando che, mentre i metodi Schatten-\infty come Muon eccellono in contesti ad alta dimensionalità, geometrie Schatten-pp più piccole sono in realtà ottimali in regimi a bassa dimensionalità come lo scaling Chinchilla, una scoperta supportata da nuovi risultati di accelerazione robusta al rumore per p>2p>2 che spiegano anche l'assenza di requisito di warmup di Muon e la sua preferenza per batch grandi.

Autori originali: Thomas Pethick

Pubblicato 2026-06-16
📖 6 min di lettura🧠 Approfondimento

Autori originali: Thomas Pethick

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

La Grande Domanda: Quale "Righello" Dovremmo Usare?

Immagina di cercare il punto più basso in una vasta valle nebbiosa (questo è il modello AI che cerca di apprendere). Per farlo, hai bisogno di un "righello" per misurare quanto sia ripido il terreno e decidere in quale direzione fare un passo.

Nel mondo del deep learning, esistono diversi tipi di righelli, chiamati norme Schatten-p.

  • Schatten-2 (Euclidea): Questo è il righello standard, quello che misura la linea retta che usiamo di solito (come l'ottimizzatore chiamato Adam).
  • Schatten-∞ (Il righello "Muon"): Questo è un righello speciale e rigido che si preoccupa solo della singola scogliera più ripida nel paesaggio. Recentemente, un metodo chiamato Muon (che usa questo righello) è diventato molto popolare perché sembrava funzionare incredibilmente velocemente in alcuni test.
  • Schatten-p (I righelli "Goldilocks"): Questi sono righelli intermedi, che misurano la pendenza in un modo che non è né troppo morbido né troppo rigido.

La Confusione:
Le persone discutevano su quale righello fosse il migliore.

  • Alcuni dicevano: "Muon (Schatten-∞) è fantastico! È il più veloce!"
  • Altri dicevano: "No, Muon è sopravvalutato. I metodi standard funzionano meglio quando addestriamo su enormi quantità di dati."

La Risposta del Paper:
L'autore, Thomas Pethick, dice: "Avete ragione entrambi, ma state guardando dimensioni diverse della valle."

Il righello migliore dipende interamente dalla dimensione del problema rispetto alla quantità di dati che hai.


I Due Regimi: Piccole Pozze vs Grandi Oceani

Il paper divide il mondo in due scenari principali:

1. Il Regime "Low-Dimensional" (La Piccola Pozza)

  • Cos'è: Succede quando hai un modello relativamente piccolo o un ciclo di addestramento breve (come gli "speedrun" sui piccoli giochi menzionati nel paper). Il numero di passi che fai (dati) è molto più grande della complessità del modello.
  • L'Analogia: Immagina di camminare in un piccolo giardino ben illuminato. Puoi vedere l'intero sentiero.
  • Il Righello Migliore: In questo scenario, il righello Schatten-∞ (Muon) in realtà non è il migliore. Sorprendentemente, un righello con un p minore (più vicino al righello euclideo standard) è più veloce.
  • Perché? Perché in un piccolo giardino, non hai bisogno di essere iper-focalizzato sulla singola scogliera più ripida. Hai bisogno di un approccio più fluido e bilanciato per accelerare rapidamente. Il paper dimostra che usare un righello più "morbido" qui ti regala una spinta di velocità.

2. Il Regime "High-Dimensional" (Il Grande Oceano)

  • Cos'è: Questo è l'addestramento massiccio utilizzato per i grandi modelli AI (come gli LLM), dove il modello è incredibilmente complesso e i dati sono vastissimi.
  • L'Analogia: Immagina di navigare in un enorme oceano buio con migliaia di isole. Non puoi vedere l'intera mappa.
  • Il Righello Migliore: Qui, il righello Schatten-∞ (Muon) brilla. È progettato per gestire la specifica "ruvidità" di questi paesaggi massicci e complessi.
  • Il Problema: Per far funzionare Muon in questo grande oceano, hai bisogno di un batch size enorme (guardando una fetta molto ampia dell'oceano contemporaneamente). Se provi a usare Muon con un batch size piccolo in questo regime, fallisce.

Il Segreto del "Batch Size"

Una delle scoperte chiave del paper riguarda il Batch Size (quanti esempi l'AI guarda prima di compiere un passo).

  • La Regola: Il paper deriva una regola matematica che mostra come, al variare del righello (da p=2p=2 a p=p=\infty), debba cambiare anche il batch size ideale.
  • La Metafora: Pensa al righello come a una barca.
    • Una piccola barca (Righello Standard) può navigare con un equipaggio piccolo (batch size ridotto).
    • Una massiccia nave da crociera (Muon/Schatten-∞) ha bisogno di un equipaggio enorme (batch size massiccio) per rimanere stabile e muoverso velocemente. Se provi a far navigare una nave da crociera con solo due persone, girerà in tondo.
  • L'Intuizione: Questo spiega perché Muon funziona bene per gli "speedrun" (dove le persone usano batch massicci su modelli piccoli) ma fatica in alcuni benchmark su larga scala (dove il batch size potrebbe non essere stato scalato abbastanza per la specifica geometria).

Perché Abbiamo Bisogno di "Warmup"?

Forse avrai sentito che alcuni addestratori di AI hanno bisogno di un "warmup" (iniziare lentamente e poi accelerare).

  • La Scoperta del Paper: Il righello Schatten-∞ (Muon) è così robusto che non ha bisogno di un warmup. Può iniziare alla massima velocità immediatamente.
  • Il Contrasto: Se usi un righello con un pp più piccolo nel regime low-dimensional, hai effettivamente beneficio di una fase di warmup per avviare l'accelerazione.

La Connessione con "Chinchilla"

Il paper collega questo a una famosa regola nell'AI chiamata scaling di Chinchilla, che dice: "Man mano che ottieni più dati, dovresti rendere il tuo modello più grande".

  • Il Colpo di Scena: Il paper sostiene che, anche con lo scaling di Chinchilla, siamo spesso ancora nel "Regime Low-Dimensional" (il piccolo giardino).
  • Il Risultato: Poiché siamo spesso in questo regime del "piccolo giardino", usare il Muon standard (Schatten-∞) potrebbe in realtà essere meno efficiente rispetto all'uso di un ottimizzatore con norma pp finita (come HTMuon o Soft-Muon). Questo spiega perché nuovi metodi che usano righelli più "morbidi" stanno iniziando a battere Muon in alcuni test su larga scala.

Riassunto: Come Scegliere il Tuo Righello

Il paper conclude con una guida semplice:

  1. Se ti trovi in un regime "Low-Dimensional" (modelli piccoli, o quando la quantità di dati è enorme rispetto alla dimensione del modello):

    • Non usare automaticamente lo estremo Schatten-∞ (Muon).
    • Considera l'uso di una norma Schatten-pp finita (un righello più "morbido"). Accelera più velocemente e gestisce meglio il rumore.
    • Nota: Potresti persino voler cambiare righello durante l'addestramento! Inizia con un righello "duro" e passa a uno più "morbido" in seguito.
  2. Se ti trovi in un regime "High-Dimensional" (complessità massiccia):

    • Lo Schatten-∞ (Muon) è probabilmente la scelta giusta, MA devi usare un batch size molto grande per farlo funzionare.

Il Punto Fondamentale: Non esiste un unico ottimizzatore "migliore". Il miglior strumento dipende dalle dimensioni del problema e dalla quantità di dati che hai. La confusione nella comunità esisteva perché le persone stavano testando gli strumenti in regimi diversi senza rendersene conto.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →