← Ultimi articoli
🤖 machine learning

Pretraining large language models with MXFP4

Questo lavoro identifica che la quantizzazione dei gradienti dei pesi (Wgrad) è la causa principale dell'instabilità nell'addestramento FP4 a pipeline completa di grandi modelli linguistici e dimostra che le rotazioni di Hadamard deterministiche, piuttosto che l'arrotondamento stocastico, sono essenziali per ripristinare la stabilità della convergenza.

Autori originali: Musa Cim, Poovaiah Palangappa, Miro Hodak, Ravi Dwivedula, Meena Arunachalam, Mahmut Taylan Kandemir

Pubblicato 2026-05-12
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Musa Cim, Poovaiah Palangappa, Miro Hodak, Ravi Dwivedula, Meena Arunachalam, Mahmut Taylan Kandemir

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di dover insegnare a uno studente gigante e brillante (un Large Language Model) a scrivere storie. Di solito, per mantenere questo studente efficace nell'apprendimento, gli si forniscono appunti scritti con inchiostro di alta qualità e dettagliato (chiamato precisione FP8). Questo funziona bene, ma gli appunti sono pesanti, occupano molto spazio nello zaino dello studente e rallentano la velocità con cui può leggerli.

I ricercatori hanno voluto vedere se potevano passare a appunti ultra-leggeri scritti con soli 4 bit di informazione (MXFP4). Questi appunti sono piccoli e veloci, promettendo di far apprendere allo studente molto più rapidamente. Tuttavia, c'è un problema: quando hanno provato a usare questi appunti minuscoli per l'intero processo di apprendimento, lo studente spesso si confondeva, iniziava a fare ipotesi selvagge e falliva nell'apprendere qualcosa (l'addestramento "divergeva").

Il documento si chiede: Perché succede questo e come possiamo risolverlo?

L'Esperimento: Un Test in Tre Fasi

I ricercatori hanno impostato un esperimento controllato per capire esattamente dove risiede il problema. Hanno suddiviso il processo di apprendimento in tre fasi e hanno sostituito gradualmente gli appunti pesanti con quelli leggeri, una fase alla volta:

  1. Forward Pass (Fprop): Lo studente legge la domanda.
  2. Activation Gradients (Dgrad): Lo studente capisce quanto ha frainteso la domanda.
  3. Weight Gradients (Wgrad): Lo studente aggiorna il suo cervello (i "pesi") per ricordare la lezione la prossima volta.

Le Scoperte:

  • Fase 1 e 2: Quando hanno usato appunti leggeri solo per la lettura e per capire i fraintendimenti, allo studente è andata bene. Ha imparato quasi quanto con gli appunti pesanti, avendo bisogno solo di qualche domanda di pratica in più.
  • Fase 3 (Il Problema): Nel momento in cui sono passati agli appunti leggeri per aggiornare il cervello (Wgrad), lo studente ha iniziato a perdere il controllo. I ricercatori hanno scoperto che questo passaggio specifico è il "collegamento debole". È come cercare di scrivere una correzione matematica complessa su un foglio di carta minuscolo e accartocciato; i dettagli si perdono e lo studente impara la lezione sbagliata.

Le Soluzioni Fallite: Aggiungere Casualità

Quando lo studente ha iniziato a fallire, i ricercatori hanno provato un trucco comune: Stocasticità (aggiungere casualità).

  • L'Analogia: Immagina che lo studente sia confuso, quindi gli dici: "Indovina a caso!" oppure "Gira una ruota per decidere la tua risposta".
  • Il Risultato: Questo non ha funzionato. Anzi, aggiungere casualità agli appunti minuscoli ha peggiorato gli errori. Il "rumore" delle ipotesi casuali ha amplificato i piccoli errori già presenti negli appunti leggeri, causando il completo crollo dell'addestramento.

La Soluzione Vincente: Il Mescolamento Deterministico

I ricercatori hanno poi provato un approccio diverso: Rotazioni Deterministiche di Hadamard.

  • L'Analogia: Invece di indovinare a caso, immagina che lo studente abbia un righello speciale e rigido che riorganizza perfettamente gli appunti minuscoli prima che vengano scritti. Questo righello non aggiunge casualità; organizza semplicemente le informazioni in modo specifico e prevedibile, in modo che gli appunti minuscoli non vengano accartocciati o persi.
  • Il Risultato: Questo ha funzionato perfettamente. Utilizzando questo metodo specifico e prevedibile di "riorganizzazione", lo studente ha potuto usare gli appunti minuscoli e veloci per l'intero processo (lettura, analisi e aggiornamento) senza confondersi.

Il Punto Fondamentale

Il documento conclude con due punti chiave:

  1. Il Collo di Bottiglia: Il motivo principale per cui l'addestramento a 4 bit fallisce non è che gli appunti sono generalmente troppo piccoli; è specificamente perché il passaggio di aggiornamento del cervello (Wgrad) è troppo sensibile ai piccoli errori presenti in quegli appunti.
  2. La Soluzione: Per far funzionare l'addestramento a 4 bit, non serve aggiungere più casualità. Serve struttura. Utilizzando un mescolamento matematico specifico e prevedibile (rotazione di Hadamard), è possibile stabilizzare il processo.

Il Guadagno:
Quando hanno risolto il problema con questo "righello di riorganizzazione", il sistema è diventato 20% più veloce in ogni fase dell'apprendimento. Poiché lo studente ha imparato in modo stabile senza bisogno di domande di pratica aggiuntive, l'intero processo è stato completato circa 10% più velocemente dall'inizio alla fine rispetto al vecchio metodo con inchiostro pesante.

In sintesi: puoi usare gli appunti minuscoli e super-veloci, ma solo se li organizzi perfettamente prima di scriverli. Se aggiungi semplicemente un po' di casualità, tutto si rompe.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →