← Ultimi articoli
🤖 machine learning

Training nGPT

Questo articolo presenta una ricetta di addestramento pratica per il Transformer normalizzato (nGPT) che incorpora tecniche come il Logit Gradient Preconditioning e il GatedAdamW, consentendo a modelli MoE ibridi Mamba-Transformer da 14 miliardi di parametri di raggiungere la stessa perdita di validazione dei loro omologhi non normalizzati utilizzando circa la metà dei token di addestramento.

Autori originali: Ilya Loshchilov, Boris Ginsburg

Pubblicato 2026-08-04
📖 7 min di lettura🧠 Approfondimento

Autori originali: Ilya Loshchilov, Boris Ginsburg

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immaginate il mondo dell'intelligenza artificiale come una biblioteca gigantesca e frenetica dove i computer stanno cercando di imparare a scrivere storie, risolvere problemi di matematica e chiacchierare come gli esseri umani. Per farlo, utilizzano strutture matematiche speciali chiamate "reti neurali", che sono come enormi web interconnessi di neuroni. All'interno di queste reti, l'informazione viaggia sotto forma di numeri, e la rete impara regolando la forza delle connessioni tra questi neuroni. Per molto tempo, gli scienziati hanno notato che questi numeri possono diventare disordinati: a volte crescono troppo, altre volte si rimpiccioliscono fino a sparire, e l'intero sistema può confondersi su quale direzione prendere per diventare più intelligente. È un po' come cercare di salire su una montagna ripida e nebbiosa portando uno zaino che continua a cambiare peso; potresti fare un passo avanti, solo per scivolare subito indietro. L'obiettivo di questa ricerca è trovare un modo migliore per trasportare quello zaino, affinché il computer possa scalare la montagna dell'apprendimento molto più velocemente ed efficientemente.

Il documento che state per leggere proviene dal team di NVIDIA, guidato da Ilya Loshchilov e Boris Ginsburg. Stanno affrontando un problema specifico: come far apprendere meglio questi modelli di IA costringendo tutti i loro numeri interni a rimanere su una sfera perfetta e invisibile. Pensateci come a una regola che dice: "Non importa quanto cammini, devi sempre stare esattamente a un miglio di distanza dal centro della città". Questa regola, chiamata "normalizzazione", impedisce ai numeri di diventare troppo grandi o troppo piccoli, aiutando il computer a mantenere la concentenza. Gli autori si sono basati su un'idea precedente chiamata "nGPT" (GPT normalizzato) e l'hanno testata su un tipo di IA molto moderno e potente che mescola due diverse tecnologie: "Mamba-2" (che è bravissima a ricordare lunghe sequenze) e i "Transformer" (che sono eccellenti nel comprendere il contesto). Volevano vedere se le loro nuove regole di addestramento potessero far apprendere questi modelli ibridi più velocemente rispetto al metodo standard.

La Grande Idea: Una Nuova Ricetta di Addestramento

Gli autori non hanno solo apportato una piccola modifica; hanno cucinato un'intera nuova "ricetta di addestramento" per questi modelli di IA. Immaginate di insegnare a un robot come camminare. Il vecchio modo (usando un metodo standard chiamato AdamW) è come lasciare che il robot inciampi, facendo a volte passi giganti e goffi e altre volte piccoli e titubanti, sperando che alla fine trovi il sentiero. La nuova ricetta, che chiamano ricetta di addestramento nGPT, è come mettere il robot su un tapis roulant con un insieme molto specifico di regole per mantenere i suoi passi perfetti.

Ecco come l'hanno fatto, suddiviso in concetti semplici e quotidiani:

1. Il "Logit Gradient Preconditioning" (La Manopola del Volume)
Quando l'IA cerca di indovinare la parola successiva in una frase, produce una lista di punteggi chiamati "logits". Nel vecchio sistema, il volume di questi punteggi poteva diventare stranamente alto o basso durante l'addestramento, confondendo il robot su quanto spingere con forza. Gli autori hanno aggiunto una speciale "manopola del volume" (un vettore di scala apprendibile) che potevano regolare. Ma ecco la parte intelligente: si sono resi conto che se avessero semplicemente girato la manopola, avrebbero rovinato la memoria del robot su come camminare. Così, hanno inventato un trucco chiamato Logit Gradient Preconditioning. È come avere una manopola del volume che cambia il suono che senti, ma quando il robot cerca di imparare da un errore, il sistema riporta automaticamente il volume alla normalità in modo che il robot non si confonda. Questo mantiene il processo di apprendimento costante, anche se l'"intensità" delle previsioni cambia.

2. Il "Logarithmic Learning Rate Decay" (Il Pilota di Formula 1)
Di solito, quando si addestra un'IA, si parte con una velocità di apprendimento veloce e la si rallenta lentamente, come un pilota di auto da corsa che toglie il piede dall'acceleratore. Gli autori hanno scoperto che il modo standard di rallentare (come una curva fluida) non era il migliore per il loro nuovo sistema a "sfera". Invece, hanno utilizzato un "Logarithmic Learning Rate Decay". Immaginate un'auto da corsa che parte a tutta velocità, rallenta molto rapidamente all'inizio per prendere le distanze e poi procede con una lunga, costante coda per il resto della gara. Questo programma "caricato in avanti" permette al modello di apprendere le basi rapidamente e poi di perfezionare le sue abilità durante un lungo periodo, il che si è rivelato molto più efficiente.

3. "GatedAdamW" (Il Guardiano Intelligente)
Il modo standard di aggiornare il cervello del robot è chiamato AdamW. Gli autori lo hanno aggiornato in GatedAdamW. Pensate al metodo standard come a un guardiano che lascia passare ogni aggiornamento, anche se l'aggiornamento è minuscolo e quasi impercettibile. A volte, questi piccoli aggiornamenti sono solo rumore. Il nuovo GatedAdamW ha un "cancello intelligente" che osserva ogni aggiornamento. Se un aggiornamento è troppo piccolo (come un sussurro), il guardiano dice gentilmente: "Non oggi", e lo blocca. Se l'aggedale è un grido (un cambiamento significativo), il cancello si spalanca completamente. Questo evita al robot di sprecare energia in piccoli e inutili aggiustamenti e lo aiuta a concentrarsi sui cambiamenti grandi e importanti.

4. L' "Angular Step Cap" (Il Guinzaglio di Sicurezza)
Po dato che il robot sta camminando su una sfera, fare un passo troppo grande potrebbe farlo perdere il controllo o farlo saltare sul lato sbagliato del mondo. Gli autori hanno aggiunto un "Angular Step Cap", che è come un guinzaglio di sicurezza. Se il robot prova a fare un passo troppo grande, il guinzaglio lo tira delicatamente indietro verso un angolo più piccolo e sicuro. Questo assicura che il robot non faccia mai un salto selvaggio e pericoloso, mantenendo il suo viaggio fluido e stabile.

I Risultati: Imparare in Modo Più Efficiente

Il team ha testato questa nuova ricetta su una serie di modelli di IA, che vanno da 1 a 14 miliardi di parametri (la "dimensione del cervello" del robot). Hanno confrontato i loro nuovi modelli nGPT con i modelli GPT standard addestrati con i vecchi metodi.

I risultati sono stati impressionanti. I nuovi modelli nGPT hanno costantemente ottenuto tassi di errore inferiori (misurati come "validation loss") rispetto ai modelli standard. Nello specifico, il modello nGPT da 14 miliardi di parametri ha raggiunto lo stesso livello di abilità del modello standard da 14 miliardi, ma ha richiesto circa la metà dei token di addestramento (la quantità di testo che il modello legge) per arrivarci. In altre parole, per raggiungere la stessa destinazione, il modello nGPT ha avuto bisogno di leggere circa la metà del testo rispetto al modello standard.

Il documento suggerisce che questo miglioramento derivi dalla combinazione di tutte queste nuove regole che lavorano insieme, non solo da un singolo trucco. Hanno anche testato un'impostazione specifica per il loro "cancello intelligente" (chiamata parametro di nitidezza aa) e hanno scoperto che un cancello più morbido (a=0.5a=0.5) funzionava leggermente meglio di uno più rigido, ma la vittoria più grande è arrivata dall'intero nuovo sistema di addestramento, non solo dal cancello stesso.

Cosa Significa Questo

Gli autori sottolineano con cautela di non aver provato ogni possibile variazione di queste regole (non hanno fatto uno "studio di ablazione completo"), quindi potrebbero esserci persino impostazioni migliori che non hanno ancora trovato. Tuttavia, i risultati che hanno trovato sono solidi: costringendo l'IA a camminare su una sfera perfetta e usando un modo più intelligente e controllato per fare i passi, possiamo insegnare a questi enormi modelli a essere più intelligenti usando significativamente meno dati e tempo. È una ricetta pratica che suggerisce che possiamo costruire un'IA migliore senza doverli nutrire con l'intero internet, ma solo con una porzione di esso molto più efficiente.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →