← Ultimi articoli
🤖 machine learning

Gefen: Optimized Stochastic Optimizer

Il documento presenta Gefen, un ottimizzatore efficiente in termini di memoria che riduce l'impronta di memoria di AdamW di circa 8 volte attraverso la condivisione automatica del secondo momento e la quantizzazione appresa del primo momento, consentendo batch size più grandi e una migliore velocità di elaborazione pur mantenendo prestazioni equivalenti.

Autori originali: Nadav Benedek, Tomer Koren, Ohad Fried

Pubblicato 2026-06-15
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Nadav Benedek, Tomer Koren, Ohad Fried

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di stare addestrando un robot gigante (un modello di deep learning) per imparare una nuova abilità. Per farlo, il robot ha bisogno di un "coach" (un ottimizzatore) che gli dica come regolare le sue impostazioni interne dopo ogni sessione di pratica. Il coach più popolare al momento è chiamato AdamW.

AdamW è un ottimo coach, ma ha uno zaino pesante. Per ogni singola impostazione del robot, AdamW porta con sé due taccuini extra (chiamati "stati del primo e secondo momento") per ricordare gli errori passati e quanto velocemente le cose stiano cambiando. Se il tuo robot ha 1 miliardo di impostazioni, lo zaino di AdamW aggiunge un peso pari ad altre 2 miliardi di impostazioni. Questo rende lo zaino così pesante che non riesci a far stare un robot grande su un computer di addestramento standard, oppure devi far praticare il robot in passi minuscoli e lenti.

Il paper presenta un nuovo coach chiamato Gefen. Gefen è un ottimizzatore "efficiente nella memoria" che rimpicciolisce quello zaino pesante di 8 volte, mantenendo la velocità di apprendimento e la qualità del robot esattamente uguali a quelle di AdamW.

Ecco come Gefen lo fa, usando alcune analogie semplici:

1. La strategia dell' "Abbraccio di Gruppo" (Condivisione degli Appunti)

Il Problema: AdamW scrive un appunto separato per ogni singolo numero nel cervello del robot.
La Soluzione di Gefen: Gefen si rende conto che molti di questi numeri sono in realtà "migliori amici". Reagiscono al mondo in modi molto simili. Invece di scrivere un appunto unico per ogni singolo amico, Gefen raggruppa questi numeri in squadre (blocchi) e dà all'intera squadra un unico taccuino condiviso.

  • Come sa chi raggruppare? Di solito, avresti bisogno di una mappa super complessa (chiamata matrice Hessiana) per vedere chi è amico di chi, ma quella mappa è troppo grande da disegnare per robot giganti.
  • Il Trucco di Gefen: Gefen osserva la primissima sessione di pratica del robot. Vede quali numeri si sono mossi insieme seguendo un pattern simile. Presume: "Se vi siete mossi insieme all'inizio, probabilmente vi muoverete insieme anche in seguito". In questo modo, raggruppa questi numeri automaticamente. Nessun essere umano deve dirgli quali gruppi creare; lo capisce da solo.

2. La strategia dell' "Artista di Bozzetti" (Quantizzazione)

Il Problema: Anche con i taccuini condivisi, i numeri all'interno sono ancora scritti con un'alta precisione (come 10 cifre decimali), il che occupa spazio.
La Soluzione di Gefhen: Gefen usa un approccio da "artista di bozzetti". Inveve di scrivere il numero esatto (ad esempio 0,123456789), lo arrotonda al "valore standard" più vicino da una lista predefinita (un codebook).

  • La Lista Intelligente: La maggior parte degli ottimizzatori usa una lista di valori generica e fissa (come un righello con segni fissi). Gefen, invece, osserva il robot specifico che sta allenando e impara la lista di segni perfetta proprio per quel robot. Utilizza un metodo matematico intelligente (Programmazione Dinamica) per creare un righello personalizzato che si adatti perfettamente ai dati, minimizzando gli errori.
  • Stabilità: Una volta imparata questa lista all'inizio, continua a usare la stessa lista per tutto il tempo. Non ha bisogno di ridisegnare il righello ogni giorno, il che risparmia tempo e mantiene le cose stabili.

I Risultati: Uno Zaino Più Leggero, Stessa Performance

Gli autori hanno testato Gefen su vari modelli, dai piccoli classificatori di immagini ai grandi modelli linguistici (come Llama 3).

  • Memoria: Gefen ha ridotto la memoria necessaria per l'ottimizzatore di circa 8 volte rispetto ad AdamW. Per un modello da 13 miliardi di parametri, questo riduce la memoria necessaria da circa 97 GB a soli 1,5 GB.
  • Velocità: Poiché lo zaino è più leggero, il robot può trasportare un "micro-batch" (gruppo di pratica) più grande in una volta sola. Nei test utilizzando più computer (FSDP e DDP), questo ha permesso all'addestramento di procedere il 56% più velocemente perché i computer non stavano aspettando che la memoria si liberasse.
  • Qualità: Nonostante l'intensa compressione e la condivisione, il robot ha imparato altrettanto bene come faceva con lo zaino pesante di AdamW. La performance finale (accuratezza o perdita) è identica.

Perché questo è importante

Pensa a come si prepara per un viaggio. AdamW è come preparare una valigia dove ogni singolo calzino riceve la sua scatola individuale. Gefen è come rendersi conto che puoi arrotolare tutti i tuoi calzini in un unico pacchetto stretto e metterli in un piccolo sacchetto. Risparmi un enorme spazio, ma hai comunque tutti i tuoi calzini e puoi raggiungere la tua destinazione altrettanto velocemente.

Il paper afferma che Gefen è un "sostituto diretto" (drop-in replacement), il che significa che puoi inserirlo nel tuo codice di addestramento esistente senza cambiare alcuna impostazione, e risparmierà immediatamente memoria e potenzialmente velocizzerà il tuo addestramento.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →