← Ultimi articoli
💬 NLP

Four Over Six: More Accurate NVFP4 Quantization with Adaptive Block Scaling

Questo articolo introduce "Four Over Six" (4/6), una tecnica adattiva di ridimensionamento dei blocchi per la quantizzazione NVFP4 che riduce l'errore di quantizzazione regolando dinamicamente le scale dei blocchi per gestire meglio i valori elevati, ottenendo così prestazioni di addestramento e inferenza più vicine a BF16 con un sovraccarico computazionale minimo.

Autori originali: Jack Cook, Junxian Guo, Guangxuan Xiao, Yujun Lin, Song Han

Pubblicato 2026-05-08
📖 5 min di lettura🧠 Approfondimento

Autori originali: Jack Cook, Junxian Guo, Guangxuan Xiao, Yujun Lin, Song Han

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di dover impacchettare un'immensa biblioteca di libri in una valigetta portatile minuscola. I libri rappresentano il "cervello" di un Modello Linguistico di grandi dimensioni (AI), e la valigetta rappresenta la memoria del computer. Per farci stare tutto, devi rimpicciolire i libri.

Per molto tempo, abbiamo utilizzato un metodo chiamato BF16 (un formato standard ad alta precisione) che è come impacchettare i libri in scatole robuste e pesanti. È preciso, ma la valigetta si riempie velocemente. Recentemente, gli ingegneri hanno provato a passare a NVFP4, un formato molto più piccolo. Pensa a NVFP4 come a un set di scatole di origami minuscole e leggere. Ne entrano molte più libri nella valigetta e fanno funzionare l'AI più velocemente, ma c'è un inconveniente: poiché le scatole sono così piccole, alcuni dei "grandi" libri vengono schiacciati, accartocciati o perdono le pagine. Questo "accartocciamento" è chiamato errore di quantizzazione e fa sì che l'AI commetta errori.

Il Problema: Il "Bordo Ruvido" delle Scatole Piccole

Il documento spiega che NVFP4 ha una stranezza specifica. Ha dimensioni specifiche che può contenere: 0,5, 1, 1,5, 2, 3, 4 e 6.

  • Se un libro è esattamente di dimensione 4, entra perfettamente.
  • Se un libro è di dimensione 5, non entra. Devi forzarlo nella scatola di dimensione 4 o in quella di dimensione 6.
  • Se forzi un libro di dimensione 5 nella scatola di dimensione 4, perdi molte informazioni (viene schiacciato). Se lo forzi nella scatola di dimensione 6, sprechi molto spazio (rimbalza dentro).

Gli autori hanno scoperto che lo "schiacciamento" avviene più spesso con i libri che sono quasi grandi quanto la scatola più grande (i valori "quasi massimali"). Nel metodo standard, la valigetta è dimensionata per contenere il libro assolutamente più grande possibile (dimensione 6). Ma questo lascia un enorme spazio vuoto dove i libri di dimensione 5 vengono schiacciati pesantemente.

La Soluzione: "Quattro su Sei" (4/6)

Gli autori, Jack Cook e il suo team, hanno escogitato un trucco intelligente chiamato Quattro su Sei.

Immagina di impacchettare una valigetta. Invece di forzare ogni singolo oggetto per adattarlo a una scatola "Dimensione 6", guardi ogni gruppo di oggetti.

  • Il Vecchio Modo: Assumi che ogni gruppo abbia bisogno di una scatola "Dimensione 6". Se un gruppo ha un libro di dimensione 5, lo schiacci.
  • Il Modo 4/6: Controlli il gruppo. Se il libro più grande in quel gruppo specifico è solo di dimensione 5, dici: "Ok, non abbiamo bisogno di una scatola Dimensione 6 per questo gruppo. Usiamo invece una scatola Dimensione 4".

Passando a una scatola più piccola "Dimensione 4" per quel gruppo specifico, il libro "Dimensione 5" (che ora è relativamente più piccolo rispetto al limite della scatola) entra molto più comodamente. Non viene più schiacciato contro il bordo.

L'Analogia:
Pensa a un personaggio di un videogioco che salta.

  • NVFP4 Standard: Il gioco assume che il personaggio possa saltare fino a 10 piedi. Se prova a saltare 9 piedi, il gioco lo arrotonda a 8 piedi (una grande caduta).
  • Metodo 4/6: Il gioco controlla il livello specifico. Se la piattaforma più alta è alta solo 6 piedi, cambia il "limite di salto" a 6 piedi. Ora, un salto di 5 piedi viene arrotondato a 6 piedi (o 4 piedi) molto più accuratamente. Il personaggio non cade così lontano.

Come Funziona nella Pratica

Il documento descrive un algoritmo intelligente che esamina ogni piccolo frammento di dati (chiamato "blocco") prima di impacchettarlo:

  1. Prova a impacchettare il frammento in una scatola "Dimensione 6" e calcola quante informazioni vengono perse.
  2. Prova a impacchettare lo stesso frammento in una scatola "Dimensione 4" e calcola la perdita.
  3. Sceglie la scatola che causa meno danni (meno errore).

Di solito, per i frammenti con numeri molto grandi, la scatola "Dimensione 4" è la vincitrice perché fa adattarsi meglio i numeri "quasi massimali".

I Risultati

Il team ha testato questo su un modello AI massiccio chiamato Nemotron 3 Nano (30 miliardi di parametri).

  • Addestramento: Quando hanno addestrato l'AI usando 4/6, l'AI ha imparato meglio e ha commesso meno errori rispetto al metodo NVFP4 standard. Si è avvicinata molto di più alle prestazioni del metodo pesante e lento "BF16", ma ha mantenuto i vantaggi di velocità e dimensione di NVFP4.
  • Velocità: Hanno dimostrato che questo "impacchettamento intelligente" non rallenta il computer. Aggiunge meno del 15% di lavoro in più, che è un prezzo minimo da pagare per una precisione molto migliore.
  • Modelli Esistenti: Hanno anche provato questo su modelli già addestrati (come Llama e Qwen). Anche senza ri-addestramento, l'uso di 4/6 ha reso questi modelli più intelligenti e più precisi in test come la comprensione del testo e i puzzle logici.

La Conclusione

Il documento afferma che essendo semplicemente più intelligenti su quale dimensione di scatola usare per diversi gruppi di dati—usando a volte un "4" invece di un "6"—si può fermare lo "schiacciamento" di informazioni importanti. Questo rende l'AI a bassa precisione (NVFP4) molto più accurata, permettendoci di eseguire modelli AI più grandi e veloci sull'hardware attuale senza che perdano il loro "potere cerebrale".

Hanno persino rilasciato il codice (kernel) in modo che altri possano utilizzare questo metodo di "impacchettamento intelligente" sulle nuove GPU Blackwell di NVIDIA.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →