← Ultimi articoli
🤖 machine learning

Search Your Block Floating Point Scales!

Questo articolo introduce ScaleSearch, una strategia innovativa che ottimizza i fattori di scala in Floating Point a Blocchi attraverso una ricerca fine dei bit della mantissa per ridurre significativamente l'errore di quantizzazione e migliorare le prestazioni dei modelli generativi a bassa precisione, includendo un algoritmo specializzato ScaleSearchAttention che raggiunge una perdita di prestazioni quasi nulla.

Autori originali: Tanmaey Gupta, Hayden Prairie, Xiaoxia Wu, Reyna Abhyankar, Qingyang Wu, Austin Silveria, Pragaash Ponnusamy, Jue Wang, Ben Athiwaratkun, Leon Song, Tri Dao, Daniel Y. Fu, Chris De Sa

Pubblicato 2026-05-13
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Tanmaey Gupta, Hayden Prairie, Xiaoxia Wu, Reyna Abhyankar, Qingyang Wu, Austin Silveria, Pragaash Ponnusamy, Jue Wang, Ben Athiwaratkun, Leon Song, Tri Dao, Daniel Y. Fu, Chris De Sa

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Il quadro generale: Imballare una valigia in modo efficiente

Immagina di dover imballare una valigia (la memoria di un computer) per un viaggio. Hai molti oggetti (dati) da inserire, ma la valigia è piccola. Per farci stare tutto, devi schiacciare gli oggetti (questo processo si chiama quantizzazione).

In passato, quando si imballava un gruppo di oggetti, si guardava l'oggetto più grande del gruppo e si diceva: "Ok, rimpicciolirò tutto il resto affinché l'oggetto più grande ci stia perfettamente". Questo è il metodo standard utilizzato dai moderni chip per l'intelligenza artificiale.

Il problema:
Gli autori hanno notato che, anche se l'oggetto più grande ci sta, non significa che il resto degli oggetti sia imballato in modo efficiente. A volte, rimpicciolire tutto basandosi sull'oggetto più grande lascia molto spazio vuoto o schiaccia troppo gli oggetti più piccoli, rendendoli difficili da riconoscere in seguito. È come cercare di far entrare un orsacchiotto gigante e un minuscolo bottone in una scatola; se dimensioni la scatola per l'orsacchiotto, il bottone si perde nel rumore di fondo.

La soluzione: "ScaleSearch" (Il pacchettizzatore intelligente)

Il documento introduce una nuova strategia chiamata ScaleSearch. Invece di guardare solo l'oggetto più grande e impostare la regola una volta per tutte, l'algoritmo utilizza una piccola "lente d'ingrandimento" per verificare diversi modi di imballare la valigia.

  • Il vecchio metodo: "L'oggetto più grande è alto 10 pollici. Imposterò la mia scala a 10."
  • Il nuovo metodo (ScaleSearch): "L'oggetto più grande è alto 10 pollici. Ma aspetta... se impostassi la mia scala a 9,5, l'oggetto grande ci starebbe comunque, ma gli oggetti medi diventerebbero molto più chiari. Se la impostassi a 10,5, gli oggetti piccoli apparirebbero meglio. Lascia che test rapidamente queste poche opzioni e scelga quella che fa sembrare l'intero gruppo il migliore."

Il documento dimostra che eseguendo questa piccola e rapida ricerca, il computer può imballare i dati con molta più precisione, riducendo l'"errore di quantizzazione" (il disordine causato dallo schiacciamento dei dati) di circa il 27%.

L'hardware speciale: NVFP4

Questo trucco funziona specificamente grazie a nuovi chip computer super veloci (l'architettura Blackwell di NVIDIA) che utilizzano un formato chiamato NVFP4.

Pensa al vecchio metodo di imballaggio come all'uso di un righello con solo tacche grandi (1, 2, 3). I nuovi chip hanno un righello con tacche minuscole e fini (1,0, 1,1, 1,2, ecc.). ScaleSearch è la tecnica che utilizza quelle tacche minuscole e fini per trovare l'adattamento perfetto, invece di indovinare semplicemente con le tacche grandi.

Il potenziamento dell'"Attenzione": ScaleSearchAttention

I modelli di intelligenza artificiale (come i chatbot) devono prestare attenzione alle parole che hanno già detto per comprendere la parola successiva. Questa "memoria" è chiamata KV Cache. Memorizzare questa memoria occupa molto spazio e rallenta le operazioni.

Gli autori hanno creato una versione speciale chiamata ScaleSearchAttention.

  • Cosa fa: Applica la logica del "Pacchettizzatore intelligente" alla memoria dell'IA.
  • Il risultato: Permette all'IA di memorizzare la sua memoria in un formato molto compatto (4-bit) senza perdere la capacità di comprendere il contesto.
  • L'analogia: Immagina un bibliotecario che di solito deve scrivere ogni titolo di libro in dettaglio completo (lento e ingombrante). Con questo nuovo metodo, il bibliotecario usa un codice abbreviato intelligente che è minuscolo e veloce da scrivere, ma controlla due volte il codice per assicurarsi di non aver perso alcun dettaglio importante.

Cosa hanno dimostrato? (I risultati)

Il documento ha testato questo approccio su veri modelli di intelligenza artificiale (come Llama e Qwen) e strumenti di generazione video (come Mochi).

  1. Migliore matematica e ragionamento: Quando hanno utilizzato ScaleSearch su problemi matematici, l'IA è diventata significativamente più intelligente. Per un modello, il punteggio in un test di matematica è aumentato di 15 punti rispetto al metodo standard.
  2. Migliore linguaggio: Quando l'IA scriveva storie o rispondeva a domande, commetteva meno errori. La "perplessità" (una misura di quanto l'IA sia confusa) è diminuita, il che significa che l'IA suonava più naturale e umana.
  3. Velocità: La parte migliore? Questa "ricerca" è così veloce che rallenta il computer quasi per nulla. È come controllare tre modi diversi per allacciarsi le scarpe: richiede un istante ma assicura che non si inciampi dopo. Il sistema funziona al 98% della velocità del metodo standard.

Riassunto

Il documento afferma: "Non indovinare semplicemente come rimpicciolire i tuoi dati basandoti sul pezzo più grande. Prendi un istante per controllare alcune opzioni vicine e otterrai un risultato molto più chiaro e preciso con quasi nessuna penalità di velocità."

Chiamano questo metodo ScaleSearch, e quando viene applicato alla memoria dell'IA, lo chiamano ScaleSearchAttention. Rende i modelli di intelligenza artificiale più intelligenti ed efficienti senza la necessità di nuovo hardware.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →