← Ultimi articoli
🤖 machine learning

Hardware-Aware FP4 FlashAttention-4

Questo articolo introduce Hardware-Aware FP4 FlashAttention-4, un metodo che supera i limiti dei tensor core FP4 di Blackwell impiegando Direct-P per l'inferenza non causale e un percorso causale con gradienti FP8, ottenendo un throughput in avanti fino a 2,13× più veloce e aggiornamenti di addestramento su singola GPU fino a 1,14× più veloci, evitando al contempo i problemi di divergenza osservati nell'addestramento MXFP4.

Autori originali: Robert Hu

Pubblicato 2026-09-04✓ Author reviewed
📖 5 min di lettura🧠 Approfondimento

Autori originali: Robert Hu

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Nel mondo dell'intelligenza artificiale, i modelli più potenti si affidano a un meccanismo chiamato "attenzione" per comprendere il contesto. Immaginate un lettore che scansiona un documento lungo; l'attenzione permette al modello di concentrarsi sulle parole più rilevanti in una frase ignorando il resto, collegando le idee attraverso vaste distanze. Per fare ciò, il computer esegue una serie massiccia di calcoli, confrontando ogni parola con tutte le altre per determinare le loro relazioni. Per anni, questi calcoli sono stati eseguiti con numeri ad alta precisione, simili all'uso di un righello con segni minuscoli e precisi per misurare un edificio. Ciò assicura che il modello apprenda correttamente, ma è lento e consuma enormi quantità di energia. Man mano che i modelli diventano più grandi, la necessità di velocità diventa critica. I ricercatori hanno recentemente sviluppato chip capaci di utilizzare numeri molto più piccoli e grossolani — valori a virgola mobile a quattro bit — per eseguire questi confronti molto più velocemente. Tuttavia, non basta semplicemente passare a questi numeri più piccoli; anche il software che gestisce il flusso di dati deve cambiare, o i guadagni di velocità svaniscono.

Un ricercatore presso Graphcore ha affrontato questo specifico collo di bottiglia con un nuovo metodo che chiamano Direct-P. Il loro lavoro si concentra sul passaggio "forward" dell'attenzione, dove il modello elabora le informazioni per generare una risposta, e sul passaggio "backward", dove il modello impara dai propri errori. Il ricercatore ha scoperto che, sebbene i nuovi chip possano moltiplicare i numeri incredibilmente velocemente, il passaggio intermedio — la conversione dei punteggi grezzi in probabilità — stava rallentando tutto. Era come avere una linea di montaggio superveloce che continuava a fermarsi perché un operaio doveva misurare attentamente ogni singolo pezzo prima di passarlo. Il ricercatore ha scoperto che il modo standard di gestire questa conversione, che prevedeva una scalatura e un arrotondamento complessi, creava un ingorgo che annullava i benefici di velocità del nuovo hardware.

Per risolvere questo problema, il ricercatore ha riprogettato il processo di conversione affinché fosse diretto e snello. Invece di calcolare una probabilità precisa e poi arrotondarla, il loro metodo mappa i punteggi grezzi direttamente sui codici specifici utilizzati dall'hardware. Ciò elimina i passaggi intermedi che causavano ritardi. Quando hanno testato questo approccio sugli ultimi modelli di chip per data center, i risultati sono stati sorprendenti. Per determinate forme comuni di dati, il nuovo metodo ha elaborato le informazioni più del doppio rispetto allo standard precedente, che faceva affidamento su numeri a precisione più elevata. Ciò è stato ottenuto mantenendo l'output abbastanza accurato per compiti complessi come la generazione di video e la comprensione del linguaggio. In test che coinvolgevano un modello di generazione video, il nuovo metodo è stato quasi due volte più veloce dell'approccio standard, producendo risultati che, pur essendo finiti e utilizzabili, mostravano una deriva misurabile e punteggi di somiglianza inferiori rispetto alla versione più lenta e precisa.

Tuttamente, la storia non riguarda solo la velocità; riguarda anche cosa succede quando il modello cerca di imparare. Il ricercatore ha esplorato se potessero usare questi numeri ultra-veloci e a bassa precisione per l'intero processo di addestramento, incluso il passaggio backward dove il modello aggiorna la sua conoscenza. Ha scoperto che, mentre il passaggio forward poteva girare alla massima velocità, il passaggio backward richiedeva un compromesso attento. Quando hanno provato a usare il formato a quattro bit più veloce per i valori di probabilità durante l'addestramento, il processo di apprendimento è diventato instabile e il modello non è riuscito a migliorare. I numeri sono diventati troppo grossolani, causando il breakdown del segnale di apprendimento. Di conseguenza, il ricercatore ha determinato che, affinché l'addestramento rimanesse stabile, dovevano utilizzare un formato a otto bit leggermente più preciso per i valori di probabilità, anche se il resto del calcolo utilizza il più veloce formato a quattro bit. Questo approccio ibrido ha permesso loro di velocizzare l'intero ciclo di addestramento di circa il 14 percento su un singolo chip potente, un guadagno significativo per i modelli su larga scala.

Il ricercatore ha anche osservato i limiti fisici dei chip stessi. Ha scoperto che la velocità del calcolo non era più il problema principale; il problema era come i dati venissero memorizzati e spostati all'interno del chip. Il chip possiede un'area di memoria piccola e ultra-veloce dove contiene i numeri mentre lavora su di essi. Il ricercatore ha scoperto che questo spazio di memoria era completamente pieno, lasciando spazio per sovrapporre le diverse fasi del calcolo. Era come una cucina dove il bancone è così affollato di ingredienti che lo chef non può iniziare a tagliare la verdura successiva finché non ha finito con quella corrente, anche se il coltello è incredibilmente affilato. Poiché lo spazio di memoria era completamente occupato, il chip non poteva lavorare su più passaggi contemporaneamente, il che limitava quanto il processo intero potesse diventare più veloce.

Questo lavoro evidenzia un cambiamento cruciale nel modo in cui pensiamo a rendere l'intelligenza artificiale più veloce. Non è sufficiente costruire semplicemente calcolatori più veloci; l'intero flusso di lavoro deve essere riprogettato per adattarsi alle capacità dell'hardware. Il ricercatore ha dimostrato che cambiando il modo in cui le probabilità vengono calcolate e gestendo attentamente il flusso di dati, era possibile sbloccare enormi miglioramenti di velocità. Eppure, ha anche provato che esistono limiti invalicabili. I vincoli di memoria del chip significano che, anche con la matematica più veloce possibile, esiste un soffitto a quanto sia possibile la sovrapposizione. La strada da seguire, suggeriscono, non risiede solo in un'aritmetica più veloce, ma in modi più intelligenti per organizzare i dati in modo che le risorse del chip non restino mai in attesa. Questo equilibrio tra velocità pura e gestione attenta dei dati è ciò che permetterà alla prossima generazione di intelligenza artificiale di funzionare in modo efficiente.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →