← Ultimi articoli
🤖 AI

TileMix: Tile-Centric Mixed-Precision Attention for LLM Inference Acceleration

TileMix è un kernel a precisione mista, centrato sui tile e privo di addestramento, che accelera l'inferenza di LLM a lungo contesto instradando dinamicamente i tile dei punteggi di attenzione allineati all'hardware tra percorsi FP16 e INT8 all'interno di un'operazione di attenzione densa fusa, recuperando così l'accuratezza persa dai metodi a bassa precisione uniformi e migliorando al contempo il throughput.

Autori originali: Hanzhi Zhang, Qiao Zhang, Qinglei Cao, Heng Fan, Yan Huang, Kewei Sha, Yunhe Feng

Pubblicato 2026-08-19
📖 5 min di lettura🧠 Approfondimento

Autori originali: Hanzhi Zhang, Qiao Zhang, Qinglei Cao, Heng Fan, Yan Huang, Kewei Sha, Yunhe Feng

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

I modelli linguistici di grandi dimensioni sono diventati i motori dietro una nuova generazione di intelligenza artificiale, capaci di riassumere interi libri, rispondere a domande complesse da documenti lunghi e sostenere conversazioni che si estendono per migliare di parole. Per farlo, questi modelli si affidano a un meccanismo chiamato attenzione, che permette loro di pesare l'importanza di ogni parola in una frase rispetto a tutte le altre parole. Quando il testo è breve, questo processo è rapido. Ma man mano che il contesto cresce fino a includere interi capitoli o contratti legali, il costo computazionale esplode. Il modello deve calcolare un punteggio per ogni possibile coppia di parole, creando una griglia massiccia di dati che richiede enormi quantità di memoria e potenza di elaborazione. Questo collo di bottiglia ha reso difficile l'esecuzione efficiente di questi potenti strumenti su hardware standard, specialmente quando si trattano le lunghe sequenze richieste per compiti del mondo reale come l'analisi legale o la revisione di cartelle cliniche.

I ricercatori hanno cercato di risolvere questo problema semplificando la matematica. Un approccio comune consiste nel ridurre la precisione dei numeri utilizzati dal computer, passando da calcoli ad alta precisione a calcoli più veloci e a bassa precisione. È come passare dalla misurazione degli ingredienti con una bilancia da laboratorio all'uso di un cucchiaio da cucina; è molto più veloce, ma se lo si fa per ogni singolo passaggio di una ricetta complessa, il piatto finale potrebbe avere un sapore sbagliato. Un altro approccio consiste nel saltare completamente i calcoli, ignorando le parole che sembrano poco importanti. Sebbene ciò faccia risparmiare tempo, rischia di tagliare proprio quelle connessioni di cui il modello ha bisogno per comprendere la storia. La sfida è stata trovare un modo per utilizzare la velocità della matematica a bassa precisione senza sacrificare l'accuratezza di quella ad alta precisione, mantenendo al contempo la capacità del modello di vedere il quadro completo.

Un team di ricercatori ha introdotto un nuovo metodo chiamato TileMix che affronta questo problema trattando il processo di attenzione non come un singolo blocco uniforme di lavoro, ma come una collezione di piccoli tasselli gestibili. Immaginate la massiccia griglia di punteggi delle coppie di parole come un grande mosaico. Invece di dipingere l'intero mosaico con un unico tipo di vernice, TileMix lo divide in piccole sezioni quadrate allineate all'hardware. Per ciascuna di queste sezioni, il sistema prende una decisione fulminea: questo specifico gruppo di coppie di parole ha bisogno del calcolo lento ad alta precisione, o può accontentarsi di quello veloce a bassa precisione? Questa decisione viene presa sulla base di una mappa pre-pianificata che raggruppa questi tasselli insieme, consentendo al computer di passare tra alta e bassa precisione all'interno della stessa operazione senza fermarsi per riorganizzare i dati.

Il cuore di questa innovazione è un sistema di instradamento che agisce come un controllore del traffico per il processore del computer. Esso impacchetta queste decisioni in un codice compatto, essenzialmente una stringa di bit che dice al processore quale percorso intraprendere per ogni tassello. Se un tassello è contrassegnato per l'alta precisione, il processore utilizza le sue unità matematiche più accurate. Se è contrassegnato per la bassa precisione, passa alle sue unità più veloci ed efficienti dal punto di vista energetico. Fondamentalmente, entrambi i percorsi aggiornano uno stato di memoria condiviso che tiene traccia dei risultati complessivi, garantendo che l'output finale rimanga coerente. Ciò consente al sistema di preservare la piena connettività del modello — il che significa che le interazioni tra le parole non vengono mai ignorate — pur beneficiando dei vantaggi di velocità della matematica a bassa precisione per le parti del calcolo che possono tollerarlo.

Nei loro esperimenti, i ricercatori hanno testato questo metodo su diversi modelli linguistici di grandi dimensioni popolari, tra cui LLaMA, Qwen e Vicuna, utilizzando sequenze che vanno dalle 16.000 alle 64.000 parole. Hanno confrontato il loro approccio con il metodo standard ad alta precisione e con una versione che utilizzava la matematica a bassa precisione per tutto. I risultati hanno mostrato che l'uso della matematica a bassa precisione per l'intero calcolo portava spesso a un calo significativo dell'accuratezza, causando al modello di perdere dettagli o di fallire nei compiti di recupero informazioni. Tuttavia, TileMix è stato in grado di recuperare gran parte di quella qualità perduta. Reindirizzando attentamente solo specifici gruppi di tasselli verso il percorso ad alta precisione, il sistema ha mantenuto livelli di accuratezza molto vicini alla linea di base completa ad alta precisione, ottenendo simultaneamente velocità di elaborazione molto più elevate.

Lo studio ha anche esplorato diversi schemi per decidere quali tasselli dovessero ricevere il trattamento ad alta precisione. Hanno scoperto che la disposizione era importante; alcuni schemi, che mantenevano i calcoli ad alta precisione in specifiche regioni spaziali della griglia delle parole, funzionavano meglio di altri a seconda del compito. Ad esempio, determinati layout che preservavano l'alta precisione per le interazioni locali tra le parole funzionavano meglio per i compiti di richiamo fattuale, mentre altri erano più robusti per il fact-checking generale. I ricercatori hanno dimostrato che questo metodo può essere applicato senza riaddestrare i modelli, il che significa che può essere implementato immediatamente su sistemi esistenti. Hanno inoltre mostrato che l'approccio funziona bene con batch di lunghezza variabile e diverse architetture di modelli, suggerendo che sia uno strumento flessibile per migliorare l'efficienza.

In definitiva, TileMix offre un equilibrio controllabile tra velocità e accuratezza. Suggerisce che il futuro dell'elaborazione efficiente di contesti lunghi non richieda di scegliere tra essere veloci o essere intelligenti. Inveve, mescolando intelligentemente le due cose, i sistemi possono elaborare documenti lunghi a una velocità che si avvicina ai limiti teorici dell'hardware, senza le gravi penalità di accuratezza che derivano dall'uso della matematica a bassa precisione ovunque. Questo approccio fornisce una via pratica per l'implementazione di modelli linguistici di grandi dimensioni in scenari in cui sia la velocità che la precisione sono critiche, come l'analisi in tempo reale di enormi dataset o strumenti interattivi che devono comprendere istantaneamente contesti lunghi e complessi.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →