← Ultimi articoli
🤖 machine learning

Faster Than Flash: Exploiting Attention Sparsity for Efficient Long-Context Decoding

Faster Flash Decoding (FFD) è un framework di co-design tra hardware e algoritmo privo di addestramento che raggiunge un'accelerazione a livello di kernel fino a 11,6x e scala fino a lunghezze di contesto di 256K fondendo selezione e computazione in un unico kernel e impiegando una strategia top-delta per una sparsità adattiva alla distribuzione, il tutto mantenendo l'accuratezza del modello.

Autori originali: Zhigeng Liu, Zhiyuan Ning, Ruixiao Li, Xiaoran Liu, Yuerong Song, Min Zhang, Ziwei He, Xipeng Qiu

Pubblicato 2026-09-02
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Zhigeng Liu, Zhiyuan Ning, Ruixiao Li, Xiaoran Liu, Yuerong Song, Min Zhang, Ziwei He, Xipeng Qiu

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Nel mondo dell'intelligenza artificiale, i moderni programmi informatici noti come grandi modelli linguistici sono diventati straordinariamente abili nel comprendere e generare il linguaggio umano. Questi sistemi funzionano prevedendo la parola successiva in una frase, un token alla volta, costruendo una risposta coerente passo dopo passo. Tuttavia, man mano che questi modelli diventano più capaci, affrontano un ostacolo fisico significativo quando vengono interrogati per elaborare documenti o conversazioni molto lunghi. Più contesto un modello deve ricordare, più dati deve continuamente spostare tra la sua memoria interna veloce e la sua memoria principale. Questo costante movimento di dati crea un collo di bottiglia, simile al tentativo di riempire una piscina con una canna da giardino mentre lo scarico è spalancato. Il computer passa la maggior parte del tempo ad aspettare che le informazioni arrivino piuttosto che a pensare effettivamente, il che rallenta l'intero processo e limita quanto testo un modello può gestire contemporaneamente.

Per risolvere questo problema, ricercatori della Fudan University e dello Shanghai Innovation Institute hanno sviluppato un nuovo metodo chiamato Faster Flash Decoding. Il loro approccio affronta il problema cambiando il modo in cui il modello decide quali pezzi di informazione mantenere e quali ignorare. Invece di cercare di leggere ogni singola parola in un documento massiccio per trovare quelle rilevanti, il nuovo sistema utilizza una scorciatoia intelligente. Esso crea prima uno schizzo minuscolo e compresso dell'intera cronologia della conversazione. Questo schizzo è così piccolo che il computer può scansionarlo quasi istantaneamente. Guardando questo schizzo, il sistema può identificare rapidamente quali parti della cronologia siano probabilmente importanti e quali possano essere ignorate in sicurezza. Solo dopo questa rapida scansione il modello recupera la versione completa e dettagliata delle parti selezionate per eseguire il calcolo finale. Questo processo in due fasi consente al modello di saltare enormi quantità di dati irrilevanti senza perdere la capacità di comprendere il significato centrale del testo.

I ricercatori hanno testato questo metodo su potenti schede grafiche, quelle utilizzate per il gaming di alto livello e il calcolo scientifico, e l'hanno trovato drammaticamente più veloce delle attuali tecniche standard. Elaborando un contesto di 256.000 token, il nuovo sistema ha ridotto il tempo necessario per generare un singolo token da oltre un millisecondo a solo una frazione di esso. In termini di velocità complessiva, il sistema ha generato testo fino a 2,37 volte più velocemente rispetto ai metodi precedenti, mantenendo lo stesso livello di precisione. Il team ha verificato questa prestazione attraverso una vasta gamma di compiti, inclusi il ragionamento complesso e il recupero di fatti specifici da documenti lunghi, confermando che i guadagni di velocità non sono avvenuti a scapito dell'intelligenza. Il sistema funziona senza la necessità di riaddestrare il modello, il che significa che può essere collegato ai sistemi di intelligenza artificiale esistenti immediatamente per migliorarne l'efficienza.

Un'innovazione chiave in questo lavoro è il modo specifico in cui il sistema filtra le informazioni. I metodi tradizionali si affidano spesso a regole fisse, come mantenere solo le dieci parole più importanti, o a calcoli complessi che richiedono che l'intero sistema si fermi e si sincronizzi prima di procedere. Il nuovo metodo utilizza una soglia dinamica che si adatta al flusso naturale della conversazione. Cerca parole che siano significativamente importanti rispetto alla parola più importante nel contesto attuale, permettendogli di regolare quanto mantenere in base a quanto sia concentrata l'attenzione. Questa flessibilità, combinata con l'uso di dati a precisione estremamente bassa per la scansione iniziale, consente al computer di bypassare il collo di bottiglia della memoria che ha a lungo frenato l'elaborazione del contesto lungo. Il risultato è un sistema in grado di gestire enormi quantità di testo con una velocità che si riteneva precedentemente impossibile senza sacrificare la qualità delle risposte fornite.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →