← Ultimi articoli
🤖 machine learning

DeltaLog: Deferred Materialization of Recurrent States for Linear Attention Decoding

DeltaLog è uno schema di decodifica a stato ricorrente che accelera i modelli di attenzione lineare differendo la materializzazione completa dello stato a favore dell'aggiunta di aggiornamenti compatti a un log limitato e fondendoli periodicamente, riducendo così significativamente il traffico di memoria e migliorando la velocità di serving end-to-end.

Autori originali: Junqing Lin, Jingwei Sun, Guangzhong Sun

Pubblicato 2026-08-18
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Junqing Lin, Jingwei Sun, Guangzhong Sun

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

I moderni sistemi di intelligenza artificiale che generano testo, dai chatbot agli assistenti per la scrittura creativa, si basano su un processo fondamentale chiamato decodifica autoregressiva. In questo processo, il computer prevede la parola successiva in una frase una alla volta, utilizzando le parole già generate per informare la sua successiva ipotesi. Per anni, i modelli più potenti hanno utilizzato un meccanismo noto come attenzione per decidere quali parole precedenti siano più rilevanti per la previsione corrente. Sebbene questo approccio sia incredibilmente efficace, crea un collo di bottiglia crescente: man mano che la conversazione si allunga, il sistema deve memorizzare e recuperare costantemente un elenco in continua espansione di ogni parola vista finora, consumando enormi quantità di memoria del computer e rallentando il tempo di risposta. Per risolvere questo problema, i ricercatori hanno sviluppato una nuova classe di modelli che sostituiscono l'elenco in espansione con un riassunto di dimensioni fisse, o stato, che si aggiorna con ogni nuova parola. Questo cambiamento elimina la necessità di ricordare ogni singolo token passato, ma introduce un problema diverso: il sistema deve comunque riscrivere costantemente l'intero riassunto ogni volta che viene aggiunta una nuova parola, creando un pesante ingorgo nel traffico della memoria del computer.

Un team di ricercatori dell'Università di Scienza e Tecnologia della Cina ha identificato questa continua riscrittura come una grande inefficienza e ha ideato una soluzione che chiamano DeltaLog. Invece di costringere il computer a riscrivere l'intero riassunto della conversazione dopo ogni singola parola, DeltaLog consente al sistema di mantenere una versione stabile e completa del riassunto e di allegare semplicemente una nota piccola e compatta che descrive il cambiamento più recente. Il sistema riscrive l'intero riassunto solo occasionalmente, dopo che ha accumulato un certo numero di queste piccole note. Questo approccio è simile al tenere un registro mastro e una pila di post-it; invece di riscrivere l'intero registro ogni volta che avviene una nuova transazione, si aggiunge semplicemente la transazione alla pila e si aggiorna il registro solo quando la pila diventa troppo alta. Facendo questo, i ricercatori hanno scoperto di poter ridurre drasticamente la quantità di dati che il computer deve spostare, che è spesso la parte più lenta del processo.

I ricercatori hanno testato questo metodo su diversi tipi di modelli linguistici moderni, tra cui Gated DeltaNet, Kimi Delta Attention e RWKV6. Nei loro esperimenti, hanno misurato quanto tempo impiegava il computer per generare una singola parola e quanto traffico di memoria era coinvolto. Hanno scoperto che, differendo la riscrittura completa del riassunto, potevano velocizzare il calcolo principale che aggiorna la memoria del modello fino a 1,86 volte sulle schede grafiche di fascia alta. Ancora più importante, hanno osservato che la quantità di dati scritti nella memoria ad alta velocità del computer è diminuita fino a 7,83 volte. Questa riduzione del traffico è significativa perché, in questi tipi di modelli, la velocità è spesso limitata non dalla velocità con cui il computer può calcolare, ma dalla velocità con cui può spostare i dati in entrata e in uscita dalla sua memoria.

Quando i ricercatori hanno integrato questo metodo in un sistema completo progettato per servire molti utenti contemporaneamente, i benefici si sono tradotti in tempi di risposta più rapidi per l'utente finale. Nei test con modelli di grandi dimensioni contenenti decine di miliardi di parametri, il sistema ha generato parole tra il 5% e il 20% più velocemente rispetto a prima. Il miglioramento è stato più evidente quando il sistema gestiva molte richieste simultaneamente, uno scenario comune per le applicazioni reali. I ricercatori hanno confermato che questo aumento di velocità non è avvenuto a scapito dell'accuratezza; il testo generato dal sistema modificato rimaneva matematicamente equivalente all'originale, il che significa che la qualità dell'output è stata preservata mentre la consegna è diventata molto più efficiente.

La chiave di volta di questo lavoro è che il modo in cui un computer memorizza e aggiorna fisicamente le informazioni non deve sempre corrispondere ai passaggi logici che il modello compie. Mentre il modello aggiorna logicamente il suo stato con ogni parola, l'hardware fisico non deve riscrivere immediatamente l'intero stato per riflettere tale cambiamento. Separando la storia stabile dai cambiamenti recenti e fondendoli solo periodicamente, DeltaLog riduce la "tassa di aggiornamento dello stato", un termine che gli autori usano per descrivere l'eccessivo traffico di memoria causato dagli aggiornamenti immediati e voraci. Questa strategia non cambia il modello sottostante o i suoi pesi; cambia semplicemente la pianificazione di come il computer gestisce i dati. I risultati suggeriscono che, per i modelli linguistici su larga scala, ottimizzare il movimento fisico dei dati è importante quanto quanto migliorare gli algoritmi matematici stessi, offrendo una via chiara per un'intelligenza artificiale più veloce ed efficiente.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →