← Ultimi articoli
🤖 AI

When Good Enough Is Optimal: Multiplication-Only Matrix Inversion Approximation for Quantized Gated DeltaNet

Questo articolo propone un'approssimazione dell'inversione di matrice basata solo su moltiplicazioni e adatta all'hardware, utilizzando un'espansione di Neumann troncata con masking strutturale e correzione del residuo parallela per accelerare l'attenzione lineare a blocchi nei modelli Gated DeltaNet quantizzati, ottenendo fino a 5× di velocità in più e un overhead dello strato di decodifica inferiore del 20% preservando al contempo l'accuratezza.

Autori originali: Luoming Zhang, Yuwei Ren, Kui Zhang, Tian Liu, Lingjuan Ge, Denghao Li, Matthew Harper Langston, Yin Huang, Weiliang Will Zeng, Liang Zhang

Pubblicato 2026-06-05
📖 5 min di lettura🧠 Approfondimento

Autori originali: Luoming Zhang, Yuwei Ren, Kui Zhang, Tian Liu, Lingjuan Ge, Denghao Li, Matthew Harper Langston, Yin Huang, Weiliang Will Zeng, Liang Zhang

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di cercare di risolvere un puzzle enorme e complesso dove ogni pezzo dipende da quello precedente. Nel mondo dell'Intelligenza Artificiale, specificamente per i modelli che devono ricordare lunghe conversazioni o storie (chiamati "modelli a lungo contesto"), esiste un passaggio specifico chiamato inversione di matrice che agisce come un ingorgo stradale.

Attualmente, risolvere questo puzzle pezzo per pezzo è lento ed inefficiente, specialmente sulle unità specializzate (NPU) presenti nei moderni telefoni e dispositivi. È come cercare di riempire una piscina trasportando l'acqua con un singolo bicchiere, un bicchiere alla volta, mentre la piscina è enorme.

Questo articolo presenta un nuovo modo, molto più veloce, per risolvere questo puzzle. Ecco la suddivisione della loro soluzione utilizzando analogie semplici:

1. Il Probleo: L'ingorgo della "Sostituzione in Avanti"

Nei metodi standard, il computer deve calcolare la risposta per il pezzo #1, poi usare quella per trovare il pezzo #2, poi il pezzo #3, e così via. Questo è chiamato "sostituzione in avanti" (forward substitution).

  • L'Analogia: Immagina una fila di persone in attesa di un timbro. La prima persona riceve il timbro, poi la seconda non può ricevere il proprio finché la prima non ha finito, e così via. La fila si muove lentamente perché tutti aspettano la persona davanti a loro.
  • Il Risultato: Su hardware moderni, questa "fila" è molto inefficiente. I motori potenti (unità di elaborazione matriciale) rimangono inattivi, in attesa che i lenti passaggi sequenziali finiscano.

2. L'Intuizione: "Abbastanza Buono" è in realtà Perfetto

Gli autori si sono resi conto che, per ottenere un ottimo risultato, non è effettivamente necessario risolvere l'intero puzzle alla perfezione.

  • L'Analogia: Immagina di dipingere un ritratto. I dettagli più importanti sono al centro del viso (la diagonale principale). I dettagli negli angoli lontani (le sottodiagonali profonde) sono così sfumati che puoi malapena vederli. Se passi il 90% del tempo a perfezionare il centro e solo un rapido sguardo agli angoli, il dipinto sembrerà altrettanto buono all'occhio umano, ma lo finirai 10 volte più velocemente.
  • La Scienza: Il documento mostra che l'"energia" o l'importanza della risposta è concentrata vicino al centro. Le parti complesse e difficili da calcolare lontano dal centro contribuiscono molto poco al risultato finale.

3. La Soluzione: La scorciatoia della "Solo Moltiplicazione"

Inveve del lento metodo pezzo per pezzo, gli autori propongono un nuovo algoritmo che si basa interamente sulla Moltiplicazione di Matrici (eseguire molti calcoli contemporaneamente).

Utilizzano un trucco in tre fasi:

  • Fase A: Lo Schizzo Approssimativo (Serie di Neumann Truncata)
    Inveve di calcolare l'intera serie infinente di passaggi, si fermano in anticipo. Calcolano i primi pochi "livelli" della risposta.

    • Analogia: Inveve di leggere ogni singola pagina di un libro di 1.000 pagine per capirne la trama, leggi le prime 10 pagine. Ottieni l'idea principale immediatamente.
  • Fase B: La Rete di Sicurezza (Mascheramento Diagonale)
    Quando ci si ferma in anticipo, si potrebbe accidentalmente includere del "rumore" o numeri strani che sono troppo grandi e potrebbero far crashare il sistema (come un errore di overflow).

    • Analogia: Immagina di disegnare una mappa. Disegni le strade principali chiaramente, ma accidentalmente scarabocchi alcune linee selvagge e senza senso nei campi vuoti. Gli autori mettono una "maschera" sopra quegli scarabocchi selvaggi e li cancellano, mantenendo solo le strade pulite e importanti. Questo evita che i numeri diventino troppo grandi e rompano la matematica.
  • Fase C: La Correzione Rapida (Correzione del Residuo in Parallelo)
    Poiché ci si è fermati in anticipo, lo schizzo non è perfetto. Ci sono piccoli errori rimasti. Inveve di correggerli uno per uno (che è lento), li correggono tutti insieme usando un calcolo parallelo.

    • Analogia: Immagina di avere una bozza di un documento con alcuni errori di battitura. Inveve di leggere riga per riga per correggerli, usi uno strumento "Trova e Sostituisci" che corregge tutti gli errori simultaneamente in una frazione di secondo.

4. I Risultati: Velocità e Stabilità

Il documento ha testato questo metodo su modelli AI reali (famiglia Qwen3.5) e ha scoperto che:

  • Velocità: Il nuovo metodo è 5 volte più veloce a livello di calcolo centrale.
  • Efficienza: Riduce il tempo totale di decodifica (generazione del testo) di circa il 20%.
  • Accuratezza: Nonostante le scorciatoie prese, le risposte dell'IA rimangono altrettanto accurate rispetto al metodo lento e perfetto. Funziona anche quando i numeri vengono ridotti per risparmiare spazio (bassa precisione/quantizzazione), il che è fondamentale per eseguire l'IA su dispositivi mobili.

Riassunto

L'articolo sostiene che nell'IA, la perfezione è nemica della velocità. Capendo che abbiamo solo bisogno che la "diagonale principale" della matematica sia perfetta, e che possiamo correggere il resto in parallelo, hanno trasformato un lento collo di bottiglia sequenziale in un'autostrada veloce e parallela. Ciò consente ai grandi modelli di IA di girare molto più velocemente sui chip all'interno dei nostri telefoni e dispositivi edge senza perdere la loro intelligenza.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →