← Ultimi articoli
🤖 AI

TileFuse: A Fused Mixed-Precision Kernel Library for Efficient Quantized LLM Inference on AMD NPUs

Questo articolo introduce TileFuse, una libreria di kernel a precisione mista "close-to-metal" per le NPU AMD XDNA2 che fonde unpacking, dequantizzazione e operazioni matriciali per abilitare un supporto nativo ed efficiente per l'inferenza di LLM quantizzati in stile AWQ, ottenendo guadagni significativi in termini di prestazioni ed efficienza energetica rispetto ai baseline esistenti sui dispositivi edge client.

Autori originali: Wesley Pang, Gregory Hyegang Jun, Feiyang Liu, Deming Chen

Pubblicato 2026-06-11
📖 5 min di lettura🧠 Approfondimento

Autori originali: Wesley Pang, Gregory Hyegang Jun, Feiyang Liu, Deming Chen

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di avere un camion per consegne nuovo di zecca e super veloce (la NPU) parcheggiato nel tuo garage, ma l'unica mappa stradale che hai (il software) ti dice come guidare una vecchia e lenta bicicletta. Non puoi usare la velocità del camion perché la mappa non sa come navigare nelle sue corsie.

Questo è il problema che si riscontra nell'esecuzione dei moderni chatbot AI (LLM) sui nuovi chip per laptop oggi. Questi chip hanno potenti "motori AI" (NPU) progettati per risparmiare batteria e funzionare velocemente, ma il software solitamente costringe l'IA a cambiare forma per adattarsi al motore, invece di lasciare che il motore si adatti all'IA.

TileFuse è un nuovo set di strumenti che risolve questo problema. È come costruire un'autostrada personalizzata ad alta velocità specificamente per il camion, che gli permetta di trasportare carichi pesanti di dati compressi senza doversi fermare per riimpacchettarli.

Ecco come il documento spiega questa soluzione utilizzando semplici analogie:

1. Il Problema: Il collo di bottiglia del "Riempacchettamento"

Di solito, per eseguire un'IA su questi nuovi chip, devi prendere i "pesi" compressi dell'IA (che sono come libri impacchettati strettamente in una piccola valigia) e scompattarli in un formato ingombrante (come prendere i libri, tirarli fuori e stenderli su un tavolo) solo affinché il chip possa leggerli.

  • Il vecchio modo: Il chip legge la valigia, disimballa i libri, li mette in un'altra valigia e poi inizia a leggerli. Questo spreca tempo ed energia.
  • Il modo TileFuse: Il chip legge la valigia, la apre e legge i libri mentre vengono ancora disimballati. Fa tutto in un unico movimento fluido.

2. La Soluzione: Kernel "Fusi" (Fused Kernels)

Gli autori hanno creato una libreria chiamata TileFuse. Pensa a un "kernel" come a un manuale di istruzioni specifico per il chip.

  • Fusione: Invece di avere tre lavoratori separati (uno per disimballare, uno per convertire, uno per calcolare), TileFuse li combina in un unico super-lavoratore. Questo lavoratore prende i dati compressi, li converte "al volo" e compie i calcoli, tutto in un unico passaggio.
  • Il Risultato: È come uno chef che non si limita a tagliare le verdure; taglia, condisce e cuoce in un unico movimento continuo. Il documento afferma che questo rende la parte di "disimballaggio" del processo fino a 2,8 volte più veloce per determinati compiti rispetto ai metodi più vecchi.

3. Il Layout "Interleaved": Organizzare il magazzino

I grandi modelli di IA hanno liste massicce di numeri (pesi). Il sistema di memoria del chip ha un limite su quanto lontano può raggiungere per prendere il pezzo successivo di dati. Se i dati sono memorizzati in modo disordinato e disperso, il chip deve compiere lunghi e lenti viaggi per ottenere il pezzo successivo.

  • L'analogia: Immagina un magazzino dove le scatole sono impilate casualmente. Un carrello elevatore deve percorrere 50 piedi per prendere la scatola successiva.
  • La correzione di TileFuse: Hanno riorganizzato il magazzino (chiamato "Interleaved Pre-tiling") in modo che le scatole di cui il carrello elevatore ha bisogno subito dopo siano proprio accanto alle altre. Ciò consente al chip di afferrare enormi blocchi di dati in un unico movimento fluido, supportando modelli di IA molto più grandi (fino a 32.000 elementi di larghezza) che precedentemente non ci sarebbero entrati.

4. Il Problema "GEMV": L'ingorgo stradale

I chatbot AI lavorano in due fasi:

  1. Prefilling: Leggere un lungo prompt tutto in una volta (come leggere un intero libro). Questo è veloce e facile per il camion.
  2. Token Generation: Scrivere una parola alla volta (come scrivere una frase). Questo è lento e complicato.
  • Il Problema: Quando si scrive una parola alla volta, il "camion" del chip spesso resta inattivo perché è progettato per trasportare grandi carichi, non piccoli. È come usare un autoarticolato per consegnare una singola lettera; il motore è acceso, ma il camion è vuoto.
  • La Soluzione: TileFuse ha riprogettato il flusso del traffico per questa fase. Invece di inviare i dati a una sola corsia dell'autostrada, distribuisce il lavoro su tutte le 32 corsie del chip simultaneamente. Questo mantiene l'intero motore occupato, anche quando il "carico" è piccolo.

5. I Risultati nel Mondo Reale

Il team ha testato il sistema su veri laptop AMD (Ryzen AI) e lo ha confrontato con l'uso della scheda grafica standard (iGPU) del laptop.

  • Velocità: Per la lettura di prompt lunghi (prefilling), la NPU con TileFuse è stata fino a 2 volte più veloce della scheda grafica.
  • Batteria: Poiché la NPU è più efficiente, ha utilizzato il 64% di energia in meno per svolgere lo stesso lavoro.
  • Il Limite: Per la scrittura di una parola alla volta (token generation), la NPU è stata talvolta più lenta della scheda grafica. Questo perché il "tempo di configurazione" per impostare la NPU è troppo lungo per compiti così piccoli e rapidi.
  • La Soluzione Ibrida: Il documento suggerisce un approccio "il meglio dei due mondi": usare la NPU per i lavori pesanti (lettura di prompt lunghi) e la scheda grafica per i compiti rapidi (scrittura delle parole). Questa combinazione offre la migliore velocità e la migliore durata della batteria.

Riassunto

TileFuse è un ponte. Prende i popolari formati di IA compressi che gli sviluppatori già utilizzano (come AWQ) e li fa girare nativamente sui nuovi chip IA di AMD senza dover modificare i modelli di IA stessi. Fondendo i passaggi di disimballaggio e calcolo, organizzando perfettamente i dati e sfruttando tutta la potenza delle corsie del chip, rende l'esecuzione dell'IA sui laptop significativamente più veloce ed efficiente dal punto di vista energetico.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →