← Ultimi articoli
💻 computer science

AHASD: Asynchronous Heterogeneous Architecture for LLM Adaptive Drafting Speculative Decoding on Mobile Devices

Questo articolo introduce AHASD, un'architettura mobile eterogenea asincrona a livello di attività che sfrutta la collaborazione NPU-PIM con nuovi meccanismi di controllo per ottenere miglioramenti fino a 4,2× nel throughput e 5,6× nell'efficienza energetica per il decoding speculativo nei grandi modelli linguistici rispetto alle basi di riferimento esistenti.

Autori originali: Ma zirui, Fan Zhihua, Li Wenxing, Wu Haibin, Zhang Fulin, Ye Xiaochun, Li Wenming

Pubblicato 2026-04-29
📖 5 min di lettura🧠 Approfondimento

Autori originali: Ma zirui, Fan Zhihua, Li Wenxing, Wu Haibin, Zhang Fulin, Ye Xiaochun, Li Wenming

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di dover scrivere una storia lunga, ma hai una regola rigida: devi chiedere a un editor molto saggio, lento e costoso (il Modello Target) di controllare ogni singola parola che scrivi prima di poter scrivere la successiva. Questo rende la scrittura incredibilmente lenta.

Per velocizzare le cose, assumi un assistente veloce ed energico (il Modello Bozza) per indovinare le prossime parole per te. Scrivi queste ipotesi, e poi l'editor saggio le controlla tutte in una volta. Se le ipotesi sono buone, le mantieni e procedi. Se sono cattive, le butti via e ricominci. Questo si chiama Decodifica Speculativa.

Tuttavia, su un telefono cellulare, questo processo presenta due grandi problemi:

  1. Il "Gioco dell'Attesa": A volte l'assistente indovina 2 parole, a volte 20. Se l'assistente è lento, l'editor rimane inattivo in attesa. Se l'assistente è veloce, l'editor rimane inattivo in attesa del prossimo lotto. Si tengono costantemente per mano, aspettandosi l'uno l'altro di finire, il che spreca tempo.
  2. Il Problema della "Cattiva Ipotesi": A volte l'assistente diventa troppo sicuro di sé e indovina un intero paragrafo di assurdità perché il contesto è complicato. L'editor deve rifiutare tutto, sprecando tutta l'energia che l'assistente ha speso per indovinare.

Il documento introduce AHASD, un nuovo sistema progettato per risolvere questi problemi sui telefoni cellulari utilizzando un tipo speciale di chip informatico chiamato PIM (Processing-in-Memory, elaborazione nella memoria) e un chip AI standard chiamato NPU.

Ecco come funziona AHASD, utilizzando semplici analogie:

1. La "Danza Sincronizzata" (Esecuzione Asincrona a Livello di Attività)

Nei vecchi sistemi, l'assistente e l'editor dovevano ballare in perfetta sincronia. Se l'assistente si fermava, anche l'editor si fermava.
AHASD rompe la catena. Permette all'assistente (in esecuzione sul chip di memoria, PIM) e all'editor (in esecuzione sul processore, NPU) di lavorare indipendentemente.

  • L'Analogia: Immagina una catena di montaggio in fabbrica. Invece che il lavoratore aspetti che la macchina finisca prima di iniziare il passaggio successivo, il lavoratore continua a prendere nuovi pezzi da un contenitore (la coda) e a lavorarci mentre la macchina sta ancora elaborando il lotto precedente. Non si aspettano a vicenda; mantengono semplicemente la linea in movimento. Questo elimina il "tempo morto" in cui un dispositivo rimane seduto a non fare nulla.

2. Il "Radar della Fiducia" (Bozza Consapevole di Entropia e Storia)

L'assistente a volte diventa troppo sicuro di sé e inizia a indovinare a caso quando dovrebbe essere cauto.
AHASD fornisce all'assistente un "Radar della Fiducia". Esamina la storia delle sue recenti ipotesi.

  • L'Analogia: Pensa a un meteorologo. Se ha sbagliato a prevedere la pioggia per gli ultimi tre giorni, smette di prevedere la pioggia per il giorno successivo, anche se le nuvole sembrano simili. Allo stesso modo, se le ipotesi dell'assistente hanno una bassa "fiducia" (alta entropia), il sistema gli dice: "Smetti di indovinare in anticipo! Aspetta che l'editor confermi la parola corrente prima di indovinare la successiva". Questo impedisce all'assistente di sprecare energia su ipotesi che verranno sicuramente scartate.

3. Il "Timer Intelligente" (Pre-Verifica Consapevole del Tempo)

A volte l'assistente finisce il suo lavoro, ma l'editor è ancora occupato. L'assistente potrebbe iniziare a indovinare di nuovo, ma se indovina troppo, l'editor potrebbe rimanere senza lavoro da controllare e rimanere inattivo.
AHASD utilizza un "Timer Intelligente" per decidere esattamente quando l'assistente dovrebbe fare una pausa e eseguire un rapido "mini-controllo" (pre-verifica) da solo.

  • L'Analogia: Immagina uno chef (l'assistente) che taglia le verdure mentre un sous-chef (l'editor) sta cucinando una salsa. Lo chef sa esattamente quanto tempo richiederà la salsa. Se lo chef vede che la salsa sarà pronta tra 5 secondi, smette di tagliare e fa un rapido assaggio (pre-verifica) delle verdure per assicurarsi che siano pronte. Questo assicura che il sous-chef abbia le verdure fresche pronte nel momento in cui la salsa è finita, così il sous-chef non deve mai rimanere in piedi ad aspettare.

I Risultati

Gli autori hanno costruito una simulazione di questo sistema su un chip per telefoni cellulari. Hanno scoperto che:

  • Velocità: È fino a 4,2 volte più veloce rispetto all'uso di una semplice scheda grafica (GPU) e 1,5 volte più veloce rispetto ai precedenti tentativi di mescolare chip mobili con elaborazione nella memoria.
  • Durata della Batteria: È fino a 5,6 volte più efficiente dal punto di vista energetico rispetto a una GPU standard e 1,24 volte migliore rispetto al miglior sistema mobile precedente.
  • Costo: Tutte queste nuove e sofisticate funzionalità occupano solo circa il 3% dello spazio extra sul chip di memoria, che è un prezzo molto basso da pagare per un tale aumento di velocità.

In breve, AHASD è come dare all'AI del tuo telefono una squadra di lavoratori che smettono di aspettarsi l'un l'altro, controllano la propria fiducia prima di indovinare e sincronizzano perfettamente le loro pause per mantenere il lavoro che scorre fluidamente senza sprecare energia della batteria.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →