← Ultimi articoli
🤖 machine learning

Approximate Speculative Decoding

Questo articolo introduce l'Approximate Speculative Decoding (ASD), un metodo senza addestramento che accelera la generazione autoregressiva accettando selettivamente i disallineamenti dei token di bozza basandosi su un budget di rimpianto per riutilizzare le suffissi validi, migliorando così il throughput senza richiedere nuovi modelli di bozza o fine-tuning.

Autori originali: Yuannuo Feng, Zegang Peng, Yuxin Xie, Yubing Ye, Yizhe Chen, Wenshuai Yao, Wenyong Zhou, Wang Kang

Pubblicato 2026-08-05
📖 6 min di lettura🧠 Approfondimento

Autori originali: Yuannuo Feng, Zegang Peng, Yuxin Xie, Yubing Ye, Yizhe Chen, Wenshuai Yao, Wenyong Zhou, Wang Kang

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di cercare di scrivere una storia con un amico molto intelligente, ma incredibilmente lento. Ogni volta che vuoi aggiungere una nuova parola alla tua storia, devi aspettare che il tuo amico rifletta profondamente, consulti l'intera sua biblioteca di conoscenze e ti dica esattamente quale parola viene dopo. Ecco come funzionano i moderni modelli linguistici AI: generano testo una parola alla volta, e la parte del "pensare" occupa la maggior parte del tempo, rendendo il processo simile a guardare la vernice che asciuga. Per velocizzare questo processo, gli scienziati hanno inventato un trucco chiamato "decodifica speculativa" (speculative decoding). Immaginalo come avere un assistente junior veloce che indovina le prossime parole per te. Poi chiedi al tuo amico esperto, lento, di controllare rapidamente se queste ipotesi sono corrette. Se l'esperto concorda, puoi scrivere diverse parole in una volta sola invece di una sola, risparmiando una quantità enorme di tempo.

Tuttavia, c'è un problema. L'amico esperto è un maniaco delle regole. Se l'assistente indovina anche solo una parola che non è la scelta assolutamente perfetta che l'esperto avrebbe scelto, l'esperto interrompe immediatamente l'intero processo. Buttano via tutte le altre parole che l'assistente ha indovinato per quel turno, anche se la maggior parte di esse era in realtà perfetta. È come un insegnante che valuta un compito e smette di leggere non appena vede una sola risposta errata, buttando il resto del foglio nel cestino. Questa regola del "tutto o niente" mantiene la storia perfetta, ma spreca molto del duro lavoro dell'assistente e rallenta il processo.

Questo articolo presenta un nuovo metodo chiamato Approximate Speculative Decoding (ASD), che agisce come un insegnante più intelligente e flessibile. Invece di buttare via l'intero compito solo perché c'è un piccolo errore, l'ASD si chiede: "Questo errore è minimo? E l'assistente ha comunque indovinato le parole successive?". Se la risposta è sì, l'ASD accetta il piccolo errore, tiene le parole buone che seguono e va avanti. È come un insegnante che dice: "Hai sbagliato l'ortografia di 'perché', ma hai scritto perfettamente le dieci parole successive, quindi correggiamo solo quella parola e continuiamo". I ricercatori hanno scoperto che, essendo leggermente più indulgenti con i piccoli errori, potevano far scrivere all'AI significativamente più velocemente senza rovinare la qualità della storia.

La storia dell'assistente "con budget"

L'idea centrale dietro l'ASD è smettere di trattare ogni errore come un disastro. Nel vecchio modo, se il tuo assistente indovinava una parola che non era la scelta principale, il sistema si fermava immediatamente. Ma gli autori si sono resi conto che a volte la "scelta sbagliata" dell'assistente è in realtà molto vicina a quella giusta, e le parole che seguono sono ancora perfette.

Per risolvere questo, il team ha creato un sistema con un budget. Immagina di avere un barattolo di "token di errore". Ti è permesso commettere alcuni piccoli errori, ma devi pagarli con il tuo barattolo.

  1. Il Gate Locale (Local Gate): Prima di accettare un errore, il sistema controlla quanto sia "grave". Se la scelta dell'assistente è solo leggermente meno probabile della parola perfetta, è un errore economico. Se è un errore enorme, costa troppi token e il sistema dice "no".
  2. Il Limite di Blocco (Block Cap): Non puoi commettere troppi errori in un singolo lotto di ipotesi. Questo evita che l'assistente diventi troppo impreciso tutto in una volta.
  3. Il Budget della Richiesta (Request Budget): Questo è il barattolo totale di token per l'intera conversazione. Una volta esauriti i token, devi tornare a essere perfetto (seguendo rigorosamente le vecchie regole) per il resto della storia.

La magia avviene quando il sistema accetta un piccolo errore. Poiché le prossime ipotesi dell'assistente erano in realtà perfette (corrispondevano a ciò che l'esperto avrebbe scelto), il sistema può "riutilizzarle". Non ha bisogno di chiedere all'esperto lento di controllarle di nuovo. Le accetta semplicemente e va avanti. Questo trasforma un momento di "fermati e butta via" in un momento di "correggi e continua".

Cosa hanno scoperto

I ricercatori hanno testato questa idea utilizzando modelli AI molto popolari (come Qwen3 e DeepSeek) su una varietà di compiti, dalla risoluzione di problemi matematici alla scrittura di codice. Non hanno avuto bisogno di riaddestrare i modelli o di insegnare nulla di nuovo all'assistente; hanno solo cambiato il modo in cui l'insegnante (il verificatore) corregge il lavoro.

I risultati sono stati piuttosto promettenti. Usando questo approccio a budget, il sistema è diventato più veloce senza richiedere un addestramento aggiuntivo.

  • Su un set di sette diversi compiti, il sistema è stato il 7,78% più veloce in media rispetto al vecchio metodo rigoroso.
  • Nei casi migliori, come sul dataset MATH-500, la velocità è aumentata dell'11,73%.
  • Quando lo hanno testato su un modello massiccio chiamato DeepSeek-V4-Flash, hanno visto i tassi di accettazione (quante ipotesi il sistema mantiene) salire di circa il 10% - 16%.

L'articolo nota con attenzione che questo non è un bacchetta magica che rende tutto perfetto. Gli autori affermano esplicitamente che questo metodo cambia il percorso che l'AI prende per arrivare alla risposta. A volte, la storia potrebbe essere leggermente diversa, o l' "hash" (un'impronta digitale digitale del testo) potrebbe cambiare, anche se la risposta finale è ancora corretta. Ad esempio, in alcuni test di programmazione, l'accuratezza è scesa leggermente (di meno dell'1,5%), ma in molti altri compiti, l'accuratezza è rimasta esattamente la stessa o è addirittura migliorata leggermente.

Perché questo è importante

La bellezza di questo articolo è che non richiede la costruzione di una nuova AI più veloce o l'addestramento di un nuovo assistente. Cambia solo le regole del gioco per quello che già possiedi. È come rendersi conto che un vigile urbano molto severo sta rallentando l'intera città perché ferma l'auto per ogni singola infrazione minore, quando un approccio più flessibile manterrebbe il traffico scorrevole con rischi solo minimi e gestibili.

Gli autori suggeriscono che questo metodo è un ottimo modo per spremere più velocità dai sistemi AI attuali. Sottolineano che, sebbene i guadagni di velocità siano reali e misurabili (fino al 15,26% in alcuni casi), gli utenti devono essere consapevoli che stanno scambiando una piccola parte di perfezione rigorosa con molta velocità. È un compromesso calcolato: la tua storia viene scritta molto più velocemente e, per la maggior parte delle persone, le piccole differenze nella formulazione non importeranno affatto. L'articolo conclude che questo approccio "a budget" è un modo pratico, che non richiede addestramento, per rendere la generazione dell'AI più veloce, a patto di controllare i risultati per assicurarsi che la qualità sia ancora adeguata alle proprie esigenze.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →