← Ultimi articoli
💬 NLP

AngelSpec: Towards Real-World High Performance Inference with Speculative Decoding

AngelSpec introduce un framework di addestramento unificato che co-specializza strutture di drafting distinte (MTP per la chat e block-diffusion per codice/matematica) e ottimizza dinamicamente le risorse di verifica dell'inferenza per ottenere miglioramenti significativi del throughput e tassi di accettazione più elevati attraverso diversi carichi di lavoro reali.

Autori originali: Hong Liu, Rui Cen, Junhan Shi, Guangshuo Qin, Jiebin Zhang, Tianyu Liu, Runzhi Fan, Guoliang Zhao, Ruobing Xie, Kai Zhang, Song Liu, Guanghua Yu, Jianchen Zhu

Pubblicato 2026-07-29
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Hong Liu, Rui Cen, Junhan Shi, Guangshuo Qin, Jiebin Zhang, Tianyu Liu, Runzhi Fan, Guoliang Zhao, Ruobing Xie, Kai Zhang, Song Liu, Guanghua Yu, Jianchen Zhu

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di cercare di insegnare a un robot super intelligente come scrivere storie, risolvere problemi di matematica o scrivere codice informatico. Questo robot, noto come Large Language Model (LLM), è incredibilmente talentuoso, ma ha una particolarità molto specifica: pensa una parola alla volta. Per scrivere una frase, deve fermarsi, pensare e generare la prima parola, poi fermarsi di nuovo per pensare alla seconda, e così via. È come uno chef che può solo tagliare una verdura alla volta, poi deve aspettare che l'intera cucina si raffreddi prima di tagliare la successiva. Man mano che il robot diventa più intelligente e le richieste più complesse, questo processo "uno alla volta" diventa dolorosamente lento, come guardare la vernice che asciuga al rallentatore.

Per velocizzare le cose, gli scienziati hanno inventato un trucco chiamato "speculative decoding" (decodifica speculativa). Immaginalo come un lavoro di squadra. Hai un piccolo robot "drafting" (di bozza), veloce, che indovina le prossime parole di una frase, e un robot "target" (bersaglio), gigante e lento, che controlla se i suoi tentativi sono corretti. Se il robot grande concorda, il team può scrivere diverse parole alla volta invece di una sola. È come un corridore veloce che indovina il percorso davanti a un camminatore pesante; se la previsione è giusta, entrambi avanzano insieme, risparmiando una quantità enorme di tempo. Tuttavia, c'è un problema: il corridore veloce non sempre indovina. Se fa troppi errori nelle sue previsioni, il robot grande deve perdere tempo per correggerli, e l'intero processo rallenta. La grande domanda per gli scienziati è: come facciamo a far indovinare meglio il corridore veloce e come sappiamo quando smettere di indovinare per non sprecare tempo?

È qui che entra in gioco un nuovo progetto chiamato AngelSpec. I ricercatori di Tencent si sono resi conto che una singola strategia di "corridore veloce" non funziona per ogni situazione. Proprio come uno sprinter può essere bravo in una gara breve ma terribile in una maratona, diversi tipi di testo richiedono diverse strategie di previsione. Ad esempio, scrivere un messaggio di chat informale è caotico e pieno di sorprese (alta entropia), mentre scrivere una dimostrazione matematica o un programma informatico è molto strutturato e prevedibile. L'articolo sostiene che cercare di usare un robot di previsione "universale" per tutto sia un errore. Invezione, hanno costruito un sistema che utilizza due diversi tipi di indovini a seconda del compito, e un manager intelligente che decide esattamente quanto tempo dedicare al controllo di queste previsioni in base a quanto è impegnato il sistema.

Il team ha introdotto un nuovo metodo chiamato DFly per i compiti strutturati come la programmazione e la matematica. Immagina DFly come una squadra di detective che non si limitano a indovinare il prossimo indizio uno alla volta, ma guardano l'intero puzzle in una volta sola per vedere il modello. Usano un cervello "ibrido" speciale che guarda il quadro generale e poi affina le loro previsioni in base a ciò che è venuto immediatamente prima. Questo permette loro di prevedere lunghe catene di codice o passaggi matematici con alta precisione. Per i compiti di chat più disordinati e creativi, utilizzano un metodo più semplice e veloce chiamato MTP (Multi-Token Prediction), che è ottimo per brevi momenti conversazionali.

Ma avere un ottimo indovino non basta; serve anche un manager intelligente. L'articolo introduce una funzione chiamata D-cut, che agisce come un controllore del traffico. In un server affollato, a volte il processo di "controllo" si intasa. D-cut osserva la fiducia delle previsioni in tempo reale. Se una previsione sembra incerta, D-cut la interrompe precocemente per risparmiare tempo. Se il sistema funziona senza intoppi e le previsioni sembrano solide, lascia che il team continui più a lungo. È come un direttore d'orchestra che accelera l'orchestra quando la musica è facile e la rallenta quando le note diventano difficili, assicurando che l'intera performance rimanga veloce senza andare in crash.

I risultati di questo approccio sono impressionanti. Quando hanno testato il loro nuovo sistema sul modello Hy3-A21B, hanno scoperto che poteva elaborare il testo molto più velocemente di prima. Nello specifico, il sistema ha ottenuto un'accelerazione da 1,98 a 2,40 volte rispetto al vecchio metodo "una parola alla volta". Ancora meglio, era dal 10,5% all'11,8% più veloce del precedente metodo migliore conosciuto come DFlash. I ricercatori hanno dimostrato che, adattando la strategia di previsione al tipo specifico di testo (chat vs codice) e utilizzando il manager intelligente per regolare il carico di lavoro, potevano ottenere il massimo dalla loro potenza di calcolo. Hanno persino rilasciato l'intero toolkit, chiamato AngelSpec, al pubblico in modo che altri scienziati possano usare questi trucchi per rendere i propri modelli IA più veloci ed efficienti.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →