← Ultimi articoli
🤖 AI

HeraSys: Collaborative Serving of Multiple LLM Workflows via Fine-Grained End-to-End Optimization

HeraSys è un sistema di serving per LLM che ottimizza le prestazioni end-to-end di workflow multi-tenant concorrenti eliminando la ridondanza computazionale tra i workflow attraverso la fusione strutturale dei nodi e impiegando una politica di scheduling congiunto consapevole del carico per ridurre significativamente la latenza della coda e aumentare il throughput.

Autori originali: Size Li, Zhiqing Tang, Hongrui Liang, Jianxiong Guo, Jiong Lou, Tian Wang, Weijia Jia

Pubblicato 2026-07-28
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Size Li, Zhiqing Tang, Hongrui Liang, Jianxiong Guo, Jiong Lou, Tian Wang, Weijia Jia

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immaginate una cucina frenetica dove un team di chef sta cercando di cucinare centinaia di pasti complessi contemporaneamente. Nel mondo dell'Intelligenza Artificiale, questi "pasti" sono i compiti eseguiti dai Large Language Models (LLM) — quei cervelli informatici super intelligenti che scrivono storie, rispondono a domande e risolvono problemi. Di solito, quando chiedete a un'IA di fare qualcosa, viene trattata come un ordine singolo e isolato. Ma nel mondo reale, le applicazioni stanno diventando più simili a elaborati banchetti: una singola richiesta potrebbe comportare la ricerca di informazioni, il controllo di un database e poi la scrittura di un riassunto, tutto in un colpo solo. Questi sono chiamati "workflow" (flussi di lavoro).

Il problema è che quando molte persone ordinano questi banchetti complessi contemporaneamente, la cucina diventa caotica. Se due clienti chiedono lo stesso ingrediente sminuzzato, la cucina potrebbe sminuzzarlo due volte, sprecando tempo ed energia. Peggio ancora, se un cliente ordina uno stufato massiccio e a cottura lenta, gli chef potrebbero rimanere bloccati su di esso, lasciando tutti gli altri in attesa che le loro insalate veloci vengano servite. Questa è la sfida del "servizio" dell'IA: come si gestisce un'ondata di richieste complesse e sovrapposte senza che il sistema si blocchi o lasci alcune persone in attesa per sempre?

È qui che entra in gioco un nuovo sistema chiamato HeraSys. Pensate a HeraSys come a un rivoluzionario manager di cucina che non si limita a guardare un ordine alla volta, ma osserva l'intero piano della cucina per vedere come i diversi ordini possano aiutarsi a vicenda. Invece di trattare ogni richiesta come un'isola separata, HeraSys cerca le sovrapposizioni. Se due clienti diversi hanno bisogno che lo stesso documento venga analizzato o che venga usato lo stesso strumento, HeraSys dice: "Ehi, facciamolo una volta sola e condividiamo il risultato!". Agisce anche come un vigile urbano, assicurandosi che gli ordini rapidi e semplici non rimangano bloccati dietro quelli lenti e pesanti, e che quelli lenti non vengano privati dell'attenzione necessaria.

I ricercatori dietro HeraSys hanno costruito un sistema che scompone questi complessi compiti dell'IA in pezzi minuscoli e granulari. Hanno scoperto che, fondendo i passaggi duplicati e pianificando in modo intelligente chi riceve le risorse della cucina (come i potenti chip informatici), potevano rendere l'intero sistema molto più veloce. Nei loro test, hanno dimostrato che HeraSys poteva ridurre il tempo necessario per completare le richieste più lente fino a 2,17 volte (il che significa che erano più del doppio più veloci) e ha aumentato il numero totale di compiti che il sistema può gestire fino a 1,85 volte rispetto ai migliori sistemi esistenti.

Il documento argomenta contro il vecchio modo di fare le cose, in cui i sistemi trattano ogni richiesta come un lavoro indipendente e isolato. Dimostrano che questo "isolamento" crea sprechi e colli di bottiglia inutili. Al contrario, propongono un approccio collaborativo in cui il sistema cerca attivamente il lavoro condiviso. Argomentano inoltre contro semplici regole di pianificazione come "il primo che arriva, serve per primo", che possono causare il blocco di tutti gli altri da parte dei compiti lunghi, o "il lavoro più breve per primo", che può far attendere i compiti lunghi per sempre. HeraSys suggerisce una strategia bilanciata e "consapevole del carico" (load-aware), che riserva alcune risorse per i compiti pesanti pur dando la priorità a quelli rapidi, garantendo equità e velocità per tutti.

I risultati, misurati attraverso estesi esperimenti su hardware reale, suggeriscono che questo approccio granulare e collaborativo è un passo avanti significativo. Fondendo i passaggi ridondanti e regolando dinamicamente come i compiti vengono raggruppati ed eseguiti, HeraSys riesce a mantenere basso il tempo di attesa medio e a prevenire la "coda" di ritardi lenti e frustranti che spesso affliggono i sistemi IA complessi. È un po' come rendersi conto che, se si organizza un gruppo di amici per pulire una casa, non si dovrebbe solo assegnare a ciascuno una stanza; si dovrebbe notare che due persone stanno aspirando lo stesso corridoio e farle lavorare insieme, assicurandosi al contempo che la persona che lava i vetri non rimanga in attesa dell'aspirapolvere.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →