← Ultimi articoli
🤖 AI

Learning Agent Execution for KV-Cache Management in Agentic Serving

Questo articolo introduce CacheScout, un runtime della cache KV consapevole dell'agente che apprende online le transizioni di esecuzione degli agenti per gestire proattivamente l'evizione e il prefetching della cache, migliorando significativamente i tassi di hit e riducendo la latenza per il serving di LLM multi-agente senza richiedere grafi di workflow predefiniti.

Autori originali: Rui Zhang, Chaeeun Kim, Shaoting Feng, Kuntai Du, Yuhan Liu, Yi Zhong, Cheng-Wei Ching, Junchen Jiang, Liting Hu

Pubblicato 2026-08-18
📖 6 min di lettura🧠 Approfondimento

Autori originali: Rui Zhang, Chaeeun Kim, Shaoting Feng, Kuntai Du, Yuhan Liu, Yi Zhong, Cheng-Wei Ching, Junchen Jiang, Liting Hu

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Nel mondo moderno dell'intelligenza artificiale, un nuovo modo di costruire assistenti intelligenti ha preso il sopravvento. Invece di chiedere a un singolo cervello informatico onnisciente di risolvere un problema complesso in un colpo solo, gli sviluppatori ora suddividono i compiti in una squadra di lavoratori digitali specializzati. Immaginate un pianificatore di viaggi che prima chiede a un agente di trovare voli, poi affida il lavoro a un altro agente per prenotare hotel e infine lo passa a un terzo per localizzare ristoranti. Ognuno di questi agenti è un modello linguistico di grandi dimensioni, un tipo di software che prevede la parola successiva in una frase basandosi su schemi appresi. Per fare ciò, il software deve mantenere una vasta quantità di informazioni nella sua memoria a breve termine, nota come cache key-value. Questa memoria funge da spazio di lavoro dove il modello conserva le regole del gioco, le definizioni degli strumenti che può usare e gli esempi di come comportarsi. Ogni volta che un nuovo agente si unisce alla conversazione, porta con sé il proprio insieme di istruzioni ed esempi, creando un grande blocco di dati che il sistema deve elaborare prima di poter iniziare a rispondere alla domanda specifica dell'utente.

La sfida sorge perché queste squadre digitali sono dinamiche. Il primo agente potrebbe finire il suo compito e il sistema potrebbe immediatamente passare a un agente completamente diverso, oppure potrebbe tornare al primo più tardi. Gli attuali sistemi informatici che gestiscono queste squadre di IA gestiscono la loro memoria in modo reattivo. Mantengono le informazioni utilizzate più di recente e scartano quelle più vecchie per fare spazio a nuove richieste. Questo funziona bene per conversazioni semplici, ma in una squadra multi-agente, crea un'inefficienza frustrante. Il sistema spesso scarta le istruzioni fisse e gli esempi per un agente solo perché quell'agente non ha parlato negli ultimi secondi, anche se lo stesso agente è probabile che venga chiamato di nuovo nel passaggio successivo. Quando l'agente ritorna, il sistema deve rileggere e rielaborare tutte quelle istruzioni da zero, sprecando tempo e potenza di calcolo. Questo ciclo di scarto e riapprendimento rallenta l'intera operazione, rendendo l'IA lenta e costosa da gestire.

I ricercatori dell'Università della California, Santa Cruz, e di altre istituzioni hanno sviluppato un nuovo approccio per risolvere questo problema, chiamato CacheScout. Invece di limitarsi a osservare ciò che è accaduto in passato, questo sistema impara ad anticipare ciò che accadrà dopo. Tratta il flusso della conversazione non come una serie casuale di eventi, ma come un modello di transizioni tra diversi lavoratori. Osservando quanto spesso un agente di viaggi è seguito da un agente alberghiero, o come un agente di programmazione possa passare a un agente di revisione, il sistema costruisce una mappa mentale del flusso di lavoro mentre lo esegca. Non ha bisogno di uno script predefinito o di una mappa fornita dagli sviluppatori; impara queste connessioni al volo, aggiornando la propria comprensione con ogni singola richiesta che elabora.

Il cuore di questo nuovo sistema è uno strato leggero che si posiziona tra gli agenti IA e l'hardware del computer. Quando un agente termina il suo compito, questo strato guarda la cronologia della conversazione e prevede quale agente è più probabile che parli successivamente. Se il sistema è fiducioso sul passaggio successivo, compie due azioni specifiche per velocizzare le cose. Primo, quando deve liberare vecchi dati per fare spazio, rifiuta di eliminare le istruzioni per l'agente che si prevede tornerà presto, anche se quell'agente non parla da un po'. Protegge questi preziosi blocchi di memoria basandosi sulla loro importanza futura piuttosto che sul loro utilizzo passato. Secondo, mentre il sistema è in attesa della richiesta successiva, prepara silenziosamente e invisibilmente la memoria per quel previsto agente. Carica le istruzioni necessarie nella memoria veloce prima ancora che l'utente le richieda, in modo che quando l'agente inizia finalmente a lavorare, possa cominciare immediatamente senza ritardi.

I ricercatori hanno testato questo sistema su compiti del mondo reale, inclusi la pianificazione di viaggi, la risoluzione di problemi matematici e la scrittura di codice software. Hanno scoperto che, ricordando i modelli di comportamento degli agenti, il sistema riesce a mantenere le informazioni giuste in memoria molto più spesso rispetto a prima. Nei loro test, il tasso con cui il sistema riutilizza con successo la memoria esistente è aumentato di dieci o diciotto punti percentuali. Questo miglioramento si è tradotto direttamente in velocità. Il tempo necessario affinché la prima parola di una risposta appaia è diminuito di ben il quaranta e cinque per cento, e il tempo complessivo per completare un singolo turno di conversazione è sceso di quasi il quaranta per cento. Il sistema ha anche gestito più richieste contemporaneamente, aumentando il numero totale di compiti che può completare al secondo fino al cinquantasette per cento.

Fondamentalmente, i ricercatori hanno dimostrato che questo approccio funziona anche quando il flusso di lavoro non è fisso. In molte applicazioni moderne, il passaggio successivo è deciso dall'IA stessa in tempo reale, il che significa che il percorso può cambiare in modo imprevedibile. Il nuovo sistema si adatta a questa fluidità, imparando i percorsi più comuni man mano che avvengono e regolando le proprie previsioni di conseguenza. Si è anche dimostrato efficace con modelli IA molto più grandi e complessi, mantenendo i propri vantaggi di velocità anche quando i requisiti di memoria erano significativamente più elevati. Il sistema ottiene tutto questo senza rallentare il computer o richiedere nuovi hardware complessi; aggiunge semplicemente una piccola quantità di intelligenza al processo di gestione della memoria, trasformando un sistema di archiviazione passivo in un partecipante attivo che sa cosa sta per arrivare.

Le scoperte suggeriscono che il futuro dell'efficienza nell'erogazione dell'IA risiede nel comprendere il contesto del lavoro, non solo i dati stessi. Riconoscendo che un agente di viaggi è probabilmente seguito da un agente alberghiero, il sistema smette di trattare ogni momento come un nuovo inizio e inizia a vedere la conversazione come un viaggio continuo. Questo passaggio dal reagire al passato al prepararsi per il futuro permette a queste squadre digitali di lavorare molto più velocemente ed efficientemente, rimuovendo i colli di bottiglia che hanno rallentato l'implementazione di complesse applicazioni di IA. Il risultato è un sistema che appare più reattivo e capace, in grado di gestire i compiti intricati e multi-step che definiscono la prossima generazione di servizi di intelligenza artificiale.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →