← Ultimi articoli
💻 computer science

Observation, Not Prediction: Conversation-Level Disaggregated Scheduling for Agentic Serving

Il documento introduce ConServe, un framework di scheduling che sposta l'unità di scheduling dai singoli turni all'intera conversazione per eliminare la necessità di prevedere costi futuri ignoti, riducendo così la latenza e migliorando l'efficienza energetica sfruttando una struttura stabile in due fasi di prefill limitato dal calcolo e decoding limitato dalla memoria.

Autori originali: Jianru Ding, Ryien Hosseini, Pouya Mahdi Gholami, Mingyuan Xiang, Henry Hoffmann

Pubblicato 2026-06-02
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Jianru Ding, Ryien Hosseini, Pouya Mahdi Gholami, Mingyuan Xiang, Henry Hoffmann

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di gestire la cucina di un ristorante molto affollato. Un tempo, ogni ordine era semplice: un cliente entra, tu cucini il pasto e loro se ne vanno. Potevi gestire facilmente la cucina perché ogni ordine richiedeva all'incirca lo stesso tempo e sforzo.

Ma ora, immagina che i tuoi clienti siano "Agenti AI". Non si limitano a ordinare un pasto; iniziano un progetto complesso.

  1. Il Primo Turno (Il Grande Brief): Il cliente si siede e ti consegna un enorme manuale di istruzioni di 50 pagine. Questo richiede molto tempo per essere letto e compreso (il "Prefill").
  2. I Turni Intermedi (Le Chiamate agli Strumenti): Lo chef inizia a cucinare, poi si ferma per chiamare un fornitore, aspettare una risposta, controllare una ricetta e richiamare. Questi passaggi sono brevi, ma accadono continuamente.
  3. Il Turno Finale (Il Risultato): Finalmente, il piatto è pronto per essere servito.

Il Probleo: Il Vecchio Modo di Gestire (Scheduling)

Gli attuali gestori di cucina (sistemi AI) trattano ogni singolo passaggio come un ordine separato. Ogni volta che lo chef si ferma per chiamare un fornitore, il gestore deve decidere: "Lascio che lo chef completi questo passaggio proprio qui nella cucina principale, o lo invio a una stazione diversa e specializzata?"

Il problema è che il gestore deve indovinare quanto tempo richiederà quel passaggio o quanta memoria richiederà prima che accada. Se sbaglia la previsione, invia il passaggio alla stazione sbagliata, causando un ingorgo. È come un vigile urbano che cerca di dirigere le auto cercando di prevedere esattamente quanto velocemente guideranno prima ancora che partano.

La Soluzione: ConServe (L'Approccio a Livello di Conversazione)

Il documento introduce un nuovo sistema chiamato ConServe. Invece di gestire ogni singolo passaggio separatamente, ConServe gestisce l'intera conversazione come un'unica unità.

Ecco come ConServe cambia le regole utilizzando un piano in due fasi:

Fase 1: Il Lavoro Pesante (Il Prefill)
Quando il cliente arriva con quel manuale di 50 pagine, ConServe lo invia immediatamente a una stazione super veloce e ad alta potenza (una GPU potente). Questa stazione è costruita appositamente per leggere documenti enormi rapidamente. Legge il manuale, comprende il contesto e crea una "mappa della memoria" (chiamata KV cache) di tutto ciò che è necessario.

Fase 2: La Coda Lunga (Il Resto della Conversazione)
Una volta creata quella mappa iniziale, ConServe dice: "Ok, il lavoro pesante è finito. Ora, questa intera conversazione appartiene a una specifica stazione più piccola ed efficiente dal punto di vista energetico."

  • La "mappa della memoria" viene spostata esattamente una volta in questa nuova stazione.
  • Da quel momento in poi, ogni singolo passaggio successivo (le chiamate agli strumenti, gli aggiornamenti brevi) avviene proprio lì, sulla stessa stazione.
  • Il sistema non deve più indovinare nulla. Non importa se il passaggio successivo è breve o lungo; la conversazione rimane ancorata a quella singola stazione finché il lavoro non è terminato.

Perché è Meglio (L'Analogia)

Pensa a un camion per le consegne:

  • Il Vecchio Modo: Cerchi di prevedere se il prossimo pacco sia pesante o leggero. Se sbagli la previsione, mandi un camion piccolo per un carico pesante, o un camion grande per un pacco minuscolo. Sprechi carburante e tempo.
  • ConServe: Carichi il camion una volta all'inizio. Guidi il camion verso la destinazione e lo parcheggi lì. Tutti i pacchi successivi per quel cliente specifico vengono caricati sullo stesso camion. Non hai bisogno di prevedere il peso del prossimo pacco; devi solo far funzionare il camion in modo efficiente.

I Risultati

Il documento ha testato questo sistema su carichi di lavoro reali di agenti AI e ha scoperto che:

  1. Velocità: Ha ridotto il tempo necessario affinché il cliente veda il primo vero risultato (non solo una chiamata allo strumento) del 51%. È come ricevere il cibo il 50% più velocemente perché la cucina non è confusa su dove mettere gli ingredienti.
  2. Efficienza: Ha risparmiato il 7,5% di energia. Usando una stazione potente solo per la grande lettura iniziale e una stazione più economica per il resto, spreca meno elettricità.
  3. Affidabilità: Poiché il sistema non deve indovinare (prevedere) cosa accadrà dopo, non commette mai errori di "svolta errata". I vecchi sistemi si bloccavano o rallentavano se le loro previsioni erano errate; ConServe continua semplicemente a procedere perché si basa su ciò che può effettivamente vedere in quel momento.

In breve: ConServe smette di cercare di prevedere il futuro di ogni minuscolo passaggio in una conversazione AI. Inveve, tratta l'intera conversazione come un unico lavoro, gestisce l'inizio pesante con un motore potente e lascia che un motore costante ed efficiente completi il resto.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →