← Nieuwste papers
💻 computer science

Observation, Not Prediction: Conversation-Level Disaggregated Scheduling for Agentic Serving

Het artikel introduceert ConServe, een schedulingframework dat de scheduling-eenheid verschuift van individuele beurten naar volledige gesprekken om de noodzaak om onbekende toekomstige kosten te voorspellen te elimineren, waardoor de latentie wordt verminderd en de energie-efficiëntie wordt verbeterd door gebruik te maken van een stabiele tweefasige structuur van compute-gebonden prefill en memory-gebonden decoding.

Oorspronkelijke auteurs: Jianru Ding, Ryien Hosseini, Pouya Mahdi Gholami, Mingyuan Xiang, Henry Hoffmann

Gepubliceerd 2026-06-02
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Jianru Ding, Ryien Hosseini, Pouya Mahdi Gholami, Mingyuan Xiang, Henry Hoffmann

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een drukke restaurantkeuken runt. In de oude dagen was elke bestelling simpel: een klant komt binnen, jij bereidt de maaltijd, en ze gaan weer weg. Je kon de keuken gemakkelijk beheren omdat elke bestelling ongeveer evenveel tijd en moeite kostte.

Maar nu, stel je voor dat je klanten "AI Agents" zijn. Ze bestellen niet alleen een maaltijd; ze starten een complex project.

  1. De Eerste Beurt (De Grote Briefing): De klant komt binnen en geeft je een enorme instructiehandleiding van 50 pagina's. Dit kost veel tijd om te lezen en te begrijpen (de "Prefill").
  2. De Tussenliggende Beurten (De Tool Calls): De chef begint te koken, maar stopt dan om een leverancier te bellen, te wachten op antwoord, een recept te controlen en weer terug te bellen. Deze stappen zijn kort, maar ze gebeuren steeds opnieuw.
  3. De Laatste Beurt (Het Resultaat): Eindelijk is het gerecht klaar om te serveren.

Het Probleem: De Oude Manier van Plannen

Huidige keukenmanagers (AI-systemen) behandelen elke individuele stap als een aparte bestelling. Elke keer dat de chef stopt om een leverancier te bellen, moet de manager beslissen: "Laat ik de chef deze stap hier in de hoofdkeuken afmaken, of stuur ik deze specifieke stap naar een andere, gespecialiseerde werkplek?"

Het probleem is dat de manager moet raden hoe lang die stap zal duren of hoeveel geheugen deze zal nodig hebben voordat het gebeurt. Als ze het fout raden, sturen ze de stap naar de verkeerde werkplek, wat voor een verkeersopstopping zorgt. Het is alsoer een verkeersregelaar die probeert auto's te dirigeren door precies te voorspellen hoe snel elke bestuurder zal rijden voordat ze zelfs maar begonnen zijn.

De Oplossing: ConServe (De Aanpak op Conversatieniveau)

De paper introduceert een nieuw systeem genaamd ConServe. In plaats van elke stap afzonderlijk te beheren, beheert ConServe de volledige conversatie als één enkele eenheid.

Hier is hoe ConServe de regels verandert met een eenvoudig tweefasig plan:

Fase 1: Het Zware Werk (De Prefill)
Wanneer de klant voor het eerst arriveert met die 50-pagina tellende handleiding, stuurt ConServe hen onmiddellijk naar een supersnelle, krachtige werkplek (een krachtige GPU). Deze werkplek is specifweg gebouwd om enorme documenten snel te lezen. Het leest de handleiding, begrijpt de context en creëert een "geheugenkaart" (een zogenaamde KV cache) van alles wat nodig is.

Fase 2: De Lange Staart (De Rest van de Conversatie)
Zodra die initiële kaart is gemaakt, zegt ConServe: "Oké, het zware werk is gedaan. Nu hoort deze hele conversatie bij één specifieke, kleinere, energiezuinige werkplek."

  • De "geheugenkaart" wordt precies één keer verplaatst naar deze nieuwe werkplek.
  • Vanaf dat moment vindt elke volgende stap (de tool calls, de korte updates) plaats op diezelfde werkplek.
  • Het systeem hoeft nooit meer te raden. Het maakt niet uit of de volgende stap kort of lang is; de conversatie blijft aan die ene werkplek gekoppeld totdat de taak voltooid is.

Waarom dit Beter is (De Analogie)

Denk aan een bezorgwagen:

  • De Oude Manier: Je probeert te voorspellen of het volgende pakketje zwaar of licht is. Als je het fout raadt, stuur je een kleine wagen voor een zware lading, of een grote wagen voor een klein pakketje. Je verspilt brandstof en tijd.
  • ConServe: Je laadt de wagen één keer aan het begin. Je rijdt de wagen naar de bestemming en parkeert hem daar. Alle daaropvolgende pakketjes voor die specifieke klant worden op die zelfde wagen geladen. Je hoeft niet te voorspellen wat het gewicht van het volgende pakketje is; je houdt de wagen gewoon efficiënt draaiende.

De Resultaten

De paper heeft dit getest op echte AI-agent workloads en vond:

  1. Snelheid: Het verminderde de tijd die het kost voordat de klant het eerste echte resultaat ziet (niet alleen een tool call) met 51%. Het is alsof je eten 50% sneller krijgt omdat de keuken niet in de war is over waar de ingrediënten moeten worden geplaatst.
  2. Efficiëntie: Het bespaarde 7,5% energie. Door een krachtige werkplek alleen te gebruiken voor het zware eerste lezen en een goedkopere werkplek voor de rest, wordt er minder elektriciteit verspild.
  3. Betrouwbaarheid: Omdat het systeem niet hoeft te raden (voorspellen) wat er hierna gebeurt, maakt het nooit "foute afslag"-fouten. De oude systemen zouden vastlopen of vertragen als hun voorspellingen niet klopten; ConServe gaat gewoon door omdat het vertrouwt op wat het op dat moment daadwerkelijk kan zien.

Kortom: ConServe stopt met het proberen te voorspellen van de toekomst van elke kleine stap in een AI-conversatie. In plaats daarvan behandelt het de hele conversatie als één taak, handelt het zware begin af met een krachtige motor, en laat het een stabiele, efficiënte motor de rest voltooien.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →