← Nieuwste papers
💻 computer science

Continuum: Efficient and Robust Multi-Turn LLM Agent Scheduling with KV Cache Time-to-Live

Het artikel introduceert CacheTTL, een nieuw KV-cachebeheersysteem dat een dynamische time-to-live-mechanisme toepast om de cache selectief te behouden tijdens tool-call-pauzes in multi-turn LLM-agentworkflows, waardoor een verbetering van meer dan 8x in de voltooiingstijd van taken en een verhoogde doorvoer worden bereikt in vergelijking met bestaande evictiebeleid.

Oorspronkelijke auteurs: Hanchen Li, Runyuan He, Qiuyang Mang, Qizheng Zhang, Huanzhi Mao, Xiaokun Chen, Hangrui Zhou, Alvin Cheung, Joseph Gonzalez, Ion Stoica

Gepubliceerd 2026-05-06
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Hanchen Li, Runyuan He, Qiuyang Mang, Qizheng Zhang, Huanzhi Mao, Xiaokun Chen, Hangrui Zhou, Alvin Cheung, Joseph Gonzalez, Ion Stoica

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een uiterst efficiënte, supersnelle keuken runt waar een meesterkok (de AI) complexe maaltijden voor veel klanten tegelijk bereidt.

Het Probleem: De "Stop-en-Start" Keuken

In een normale AI-chatbot kookt de kok een gerecht, serveert het, en begint dan direct met de volgende. Als de keuken vol raakt, gooit de kok de halfvoorbereide ingrediënten voor het huidige gerecht weg om ruimte te maken voor de bestelling van een nieuwe klant. Dit werkt prima voor simpele chats.

Maar moderne AI-"agenten" zijn anders. Ze chatten niet alleen; ze handelen. Ze denken, roepen dan een hulpmiddel aan (zoals het weer controleren of het web doorzoeken), wachten op het resultaat, en dan gaan ze verder met het koken van dezelfde maaltijd.

Hier zit de glitch in huidige systemen:

  1. De kok begint met het koken van een maaltijd.
  2. De kok pauzeert om een hulpmiddel aan te roepen (bijv. "Controleer het weer").
  3. Omdat de kok "gepauzeerd" is, gaat het keukensysteem ervan uit dat de bestelling voltooid is. Het gooit de halfvoorbereide ingrediënten (de KV Cache) weg om ruimte te maken voor andere bestellingen.
  4. Het hulpmiddel is binnen 2 seconden klaar. De kok is klaar om door te gaan.
  5. Ramp: De ingrediënten zijn weg! De kok moet ze óf opnieuw kopen bij een ver magazijn (CPU offloading) óf alles opnieuw hakken (herberekening).
  6. Erger nog, omdat de ingrediënten zijn weggegooid, moet de kok in de rij wachten achter andere klanten om weer een plekje op het snijbord te krijgen.

Dit gebeurt keer op keer. Als een agent 20 stappen nodig heeft om een probleem op te lossen, kan het 20 keer werk verspillen door dingen opnieuw te doen en in de rij te wachten.

De Oplossing: CacheTTL (De "Hou-Klaar" Timer)

De onderzoekers bouwden een nieuw systeem genaamd CacheTTL. Denk hierbij aan het geven van een speciale "Hou-Klaar" timer aan de kok voor elke bestelling.

In plaats van direct de ingrediënten weg te gooien wanneer de kok pauzeert om een hulpmiddel aan te roepen, zegt het systeem: "Wacht! Deze kok is misschien binnen 2 seconden terug. Laten we de ingrediënten voor een specifieke tijd (Time-To-Live, of TTL) op het aanrecht houden."

Zo werkt het simpelweg:

  1. Slimme Voorspelling: Het systeem kijkt naar de geschiedenis. "Meestal duurt het ongeveer 2 seconden als de kok 'Controleer het weer' aanroept. Als ze 'Zoek het web' aanroepen, duurt het 5 seconden."
  2. De Timer: Het stelt een timer in op basis van die voorspelling. Als de hulpmiddeloproep naar verwachting 2 seconden duurt, blijven de ingrediënten 2,5 seconden op het aanrecht liggen.
  3. De Opbrengst:
    • Als de kok op tijd terugkeert: De ingrediënten zijn er nog! De kok pikt precies op waar hij/zij gebleven was. Geen opnieuw hakken, geen wachten in de rij.
    • Als de kok te laat is: Als het hulpmiddel 10 seconden duurt in plaats van 2, loopt de timer af. Het systeem gooit de ingrediënten veilig weg om ruimte te maken voor andere klanten, waardoor wordt voorkomen dat de keuken verstopt raakt.

Waarom is dit beter dan wat we eerder hadden?

Vorige systemen probeerden te raden of ze de ingrediënten moesten houden, maar ze keken slechts naar één ding: "Is het duur om de ingrediënten opnieuw te kopen?" Ze negeerden het grotere probleem: "Hoe lang moet de kok in de rij wachten om weer aan het werk te gaan?"

CacheTTL kijkt naar beide:

  • De kosten van het opnieuw maken van het eten.
  • De kosten van het wachten in de rij (wachttijd).

Het berekent de perfecte hoeveelheid tijd om de ingrediënten op het aanrecht te houden om in totaal de meeste tijd te besparen.

De Resultaten

De onderzoekers testten dit met real-world AI-agenten die softwarebugs oplossen, het web doorzoeken en code schrijven. Ze ontdekten dat:

  • Snelheid: De agenten hun taken in sommige real-world tests tot 8 keer sneller afrondden.
  • Efficiëntie: De keuken (GPU) kon meer bestellingen tegelijk afhandelen zonder vast te lopen.
  • Robuustheid: Zelfs als de hulpmiddeloproepen langer duurden dan verwacht, crashte het systeem niet of liep het vast; het liet de timer gewoon aflopen en ging verder.

In het Kort

CacheTTL is als een slimme keukenmanager die weet dat wanneer een kok pauzeert om een telefoontje te plegen, deze niet klaar is met koken. Door de ingrediënten precies de juiste hoeveelheid tijd klaar te houden, voorkomt het dat de kok opnieuw moet beginnen of in de rij moet wachten, waardoor de hele keuken veel soepeler en sneller loopt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →