← Nieuwste papers
💻 computer science

Beyond Prediction: Tail-Aware Scheduling for LLM Inference

Dit artikel introduceert een distributiebewust, voorspellingsvrij scheduling-framework dat gebruikmaakt van soft priority boosting en cache-bewuste preëmptie om de tail latency en time-to-first-token bij LLM-inferentie aanzienlijk te verminderen, waarbij het traditionele voorspellingsgebaseerde beleid overtreft, zelfs onder uitdagende omstandigheden zoals bursty aankomsten en GPU-geheugendruk.

Oorspronkelijke auteurs: Yueying Li, Yuanfan Chen, Jiayang Chen, Esha Choukse, Haoran Qiu, G. Edward Suh, Rodrigo Fonseca, Ziv Scully, Udit Gupta

Gepubliceerd 2026-06-19
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yueying Li, Yuanfan Chen, Jiayang Chen, Esha Choukse, Haoran Qiu, G. Edward Suh, Rodrigo Fonseca, Ziv Scully, Udit Gupta

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een drukke keuken van een restaurant voor waar chefs (de GPU's) maaltijden bereiden voor klanten (de AI-verzoeken). Sommige bestellingen zijn simpel: "Alleen een glas water" (een kort chatbericht). Anderen zijn complex: "Ontwerp een roman van 50 pagina's met een gedetailleerd plot" (een complexe redeneertaak).

Het probleem is dat de keukenmanager niet weet hoe lang een bestelling zal duren totdat deze bijna klaar is. Een "glas water" kan veranderen in een "5-gangen tasting menu" als de klant blijft doorvragen.

De Oude Manier: De Toekomst Raden

Huidige keukenmanagers proberen efficiënt te zijn door te raden hoe lang een bestelling zal duren. Ze gebruiken een strategie die "Shortest Job First" (SJF) wordt genoemd.

  • De Logica: "Ik denk dat deze bestelling snel zal gaan, dus ik bereid hem eerst om hem van de tafel te krijgen."
  • De Fout: Als de manager het fout raadt (wat vaak gebeurt bij complexe AI-taken), wordt de snelle bestelling vertraagd, en eindigt de lange bestelling die eigenlijk "kort" zou moeten zijn alsnog als een eeuwige gast aan het fornuis.
  • Het Resultaat: De gemiddelde wachttijd ziet er oké uit, maar de worst-case wachttijden (de tail latency) zijn verschrikkelijk. Sommige klanten wachten uren terwijl anderen binnen seconden worden bediend. Dit is slecht voor de gebruikerservaring.

De Nieuwe Manier: Het "Boost"-systeem (UNIBOOST)

De auteurs van dit paper stellen een nieuwe manager voor die stopt met raden en begint met observeren. Ze noemen hun systeem UNIBOOST.

Zo werkt het, met behulp van eenvoudige analogieën:

1. De "Soft Boost" (Geen Kristallen Bol Nodig)

In plaats van te proberen de toekomst te voorspellen, geeft de nieuwe manager elke bestelling een "prioriteitsscore" die vloeiend in de loop van de tijd verandert.

  • De Analogie: Stel je een rij mensen voor die wachten op een attractie. De nieuwe manager vraagt niet: "Hoe ver moet jij reizen?" In plaats daarvan zegt hij: "Hoe langer je wacht, hoe meer je ticket een kleine 'boost' in prioriteit krijgt."
  • Hoe het helpt: Korte bestellingen worden snel geserveerd omdat ze als eerste aankomen. Maar als een lange bestelling al een tijdje wacht, krijgt deze een zachte duw naar voren zodat deze niet vast komt te zitten achter een eindeloze stroom nieuwe, korte bestellingen. Dit voorkomt dat de "lange staart" van klanten eeuwig moet wachten.

2. De "Memory Guard" (Verspil de Pan Niet)

In AI vereist het bereiden van een maaltijd veel geheugen (de KV cache). Als je halverwege het koken van een maaltijd stopt om over te schakelen naar een nieuwe, moet je alle ingrediënten die je net hebt voorbereid weggooien en opnieuw beginnen. Dit is duur en traag.

  • De Analogie: Stel je voor dat een chef halverwege het bakken is van een enorme taart. Als de manager roept: "Stop! Bak eerst een koekje in plaats daarvan!", dan moet de chef het beslag uit de pan schrapen, de pan afwassen en de koekjes beginnen. En als ze daarna weer terugschakelen, moeten ze de pan weer afwassen.
  • De Oplossing: De nieuwe manager gebruikt een "Memory Guard". Ze zeggen: "Zodra je begint met het bakken van een taart, moet je ten minste een 'plakje' ervan afmaken voordat we zelfs maar overwegen om te wisselen." Dit voorkomt dat de keuken constant van taak wisselt en tijd verspilt aan het schoonmaken van pannen.

3. De "Adaptieve Thermostaat"

De omstandigheden in de keuken veranderen. Soms is er een stormloop van kleine bestellingen; andere keren zijn er een paar enorme bestellingen.

  • De Analogie: De manager heeft een slimme thermostaat die observeert hoe lang mensen daadwerkelijk wachten. Als de rij te lang wordt, past de manager de "boost"-instellingen automatisch aan om agressiever te helpen bij de mensen die het langst wachten. Het leert on the fly zonder dat er een kristallen bol nodig is.

De Resultaten

Het paper testte dit nieuwe systeem tegenover de oude "radende" systemen met echte data (zoals programmeertaken en chatgesprekken).

  • De Oude Systemen: Wanneer de werklast chaotisch werd (bursty), faalden de "radende" systemen. De worst-case wachttijden (P99) werden enorm.
  • Het Nieuwe Systeem (UNIBOOST): Het verbeterde niet alleen de gemiddelde wachttijd, maar verkortte ook drastisch de slechtste wachttijden (P99).
    • Het verminderde de worst-case wachttijd (P99) met 35% tot 50% vergeleken met de beste "perfecte voorspellings"-systemen.
    • Het maakte de eerste token (TTFT) 34% tot 47% sneller.

De Kern van het Verhaal

Het paper betoogt dat proberen te voorspellen hoe lang een AI-taak zal duren fragiel is en vaak fout gaat. In plaats daarvan creëert een systeem dat reageert op hoe lang taken aan het wachten zijn, terwijl het voorzichtig is om geen geheugen te verspillen door te vaak van taak te wisselen, een veel eerlijkere en snellere ervaring voor iedereen. Het gaat om het beheren van de doorstroom van de rij, niet om het raden van de bestemming.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →