← Nieuwste papers
🤖 machine learning

Breaking the Ice: Analyzing Cold Start Latency in vLLM

Dit artikel presenteert de eerste systematische analyse van de cold start-latentie van vLLM, waarbij wordt vastgesteld dat deze voornamelijk CPU-gebonden is via een zesstaps-analyse, en maakt gebruik van deze inzichten om een accuraat analytisch model te creëren voor het voorspellen van opstarttijden ter ondersteuning van resourceplanning in grootschalige inferentieomgevingen.

Oorspronkelijke auteurs: Huzaifa Shaaban Kabakibo, Animesh Trivedi, Lin Wang

Gepubliceerd 2026-06-08
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Huzaifa Shaaban Kabakibo, Animesh Trivedi, Lin Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een high-tech, supersnelle restaurantkeuken hebt (vLLM) die ontworpen is om antwoorden te bereiden voor een gigantische AI-chef (een Large Language Model). Wanneer het restaurant al open is en de chefs klaarstaan, is het serveren van een klant direct. Maar wat gebeurt er wanneer de keuken de hele nacht gesloten is geweest en er een klant binnenloopt? Dat moment van het wakker maken van de keuken, het aanzetten van de ovens en het gereedmaken van de ingrediënten wordt de "Cold Start" genoemd.

Dit paper is als een detectiveverhaal waarin de auteurs precies ontleden wat er tijdens die "wakker worden"-fase gebeurt om te achterhalen waarom het soms zo lang duurt.

Hier is de uitsplitsing van hun bevindingen in eenvoudige termen:

De Grote Verrassing: Het is niet de Oven, het is de Chef

Je zou kunnen denken dat omdat deze AI-modellen enorm groot zijn en draaien op krachtige grafische kaarten (GPU's), de "cold start"-vertraging komt doordat de GPU's traag opwarmen.

De belangrijkste ontdekking van het paper is het tegenovergestelde: De vertraging wordt bijna volledig veroorzaakt door de CPU (het hoofdbrein van de computer), en niet door de luxe GPU (de oven).

  • De Analogie: Stel je een meesterchef voor (de GPU) die groenten in een milliseconde kan snijden. Maar voordat de chef kan beginnen, moet een trage, overwerkte manager (de CPU) de achterdeur ontgrendelen, het receptenboek vinden, de instructies lezen en de snijplank klaarmaken. Hoe snel de chef ook is, hij moet wachten op de manager. Het paper ontdekte dat 80% van de wachttijd wordt besteed aan het papierwerk van de manager, en niet aan het koken door de chef.

De Zes Stappen van het "Wakker Worden"

De auteurs hebben het opstartproces onderverdeeld in zes duidelijke stappen, als een checklist voor het openen van het restaurant:

  1. Het Personeel Wakker Maken (Framework Bootstrapping): Het systeem zet de lichten aan en krijgt de basissoftware draaiende. Dit kost een vaste hoeveelheid tijd, ongeacht hoe groot de menukaart is.
  2. Het Woordenboek Lezen (Tokenizer Initialization): De AI moet leren hoe het menselijke woorden kan omzetten in getallen die het begrijpt. Hoe groter het woordenboek (vocabulaire), hoe langer het duurt om het te lezen. Het is een rechte lijn: groter woordenboek = langere wachttijd.
  3. De Ingrediënten Uitpakken (Model Loading): Dit is het moment waarop het eigenlijke AI-model (het recept) van de harde schijf naar het geheugen wordt geladen.
    • Bevinding: Als je een groter model hebt, duurt het langer om te laden, net zoals het verplaatsen van een grotere bank meer tijd kost.
    • Verrassing: Als je laadt vanaf een super snelle SSD (een snelle bezorgwagen), gaat het sneller, maar dat bespaart slechts een fractie van de totale tijd omdat deze stap niet de grootste bottleneck is.
  4. Het Recept Vertalen (Torch Compilation): Het systeem vertaalt het recept naar een super efficiënt formaat dat de GPU later direct kan begrijpen. Dit is als een vertaler die een complex boek herschrijft naar een simpel stripverhaal.
    • Bevinding: Hoe complexer het recept (meer lagen in het model), hoe langer de vertaler erover doet.
  5. De Pan Meten (KV Cache Profiling): Het systeem voert een "dummy"-test uit om te zien hoeveel geheugen het nodig heeft om de gesprekshistorie op te slaan.
    • Bevinding: Dit duurt iets langer voor grotere modellen, maar het is grotendeels een snelle berekening.
  6. De Bewegingen Registreren (CUDA Graph Capturing): Het systeem legt de exacte volgorde van bewegingen vast die de GPU zal maken, zodat hij er later niet meer over na hoeft te denken.
    • Bevinding: Dit duurt langer als het model enorm groot is of als het restaurant veel klanten tegelijk verwacht (batch size).

De "Hardware" Test

De auteurs hebben deze keuken getest met verschillende apparatuur:

  • Verschillende Ovens (GPU's): Ze probeerden een super dure oven (H100) en een iets goedkopere (L40S). Resultaat: De dure oven maakte het "wakker worden"-proces niet sneller. De manager (CPU) bleef de bottleneck.
  • Verschillende Managers (CPU's): Ze vervingen de manager door een snellere versie. Resultaat: De keuken werd merkbaar sneller wakker. Dit bewijst dat de CPU de werkelijke snelheidslimiet is.

De "Kristallen Bol" (Predictor)

Omdat ze precies begrepen hoe elke stap werkte, hebben de auteurs een voorspeller (een wiskundige formule) gebouwd.

  • Hoe het werkt: Als je de voorspeller vertelt: "Ik heb een model van deze grootte, draaiend op deze specifieke computer," kan hij precies voorspellen hoeveel seconden de cold start zal duren.
  • Waarom het belangrijk is: Het is als een weersverwachting voor de opening van je restaurant. Als je weet dat het 20 seconden gaat duren om wakker te worden, kun je je personeel en middelen beter plannen, in plaats van te gokken terwijl klanten in het donker moeten wachten.

Samenvatting

Het paper concludeert dat om AI-diensten sneller te laten starten, we niet alleen snellere grafische kaarten moeten kopen. In plaats daarvan moeten we het CPU-werk optimaliseren dat plaatsvindt voordat de AI überhaupt begint met denken. Ze hebben ook een hulpmiddel geleverd om precies te voorspellen hoe lang deze wachttijd zal zijn, wat cloudproviders helpt bij de planning.

Noot: Het paper richt zich strikt op de opstartmechanica van de vLLM-software. Het beweert niet medische problemen op te lossen, ziekten te diagnosticeren of deze bevindingen toe te passen in een klinische setting. Het gaat puur over het sneller laten opstarten van de software.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →