← Nieuwste papers
🤖 AI

Towards Multi-Model LLM Schedulers: Empirical Insights into Offloading and Preemption

Dit artikel presenteert een empirische studie die aantoont dat multi-model LLM-scheduling op heterogene hardware te maken krijgt met aanzienlijke, modelafhankelijke prestatiedegradatie door CPU-GPU offloading en aanzienlijke preemption-overhead veroorzaakt door statusherladingen, waardoor kritieke factoren worden geïdentificeerd voor het ontwerpen van efficiënte next-generation schedulers.

Oorspronkelijke auteurs: Mert Yildiz, Pietro Spadaccino, Alexey Rolich, Francesca Cuomo, Andrea Baiocchi

Gepubliceerd 2026-05-20
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Mert Yildiz, Pietro Spadaccino, Alexey Rolich, Francesca Cuomo, Andrea Baiocchi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een drukke keuken runt (een computerserver) met een paar supersnelle chefs (GPUs) en een langzamere, maar zeer ruime, voorraadhulp (de CPU). Je doel is om veel verschillende soorten complexe gerechten (Large Language Models of LLM's) tegelijkertijd te bereiden. Soms wordt de keuken zo vol dat de snelle chefs hun aanrechtruimte opgebruiken, waardoor je de voorraadhulp moet vragen om wat ingrediënten vast te houden of zelfs wat snijwerk te doen.

Dit artikel is als een gedetailleerde studie van wat er gebeurt wanneer je probeert het kookwerk te verdelen tussen de snelle chefs en de trage hulp, of wanneer je plotseling een gerecht moet stoppen om een dringender gerecht te bereiden.

Hier zijn de belangrijkste ontdekkingen uit de studie, eenvoudig uitgelegd:

1. Het "Half-chef"-probleem (Offloading)

Wanneer een gerecht te groot is voor het aanrecht van de chef, verplaats je enkele stappen van het recept naar de voorraadhulp.

  • De bevinding: Het is geen vlotte afweging. Als je slechts een klein beetje werk naar de trage hulp verplaatst, daalt de kooksnelheid niet een beetje; het crasht hard.
  • De analogie: Denk eraan als een estafettewedstrijd. Als de snelle loper (GPU) de staf moet overhandigen aan een langzame wandelaar (CPU), zelfs voor een klein deel van de race, vertraagt het hele team dramatisch.
  • De verrassing: Kleine gerechten (kleinere AI-modellen) lijden het meest. Als je probeert zelfs een klein deel van een klein model uit te laden, wordt het zeer traag. Grotere gerechten (grotere modellen) gaan beter met de verdeling om, waarbij ze geleidelijk meer vertragen.
  • De les: Je kunt niet zomaar raden hoeveel werk je aan de CPU moet geven. Je moet precies weten welk "gerecht" je bereidt, omdat sommige modellen er meer van houden om niet opgesplitst te worden dan andere.

2. De "Wisselkosten" (Preemptie)

Soms bestelt een VIP-klant een nieuw gerecht en moet je de huidige chef stoppen, hun station opruimen en het nieuwe gerecht starten. Dit heet "preemptie".

  • De bevinding: De tijd die het kost om van gerecht te wisselen, is bijna hetzelfde of je het huidige gerecht nu na 1 minuut stopt of na 1 uur.
  • De analogie: Stel je voor dat je een gigantisch muurschildering aan het schilderen bent. Als je moet stoppen om iemand anders te laten schilderen, is de tijd die het kost om je kwasten schoon te maken en de kwasten van de nieuwe schilder klaar te maken, hetzelfde, of je nu 3 meter of 300 meter hebt geschilderd. De tijd die je hebt geschilderd maakt niet uit; de tijd die het kost om te wisselen is vast.
  • De grote onthulling: De meeste mensen dachten dat de tijd die werd besteed aan het verplaatsen van de "notities" (het geheugen van wat al was geschilderd, de KV-cache) het trage deel was. De studie vond uit dat het verplaatsen van de notities eigenlijk direct gaat (minder dan 1% van de tijd). De echte tijdverspilling is het uitpakken van de oude chef's gereedschappen en het uitpakken van de nieuwe chef's gereedschappen (het laden van de modelgewichten vanaf de harde schijf).
  • De les: Taken wisselen is duur, maar de kosten zijn voorspelbaar. Het hangt volledig af van hoe zwaar de "gereedschapskist" (de modelgrootte) is, niet van hoe lang de taak al loopt.

3. De "Verkeersopstopping" (Gegevensbeweging)

Wanneer dingen worden verplaatst tussen de snelle chef en de trage hulp, moeten ze door een gang lopen (de datakabel).

  • De bevinding: Zelfs wanneer de "notities" (geheugen) enorm groot worden omdat het gerecht zeer lang is, is het verplaatsen ervan nog steeds supersnel in vergelijking met het uitpakken van de gereedschappen.
  • De analogie: Het is als het verplaatsen van een enkel vel papier versus het verplaatsen van een hele boekenkast. Het verplaatsen van het vel (de notities) is zo snel dat het nauwelijks meetelt. Het verplaatsen van de boekenkast (de modelgereedschappen) duurt eeuwen.
  • De les: Maak je niet te veel zorgen over de grootte van de "notities" bij het beslissen om taken te wisselen. Maak je zorgen over de grootte van de "boekenkast".

4. De "Hardware-persoonlijkheid"

De studie testte twee verschillende soorten keukens (twee verschillende GPU's).

  • De bevinding: De ene keuken was sneller in koken, maar trager in het wisselen van taken dan de andere.
  • De analogie: De ene keuken heeft een supersnelle chef maar een smalle gang, waardoor het moeilijk is om snel gereedschap te wisselen. De andere heeft een iets langzamere chef maar een brede gang, waardoor wisselen makkelijker is.
  • De les: Je kunt geen "alles-in-één"-regel gebruiken. De beste manier om taken te plannen, hangt af van precies welke hardware je hebt.

Samenvatting voor de Toekomst

De auteurs concluderen dat de volgende generatie "Keukenmanagers" (schedulers) slimmer moet zijn. Ze moeten niet alleen kijken naar hoeveel bestellingen er in de wachtrij staan. Ze moeten weten:

  1. Welk model is het? (Sommige modellen haten het om opgesplitst te worden).
  2. Hoe groot is de gereedschapskist? (Dit bepaalt hoe lang een wissel duurt).
  3. Wat voor soort keuken is dit? (Verschillende hardware verandert de regels).

Door deze specifieke eigenaardigheden te begrijpen, kunnen managers stoppen met het proberen om een vierkante peg in een rond gat te duwen en in plaats daarvan een systeem creëren dat veel verschillende AI-modellen efficiënt uitvoert zonder de keuken te laten crashen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →