← Nieuwste papers
🤖 AI

Position: LLM Serving Needs Mathematical Optimization and Algorithmic Foundations, Not Just Heuristics

Dit position paper betoogt dat het serveren van LLM-inferentie de fase van generieke heuristieken heeft gepasseerd en de ontwikkeling vereist van wiskundige optimalisatiemodellen en algoritmische fundamenten die zijn toegespitst op de unieke kenmerken ervan, om waarborgde prestatiegaranties te waarborgen voor uiteenlopende werklasten.

Oorspronkelijke auteurs: Zijie Zhou

Gepubliceerd 2026-05-06
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zijie Zhou

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, supersnelle restaurantkeuken runt. Deze keuken kookt niet alleen hamburgers; hij bereidt complexe, meergangse maaltijden op basis van bestellingen die één voor één binnenkomen. De twist? Je weet niet hoe lang elke maaltijd zal duren om te koken, en hoe meer de chef kookt, hoe meer aanrechtplek de maaltijd inneemt, waardoor andere bestellingen worden verdrongen.

Dit is precies de situatie met Grote Taalmodellen (LLMs) vandaag de dag. Zij zijn de "keukens" die zoekmachines, programmeerassistenten en chatbots aandrijven.

Het artikel stelt dat deze digitale keukens momenteel draaien op gissingen en simpele regels (heuristieken). De auteur vindt dat het tijd is om over te schakelen op wiskundige precisie en stevige algoritmische fundamenten om ze sneller, goedkoper en betrouwbaarder te maken.

Hier is de uiteenzetting van het argument uit het artikel, gebruikmakend van alledaagse analogieën:

1. Het Probleem: "Voldoende" Regels Falen

Momenteel gebruiken systemen zoals vLLM en SGLang (de software die deze modellen draait) ouderwetse regels die zijn overgenomen van de algemene informatica.

  • De Wachtlijn: Als je een rij klanten hebt, bedient de keuken ze gewoon in de volgorde van aankomst (Eerst-Komst-Eerst-Bediening).
  • Het Routing: Als je meerdere chefs hebt, stuurt de keuken de volgende bestelling naar de chef met de kortste rij, of draait hij gewoon een wiel om er één te kiezen.
  • De Opruiming: Als het aanrecht vol raakt, gooit de keuken het oudste item op het aanrecht weg om ruimte te maken voor een nieuw item.

Het Punt van het Artikel: Deze regels werken prima voor een standaard hamburgerzaak. Maar LLM's zijn raar.

  • De "Groeiende" Maaltijd: In tegenstelling tot een hamburger die van begin tot eind evenveel ruimte inneemt, groeit een LLM-maaltijd naarmate hij wordt bereid. Elk woord dat de AI genereert, neemt meer geheugen in beslag.
  • De "Twee-Fase" Bereiding: Het eerste deel van de bestelling (het lezen van de prompt) is snel en vereist veel rekenkracht (compute). Het tweede deel (het genereren van het antwoord) is traag en vereist veel geheugenbandbreedte.
  • Het Onbekende: De keuken weet niet hoe lang de maaltijd zal zijn totdat hij klaar is.

Vanwege deze eigenaardigheden veroorzaken de oude "kortste rij"- of "oudste item eruit"-regels vaak chaos, waardoor sommige chefs inactief blijven terwijl anderen overbelast raken, of waardoor het aanrecht onverwacht volloopt.

2. De Oplossing: Breng de Wiskundigen In

De auteur zegt dat we moeten stoppen met gissen en moeten beginnen met wiskundige optimalisatie. Denk hierbij aan het inhuren van een meesterlogistiek planner die een supercomputer gebruikt om de perfecte manier te berekenen om de keuken te runnen, in plaats van gewoon een regelboek te volgen.

Het artikel benadrukt vier specifieke gebieden waar wiskunde de keuken kan repareren:

  • Het Balanceren van de Chefs (Load Balancing):

    • Huidige Manier: Stuur bestellingen naar de chef met de minste tickets.
    • Wiskundige Manier: Bereken precies hoeveel "aanrechtplek" en "rekenkracht" elke bestelling nodig zal hebben naarmate deze groeit, en verdeel ze zodat geen enkele chef ooit vastloopt door te wachten op de langzaamste. Het artikel citeert een echt systeem (DeepSeek) dat Lineaire Programmering (een type wiskunde) gebruikt om dit perfect te doen, wat tijd en geld bespaart.
  • De Wachtlijn (Scheduling):

    • Huidige Manier: Dien de eerste persoon in de rij op.
    • Wiskundige Manier: Kijk naar de rij en realiseer je: "Die persoon heeft een 10-pagina's lang essay besteld, maar de volgende persoon wil slechts een grapje van één zin." Dien het grapje eerst op! Het ruimt het aanrecht sneller op en laat meer mensen eten. Wiskunde kan voorspellen welke bestellingen snel klaar zullen zijn om de keuken in beweging te houden.
  • De Aanrechtplek (Caching):

    • Huidige Manier: Gooi het oudste item weg als het aanrecht vol is.
    • Wiskundige Manier: Realiseer je dat het weggooien van een "hoge-resolutie video" om ruimte te maken voor een "kleine thumbnail" een slechte deal is. Het opnieuw maken van de video kost eeuwen en een fortuin. Wiskunde kan de "kosten" van het weggooien van dingen berekenen en de dure items op het aanrecht houden.
  • Het Plannen van het Personeel (Capacity Planning):

    • Huidige Manier: Blijf chefs toevoegen als de rij te lang wordt.
    • Wiskundige Manier: Gebruik formules om te weten exact hoeveel chefs je nodig hebt voordat je de deuren zelfs maar opent, gebaseerd op het aantal klanten dat wordt verwacht. Dit voorkomt dat de keuken in de eerste plaats overbelast raakt.

3. Waarom Blijven We Niet Gewoon bij de Regels?

Het artikel adresseert de sceptici die zeggen: "De huidige regels werken prima, waarom veranderen?"

  • "Het werkt op schaal": De auteur geeft toe dat de huidige regels oké werken, maar ze zijn fragiel. Als een virale app plotseling een rare soort bestelling stuurt, kan de keuken crashen. Wiskunde biedt een veiligheidsnet (garanties) dat ervoor zorgt dat de keuken niet faalt, zelfs niet in de ergste scenario's.
  • "Hardware verandert te snel": De auteur betoogt dat hoewel de hardware (de ovens) verandert, de logica van hoe je de keuken organiseert hetzelfde blijft. Wiskunde geeft je een blauwdruk die werkt, zelfs als je de ovens verwisselt.
  • "Systeemtechniek is belangrijker": De auteur zegt dat wiskunde en techniek partners zijn. Je kunt de snelste oven ter wereld hebben, maar als je planning slecht is, staat de oven inactief. Wiskunde vertelt je hoe je de oven bezig houdt.

4. Het Grote Plaatje

Het artikel concludeert dat het veld van LLM-serving zijn "kinderjaren" van simpele regels is ontgroeid. Het is uitgegroeid tot een complex systeem dat volwassen toezicht van wiskundigen en algoritme-experts vereist.

Door deze problemen te behandelen als wiskundige puzzels in plaats van slechts technische aanpassingen, kunnen we krijgen:

  1. Voorspelbaarheid: Weten precies hoe het systeem zich zal gedragen.
  2. Efficiëntie: Het besparen van enorme hoeveelheden energie en geld.
  3. Betrouwbaarheid: Zorgen dat het systeem niet crasht als de dingen gek worden.

Kortom: Stop met gissen. Begin met berekenen. De toekomst van AI-serving gaat niet alleen over het bouwen van grotere modellen; het gaat over het bouwen van slimmere, wiskundig bewezen manieren om ze te runnen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →