← Nieuwste papers
💻 computer science

TEMPO: Makespan-Aware Expert-Parallel Load Balancing Across Memory- and Compute-Bound Regimes

TEMPO introduceert een maaktijd-bewuste expert-parallelle load balancing dispatcher die niet-lineaire expert-executietijden over geheugen- en rekengebonden regimes modelleert om de tokenverdeling dynamisch te optimaliseren, waarbij tot 15,5% doorvoergroei en significante latentiereducties worden bereikt in scenario's met gemengde regimes waar traditionele lineaire telgebaseerde methoden falen.

Oorspronkelijke auteurs: Jie Li, Chenxin Jia, Jinliang Shen, Cunzhuang Liu, Ruiyi Ding, Jianwen Xian, Kang He, Chengru Song

Gepubliceerd 2026-08-14
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jie Li, Chenxin Jia, Jinliang Shen, Cunzhuang Liu, Ruiyi Ding, Jianwen Xian, Kang He, Chengru Song

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, razendsnelle pizzabestelservice runt voor een stad die nooit slaapt. Je hebt een vloot identieke bezorgers (de GPU's) en een centrale keuken met honderden verschillende specialiteitschefs (de "experts" in een AI-model). Elke keer als een klant een pizza bestelt, moet het systeem beslissen welke chefs aan de pizza werken en welke chauffeur de afgeronde pizza meeneemt. In de wereld van Kunstmatige Intelligentie, specifits bij een type model dat een "Mixture-of-Experts" (MoE) wordt genoemd, is dit precies wat er gebeurt. Deze AI-modellen zijn als gigantische hersenen die bestaan uit duizenden kleinere, gespecialiseerde sub-hersenen. Wanneer de AI nadenkt, gebruikt hij niet zijn hele brein tegelijk; hij kiest een paar specifieke experts om de taak af te handelen.

De grote uitdaging is om het hele team op dezelfde snelheid te laten bewegen. Als één chauffeur vast komt te zitten met een enorme, ingewikkelde bestelling terwijl de rest niets te doen heeft, wordt de hele levering vertraagd. De tijd die het kost om een batch bestellingen af te handelen, wordt bepaald door de langzaamste persoon in de groep. Jarenlang was de standaardregel voor het balanceren van deze werklast simpel: "Verdeel het aantal bestellingen gewoon gelijkmatig." Als je 100 bestellingen hebt, geef je er 10 aan elk van de 10 chauffeurs. Dit leek logisch, alsof je een stapel appels gelijk verdeelt. Maar wat als sommige appels zware stenen zijn en andere lichte veren? Of wat als de keuken een regel heeft waarbij het ophalen van een nieuwe chef een vaste hoeveelheid tijd kost, ongeacht hoeveel pizza's ze maken? De oude regels gingen ervan uit dat tijd altijd direct verbonden was aan het aantal bestellingen. Deze paper vraagt: wat als die aanname onjuist is?

De onderzoekers achter deze paper, werkend bij KlingAI, ontdekten dat de oude "tel de bestellingen"-regel eigenlijk een valstrik is. Ze ontdekten dat in moderne AI-hardware de tijd die nodig is om een expert te verwerken niet alleen afhangt van hoeveel tokens (woorden of datapakketjes) deze ziet. Het is een tweeledig beest. Soms wordt de tijd gedomineerd door de pure inspanning om het "recept" van de expert (de gewichten) uit het geheugen te laden, wat een vaste hoeveelheid tijd kost, ongeacht hoe klein de bestelling is. Op andere momenten, zodra het recept geladen is, groeit de tijd lineair mee met het aantal bestellingen. De oude methoden, die alleen naar het aantal bestellingen keken, misten de verborgen kosten van het laden van het recept. Ze probeerden een stapel veren en stenen te balanceren door ze te tellen, in plaats van ze te wegen.

Om dit op te lossen, bouwde het team een nieuwe dispatcher genaamd TEMPO (Time-modeled Expert-Parallel Optimization). In plaats van alleen tokens te tellen, fungeert TEMPO als een slimme verkeersregelaar die de fysica van de keuken begrijpt. Het gebruikt een speciale "kostenmodellen" die exact meet hoe lang het duurt om het recept van een chef te laden en hoe lang het duurt om de pizza te bakken. Het realiseert zich dat als je een "koude" expert hebt (één die een tijdje niet is gebruikt), het verdelen van zijn kleine bestelling over twee chauffeurs een ramp is, omdat je de "laadkosten" twee keer moet betalen. Maar als je een "hete" expert hebt met een berg aan bestellingen, is het verdelen ervan prima.

De paper laat zien dat TEMPO niet alleen maar gokt; het berekent de perfecte balans voor elke batch verzoeken in milliseconden. Ze testten dit op echte AI-modellen en vonden dat de oude methoden vaak 15% langzamer waren of significante vertragingen veroorzaakten voor de laatste paar klanten in een rij. TEMPO houdt de lijn echter soepel in beweging. Het is alsof je overstapt van een regel die zegt "iedereen krijgt hetzelfde aantal appels" naar een regel die zegt "iedereen krijgt evenveel werk", rekening houdend met het feit dat sommige appels zwaar zijn en sommige chefs traag wakker worden.

De onderzoekers waren zeer zorgvuldig in het aantonen waar deze nieuwe methode wel en niet werkt. Ze bewezen dat als de "hete" experts zo talrijk zijn dat het systeem simpelweg wordt overweldigd door de enorme hoeveelheid data (het "compute-bound" regime), de oude methode van het tellen van tokens eigenlijk prima is. Maar in de echte wereld, waar sommige experts druk zijn en anderen rusten, en waar de "laadkosten" hoog zijn, blinkt TEMPO uit. Ze brachten zelfs een "fasediagram" in kaart, wat een soort weerkaart is voor AI-verkeer, die precies voorspelt wanneer de nieuwe methode tijd zal besparen en wanneer de oude methode goed genoeg is.

Uiteindelijk gaat deze paper niet alleen over een sneller algoritme; het gaat over het veranderen van hoe we denken over het verdelen van werk in AI. Het leert ons dat je in de complexe, hogesnelheidswereld van moderne AI niet alleen dingen kunt tellen. Je moet de verborgen kosten van het verplaatsen van data en de specifieke vorm van het werk begrijpen. Door de werkelijke tijd te meten die nodig is om de klus te klaren in plaats van alleen de items te tellen, maakt TEMPO AI-modellen sneller, efficiënter en klaar om aan de enorme eisen van de toekomst te voldoen. Het verandert een chaotische keuken in een goed geoliede machine, waardoor geen enkele chauffeur hoeft te wachten terwijl de pizza onder de warmtelamp ligt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →