← Neueste Arbeiten
💻 computer science

TEMPO: Makespan-Aware Expert-Parallel Load Balancing Across Memory- and Compute-Bound Regimes

TEMPO führt einen auf die Makespan fokussierten, expertenparallelen Lastverteiler ein, der nicht-lineare Experten-Ausführungszeiten über speicher- und rechengebundene Regime hinweg modelliert, um die Token-Verteilung dynamisch zu optimieren, wodurch Durchsatzsteigerungen von bis zu 15,5 % sowie signifikante Latenzreduzierungen in gemischten Regimeszenarien erzielt werden, in denen traditionelle, auf linearen Zählungen basierende Methoden versagen.

Ursprüngliche Autoren: Jie Li, Chenxin Jia, Jinliang Shen, Cunzhuang Liu, Ruiyi Ding, Jianwen Xian, Kang He, Chengru Song

Veröffentlicht 2026-08-14
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Jie Li, Chenxin Jia, Jinliang Shen, Cunzhuang Liu, Ruiyi Ding, Jianwen Xian, Kang He, Chengru Song

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie betreiben einen riesigen, Hochgeschwindigkeits-Pizzalieferdienst für eine Stadt, die niemals schläft. Sie haben eine Flotte identischer Lieferfahrer (die GPUs) und eine zentrale Küche mit hunderten verschiedenen Spezialitätenköchen (den „Experten“ eines KI-Modells). Jedes Mal, wenn ein Kunde eine Pizza bestellt, muss das System entscheiden, welche Köche an ihr arbeiten und welcher Fahrer die fertige Pizza übernimmt. In der Welt der Künstlichen Intelligenz, speziell bei einem Typ von Modell namens „Mixture-of-Experts“ (MoE), passiert genau das. Diese KI-Modelle sind wie riesige Gehirne, die aus tausenden kleineren, spezialisierten Teilgehirnen bestehen. Wenn die KI denkt, nutzt sie nicht ihr ganzes Gehirn auf einmal; sie wählt ein paar spezifische Experten aus, um die Aufgabe zu erledigen.

Die große Herausforderung besteht darin, das gesamte Team auf die gleiche Geschwindigkeit zu bringen. Wenn ein Fahrer mit einer riesigen, komplizierten Bestellung feststeckt, während alle anderen untätig sind, verzögert sich die gesamte Lieferung. Die Zeit, die es dauert, einen Stapel von Bestellungen abzuarbeiten, wird durch den langsamsten Beteiligten in der Gruppe bestimmt. Jahrelang war die Standardregel für die Lastverteilung einfach: „Teile die Anzahl der Bestellungen einfach gleichmäßig auf.“ Wenn du 100 Bestellungen hast, gib jedem deiner 10 Fahrer 10 Stück. Das schien logisch, als würde man einen Apfelhaufen gleichmäßig verteilen. Aber was ist, wenn einige Äpfel schwere Steine und andere leichte Federn sind? Oder was, wenn in der Küche eine Regel gilt, dass das Abholen eines neuen Kochs eine feste Zeitspanne beansprucht, egal wie viele Pizzas dieser produziert? Die alten Regeln gingen davon aus, dass die Zeit immer direkt an die Anzahl der Bestellungen gekoppelt ist. Diese Arbeit fragt: Was, wenn diese Annahme falsch ist?

Die Forscher hinter dieser Arbeit, die bei KlingAI arbeiten, haben entdeckt, dass die alte Regel des „Zählens der Bestellungen“ in Wahrheit eine Falle ist. Sie fanden heraus, dass in moderner KI-Hardware die Zeit, die benötigt wird, um einen Experten zu verarbeiten, nicht nur von der Anzahl der Token (Wörter oder Datensegmente) abhängt, die er sieht. Sie ist ein zweigesichtiges Biest. Manchmal wird die Zeit durch den reinen Aufwand dominiert, das „Rezept“ des Experten (die Gewichte) aus dem Speicher zu laden, was eine feste Zeitspanne beansprucht, unabhängig davon, wie klein die Bestellung ist. Ein anderes Mal, sobald das Rezept geladen ist, wächst die Zeit linear mit der Anzahl der Bestellungen. Die alten Methoden, die nur auf die Anzahl der Bestellungen blickten, übersahen die versteckten Kosten des Ladens des Rezepts. Sie versuchten, einen Haufen aus Federn und Steinen zu balancieren, indem sie sie zählten, anstatt sie zu wiegen.

Um dies zu beheben, entwickelten die Experten einen neuen Dispatcher namens TEMPO (Time-modeled Expert-Parallel Optimization). Anstatt nur Token zu zählen, agiert TEMPO wie ein intelligenter Verkehrskontrolleur, der die Physik der Küche versteht. Es verwendet ein spezielles „Kostenmodell“, das exakt misst, wie lange es dauert, das Rezept eines Kochs zu laden und wie lange es dauert, die Pizza zu backen. Es erkennt, dass es eine Katastrophe ist, eine winzige Bestellung eines „kalten“ Experten (eines, der eine Weile nicht benutzt wurde) auf zwei Fahrer aufzuteilen, da man die „Ladegestaltgebühr“ zweimal bezahlen muss. Aber wenn man einen „heißen“ Experten mit einem Berg von Bestellungen hat, ist das Aufteilen völlig in Ordnung.

Die Arbeit zeigt, dass TEMPO nicht nur rät; es berechnet das perfekte Gleichgewicht für jede einzelne Charge von Anfragen in Millisekunden. Sie testeten dies an echten KI-Modellen und fanden heraus, dass die alten Methoden oft 15 % langsamer waren oder die letzten Kunden in einer Schlange signifikante Verzögerungen verursachten. TEMPO hingegen hält die Schlange flüssig in Bewegung. Es ist wie der Wechsel von einer Regel, die besagt: „Jeder bekommt die gleiche Anzahl an Äpfeln“, zu einer Regel, die besagt: „Jeder bekommt die gleiche Menge an Arbeit“, wobei berücksichtigt wird, dass manche Äpfel schwer sind und manche Köche lange brauchen, um wach zu werden.

Die Forscher waren sehr sorgfältig darin, genau aufzuzeigen, wo diese neue Methode funktioniert und wo sie es nicht tut. Sie bewiesen, dass, wenn die „heißen“ Experten so zahlreich sind, dass das System einfach von der schieren Menge der Daten überwältigt wird (das „compute-bound“ Regime), die alte Methode des Token-Zählens tatsächlich völlig ausreichend ist. Aber in der realen Welt, in der einige Experten beschäftigt sind und andere ruhen, und in der die „Ladegestaltgebühr“ hoch ist, glänzt TEMPO. Sie erstellten sogar ein „Phasendiagramm“, das wie eine Wetterkarte für den KI-Verkehr funktioniert und präzise vorhersagt, wann die neue Methode Zeit spart und wann die alte Methode gut genug ist.

Letztendlich handelt es sich bei dieser Arbeit nicht nur um einen schnelleren Algorithmus; es geht darum, wie wir die Arbeitsverteilung in der KI denken. Sie lehrt uns, dass man in der komplexen, Hochgeschwindigkeitswelt moderner KI nicht einfach Dinge zählen kann. Man muss die versteckten Kosten der Datenbewegung und die spezifische Form der Arbeit verstehen. Indem TEMPO die tatsächliche Zeit misst, die für die Erledigung der Aufgabe benötigt wird, anstatt nur die Gegenstände zu zählen, macht es KI-Modelle schneller, effizienter und bereit für die massiven Anforderungen der Zukunft. Es verwandelt eine chaotische Küche in eine perfekt geölte Maschine und stellt sicher, dass kein Fahrer warten muss, während die Pizza unter der Wärmelampe liegt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →