← Neueste Arbeiten
🤖 machine learning

TokenWeave: Efficient Compute-Communication Overlap for Distributed LLM Inference

TokenWeave ist ein neuartiges System, das durch das Verschmelzen der RMSNorm-Operation mit der AllReduce-Kommunikation unter Verwendung spezialisierter GPU-Funktionen eine effiziente Überlappung von Berechnung und Kommunikation für verteilte LLM-Inferenz bei kleinen Batch-Größen erreicht und dadurch die Latenz verringert sowie den Durchsatz erhöht, selbst wenn die Anzahl der Tokens pro Iteration so gering wie 1024 ist.

Ursprüngliche Autoren: Raja Gond, Nipun Kwatra, Ramachandran Ramjee

Veröffentlicht 2026-05-04
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Raja Gond, Nipun Kwatra, Ramachandran Ramjee

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie betreiben eine massive, hochgeschwindigkeitsfähige Fabrik (ein Large Language Model), die Anfragen von Kunden verarbeitet. Um diese Fabrik schnell genug zu machen, haben Sie ein Team von 8 Expertenarbeitern (GPUs) eingestellt, die zusammenarbeiten. Sie sind durch ein ultraschnelles Förderbandsystem (NVLink) verbunden, damit sie ihre Arbeit sofort austauschen können.

Allerdings gibt es ein Problem: Die Arbeiter verbringen zu viel Zeit damit, auf den Austausch untereinander zu warten.

Selbst mit den ultraschnellen Förderbändern müssen die Arbeiter ihre eigentliche Produktion (Berechnung) unterbrechen, um Notizen hin und her zu geben (Kommunikation). In der Arbeit stellten die Autoren fest, dass bei großen Modellen diese „Sprechzeit" etwa 20 % der Gesamtzeit verschlingt. Es ist wie ein Koch, der aufhört, um die anderen Köche in der Küche anzurufen und nur zu fragen: „Hast du das Salz?", bevor er das nächste Gemüse schneiden kann.

Der alte Weg: Dinge aufteilen

Frühere Versuche, dies zu beheben, versuchten, die Arbeit in winzige Stücke zu zerlegen. Die Idee war: „Während Arbeiter A eine Notiz an Arbeiter B weitergibt, kann Arbeiter A mit dem Schneiden des nächsten Gemüses beginnen."

Die Autoren stellten jedoch fest, dass dies bei kleinen Aufträgen (was passiert, wenn man eine KI eine kurze Frage stellt) nicht gut funktioniert. Die Aufteilung eines großen Auftrags in winzige Stücke machte die Arbeiter tatsächlich langsamer, weil sie so oft anhalten und wieder starten mussten. Es ist wie der Versuch, einen Staffellauf zu laufen, bei dem Sie den Staffelstab alle 10 Fuß übergeben; die Zeit, die zum Laufen verbracht wird, ist geringer als die Zeit, die zum Anhalten und Übergeben des Stabes benötigt wird!

Die neue Lösung: TokenWeave

Die Autoren entwickelten ein neues System namens TokenWeave. Stellen Sie es sich als einen intelligenten Manager vor, der den Fabrikboden neu organisiert, um Wartezeiten zu eliminieren. So haben sie es mit drei einfachen Tricks erreicht:

1. Der „intelligente Split" (Die zweispurige Autobahn)

Anstatt zu versuchen, die Arbeit in eine Million winziger Stücke zu zerlegen, teilt TokenWeave den Auftrag in nur zwei große Blöcke auf.

  • Block A beginnt mit der Bearbeitung der ersten Hälfte des Auftrags.
  • Block B beginnt mit der Bearbeitung der zweiten Hälfte.
  • Die Magie: Während Block A mit seiner Mathematik beschäftigt ist, ist Block B damit beschäftigt, seine Notizen zu übergeben. Dann wechseln sie. Block A gibt Notizen weiter, während Block B Mathematik betreibt.
  • Warum es funktioniert: Die Autoren haben genau herausgefunden, wie die Arbeit aufgeteilt werden muss, damit die Arbeiter nicht durch Warten auf das Förderband „stecken bleiben". Sie nennen dies „wave-aware", was bedeutet, dass sie sicherstellen, dass die Arbeiter immer beschäftigt sind, ähnlich wie ein gut getaktetes Ampelsystem, das den Verkehr am Laufen hält, ohne anzuhalten.

2. Der „Fused Kernel" (Das All-in-One-Werkzeug)

In der alten Fabrik mussten die Arbeiter zwei separate Dinge tun:

  1. Notizen übergeben (Kommunikation).
  2. Die Daten normalisieren (ein mathematischer Schritt namens RMSNorm).

Die Autoren erkannten, dass das getrennte Durchführen dieser beiden Schritte verschwenderisch war. Es ist wie wenn man zum Vorratsraum laufen müsste, um einen Hammer zu holen, dann zurück zur Werkbank, um einen Nagel zu schlagen, und dann wieder zum Schrank, um einen Schraubenzieher zu holen.

  • Die Lösung: Sie bauten ein neues „Super-Werkzeug" (einen fused kernel), das das Notizübergeben und den mathematischen Schritt gleichzeitig ausführt.
  • Der Bonus: Dieses Super-Werkzeug ist so effizient, dass es nur einen winzigen Bruchteil der Fabrikleistung benötigt (nur 2–8 Arbeiter von 132), um zu laufen. Dies lässt den Rest der Arbeiter frei, sich ganz auf die schwere Arbeit (Berechnung) zu konzentrieren.

3. Die „intelligente Neuordnung" (Es in der richtigen Reihenfolge tun)

Normalerweise gibt die Fabrik zuerst alle Notizen weiter und macht dann die Mathematik. Die Autoren erkannten jedoch, dass der mathematische Schritt (RMSNorm) während des Notizübergebens durchgeführt werden könnte, wenn sie die Schritte neu ordnen.

  • Die Analogie: Anstatt darauf zu warten, dass der ganze Truck ankommt, bevor Sie mit dem Entladen beginnen, beginnen Sie mit dem Entladen der ersten Kiste, sobald der Truck einfährt. TokenWeave ordnet die Schritte so neu an, dass die Mathematik stattfindet, während sich die Daten noch bewegen, was eine enorme Zeitersparnis bringt.

Die Ergebnisse

Die Arbeit testete dieses neue System auf leistungsstarken Computern (8x H100 GPUs) mit realen Modellen wie Llama und Qwen.

  • Geschwindigkeit: Sie stellten fest, dass TokenWeave die Fabrik 1,28-mal schneller machte (eine 28%ige Beschleunigung) im Vergleich zu den besten bestehenden Systemen.
  • Kleine Aufträge: Selbst für sehr kurze Fragen (nur 1.000 Wörter) war es 1,2-mal schneller. Frühere Systeme wurden bei kleinen Aufträgen tatsächlich langsamer.
  • Durchsatz: Die Fabrik konnte 19 % mehr Kunden pro Stunde bedienen.
  • Die „magische" Behauptung: In einigen Fällen war TokenWeave so effizient, dass es besser abschnitt als eine theoretische Version der Fabrik, die keine Kommunikation überhaupt hatte. Dies liegt daran, dass ihr neues „Super-Werkzeug" den mathematischen Schritt so gut behob, dass es die Zeit, die für das Sprechen aufgewendet wurde, wettmachte.

Zusammenfassung

TokenWeave ist wie ein Meisterdirigent für ein Orchester. Anstatt die Musiker anzuhalten, damit sie miteinander sprechen (was die Musik verlangsamt), lehrt er sie, ihre Teile zu spielen, während der Dirigent gleichzeitig die Notenblätter verteilt. Indem sie die Arbeit in nur zwei intelligente Blöcke aufteilen und ein neues „All-in-One"-Werkzeug verwenden, haben sie die Wartezeit eliminiert und die KI-Inferenz erheblich schneller und effizienter gemacht.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →