← Nieuwste papers
🤖 machine learning

TokenWeave: Efficient Compute-Communication Overlap for Distributed LLM Inference

TokenWeave is een nieuw systeem dat efficiënte overlap van berekening en communicatie realiseert voor gedistribueerde LLM-inferentie op kleine batchgroottes door de RMSNorm-bewerking te fuseren met AllReduce-communicatie met behulp van gespecialiseerde GPU-functies, waardoor de latentie wordt verlaagd en de doorvoer wordt verhoogd, zelfs wanneer het aantal tokens per iteratie zo laag is als 1024.

Oorspronkelijke auteurs: Raja Gond, Nipun Kwatra, Ramachandran Ramjee

Gepubliceerd 2026-05-04
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Raja Gond, Nipun Kwatra, Ramachandran Ramjee

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, hoogwaardige fabriek (een Large Language Model) runt die verzoeken van klanten verwerkt. Om deze fabriek snel genoeg te maken, heb je een team van 8 expertarbeiders (GPU's) ingehuurd die samenwerken. Ze zijn verbonden door een supersnel transportbandsysteem (NVLink) zodat ze hun werk direct kunnen delen.

Echter, er is een probleem: De arbeiders besteden te veel tijd aan wachten om met elkaar te praten.

Zelfs met de supersnelle transportbanden moeten de arbeiders hun eigenlijke bouwen (berekening) stoppen om notities heen en weer te sturen (communicatie). In het paper vonden de auteurs dat voor grote modellen deze "praattijd" ongeveer 20% van de totale tijd opslokt. Het is alsof een kok stopt om de andere koks in de keuken te bellen om te vragen: "Heb jij het zout?" voordat ze de volgende groente kunnen snijden.

De Oude Manier: Dingen Opbreken

Eerdere pogingen om dit op te lossen probeerden het werk op te breken in tiny stukjes. Het idee was: "Terwijl Arbeider A een notitie doorgeeft aan Arbeider B, kan Arbeider A beginnen met het snijden van de volgende groente."

Maar de auteurs ontdekten dat dit niet goed werkte voor kleine bestellingen (wat gebeurt als je een AI een korte vraag stelt). Het opbreken van een grote klus in tiny stukjes maakte de arbeiders eigenlijk langzamer, omdat ze zo vaak moesten stoppen en weer beginnen. Het is alsof je een estafetteloop probeert te rennen waarbij je de stok elke 10 meter doorgeeft; de tijd die je besteedt aan rennen is minder dan de tijd die je besteedt aan stoppen om de stok over te dragen!

De Nieuwe Oplossing: TokenWeave

De auteurs bouwden een nieuw systeem genaamd TokenWeave. Denk hierbij aan een slimme manager die de fabrieksvloer herorganiseert om wachttijd te elimineren. Hier is hoe ze dit deden, met drie simpele trucs:

1. De "Slimme Split" (De Tweebaansweg)

In plaats van te proberen het werk op te breken in een miljoen tiny stukjes, splitst TokenWeave de bestelling op in slechts twee grote chunks.

  • Chunk A begint met werken aan de eerste helft van de klus.
  • Chunk B begint met werken aan de tweede helft.
  • De Magie: Terwijl Chunk A druk bezig is met zijn wiskunde, is Chunk B druk bezig met het doorgeven van notities. Dan wisselen ze. Chunk A geeft notities door terwijl Chunk B wiskunde doet.
  • Waarom het werkt: De auteurs bedachten precies hoe ze het werk moesten splitsen zodat de arbeiders niet "vastlopen" door te wachten op de transportband. Ze noemen dit "wave-aware", wat betekent dat ze ervoor zorgen dat de arbeiders altijd bezig zijn, net als een goed getimed verkeerslichtsysteem dat auto's in beweging houdt zonder dat ze stoppen.

2. De "Gefuseerde Kernel" (Het Alles-in-Eén Gereedschap)

In de oude fabriek moesten de arbeiders twee aparte dingen doen:

  1. Notities doorgeven (Communicatie).
  2. De data normaliseren (een wiskundige stap genaamd RMSNorm).

De auteurs beseften dat het doen van deze twee stappen apart verspillend was. Het is alsof je naar de voorraadkast moet lopen om een hamer te halen, dan terug naar het werkbank om een spijker te slaan, en dan weer terug naar de kast om een schroevendraaier te halen.

  • De Oplossing: Ze bouwden een nieuw "super-gereedschap" (een gefuseerde kernel) dat het doorgeven van notities en de wiskundestap tegelijkertijd doet.
  • De Bonus: Dit super-gereedschap is zo efficiënt dat het slechts een klein fractie van de kracht van de fabriek nodig heeft (slechts 2–8 arbeiders van de 132) om te draaien. Hierdoor blijven de rest van de arbeiders vrij om zich volledig te richten op het zware tillen (berekening).

3. De "Slimme Herordening" (Het Op de Juiste Volgorde Doen)

Normaal gesproken geeft de fabriek eerst alle notities door, en daarna wordt de wiskunde gedaan. Maar de auteurs beseften dat de wiskundestap (RMSNorm) tijdens het doorgeven van notities gedaan kon worden als ze de stappen herschikten.

  • De Analogie: In plaats van te wachten tot de hele vrachtwagen is aangekomen voordat je begint met lossen, begin je met het lossen van het eerste doosje zodra de vrachtwagen voorrijdt. TokenWeave herschikt de stappen zodat de wiskunde gebeurt terwijl de data nog in beweging is, wat enorm veel tijd bespaart.

De Resultaten

Het paper testte dit nieuwe systeem op krachtige computers (8x H100 GPU's) met real-world modellen zoals Llama en Qwen.

  • Snelheid: Ze ontdekten dat TokenWeave de fabriek 1,28 keer sneller maakte (een snelheidswinst van 28%) in vergelijking met de beste bestaande systemen.
  • Kleine Bestellingen: Zelfs voor zeer korte vragen (slechts 1.000 woorden) was het 1,2 keer sneller. Eerdere systemen werden juist langzamer met kleine bestellingen.
  • Doorvoer: De fabriek kon 19% meer klanten per uur afhandelen.
  • De "Magische" Claim: In sommige gevallen was TokenWeave zo efficiënt dat het beter presteerde dan een theoretische versie van de fabriek die geen communicatie had. Dit komt omdat hun nieuwe "super-gereedschap" de wiskundestap zo goed oploste dat het de tijd die besteed werd aan praten compenseerde.

Samenvatting

TokenWeave is als een meesterdirigent voor een orkest. In plaats van de muzikanten te laten stoppen om met elkaar te praten (wat de muziek vertraagt), leert het hen hun partijen te spelen terwijl de dirigent tegelijkertijd de bladmuziek doorgeeft. Door het werk op te splitsen in slechts twee slimme chunks en een nieuw "alles-in-eén" gereedschap te gebruiken, elimineerden ze de wachttijd, waardoor AI-inferentie aanzienlijk sneller en efficiënter wordt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →