← Nieuwste papers
🤖 machine learning

DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism

DisagMoE is een nieuw Mixture-of-Experts-trainingssysteem dat de efficiëntie op grote schaal clusters verbetert door de attention- en feed-forward-lagen te ontkoppelen in aparte GPU-groepen met een meerstaps-pijplijn, waardoor communicatie en berekening effectief overlappen om all-to-all-communicatieknelpunten te overwinnen en een trainingssnelheidswinst van tot 1,8x te bereiken.

Oorspronkelijke auteurs: Zhichen Zeng, Chi-Chih Chang, Jiayi Wang, Zezhou Wang, Ningxin Zheng, Zheng Zhong, Cesar A. Stuardo, Dongyang Wang, Mohamed S. Abdelfattah, Haibin Lin, Banghua Zhu, Ang Li, Ziheng Jiang

Gepubliceerd 2026-05-13
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zhichen Zeng, Chi-Chih Chang, Jiayi Wang, Zezhou Wang, Ningxin Zheng, Zheng Zhong, Cesar A. Stuardo, Dongyang Wang, Mohamed S. Abdelfattah, Haibin Lin, Banghua Zhu, Ang Li, Ziheng Jiang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, supersnelle fabriek runt die reuzenachtige "denkmachines" (AI-modellen) bouwt. Deze fabriek heeft twee hoofdsoorten werknemers:

  1. Het "Context"-team (Attention): Deze werknemers zijn als detectives. Ze kijken naar het hele verhaal tot nu toe om te begrijpen wat er gebeurt. Ze zijn zeer goed in denken, maar hoeven niet veel te bewegen.
  2. Het "Specialist"-team (Experts/FFN): Dit zijn de echte bouwers. Er zijn er duizenden, maar voor elke enkele taak zijn er maar een paar nodig. Ze zijn geweldig in het zware werk, maar ze zijn verspreid over de hele fabrieksvloer.

Het probleem: De files

Op de oude manier van deze fabriek runnen (genaamd Expert Parallelism) zaten het Context-team en het Specialist-team in dezelfde ruimte.

Dit was wat er gebeurde:

  1. Het Context-team was klaar met hun denken.
  2. Ze moesten over de hele ruimte schreeuwen naar de Specialisten: "Jij, jij en jij! Kom hier en werk hieraan!"
  3. De Specialisten deden hun werk.
  4. Ze moesten terug schreeuwen: "Hier is het resultaat!"

Het probleem? Het "schreeuwen" (het verzenden van data tussen computers) was traag, vooral toen de fabriek enorm werd en de werknemers op verschillende verdiepingen zaten (verschillende serverknooppunten). De specialisten zaten vaak inactief te wachten tot het Context-team klaar was met schreeuwen, en vice versa. De fabriek zat vast in een file, en spendeerde meer tijd aan praten dan aan werken.

Eerdere pogingen om dit op te lossen waren als proberen de werknemers te vertellen om "te praten terwijl ze werken". Maar omdat het Context-team lang nodig heeft om na te denken (vooral bij lange verhalen) en de Specialisten snel bouwen, klopte het tijdstip nooit helemaal. Er was altijd nog schreeuwtijd over die niet kon worden verborgen.

De oplossing: DisagMoE (De gedesaggregeerde fabriek)

De auteurs van dit artikel, DisagMoE, besloten om te stoppen met proberen de twee teams in dezelfde ruimte te laten werken. In plaats daarvan bouwden ze een tweestaps assemblagelijn.

1. Scheid de teams (Degasgregatie)
Ze verplaatsten het Context-team naar één set machines en het Specialist-team naar een volledig andere set machines.

  • Team A (Context): Alle "detective"-lagen bevinden zich op één groep computers.
  • Team B (Specialisten): Alle "bouwer"-lagen bevinden zich op een andere groep.

2. De nieuwe assemblagelijn (AF-Pipe)
In plaats van een chaotisch schreeuw-systeem, creëerden ze een soepele, eenrichtingsbandensysteem:

  • Het Context-team voltooit een batch denken en schuift het werk over de band naar de Specialisten.
  • Terwijl de Specialisten werken aan Batch #1, begint het Context-team al met Batch #2.
  • Terwijl de Specialisten Batch #1 afronden en de resultaten terugsturen, werkt het Context-team al aan Batch #3.

Dit heet pipelining. Het is als een estafettewedstrijd waar de estafettestok zo soepel wordt doorgegeven dat geen enkele loper ooit stopt met rennen.

3. De slimme manager (Adaptieve toewijzing)
Hier komt het slimme deel. Het artikel realiseerde zich dat het Context-team en het Specialist-team verschillende behoeften hebben.

  • Het Context-team is als een zware denker; ze hebben krachtige hersenen (rekenkracht) nodig, maar hebben niet zozeer een snelle internetverbinding nodig.
  • Het Specialist-team is als een hardloper; ze hebben een supersnel snelweg (netwerkbandbreedte) nodig om hun data snel naar de juiste persoon te krijgen.

In de oude fabriek kreeg iedereen hetzelfde aantal internetverbindingen en evenveel rekenkracht. Bij DisagMoE is de manager slim. Als het verhaal erg lang is, geven ze meer "internetbanen" aan de Specialisten en meer "hersenen" aan het Context-team. Ze passen de middelen voortdurend aan om ervoor te zorgen dat geen enkel team ooit op het andere hoeft te wachten.

De resultaten

Door de teams te scheiden en de manager de middelen te laten aanpassen, stopte de fabriek met tijd verspillen door te wachten op berichten.

  • Snelheid: Ze ontdekten dat dit nieuwe systeem het trainen 1,8 keer sneller maakte dan de oude standaardmethoden.
  • Efficiëntie: Ze verminderden de tijd die de computers alleen maar "praatten" (wachten op data) met wel 88%.

De grote les

Het artikel stelt dat je niet zomaar meer internetbandbreedte op een probleem kunt gooien om het sneller te maken. Je moet kijken naar de specifieke taak die elk deel van de AI uitvoert. Door het "denken" te scheiden van het "bouwen" en elk team precies de juiste hoeveelheid middelen te geven die ze nodig hebben, kun je deze reuzenachtige AI-modellen veel, veel sneller bouwen.

Kortom: Ze stopten met proberen een vierkante pen in een rond gat te forceren door de werknemers te scheiden, een betere band te bouwen en een manager aan te nemen die precies weet hoe het werklast in evenwicht te brengen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →