← Nieuwste papers
🤖 machine learning

DMuon: Efficient Distributed Muon Training with Near-Adam Overhead

Het artikel introduceert DMuon, een open-source gedistribueerde implementatie van de Muon-optimizer die naadloos integreert in bestaande trainingspipelines om de optimizer-stap latentie drastisch te verminderen en een efficiëntie te bereiken die nabij die van AdamW ligt, waardoor het schaalbare gebruik van op matrix-orthogonalisatie gebaseerde optimalisatie in grote foundationmodellen mogelijk wordt.

Oorspronkelijke auteurs: Vincent Chen, Starrick Liu, Regis Cheng, Dance Yang, Shalfun Li, Ryan Yu, Lucy Liang, Hang Su, Roy Gan, Hao Wang, Qian Wang

Gepubliceerd 2026-06-26
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Vincent Chen, Starrick Liu, Regis Cheng, Dance Yang, Shalfun Li, Ryan Yu, Lucy Liang, Hang Su, Roy Gan, Hao Wang, Qian Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een gigantische robotbrein (een Large Language Model of een embodied AI) traint om te leren. Om het te onderwijzen, heb je een "optimizer" nodig—een coach die naar de fouten van de robot kijkt en de interne verbindingen (gewichten) aanpast om hem slimmer te maken.

Jarenlang was de standaardcoach AdamW. Het is als een team van duizenden kleine werkers, die elk op hun beurt één klein schroefje aan de robot vastdraaien. Het is snel en efficiënt, maar het behandelt elk schroefje onafhankelijk.

Onlangs is er een nieuwe, intelligentere coach genaamd Muon ontdekt. In plaats van schroefjes één voor één te repareren, kijkt Muon naar volledige panelen van de robot (gehele matrices van data) en past deze allemaal tegelijkert aan. Deze "groepstherapie"-aanpak helpt de robot sneller te leren en een hoger prestatieniveau te bereiken. Er is echter een addertje onder het gras: Muon is extreem traag bij het draaien op een gedistribueerd systeem (een cluster van vele computers die samenwerken).

Het Problek: De "Iedereen-is-aanwezig"-vergadering-bottleneck
In een gedistribueerde trainingsopstelling wordt de hersenpan van de robot verdeeld over veel computers (GPU's).

  • AdamW werkt als een extern team: Computer A repareert zijn schroefjes, Computer B die van hem, en ze hoeven niet veel met elkaar te praten.
  • Muon werkt als een commissie: Om een paneel te repareren, moet elke computer eerst het volledige paneel te zien krijgen.

In een naïeve implementatie van Muon moet elke computer stoppen met waar hij mee bezig is, de volledige data van iedereen downloaden, de complexe wiskunde uitvoeren en vervolgens de resultaten terugsturen. Dit is als het houden van een enorme vergadering waarbij iedereen eerst een rapport van 1.000 pagina's leest voordat er een enkele beslissing kan worden genomen. Het duurt zo lang dat de "vergadering" (de optimizer stap) langer duurt dan het eigenlijke werk (de leerstappen). Sterker nog, het paper merkt op dat dit 2x meer tijd kan kosten dan het leren zelf!

De Oplossing: DMuon (Distributed Muon)
Het X Square Robot Team heeft DMuon gebouwd, een nieuw systeem dat Muon bijna net zo snel maakt als AdamW. Ze hebben dit gedaan door de manier waarop het team werkt te veranderen, niet door de wiskunde van de coach te veranderen.

Hier is hoe ze de bottleneck hebben opgelost met drie belangrijke trucs:

1. De "Gespecialiseerde Expert"-strategie (Owner-Centric Execution)

In plaats van dat iedereen probeert elk paneel te repareren, wijst DMuon één specifieke computer toe als de "Owner" (eigenaar) voor elk paneel.

  • Voorheen: Iedereen verzamelde de data, iedereen deed de wiskunde, iedereen verspilde tijd.
  • Nu: Alleen de "Owner"-computer verzamelt de data en doet de zware wiskunde. De andere computers wachten simpelweg of doen ander werk.
  • Analogie: Stel je een bouwplaats voor. In plaats van dat elke arbeider het hele huis probeert te bouwen, wordt er één expert toegewezen aan het dak, een andere aan de loodgieterij. De anderen proberen niet het dak te bouwen; ze leveren alleen de gereedschappen aan die de expert nodig heeft. Dit voorkomt dat iedereen twee keer hetzelfde werk doet.

2. Het "Transportband"-systeem (Communication Overlap)

Terwijl de "Owner" de wiskunde uitvoert, zijn de andere computers niet simpelweg aan het niksen. DMuon creëert een pijplijn:

  • Forward Pass: Terwijl de robot "denkt" (data verwerkt), stuurt het systeem op de achtergrond stilletjes de volgende set gereedschappen naar de experts.
  • Backward Pass: Terwijl de robot "leert van fouten", verzamelt het systeem alvast de volgende batch data voor de experts.
  • Analogie: Het is als een keuken in een restaurant. De chef (de Owner) is groenten aan het snijden. In plaats van te wachten tot de chef klaar is voordat de ober de volgende bestelling brengt, brengt de ober de volgende bestelling alvast terwijl de chef nog aan het snijden is. De wachttijd wordt verborgen binnen de snijtijd.

3. De "Slimme Assemblagelijn" (Batching en Tuning)

De wiskunde die Muon doet is complex. Soms zijn de stukken enorm (zoals een gigantische muur), en soms zijn ze piepklein (zoals een kleine tegel).

  • Het Probleem: Als je probeert een piekleine tegel op een enorme machine te verwerken, staat de machine stil. Als je een gigantische muur verwerkt, duurt het eeuwig.
  • De Oplossing: DMuon groepeert veel kleine tegeltjes samen in één enkele "batch" zodat de machine druk blijft. Het gebruikt ook een "tuner" die automatisch de snelste manier vindt om elke specifieke vorm van tegel te verwerken.
  • Analogie: In plaats van een bezorgwagen te sturen voor één enkele envelop, wacht DMuon tot hij een volle vrachtwagen aan enveloppen heeft en stuurt ze dan allemaal tegelijk. Het past ook de route van de vrachtwagen aan, afhankelijk van of de bestemming een stad of een boerderij is.

De Resultaten

Het paper heeft DMuon getest op echte modellen, waaronder een robot trainingsmodel (Wall-OSS) en een taalmodel (Qwen2.5).

  • Snelheid: DMuon maakte de "optimizer stap" (de vergadering) 6 tot 163 keer sneller dan de oude, naïeve methode.
  • Efficiëntie: De totale tijd om een stap te trainen is nu slechts 2% langzamer dan de standaard AdamW-methode.
  • Conclusie: DMuon stelt teams in staat om de superieure "groepstherapie"-leerstijl van Muon te gebruiken zonder de enorme tijdstraf te betalen. Het verandelt een traag, log proces in een soepel en efficiënt proces, waardoor het klaar is voor gebruik in massale AI-modellen.

Kortom, DMuon is het verkeersregelsysteem dat ervoor zorgt dat de slimste coach (Muon) op een snelweg van computers kan rijden zonder een file te veroorzaken, waardoor het eindelijk praktisch wordt om de volgende generatie AI te trainen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →