← Nieuwste papers
🤖 machine learning

Muown: Row-Norm Control for Muon Optimization

Het artikel introduceert Muown, een plug-in optimizer die expliciet rij-magnitude-vectoren controleert om spectrale norm-drift in Muon te voorkomen, waardoor de trainingsstabiliteit wordt verbeterd, de gevoeligheid voor gewichtsverval wordt verminderd en superieure perplexiteit wordt bereikt over verschillende modelgroottes.

Oorspronkelijke auteurs: Kai Lion, Florian Hübler, Bingcong Li, Antonio Orvieto, Niao He

Gepubliceerd 2026-05-12
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Kai Lion, Florian Hübler, Bingcong Li, Antonio Orvieto, Niao He

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een gigantisch digitaal brein (een Large Language Model) traint om verhalen te schrijven, wiskundeproblemen op te lossen of met je te chatten. Om dit te doen, moet het brein leren door miljoenen kleine knoppen (gewichten) in zijn circuits aan te passen.

Lange tijd was de beste manier om deze knoppen te draaien een methode genaamd AdamW. Onlangs arriveerde een nieuwe, snellere methode genaamd Muon. Het was als overstappen van een fiets naar een sportauto; het leerde sneller en beter. Maar er was een addertje onder het gras: de sportauto had de neiging om onbedwingbaar te versnellen.

Het Probleem: De "Afdrijvende" Motor

Het artikel identificeert een specifiek probleem met Muon. Naarmate het model traint, begint de "grootte" van zijn interne verbindingen (specifiek, de sterkte van de rijen in zijn gewichtsmatrices) oncontroleerbaar te groeien.

Denk hierbij aan een ballon die wordt opgeblazen.

  • Muon is uitstekend in het uitvinden naar welke kant de ballon moet worden opgeblazen (de richting).
  • Echter, het pompt steeds meer lucht in dan nodig is, waardoor de ballon steeds groter wordt tot hij misschien knapt (numerieke fouten) of instabiel wordt.
  • De standaardoplossing was om een touw om de ballon te binden en het strak te trekken elke keer als hij te groot werd (Weight Decay). Maar de auteurs ontdekten dat dit was als het gebruik van een sloopkogel om een noot te kraken: het vertraagde het leerproces omdat het de hele ballon samendrukte, zelfs de delen die prima waren.

De Diagnose: Twee Delen van het Probleem

De auteurs, geleid door Kai Lion, besloten om in de ballon te kijken om te zien wat er eigenlijk groeide. Ze realiseerden zich dat de "grootte" van de verbinding uit twee onderscheiden delen bestaat:

  1. De Magnitude (Het Volume): Hoe groot de rij getallen in zijn geheel is.
  2. De Coherence (De Vorm): Hoe de getallen binnen die rij ten opzichte van elkaar zijn gerangschikt.

Ze ontdekten dat alleen de Magnitude oncontroleerbaar afdreef. De Vorm (Coherence) gedroeg zich eigenlijk perfect en bleef stabiel. De ballon veranderde niet van vorm; hij werd gewoon groter.

De Oplossing: Muown (De Slimme Pomp)

De auteurs creëerden een nieuwe optimizer genaamd Muown.

In plaats van de hele verbinding als één groot klompje te behandelen, splitst Muown de taak op in twee aparte taken:

  1. Het Richtingsteam (Muon): Dit team blijft doen wat Muon het beste doet: het uitvinden van de perfecte richting om de gewichten bij te werken. Ze laten dit deel onveranderd.
  2. Het Volumeteam (Nieuw): Dit is het nieuwe deel. Ze nemen de "Magnitude" (het volume) en behandelen het als een aparte, expliciete variabele. Ze geven dit volume een speciale set regels (een specifieke wiskundige geometrie genaamd \ell_\infty) om te voorkomen dat het te snel groeit.

De Analogie:
Stel je voor dat je een auto rijdt waarbij het stuurwiel en het gaspedaal aan elkaar vastzitten. Als je het stuur draait, wordt het gaspedaal ook ingedrukt, waardoor de auto onbedwingbaar versnelt.

  • Muon was als die vastzittende auto.
  • Muown is als het ontkoppelen van het stuurwiel van het gaspedaal. Je kunt nog steeds perfect sturen (met de logica van Muon), maar nu heb je een aparte, slimme cruisecontrol voor het gaspedaal (de magnitude) die de snelheid precies op de juiste plek houdt zonder je te vertragen.

De Resultaten

Het artikel testte dit op modellen variërend van klein (124 miljoen parameters) tot zeer groot (2,7 miljard parameters). Hier is wat ze vonden:

  • Beter Prestatie: Muown produceerde consequent betere resultaten (lagere "perplexity", een maatstaf voor hoe verward het model is) dan Muon, AdamW en andere concurrenten.
  • Vergevingsgezinder: Met Muon moest je zeer voorzichtig zijn met je instellingen (leersnelheid). Als je de verkeerde koos, zou het model falen. Muown is veel robuuster; het werkt goed over een breed scala aan instellingen, zoals een auto met een bredere "sweet spot" voor rijden.
  • Geen Extra Kosten: Meestal vertraagt het toevoegen van een nieuw controlesysteem een auto. Maar omdat de auteurs deze nieuwe "volumeregeling" direct in de bestaande workflow van de motor integreerden, voegde het bijna geen extra tijd toe aan het trainingsproces.
  • Stabiliteit: De "ballon" stopte met afdrijven. De spectrale norm (de grootte van de verbindingen) bleef stabiel, waardoor de numerieke fouten die het oorspronkelijke Muon teisterden, werden voorkomen.

Samenvatting

Het artikel betoogt dat de instabiliteit in de populaire Muon-optimizer geen gebrek was aan zijn vermogen om de richting te vinden, maar eerder een gebrek aan controle over het "volume" van zijn updates. Door het "volume" te scheiden van de "richting" en ze te controleren met verschillende, gespecialiseerde tools, houdt Muown het trainen snel en stabiel zonder zware ingrepen zoals weight decay nodig te hebben. Het is een directe vervanging die het trainingsproces soepeler, sneller en betrouwbaarder maakt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →