← Nieuwste papers
🤖 machine learning

LionMuon: Alternating Spectral and Sign Descent for Efficient Training

Het artikel introduceert LionMuon, een efficiënte optimizer die afwisselend de updates van Lion en Muon toepast terwijl deze één momentumbuffer deelt, en die in vergelijking met bestaande methoden zoals AdamW, Lion en Muon superieure prestaties en lagere rekenkosten bereikt over verschillende modelgroottes.

Oorspronkelijke auteurs: Arman Bolatov, Artem Riabinin, Nikita Kornilov, Andrey Veprikov, Samuel Horváth, Martin Takáč, Aleksandr Beznosikov

Gepubliceerd 2026-05-20
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Arman Bolatov, Artem Riabinin, Nikita Kornilov, Andrey Veprikov, Samuel Horváth, Martin Takáč, Aleksandr Beznosikov

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een enorme, complexe robot (een Large Language Model) te leren spreken door hem miljoenen voorbeelden te tonen. Om dit te doen, heb je een "optimizer" nodig — een coach die de robot vertelt hoe hij zijn hersenen (zijn parameters) moet aanpassen na elk enkel voorbeeld dat hij ziet.

Het probleem is dat deze coach een beslissing moet nemen miljarden keren. Als de coach te traag is of te duur om uit te voeren, wordt het hele project te kostbaar. Als de coach te goedkoop is maar slechte beslissingen neemt, leert de robot langzaam of blijft hij vastzitten.

Dit paper introduceert een nieuwe coach genaamd LionMuon. Het is een slimme hybride die probeert het beste van twee zeer verschillende coachingstijlen te halen.

De twee bestaande coaches

Om LionMuon te begrijpen, moeten we eerst de twee coaches ontmoeten die het combineert:

  1. De "Sign"-coach (Lion/Signum):

    • Hoe het werkt: Deze coach is ongelooflijk snel en goedkoop. Hij kijkt niet naar de exacte grootte van de fout; hij kijkt alleen naar de richting (positief of negatief). Het is alsof een GPS je alleen vertelt "Sla linksaf" of "Sla rechtsaf", zonder de exacte afstand te berekenen.
    • Voordelen: Het is super efficiënt. Je kunt het miljarden keren uitvoeren zonder je bankrekening te breken.
    • Nadelen: Omdat het de "magnitude" negeert (hoe groot de draai moet zijn), volgt het soms een zwakke of licht afwijkende route. Het is snel, maar niet altijd het meest nauwkeurig.
  2. De "Spectral"-coach (Muon):

    • Hoe het werkt: Deze coach is een genie in wiskunde. Hij bekijkt de volledige kaart van de fout in één keer en berekent de perfecte, sterkst mogelijke richting om het te herstellen. Hij gebruikt complexe matrixwiskunde (zoals een high-end GPS die de absoluut kortste route berekent, rekening houdend met verkeer, terrein en snelheidslimieten).
    • Voordelen: Het vindt zeer snel het beste pad. De robot leert sneller per stap.
    • Nadelen: Het is rekenkundig duur. Het uitvoeren van deze complexe wiskunde kost veel tijd en energie. Als je deze coach voor elke enkele stap gebruikt, schiet de trainingsrekening omhoog.

De nieuwe oplossing: LionMuon

De auteurs stelden een simpele vraag: "Kunnen we de snelheid van de Sign-coach hebben, maar de nauwkeurigheid van de Spectral-coach?"

Hun antwoord is LionMuon.

In plaats van het een of het ander te kiezen, fungeert LionMuon als een slim schakelbord. Het wisselt tussen de twee coaches volgens een vast schema (stel, elke 2 stappen):

  • Stap 1: Het gebruikt de Muon-coach om die perfecte, sterke richting te vinden.
  • Stap 2: Het gebruikt de Lion-coach om een goedkope, snelle aanpassing te maken gebaseerd op de momentum van de eerste stap.
  • Stap 3: Het gaat terug naar Muon, en zo verder.

Het geheim:
Normaal gesproken moet je, als je coaches wisselt, hun geheugen resetten of twee verschillende geheugenbanken gebruiken. LionMuon is slim omdat het een enkele geheugenbank deelt tussen beide coaches. Dit betekent dat het geen extra computergeheugen (RAM) nodig heeft om te draaien. Het gebruikt evenveel geheugen als de goedkope Lion-coach, wat de helft is van het geheugen van de standaard industriële coach (AdamW).

Waarom is dit een grote zaak?

Het paper beweert dat LionMuon door het afwisselen van deze stappen het beste van twee werelden krijgt:

  1. Het is goedkoper: Omdat het alleen de dure "perfecte wiskunde" (Muon) elke paar stappen uitvoert, dalen de totale trainingskosten aanzienlijk (ongeveer 5% minder rekenkracht nodig voor hetzelfde resultaat).
  2. Het is slimmer: Hoewel het soms de dure wiskunde overslaat, worden de "goedkope" stappen geleid door de sterke richting die in de vorige stap is gevonden. Het resultaat is dat de robot sneller leert en een lagere foutenratio bereikt dan bij het gebruik van slechts één coach.
  3. Het schaalt: De onderzoekers testten dit op modellen van verschillende groottes (van 124 miljoen tot 720 miljoen parameters). In elk geval was LionMuon de winnaar, en bereikte het de beste resultaten met de minste hoeveelheid rekenkracht.

De theorie (Het "Waarom" het werkt)

De auteurs gokten niet zomaar; ze deden de wiskunde. Ze bewezen dat onder bepaalde voorwaarden (specifiek wanneer de data ruis bevat, wat gebruikelijk is in AI), er een "sweet spot" is voor hoe vaak je moet wisselen.

Ze ontdekten dat als je te vaak wisselt (Muon elke stap doen), het te duur is. Als je te zelden wisselt, verlies je de nauwkeurigheidsboost. Hun wiskunde toont aan dat voor de meeste moderne AI-modellen, het wisselen elke 2 stappen (één Muon, één Lion) het perfecte evenwicht is.

Samenvattende analogie

Stel je voor dat je in de mist een berg opwandelt.

  • Lion is een snelle hardloper die gewoon de richting gokt op basis van de wind. Hij beweegt snel, maar kan zigzaggen.
  • Muon is een trage, dure helikopterpiloot die een warmtebeeldcamera gebruikt om het absoluut steilste en veiligste pad te vinden.
  • LionMuon is een team waar de helikopterpiloot één keer vliegt om het beste pad te vinden, waarna de snelle hardloper een tijdje langs dat pad sprint voordat de helikopter weer controleert.

Het resultaat? Je bereikt de top sneller en met minder brandstof dan als je voor de hele reis op de helikopter zou vertrouwen of de hele weg zou gokken.

De kernboodschap: LionMuon is een nieuwe, efficiënte manier om AI te trainen die geld en tijd bespaart terwijl het de AI slimmer maakt, zonder extra computergeheugen nodig te hebben.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →