← Nieuwste papers
🤖 AI

Optimizer-Induced Mode Connectivity: From AdamW to Muon

Dit artikel toont aan dat optimalisatiealgoritmen zoals AdamW en Muon onderscheiden, vaak onderling niet-verbonden, nul-verlies-oplossingsvariëteiten in neurale netwerken induceren, wat aantoont dat modusconnectiviteit fundamenteel afhankelijk is van het specifieke optimalisatiealgoritme en diens impliciete regularisatie in plaats van een universele eigenschap van het verlieslandschap te zijn.

Oorspronkelijke auteurs: Fangzhao Zhang, Sungyoon Kim, Erica Zhang, Yiqi Jiang, Mert Pilanci

Gepubliceerd 2026-05-12
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Fangzhao Zhang, Sungyoon Kim, Erica Zhang, Yiqi Jiang, Mert Pilanci

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert het laagste punt te vinden in een uitgestrekt, bergachtig landschap. Dit landschap vertegenwoordigt de "verliesfunctie" van een neurale netwerk: hoe hoger je bent, hoe slechter je model presteert; hoe lager je bent, hoe beter.

Lange tijd geloofden onderzoekers dat als je twee verschillende modellen trainde om de bodem van deze vallei te bereiken (de "nul-verlies"-toestand), je een eenvoudige, gladde weg tussen hen kon trekken zonder ooit weer een heuvel op te klimmen. Dit idee heet Mode Connectiviteit. Het is alsof je zegt: "Als twee wandelaars de bodem van dezelfde vallei hebben gevonden, moet er een vlak pad zijn dat hen verbindt."

Echter, dit artikel stelt een nieuwe vraag: Hangt het pad af van hoe de wandelaars hebben gelopen?

De auteurs introduceren twee verschillende "wandelstijlen" (optimalisatoren):

  1. AdamW: De klassieke, betrouwbare wandelaar.
  2. Muon: Een nieuwere, meer gespecialiseerde wandelaar die anders beweegt.

Hier is wat het artikel ontdekte, uitgelegd via eenvoudige analogieën:

1. De "Spectrale Vingerafdruk"

Elk model heeft een unieke "vingerafdruk" bestaande uit getallen die singuliere waarden worden genoemd (denk hierbij aan de interne "spiertonus" of "vorm" van het model).

  • AdamW-modellen hebben de neiging om een paar zeer sterke spieren en vele zwakke spieren te hebben (uitbijters in het spectrum).
  • Muon-modellen hebben de neiging om spieren te hebben die allemaal ongeveer even groot zijn (een meer gebalanceerd, "isotroop" spectrum).

Het artikel vond dat als je twee modellen neemt die met AdamW zijn getraind, je tussen hen kunt lopen en hun "spiertonus" consistent blijft. Als je twee Muon-modellen neemt, geldt hetzelfde. Ze blijven in hun eigen "buurten".

2. De Snelweg voor Dezelfde Optimalisator (Intra-Optimizer Connectiviteit)

Het artikel bewijst wiskundig dat als het neurale netwerk breed genoeg is (genoeg neuronen heeft), alle oplossingen die door AdamW worden gevonden, verbonden zijn door een glad, laag-verlies pad. Hetzelfde geldt voor Muon.

  • Analogie: Stel je een groot, vlak weiland voor. Als jij en je vriend dezelfde wandelschoenen gebruiken (AdamW), kun je van je plek naar de plek van je vriend lopen zonder ooit op een steen te stappen of omhoog te gaan. Je blijft in dezelfde "schoenafdruk"-zone.

3. De Barrière tussen Optimalisatoren (Inter-Optimizer Disconnectiviteit)

Dit is het meest verrassende deel. Wat gebeurt er als je probeert te lopen van een AdamW-model naar een Muon-model?

  • De Theorie: In een klein, eenvoudig netwerk bewezen de auteurs dat de "AdamW-vallei" en de "Muon-vallei" misschien gescheiden zijn door een hoge bergkam. Je kunt niet van de ene naar de andere lopen zonder omhoog te klimmen en prestaties te verliezen. Ze bevinden zich in verschillende "eilanden" van de oplossingsruimte.
  • De Realiteit (Grote Modellen): In hun grootschalige experimenten (met GPT-2, een taalmodel) vonden ze dat je ze wel kunt verbinden, maar dat het pad speciaal is. Terwijl je van AdamW naar Muon loopt, verandert de "spiertonus" (spectrum) van het model niet alleen; het verandert soepel.
    • Analogie: Stel je voor dat je loopt van een bos met dennenbomen (AdamW) naar een bos met eikenbomen (Muon). Je teleporteert niet zomaar; je loopt door een overgangszone waar de bomen geleidelijk van den naar eik veranderen. Het pad bestaat, maar het loopt door een uniek "hybride" landschap dat geen enkele optimalisator van nature alleen zou creëren.

4. Het "Smoothie"-effect (Generalisatie)

Het artikel testte wat er gebeurt als je een model neemt halverwege tussen een AdamW-oplossing en een Muon-oplossing.

  • Het Resultaat: Deze "hybride" modellen presteerden vaak beter op data die ze nog niet hadden gezien (generalisatie buiten de verdeling) dan de oorspronkelijke modellen.
  • Analogie: Als je koffie (AdamW) en thee (Muon) mengt, krijg je een nieuw drankje dat voor sommige mensen misschien lekkerder smaakt dan alleen de koffie of alleen de thee. De "mix" verkent delen van het landschap die de afzonderlijke optimalisatoren gemist hebben.

Samenvatting van Beweringen

  • Zelfde Optimalisator: Als je dezelfde optimalisator twee keer gebruikt, zijn de oplossingen verbonden door een glad pad dat de interne structuur van het model consistent houdt.
  • Verschillende Optimalisatoren: Als je verschillende optimalisatoren gebruikt, kunnen de oplossingen in kleine netwerken gescheiden zijn door een barrière, of verbonden zijn door een pad dat de interne structuur van het model in grote netwerken soepel overgaat.
  • Het Voordeel: Het lopen tussen deze verschillende optimalisator-oplossingen creëert "hybride" modellen die beter kunnen generaliseren naar nieuwe, ongezette data.

Het artikel claimt niet dat dit werkt voor medische diagnose, autonoom rijden of specifieke toekomstige AI-toepassingen. Het richt zich strikt op de meetkundige geometrie van hoe deze modellen verbonden zijn en de empirische observatie dat het mengen van hen de generalisatie verbetert bij het trainen van taalmodellen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →