← Nieuwste papers
🔢 mathematics

Convergence Rate Analysis of the AdamW-Style Shampoo: Unifying One-sided and Two-Sided Preconditioning

Dit artikel biedt een theoretische convergentieanalyse van de AdamW-stijl Shampoo-optimizer, die eenzijdige en tweezijdige preconditionering verenigt om een op de nucleaire norm gebaseerde convergentiesnelheid te vestigen die analoog is aan de optimale snelheid van SGD.

Oorspronkelijke auteurs: Huan Li, Yiming Dong, Zhouchen Lin

Gepubliceerd 2026-05-04
📖 4 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Huan Li, Yiming Dong, Zhouchen Lin

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een massief, mistig bergmassief te doorkruisen om de laagste vallei te vinden (de perfecte oplossing voor een AI-model). Je hebt een kaart, maar die is wat wazig, en elke keer als je een stap zet, verschuift de grond iets. Dit is wat het trainen van een diep neurale netwerk voelt.

Jarenlang was de populairste manier om deze stappen te zetten het gebruik van een methode genaamd Adam. Denk aan Adam als een wandelaar die naar de helling onder zijn voeten kijkt en zijn snelheid aanpast op basis van hoe steil het is in elke individuele richting (Noord, Zuid, Oost, West). Het is een goede wandelaar, maar hij behandelt elke richting onafhankelijk, en negeert hoe het terrein met elkaar verbonden zou kunnen zijn.

Dan komt Shampoo in beeld, een nieuwere, meer verfijnde wandelaar. In plaats van de richtingen individueel te bekijken, bekijkt Shampoo het terrein als geheel, als een tweedimensionaal vlak. Het begrijpt dat bewegen naar het Noord, invloed kan hebben op hoe je naar het Oost moet bewegen. Dit "tweezijdige" perspectief stelt het in staat om slimmere, efficiëntere stappen te zetten. Onlangs won een versie van Shampoo genaamd AdamW-style Shampoo een grote competitie om de snelste manier te vinden om AI-modellen te trainen, en versloeg de oude standaard.

Echter, terwijl iedereen wist dat deze nieuwe wandelaar in de praktijk snel was, had niemand een stevig wiskundig bewijs dat uitlegde waarom het zo goed werkte of hoe snel het gegarandeerd de bodem zou bereiken.

Wat dit artikel doet
Dit artikel is als een rigoureus technisch rapport dat eindelijk de fysica achter deze super-wandelaar uitlegt. De auteurs, Huan Li, Yiming Dong en Zhouchen Lin, deden drie hoofddingen:

  1. De regels verenigd: Zij creëerden een enkel wiskundig raamwerk dat zowel de "éénzijdige" versie (het bekijken van rijen of kolommen afzonderlijk) als de "tweezijdige" versie (het bekijken van het hele rooster) van Shampoo omvat. Het is alsof je één regelboek schrijft dat uitlegt hoe je zowel een sedan als een vrachtwagen moet besturen.
  2. De snelheid bewezen: Zij berekenden precies hoe snel dit algoritme convergeert (de oplossing bereikt). Zij vonden dat na KK stappen de fout afneemt met een snelheid van ongeveer 1/K41/\sqrt[4]{K}.
    • De analogie: Stel je voor dat je naar een doel loopt. De "oude" manier (SGD) brengt je daar met een bepaalde snelheid. De auteurs bewezen dat deze nieuwe Shampoo-methode je daar brengt met in wezen dezelfde theoretische snelheidslimiet als de best mogelijke methode, mits het terrein (de wiskunde van het probleem) zich netjes gedraagt.
  3. Brug geslagen tussen theorie en realiteit: Er was een kloof tussen de wiskunde en de echte wereld. De wiskunde suggereerde dat het algoritme een kleine "veiligheidsbuffer" (een getal genaamd ϵ\epsilon) nodig had om te werken, maar in de praktijk stelden mensen deze buffer bijna op nul. De auteurs toonden aan dat zelfs met deze kleine buffer, de "preconditievoorwaarden" van het algoritme (zijn interne kaart van het terrein) van nature groot genoeg blijven om de wandelaar veilig te houden. Dit verklaart waarom het algoritme in het echte leven zo goed werkt, zelfs wanneer het theoretische "veiligheidsnet" te dun lijkt.

Belangrijkste punten voor het algemene publiek

  • Het "tweezijdige" voordeel: Stel je voor dat je probeert een knoop te ontwarren. Een éénzijdige aanpak trekt aan één uiteinde. Een tweezijdige aanpak (zoals Shampoo) trekt tegelijkertijd aan beide uiteinden, en begrijpt hoe de draden met elkaar verweven zijn. Dit artikel bewijst dat het aan beide uiteinden trekken wiskundig onderbouwd is en even snel is als de best mogelijke strategie.
  • Het geheim van de "nucleaire norm": Om te meten hoe snel de wandelaar gaat, gebruikten de auteurs een specifieke wiskundige liniaal genaamd de "nucleaire norm". Zij toonden aan dat hoewel deze liniaal iets anders is dan de standaard die in oudere methoden wordt gebruikt, het resultaat in de echte wereld praktisch identiek is. Het is alsof je een kamer meet in "voeten" versus "meters" – de getallen zien er anders uit, maar de grootte van de kamer is hetzelfde.
  • Waarom het belangrijk is: Dit is niet zomaar abstracte wiskunde. Het bevestigt dat het algoritme dat door de winnaars van de AlgoPerf-competitie wordt gebruikt (die enorme AI-modellen traint zoals die chatbots aandrijven), niet zomaar een gelukkig giswerk is. Het is een wiskundig robuuste methode die gegarandeerd de beste oplossing efficiënt vindt, zelfs voor de meest complexe, niet-lineaire problemen.

Kortom, dit artikel neemt een "black box"-winnaar van een machine learning-competitie, opent deze, en zegt: "Hier is precies hoe het werkt, hier is het bewijs dat het snel is, en hier is waarom het niet kapot gaat als we het in de echte wereld gebruiken."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →