← Nieuwste papers
🤖 machine learning

M+Adam: Low-Precision Training via Additive-Multiplicative Optimization

Het artikel stelt M+Adam voor, een nieuwe optimizer die additieve en multiplicatieve updates combineert om de complementaire faalmodi van training met lage precisie te overwinnen, waardoor stabiele en nauwkeurige training van LLaMA-stijl modellen mogelijk wordt met uitsluitend BF16, FP8 en FP4 mastergewichten.

Oorspronkelijke auteurs: Xiaoyuan Liang, Sebastian Loeschcke, Mads Toftrup, Anima Anandkumar

Gepubliceerd 2026-07-14
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xiaoyuan Liang, Sebastian Loeschcke, Mads Toftrup, Anima Anandkumar

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een gigantische, hyperintelligente robot (een Large Language Model) probeert te leren schrijven als een mens. Om dit te doen, moet je miljoenen kleine draaiknoppen op de hersenen van de robot aanpassen. Normaal gesproken worden deze draaiknoppen met extreme precisie aangepast, zoals het met een microscoop een schroefje draaien. Maar microscopen zijn zwaar, traag en duur.

De paper vraagt: Wat als we een goedkope, lichtgewicht moersleutel gebruiken?

Dit is de wereld van low-precision training. In plaats van deze "master weights" (het geheugen van de robot over de draaiknoppen) met hoge precisie te bewaren, proberen onderzoekers ze op te slaan in een kleiner, grover formaat zoals BF16, FP8 of zelfs FP4. Het is alsof je de hoogte van een berg probeert te meten met een liniaal die alleen markeringen heeft om de 3 meter.

Het Probleem: De "Afrondingsval"

De auteurs ontdekten dat wanneer je deze grove linialen gebruikt, standaard trainingsmethoden (genaamd Adam) tegen een muur aanlopen. Hier is waarom:

  1. Het Grote Bergprobleem: Wanneer een draaiknop op een enorm hoog getal staat, staan de markeringen op de "liniaal" heel ver uit elkaar. Als de robot de draaiknop slechts een klein beetje moet verplaatsen, kan de liniaal dat niet zien. De kleine beweging wordt afgerond naar nul, en de robot denkt: "Ik heb niets bewogen!" De robot zit vast en kan de berg niet beklimmen.
  2. Het Nul-dal Probleem: Andere methoden probeerden dit op te lossen door multiplicatieve updates te gebruiken (zoals Madam). In plaats van een klein getal op te tellen, vermenigvuldig je de draaiknop met een factor. Dit werkt geweldig voor grote bergen, omdat de stapgrootte meegroeit met de draaiknop. Echter, als een draaiknop precies op nul staat, kun je hem niet door vermenigvuldiging in beweging krijgen. Het is alsof je een auto probeert te duwen die geen wielen heeft; vermenigvuldigen van nul met wat dan ook levert nog steeds nul op. Ook, als de draaiknop van positief naar negatief moet veranderen (door nul heen kruisen), raken deze methoden in de war en kunnen ze die overstap niet maken.

De Oplossing: M+Adam (De Twee-Gereedschap-Kit)

De paper introduceert M+Adam, een nieuwe optimizer die werkt als een slimme monteur die twee verschillende gereedschappen tegelijk bij zich draagt. Het combineert het beste van beide werelden om de "complementaire faalmodi" op te lossen.

  • Gereedschap 1: De Additieve Moersleutel (Adam-stijl). Dit gereedschap is goed voor kleine, precieze aanpassingen. Het kan een draaiknop van nul wegduwen, het teken laten omslaan van positief naar negatief, en kleine bewegingen nabij de bodem van het dal afhandelen.
  • Gereedschap 2: De Multiplicatieve Hefboom (Madam-stijl). Dit gereedschap is goed voor het zware werk. Wanneer een draaiknop enorm groot is en de additieve moersleutel wordt "afgerond" naar niets, komt de multiplicatieve hefboom in actie. Het schaalt de draaiknop omhoog of omlaag, waardoor de robot vooruitgang blijft boeken, zelfs op de hoogste bergen.

M+Adam gebruikt beide gereedschappen gelijktijdig. Als het additieve gereedschap vastloopt door afronding, houdt het multiplicatieve gereedschap de robot in beweging. Als het multiplicatieve gereedschap niet uit nul kan ontsnappen, duwt het additieve gereedschap het eruit.

Het Bewijs: Werkt het?

De auteurs hebben niet alleen gegesteld; ze hebben dit op enorme schaal getest.

  • De Test: Ze trainden "LLaMA-stijl" taalmodellen variërend van 60 miljoen tot 1 miljard parameters.
  • Het Budget: Ze gebruikten trainingsbudgetten van 1x tot 8x het standaard "Chinchilla"-budget (een standaardmaatstaf voor hoeveel data een model ziet).
  • De Precisie: Ze testten met BF16, FP8 en NVFP4 master weights.

De Resultaten:
In elke enkele test versloeg M+Adam consequent de standaard Adam-optimizer.

  • In de meest extreme low-precision setting (NVFP4), verminderde M+Adam de "perplexity" (een maatstaf voor hoe verward het model is) met 16,6% voor het 350M-model vergeleken met Adam.
  • Zelfs met 1 miljard parameters liet M+Adam duidelijke verbeteringen zien ten opzichte van Adam in alle precisie-regimes.

De paper bewijst wiskundig dat deze gecombineerde aanpak garandeert dat de trainingsverlies zal dalen (een "monotone daling"), wat betekent dat de robot altijd leert en nooit in een lus vast komt te zitten.

Wat het NIET is

Het is belangrijk om te weten wat deze paper niet beweert:

  • Het zegt niet dat M+Adam een wondermiddel is dat alle geheugenkosten elimineert. Sterker nog, de paper merkt op dat M+Adam een klein beetje extra geheugen toevoegt (één extra "state" voor het multiplicatieve gerek), maar ze laten zien dat dit later gecomprimeerd kan worden.
  • Het beweert niet dat standaardmethoden zoals Stochastic Rounding (een techniek om afrondingsfouten te herstellen) nutteloos zijn. Ze hebben Adam met Stochastic Rounding getest, en M+Adam presteerde nog steeds beter.
  • Het suggereert niet dat we volledig moeten stoppen met het gebruik van high-precision hardware. In plaats daarvan laat het zien dat als we moeten werken met low-precision opslag, M+Adam de juiste manier is om het te doen.

De Kernboodschap

De paper suggereert dat wanneer je gedwongen bent om "grove" linialen (low-precision weights) te gebruiken om gigantische AI-modellen te trainen, je niet op slechts één type beweging kunt vertrouwen. Je hebt een hybride aanpak nodig. M+Adam is die hybride, die zowel additieve als multiplicatieve stappen gebruikt om ervoor te zorgen dat de robot nooit vastloopt, of hij nu een gigantische berg beklimt of probeert te ontsnappen aan een nul-dal. Het is een principiële stap naar het efficiënt trainen van massieve AI-modellen zonder de zware, dure high-precision geheugens die we gewoonlijk nodig hebben.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →