On the Principles Behind Neural Network Optimizers
Dit artikel biedt een gefundeerd theoretisch fundament voor de Adam-optimizer door het debat over de convergentie ervan op te lossen, de superioriteit ervan ten opzichte van SGD op Transformers te verklaren via evoluerende Hessian-structuren, en deze inzichten te benutten om Adam-mini te introduceren, een nieuwe optimizer die het geheugengebruik halveert terwijl de prestaties behouden blijven.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Moderne kunstmatige intelligentie rust op een delicaat evenwicht. Om een computer te leren een kat in een foto te herkennen of om een samenhangend verhaal te schrijven, moeten onderzoekers een massaal wiskundig systeem door een landschap van fouten leiden, waarbij ze voortdurend de interne instellingen aanpassen om het laagste punt te vinden. Dit proces wordt training genoemd, en het instrument dat wordt gebruikt om dit terrein te navigeren, is een optimizer. Jarenlang was de industriestandaard een algoritme genaamd Adam. Het is de standaardmotor voor de krachtigste taalmodellen, die code kunnen schrijven, talen kunnen vertalen en gesprekken kunnen voeren. Toch was de wiskundige basis van Adam, ondanks de alomtegenwoordigheid ervan, wankel. Voor bijna een decennium suggereerde een beroemd theoretisch resultaat dat Adam catastrofaal zou kunnen falen, waarbij het zelfs bij eenvoudige problemen uit de hand zou lopen. Dit creëerde een paradox: het hulpmiddel dat de meest geavanceerde AI aandrijft, was theoretisch kapot, maar werkte in de praktijk perfect. Onderzoekers vroegen zich af waarom de theorie niet overeenkwam met de realiteit en of het hulpmiddel waarop zij vertrouwden werkelijk veilig was.
Een nieuwe promotieonderzoek van Yushun Zhang aan de Chinese University of Hong Kong, Shenzhen, lost deze paradox op door het probleem vanuit een frisse hoek te bekijken. Het werk reponeert niet alleen de theorie; het heroverweegt de essentie van de problemen die deze modellen oplossen. De onderzoeker ontdekte dat de angst dat Adam zou falen gebaseerd was op een specifieke, kunstmatige opzet die niet weerspiegelt hoe echte training in de praktijk verloopt. Door het perspectief te veranderen naar de grootte van de datablokken die tijdens de training worden gebruikt, bewijst de studie dat Adam inderdaad veilig is, mits de instellingen correct zijn afgestemd op de specifieke taak. Belangrijker nog, de thesis onthult een verborgen geometrische structuur binnen de data van moderne neurale netwerken. Deze structuur verklaart waarom Adam beter presteert dan zijn rivalen bij complexe taken zoals het trainen van grote taalmodellen, terwijl het faalt op eenvoudigere taken. Het blijkt dat het interne landschap van deze modellen geen chaotische bende is, maar eerder een verzameling van duidelijke, georganiseerde blokken. Het herkennen van dit patroon stelde de onderzoeker in staat om een nieuwe, efficiëntere optimizer genaamd Adam-mini te ontwerpen, die de benodigde geheugenruimte om deze enorme modellen te trainen met de helft vermindert zonder aan prestaties in te boeten.
Het verhaal begint met het langlopende debat over de vraag of Adam betrouwbaar is. Jarenlang beweerde een veel geciteerd artikel dat Adam kon divergeren, wat betekent dat het trainingsproces naar oneindig zou weglopen in plaats van tot rust te komen. Deze claim was gebaseerd op een specifiek wiskundig voorbeeld waarbij het algoritme werd getest op een probleem dat zijn regels veranderde afhankelijk van de instellingen van het algoritme. In de echte wereld passen onderzoekers echter niet het probleem aan om bij het hulpmiddel te passen; ze fixeren het probleem en stemmen het hulpmiddel af op het probleem. Zhangs werk laat zien dat wanneer het probleem gefixeerd is, zoals in werkelijke training, Adam niet divergeert. In plaats daarvan vertoont het een duidelijke faseovergang: als de instellingen slecht zijn gekozen, kan het falen, maar als ze correct zijn gekozen, convergeert het veilig. De sleutel tot deze veiligheid ligt in een specifieke instelling die bepaalt hoeveel gewicht het algoritme geeft aan informatie uit het verleden. De studie bewijst dat voor grotere datasets deze instelling hoger moet zijn om stabiliteit te garanderen. Deze bevinding komt overeen met wat ingenieurs in de praktijk hebben waargenomen: bij het trainen van grote taalmodellen met kleine batches data, voorkomt het verhogen van deze instelling dat de training crasht. De thesis levert het eerste rigoureuze wiskundige bewijs dat de standaardversie van Adam, zonder enige modificaties, veilig is om te gebruiken wanneer het correct is afgesteld.
Nadat is vastgesteld dat Adam veilig is, richt het onderzoek zich op een nog puzzelender vraag: waarom werkt het veel beter dan de belangrijkste concurrent, SGD, op complexe modellen zoals Transformers, terwijl het slechter presteert op eenvoudigere modellen? Om dit te beantwoorden, keek de onderzoeker naar de vorm van het foutenlandschap, specifal naar een wiskundig object genaamd de Hessiaan, die beschrijft hoe de fout verandert in elke richting. In eenvoudige problemen is dit landschap dicht en verstrengeld, als een dik bos waar elk pad met elk ander pad verbonden is. In dergelijke omgevingen is de strategie van Adam om elke instelling afzonderlijk aan te passen inefficiënt. Echter, toen de onderzoeker de Hessiaan van diepe neurale netwerken en Transformers onderzocht, kwam er een verrassend patief naar voren. Naarmate de training vorderde, vereenvoudigde het complexe, verstrengelde landschap tot een structie van duidelijke, afzonderlijke blokken. Stel je een enorm spreadsheet voor waar, in plaats van dat elke cel elke andere cel beïnvloedt, de invloed beperkt is tot specifieke rijen en kolommen. In deze netwerken vormen de parameters die een specifieke output-neuron of een specifieke attention head controleren, hun eigen geïsoleerde groep.
Deze blokstructuur is het geheim van het succes van Adam. Omdat het landschap is opgedeeld in onafhankelijke blokken, wordt de methode van Adam om een unieke leersnelheid aan elke parameter toe te wijzen zeer effectief. Het kan de instellingen voor één blok aanpassen zonder per ongeluk de instellingen van een ander blok te verstoren. In contrast hiermee passen simpelere optimizers zoals SGD een enkele leersnelheid toe op het gehele systeem, wat moeite heeft met het hanteren van de variërende snelheden en schalen van deze verschillende blokken. De studie onthulde verder dat deze blokstructuur geen toeval is; het ontstaat natuurlijk uit de manier waarop deze netwerken zijn gebouwd, specifiek uit de opeenvolgende vermenigvuldiging van grote matrices tijdens het berekeningsproces. Terwijl het netwerk traint, vervagen de verbindingen tussen verre delen van het systeem, waardoor deze schone, gescheiden blokken achterblijven. Dit inzicht verklaart waarom Adam de motor van keuze is voor moderne AI: de problemen die het oplost hebben een verborgen geometrie die perfect past bij het ontwerp van de optimizer.
Gewapend met dit begrip van de verborgen blokstructuur, ontwikkelde de onderzoeker een nieuwe optimizer genaamd Adam-mini. Het standaard Adam-algoritme is geheugenhongerig omdat het een unieke leersnelheid bijhoudt voor elke individuele parameter in het model. Voor een massaal taalmodel vereist dit het opslaan van twee keer zoveel data als het model zelf, wat een bottleneck creëert die de training vertraagt en de omvang van de modellen die op beschikbare hardware kunnen worden gedraaid, beperkt. Het nieuwe inzicht was dat omdat de parameters in blokken zijn georganiseerd, we niet voor elke parameter een unieke leersnelheid nodig hebben. In plaats daarvan kunnen we één leersnelheid aan elk heel blok toewijzen. Deze eenvoudige verandering vermindert de geheugenvoetafdruk met 50 procent. De nieuwe optimizer, Adam-mini, groepeert parameters volgens hun natuurlijke blokstructuur — groeperen per rij voor de meeste lagen en per attention heads voor specifieke delen van het netwerk — en past een enkele leersnelheid toe op elke groep.
De resultaten van dit herontwerp zijn onmiddellijk en praktisch. In tests bij het trainen van modellen variërend van 39 miljoen tot één miljard parameters, evenaarde Adam-mini de prestaties van de standaard Adam-optimizer terwijl het de helft minder geheugen gebruikte. Deze efficiëntie stelt onderzoekers in staat om grotere modellen te trainen op dezelfde hardware of bestaande modellen sneller te trainen. De aanpak is al overgenomen door grote AI-labs, waaronder DeepSeek en het team achter het Kimi K3-model, die een variatie van deze methode gebruiken om hun volgende generatie systemen te trainen. De thesis toonde ook aan dat dit principe van blokgewijze leersnelheden kan worden toegepast op andere geavanceerde optimizers, waardoor hun efficiëntie wordt verbeterd zonder hun kernlogica te veranderen. Door de verborgen geometrie van het trainen van neurale netwerken te onthullen, heeft dit werk het veld verplaatst van een plek van onzekerheid en trial-and-error naar een plek van principiële vormgeving. Het demonstreert dat de meest effectieve instrumenten voor kunstmatige intelligentie niet slechts gelukkige gokken zijn, maar algoritmen die perfect zijn afgestemd op de specifieke wiskundige structuur van de problemen die ze oplossen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.