← Nieuwste papers
🤖 machine learning

How does the optimizer implicitly bias the model merging loss landscape?

Dit artikel onthult dat het effectieve ruisniveau, bepaald door optimizer-componenten zoals leersnelheid en batchgrootte, de geometrie van het verlieslandschap zo beïnvloedt dat het succes van modelmerging een niet-monotoon verband vertoont met een duidelijk optimum.

Oorspronkelijke auteurs: Chenxiang Zhang, Alexander Theus, Damien Teney, Antonio Orvieto, Jun Pang, Sjouke Mauw

Gepubliceerd 2026-04-22
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Chenxiang Zhang, Alexander Theus, Damien Teney, Antonio Orvieto, Jun Pang, Sjouke Mauw

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Hoe de 'ruis' van een optimizer bepaalt of twee AI-modellen goed kunnen samensmelten

Stel je voor dat je twee verschillende chefs hebt. Chef A is een meester in het maken van perfecte pizza's, en Chef B is een expert in het maken van heerlijke sushi. Je wilt een nieuwe chef creëren die beide vaardigheden beheerst, zonder dat je twee keer zoveel personeel nodig hebt. Dit noemen we in de AI-wereld modelmerging: het samenvoegen van twee onafhankelijk getrainde kunstmatige intelligenties tot één krachtig model.

Maar hier zit de kluif: soms werkt dit perfect, en soms is het resultaat een smakeloze soep. Waarom? Dit artikel uit 2026 geeft een verrassend antwoord: het hangt af van hoe "ruisig" het trainingsproces was.

Hier is de uitleg in simpele taal, met een paar creatieve vergelijkingen.

1. Het probleem: Waarom smelten sommige modellen niet?

Wanneer je een AI-model traint, laat je het duizenden keren oefenen op een dataset. Aan het einde heb je een "oplossing" (een set van gewichten). Als je twee modellen traint op dezelfde taak, eindigen ze vaak in een heel vergelijkbaar punt, maar niet exact op hetzelfde punt.

Als je deze twee modellen nu simpelweg gemiddeld (zoals het mengen van twee kommen soep), werkt het alleen als ze in een vrij vlak landschap zitten. Als ze in een diepe, smalle kuil zitten, is het mengen een ramp. De vraag is: wat bepaalt of een model in een vlak landschap of in een smalle kuil belandt?

2. De sleutel: De "Effectieve Ruis"

De auteurs ontdekken dat er één geheimzinnige factor is die alles bepaalt: de Effectieve Ruis Schaal.

Stel je voor dat het trainen van een AI-model als een wandeling door een mistig berglandschap is. Je wilt naar de laagste vallei (de beste oplossing) lopen.

  • Te weinig ruis (Te stil): Je loopt heel voorzichtig en precies. Je komt misschien wel in een vallei, maar het is een hele smalle, diepe kuil. Als je nu een tweede wandelaar probeert te vinden die in een andere smalle kuil zit, en je probeert ze te middelen, dan beland je precies op de rand van een afgrond. Het werkt niet.
  • Te veel ruis (Te lawaaiig): Je loopt als een dronken man. Je trilt en strompelt overal heen. Je vindt geen stabiele vallei, maar blijft overal heen en weer springen. Ook hier werkt samenvoegen niet.
  • De Gouden Middenweg (Net genoeg ruis): Je loopt met een gezonde dosis onzekerheid. Je stuitert een beetje, maar niet te veel. Hierdoor beland je in een brede, vlakke vallei. Twee wandelaars die in zo'n brede vallei lopen, kunnen makkelijk worden gemiddeld. Het resultaat is nog steeds diep in de vallei, maar nu is de weg ertussen ook veilig.

3. Wat veroorzaakt deze "ruis"?

De auteurs laten zien dat verschillende instellingen in de training allemaal hetzelfde effect hebben: ze veranderen de hoeveelheid ruis. Je kunt dit zien als de "stabiliteit" van de wandeling:

  • Leerstempo (Learning Rate): Een groot leertempo is als een wandelaar met lange, energieke passen. Hij stuitert meer (meer ruis) en vindt de brede valleien sneller. Een klein leertempo is als een mierenpas: heel precies, maar je belandt in een smalle kuil.
  • Batch Grootte: Als je met een hele grote groep (grote batch) oefent, is de feedback heel stabiel en saai (weinig ruis). Oefen je met kleine groepjes (kleine batch), dan is de feedback wisselvallig en "ruisig", wat juist helpt om brede valleien te vinden.
  • Gewichtsverval (Weight Decay): Dit is een techniek om te voorkomen dat het model te complex wordt. De auteurs ontdekten dat dit ook de "ruis" beïnvloedt en helpt bij het vinden van die brede valleien.
  • Data Augmentatie: Het willekeurig verdraaien of spiegelen van foto's tijdens het trainen voegt extra ruis toe, wat ook helpt.

4. De verrassende conclusie: Meer ruis is soms beter!

Vroeger dachten wetenschappers dat je training zo stabiel mogelijk moest houden. Dit artikel zegt: Nee!

Als je wilt dat je modellen later makkelijk te samenvoegen zijn, moet je ze trainen met een beetje meer ruis (een iets hogere leersnelheid, kleinere batches, etc.).

  • Een model getraind met een groot leertempo (veel ruis) is misschien net zo goed in zijn eigen taak als een model met een klein leertempo.
  • Maar het model met de grote ruis zit in een brede vallei.
  • Het model met de kleine ruis zit in een smalle kuil.

Wanneer je twee brede valleien samenvoegt, krijg je een super-model. Wanneer je twee smalle kuilen samenvoegt, krijg je een puinhoop.

5. Waarom is dit belangrijk?

In de praktijk betekent dit dat AI-ontwikkelaars niet hoeven te gissen welke modellen ze moeten samenvoegen. Ze kunnen simpelweg hun training instellen op een "moderate noise" niveau (bijvoorbeeld een iets hogere leersnelheid).

Het is alsof je twee teams bouwt die niet alleen goed zijn in hun eigen werk, maar ook compatibel zijn met elkaar. Door de training net een beetje "onrustig" te maken, zorg je ervoor dat de teams in een gebied terechtkomen waar ze later makkelijk kunnen samenwerken.

Kort samengevat:
Om AI-modellen succesvol te laten trouwen en een gezin te vormen (samenvoegen), moet je ze tijdens hun jeugd (training) niet te streng en te stil houden. Een beetje chaos en onzekerheid zorgt ervoor dat ze in een breed, veilig huis terechtkomen waar ze later makkelijk met elkaar kunnen samenwerken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →