← Nieuwste papers
🤖 machine learning

The Convergence Gap: Instruction-Tuned Language Models Stabilize Later in the Forward Pass

Dit artikel introduceert de "convergentiegap"-diagnose om aan te tonen dat instructie-gefineerde taalmodellen hun volgende-tokenvoorspellingen later in de forward pass stabiliseren dan hun vooraf getrainde tegenhangers, een vertraging die voornamelijk wordt veroorzaakt door berekeningen in de late MLP-lagen.

Oorspronkelijke auteurs: Yifan Zhou

Gepubliceerd 2026-05-11
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yifan Zhou

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je twee chefs ziet die precies hetzelfde gerecht bereiden. De ene is een Beginnende Chef (het voorgetrainde model) die heeft geleerd door miljoenen kookboeken te lezen. De andere is een Meesterchef (het instructie-gefineerde model) die dezelfde training heeft gevolgd, maar daarna extra tijd heeft besteed om precies te leren hoe hij specifieke klantbestellingen moet volgen en beleefd moet chatten.

Je zou kunnen verwachten dat ze, zodra ze beginnen met koken, allebei vrij snel het eindgerecht zouden bedenken. Maar dit paper ontdekte iets verrassends: De Meesterchef blijft veel langer van mening veranderen dan de Beginnende Chef.

Hier is de uiteenzetting van de bevindingen uit het paper, met behulp van eenvoudige analogieën:

1. De "Convergentiegap": Wanneer beslissen ze?

Stel je het AI-model voor als een lange assemblagelijn met vele stations (lagen). Bij elk station maakt het model een gok over welk woord er als volgende komt.

  • De Beginnende Chef bedenkt de uiteindelijke smaak van het gerecht meestal heel vroeg in het proces. Tegen de tijd dat ze de laatste paar stations bereiken, zijn ze alleen nog maar een beslissing aan het polijsten die ze lang geleden aan het begin hebben genomen.
  • De Meesterchef blijft het recept de hele lijn door aanpassen. Zelfs bij de allerlaatste stations zijn ze nog aanzienlijk verschillend van het eindgerecht dat ze zullen serveren.

De auteurs noemen dit de "Convergentiegap". Het meet hoe ver de huidige gok van het model verwijderd is van het uiteindelijke antwoord. Het paper vond dat voor instructie-gefineerde modellen deze gap veel langer breed blijft. Ze "settelen" zich later in het proces op hun antwoord.

2. Is het gewoon een kwestie van vertrouwen?

Je zou kunnen denken: "Misschien klinkt de Meesterchef gewoon zelfverzekerder, dus zien ze er anders uit?"
De onderzoekers testten dit door beide chefs precies hetzelfde niveau van vertrouwen en onzekerheid te geven. Zelfs toen ze perfect op elkaar waren afgestemd wat betreft hoe zeker ze zich voelden, bleef de Meesterchef zich later in het proces van mening veranderen. Het was niet zomaar een trucje van vertrouwen; het was een fundamenteel verschil in hoe ze denken.

3. De "Magische Schakelaar": Waar gebeurt de verandering?

Om uit te zoeken waarom de Meesterchef zo lang aarzelt, speelden de onderzoekers een spelletje "Frankenstein". Ze namen delen van het brein van de Beginnende Chef en wisselden ze in het brein van de Meesterchef in, en andersom.

Ze testten drie zones:

  • Vroege Zone: Het begin van de assemblagelijn.
  • Midden Zone: Het midden van de lijn.
  • Late Zone: Het alleruiteinde van de lijn, net voordat het gerecht wordt geserveerd.

De Ontdekking:

  • Als je de Late Zone van de Meesterchef neemt en in de Beginnende Chef plaatst, begint de Beginneling plotseling te aarzelen en laat in het proces van mening te veranderen, net als de Meester.
  • Als je de Late Zone van de Meesterchef vervangt door de Late Zone van de Beginneling, stopt de Meesterchef plotseling met aarzelen en beslist vroeg.

De Analogie: Het is alsof de "Late Zone" het besluitvormingscomité is aan het einde van de fabriek. Het comité van de Meesterchef is ontworpen om tot het allerlaatste moment te debatteren en het plan te verfijnen. Het comité van de Beginneling tekent gewoon vroeg af.

4. Is het gewoon willekeurige ruis?

De onderzoekers vroegen zich af: "Is het gewoon omdat het brein van de Meesterchef complexer is, dus zou elke willekeurige verandering aan het einde dit veroorzaken?"
Ze probeerden willekeurige, verwarde delen aan het einde van de lijn in te wisselen. Er gebeurde niets. Het "Late Besluit"-effect verscheen alleen wanneer ze de echte getrainde delen van de Meesterchef inwisselden. Dit bewijst dat het een specifiek, aangeleerd gedrag is, en niet zomaar willekeurige chaos.

5. Verandert dit echt hoe ze praten?

Het paper bevatte een kleine test met één specifiek model (Gemma) om te zien of deze "laatse beslissing"-gewoonte het gesprek daadwerkelijk verandert.

  • Ze namen de Meesterchef en vervingen hun "Late Besluitcomité" door de versie van de Beginneling.
  • Resultaat: Toen mensen de gesprekken beoordeelden, gaven ze overweldigend de voorkeur aan de originele Meesterchef. De versie met het "Beginneling Late Comité" klonk minder behulpzaam en minder natuurlijk.

De Conclusie

Het paper claimt niet alle AI opgelost te hebben. Het wijst simpelweg op een specifiek, meetbaar verschil:
Instructie-gefineerde modellen (diegenen die met ons chatten) nemen een langere, slingerende weg om hun uiteindelijke antwoord te bereiken, in vergelijking met hun ruwe, voorgetrainde versies.

Ze "weten" het antwoord niet alleen anders; ze verwerken het pad naar het antwoord anders, waardoor ze hun opties veel langer openhouden. De "motor" die verantwoordelijk is voor deze vertraging bevindt zich in het allerlaatste deel van het brein van het model (de late MLP-lagen).

Wat het paper NIET claimt:

  • Het zegt niet dat dit de enige reden is waarom AI goed is in het volgen van instructies.
  • Het claimt niet dat deze methode werkt voor elk AI-model dat ooit is gemaakt.
  • Het belooft niet dat we dit kunnen gebruiken om AI-fouten in de echte wereld op te lossen (nog niet).

Het identificeert simpelweg een "handtekening" van hoe deze modellen leren instructies te volgen: ze wachten langer om te beslissen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →