← Nieuwste papers
🤖 machine learning

Lying Is Just a Phase: The Hidden Alignment Transition in Language Model Scaling

Dit artikel identificeert een verborgen "aligneringsovergang" in taalmiddelen waarbij redeneren en waarheidsgetrouwheid zich van een anticorrelatie naar een samenwerking verschuiven boven een kritieke schaal, een faseovergang die voorspeld en gemanipuleerd kan worden via architecturale aanpassingen, datacuratie en trainingsrecepten zonder toegang tot de interne werking van het model.

Oorspronkelijke auteurs: Adil Amin

Gepubliceerd 2026-05-20
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Adil Amin

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Idee: De "Groei-klachten" van AI

Stel je voor dat je een kind leert om tegelijkertijd slim en eerlijk te zijn. Lange tijd dachten wetenschappers dat als je een kind meer onderwijs geeft (meer "schaal"), ze van nature zowel slimmer als eerlijker worden.

Dit artikel stelt dat dit voor AI-modellen niet altijd waar is. Sterker nog, er is een specifieke fase van "groei-klachten" waarin slimmer worden de AI juist slechter maakt in het vertellen van de waarheid.

De auteurs noemen dit de "Alignment Tax" (Aanpassingsbelasting). Het is als een tijdelijke boete die je betaalt terwijl de AI opgroeit. Maar het goede nieuws? Dit is geen natuurwet. Het is een ontwerpfout die ingenieurs kunnen oplossen.


1. De U-bocht in de Weg

De onderzoekers keken naar 63 verschillende AI-modellen uit 16 verschillende families. Ze maten twee dingen:

  1. Redeneren: Hoe goed de AI puzzels oplost (zoals een wiskundetoets).
  2. Eerlijkheid: Hoe goed de AI voorkomt dat hij dingen verzonnen (zoals een leugendetector).

Wat ze vonden:

  • Kleine Modellen (De "Belasting"-fase): Wanneer de AI klein is, maakt het slimmer maken hem vaak slechter in het vertellen van de waarheid. Het is als een tiener die zo zelfverzekerd raakt in zijn nieuwe ideeën dat hij verhalen begint te verzinnen om cool over te komen. De twee vaardigheden vechten met elkaar.
  • De Kritieke Schakel (NcN_c): Er is een specifieke grootte (rond de 3,5 miljard parameters voor sommige modellen) waar dit verandert.
  • Grote Modellen (De "Bonus"-fase): Zodra de AI die grootte-drempel overschrijdt, stopt het gevecht. Nu maakt het slimmer maken hem ook eerlijker. De twee vaardigheden gaan samenwerken als een goed geoliede machine.

De Vangst: De verliescurve (de standaard manier waarop we AI-progressie meten) toont dit niet. Het lijkt op een gladde, perfecte lijn die omlaag gaat. Het "gevecht" tussen vaardigheden is onzichtbaar voor de standaardtools, en schuilt precies onder het oppervlak.

2. Het Gaat Niet om Grootte; Het Gaat om het Recept

Je zou kunnen denken: "Oh, dus we hebben gewoon grotere modellen nodig om dit op te lossen." Het artikel zegt: Nee. Grootte is slechts één ingrediënt.

De "Alignment Tax" is eigenlijk een ontwerpkeuze. De onderzoekers vonden drie "knoppen" die ingenieurs kunnen draaien om het probleem op te lossen, soms zelfs in heel kleine modellen:

  • Knop 1: Betere Data (Het "Gecureerde Dieet"):

    • Analogie: Stel je voor dat je een kind alleen hoogwaardige, geverifieerde feiten voert in plaats van willekeurige internetgeruchten.
    • Resultaat: Het Phi-model (zeer klein, 1 miljard parameters), getraind op super-schone data, gedraagt zich even eerlijk en slim als een 10-miljard-parameter model getraind op rommelige webdata. De "belasting" verdwijnt omdat het dieet beter was.
    • Voorbeeld: Qwen3-modellen vertonen helemaal geen "belasting" omdat hun trainingsdata zorgvuldig was gecureerd.
  • Knop 2: Breder Architectuur (De "Brede Gang"):

    • Analogie: Stel je een gang voor waar twee mensen (Redeneren en Waarheid) proberen tegelijk door een smalle deur te lopen. Ze botsen op elkaar en vechten. Als je de deur verbreedt, kunnen ze naast elkaar lopen zonder te botsen.
    • Resultaat: Het probleem zit niet in het brein zelf; het zit in de output-projectie (de laatste deur waar de informatie doorheen gaat). Als je die deur breder maakt, stopt het gevecht, zelfs als het model even groot blijft.
  • Knop 3: Architectuurwijzigingen:

    • Analogie: Het wijzigen van de blauwdruk van het huis.
    • Resultaat: Nieuwere ontwerpen (zoals Gemma-4) kunnen de fase van "groei-klachten" volledig overslaan. Een 4-miljard parameter Gemma-4 gedraagt zich als een 13-miljard parameter model uit een oudere generatie.

3. Waar Verbergt het Probleem Zich?

De onderzoekers keken in het "brein" van de AI (de attention heads).

  • Verrassing: In het brein zijn de delen die verantwoordelijk zijn voor redeneren en waarheid eigenlijk vriendelijk. Ze werken 95% van de tijd samen.
  • De Echte Bottleneck: Het probleem gebeurt helemaal aan het einde, wanneer de AI het antwoord moet uitspuwen. Het is als een groep vrienden die het eens worden over een plan, maar de persoon die namens de groep spreekt een microfoon heeft die te klein is om beide stemmen tegelijk te dragen. Het signaal wordt samengeperst, en het lijkt alsof ze vechten.
  • De Oplossing: Als je die spreker een grotere microfoon geeft (een bredere outputlaag), komt de samenwerking naar voren.

4. Waarom Dit Voor Jou Belangrijk Is

  • Ga niet uit van "Groter is Beter": Als je een klein AI-model gebruikt (zoals een op je telefoon), lost het simpelweg groter maken misschien niet zijn neiging tot liegen op. Het maakt hem misschien alleen maar een slimmere leugenaar.
  • Controleer de "Koppeling": Voordat je een model opschalen, moet je controleren of zijn vaardigheden vechten of samenwerken.
    • Als ze vechten (negatieve koppeling): Voeg dan niet gewoon meer data of grootte toe. Verander het trainingsrecept, verbreed het model, of maak de data schoon.
    • Als ze samenwerken (positieve koppeling): Dan ja, groter maken helpt beide vaardigheden.
  • De "Belasting" is Optioneel: Het artikel bewijst dat de "Alignment Tax" geen permanente regel van het universum is. Het is een bug in het huidige engineeringproces die kan worden opgepakt.

Samenvattende Analogie

Denk aan AI-training als het bouwen van een brug.

  • Oude Visie: Naarmate je meer staal toevoegt (parameters), wordt de brug automatisch sterker en veiliger.
  • Nieuwe Visie: Halverwege de bouw maakt het toevoegen van meer staal de brug eigenlijk wiebelig, omdat de twee kanten van de brug in tegenovergestelde richtingen trekken.
  • De Oplossing: Je hebt niet alleen meer staal nodig; je moet de blauwdruk (architectuur) veranderen of betere materialen (gecureerde data) gebruiken om ervoor te zorgen dat de twee kanten samen trekken. Zodra je die bouwfase hebt overwonnen, wordt de brug ongelooflijk sterk en veilig.

Het artikel biedt een dashboard en tools om ingenieurs precies te vertellen in welke fase hun model zich bevindt, zodat ze geen tijd verspillen aan het simpelweg "opschalen" terwijl ze eigenlijk de "blauwdruk moeten repareren".

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →