← Nieuwste papers
💬 NLP

How Do Transformers Learn to Associate Tokens: Gradient Leading Terms Bring Mechanistic Interpretability

Dit artikel biedt een mechanistische interpretatie van hoe transformers semantische associaties leren door gesloten-vorm uitdrukkingen af te leiden voor gewichten in een vroeg stadium als composities van bigram-, token-uitwisselbaarheids- en contextmappings gebaseerd op trainingsgradiëntdynamiek.

Oorspronkelijke auteurs: Shawn Im, Changdae Oh, Zhen Fang, Sharon Li

Gepubliceerd 2026-05-14
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Shawn Im, Changdae Oh, Zhen Fang, Sharon Li

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een Transformer (het brein achter moderne AI-chatbots) voor als een gigantisch, blanco notitieboek. Wanneer we beginnen met het trainen ervan, zijn de pagina's leeg. Het artikel waar je naar vraagt, stelt een eenvoudige maar diepzinnige vraag: Hoe leert dit notitieboek woorden als "vogel" en "vliegde" met elkaar te verbinden, puur door miljoenen zinnen te lezen?

In plaats van te kijken naar de afgewerkte, complexe AI, besloten de auteurs om in te zoomen op de allereerste momenten van het leerproces. Ze gebruikten een wiskundige "vergrotingsglas" om de allereerste stappen te bekijken die de AI zet wanneer het begint met het updaten van zijn geheugen.

Hier is de uiteenzetting van hun ontdekking, gebruikmakend van eenvoudige analogieën:

1. De "Eerste Stap"-Shortcut

Het trainen van een AI is als proberen het volgende woord in een zin te voorspellen. Meestal is de wiskunde achter hoe de AI zijn geheugen updatet, ongelooflijk rommelig en complex.

De auteurs beseften dat de AI aan het begin geen complexe calculus hoeft uit te voeren. Het hoeft alleen maar de sterkste, meest voor de hand liggende signaal in de data te volgen. Ze noemen dit de "leidende term". Denk hierbij aan een wandelaar die een tocht begint om een berg op te gaan. Aan het allereerste begin is het pad duidelijk en recht. Pas later, naarmate ze hoger komen, wordt het pad kronkelig en complex. De auteurs bewezen dat de "geheugengewichten" van de AI voor een verrassend lange tijd zeer dicht bij dat eenvoudige, rechte initiële pad blijven.

2. De Drie Bouwstenen

Het artikel onthult dat het geheugen van de AI geen willekeurige rommel is. In plaats daarvan wordt het opgebouwd door drie specifieke soorten "Lego-blokken" (die de auteurs basisfuncties noemen) op elkaar te stapelen. Deze blokken zijn direct afgeleid van de statistieken van de tekst die de AI leest:

  • Het "Volgende Woord"-Blok (Bigram Mapping):

    • Analogie: Stel je een kind voor dat leert dat "De" bijna altijd wordt gevolgd door een zelfstandig naamwoord zoals "kat" of "hond".
    • Wat het doet: Dit blok registreert simpelweg: "Als je woord A ziet, wat is dan het meest waarschijnlijke woord B dat als volgende komt?" Het vangt eenvoudige, directe connecties op.
  • Het "Uitwisselbare" Blok (Interchangeability Mapping):

    • Analogie: Denk aan een synoniemenwoordenboek. Als je "auto" kunt vervangen door "vrachtwagen" in een zin zonder de grammatica te breken, zijn ze "uitwisselbaar".
    • Wat het doet: Dit blok leert dat bepaalde woorden dezelfde rol spelen. Als "rood" meestal een "auto" beschrijft, en "snel" ook een "auto" beschrijft, helpt dit blok de AI te beseffen dat "rood" en "snel" misschien gerelateerd zijn omdat ze allebei met dezelfde woorden "hangen". Het groepeert woorden op basis van hun functie, niet alleen op basis van hun directe buren.
  • Het "Context"-Blok (Context Mapping):

    • Analogie: Stel je voor dat je een verhaal leest over een "vis". Zelfs als het woord "vijver" niet direct naast "vis" staat, kan het verhaal eerder "water", "meer" of "boot" noemen.
    • Wat het doet: Dit blok kijkt verder terug in de zin. Het leert dat als een woord in een specifieke context verschijnt (zoals een verhaal over de natuur), het waarschijnlijk geassocieerd is met andere woorden uit diezelfde context, zelfs als ze ver uit elkaar liggen.

3. Hoe Ze Samenwerken

Het artikel toont aan dat de interne "gewichten" van de AI (de getallen die bepalen hoe het denkt) gewoon combinaties zijn van deze drie blokken.

  • De Outputlaag (het deel dat het volgende woord raadt) is grotendeels slechts het Volgende Woord-Blok. Het is de AI die zegt: "Op basis van wat ik zojuist zag, wat komt er als volgende?"
  • De Attention-laag (het deel dat bepaalt waar de focus op ligt) is een mix van het Uitwisselbare en Context-blok. Het is de AI die zegt: "Ik zie het woord 'vis'. Ik moet terugkijken naar het woord 'vijver', omdat ze vaak samen voorkomen in vergelijkbare verhalen, zelfs als ze niet direct aan elkaar grenzen."

4. Het Bewijs: Het Werkt Werkelijk

De auteurs schreven niet alleen vergelijkingen; ze testten dit op echte AI-modellen.

  • Ze trainden een kleine AI op een dataset met kinderboeken.
  • Ze vergeleken het daadwerkelijke geleerde geheugen van de AI met hun wiskundige formule.
  • Het Resultaat: De overeenkomst was ongelooflijk groot (in sommige gevallen meer dan 99% gelijkenis). Zelfs toen ze keken naar een enorme, echte AI (Pythia-1.4B), bleven dezelfde patronen gelden. De AI organiseerde inderdaad zijn geheugen met behulp van deze drie eenvoudige statistische bouwstenen.

De Grote Conclusie

Het artikel betoogt dat we AI niet hoeven te zien als een mysterieuze "black box" die op magische wijze taal begrijpt. In plaats daarvan is het op zijn kern simpelweg statistisch het ordenen van de wereld door:

  1. Te noteren wat meestal wat volgt.
  2. Woorden te groeperen die hetzelfde werk doen.
  3. Woorden te koppelen die een gemeenschappelijk achtergrondverhaal delen.

Door deze drie eenvoudige regels te begrijpen, kunnen we eindelijk zien hoe de machine leert "vogel" te associëren met "vliegde" en "land" met "hoofdstad". Het is geen magie; het is een zeer gestructureerde manier om de tekst die het heeft gelezen, samen te vatten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →