← Nieuwste papers
💻 computer science

Mechanistic Circuit Tracking Causal Activation Patching and Formation Trajectories in Transformer Architectures

Dit artikel introduceert Mechanistic Circuit Tracking, een modulair framework dat directe logit-attributie, causale activatie-patching en ablatie-technieken combineert om de opkomst van aandachtscircuits tijdens pre-training te traceren en hun causale robuustheid te kwantificeren via een nieuwe Circuit Stability Index voor het verbeteren van AI-veiligheid en alignment.

Oorspronkelijke auteurs: Yash Prajapati

Gepubliceerd 2026-08-25
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yash Prajapati

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Moderne systemen van kunstmatige intelligentie, met name die welke menselijke tekst genereren, worden vaak beschreven als zwarte dozen. We weten wat erin gaat en wat eruit komt, maar de interne machinerie die een eenvoudige prompt transformeert naar een complex antwoord, blijft grotendeels opaak. Dit gebrek aan transparantie maakt het moeilijk om te begrijpen waarom deze systemen soms falen of onvoorspelbaar gedrag vertonen. Om dit op te lossen, is een studieveld genaamd mechanistische interpreteerbaarheid ontstaan. In plaats van het neurale netwerk te behandelen als een enkele, ondoordringbare eenheid, proberen onderzoekers in dit veld het systeem te reverse-engineeren door het af te breken tot de kleinste werkende onderdelen. Ze zoeken naar specifieke, herbruikbare patronen van activiteit—zoals afzonderlijke circuits in een computer—die specifieke taken uitvoeren. Door deze interne paden in kaart te brengen, hopen wetenschappers voorbij het gissen te gaan en in plaats daarvan precies aan te wijzen welke delen van de breinachtige structuur verantwoordelijk zijn voor specifieke gedachten of woorden, een capaciteit die essentieel is om te waarborgen dat deze krachtige instrumenten veilig blijven en in lijn blijven met menselijke waarden.

In een nieuwe studie heeft een onderzoeker genaamd Yash Prajapati van de Gandhinagar University in India een methode ontwikkeld om te traceren hoe deze interne circuits zich vormen en hoe ze reageren wanneer delen van het systeem worden verstoord. Het werk richt zich op een specifiek type patroonherkenning binnen grote taalmodellen, waarbij het systeem leert om het volgende woord in een sequentie te voorspellen op basis van een patroon dat het eerder heeft gezien. De onderzoeker wilde niet alleen begrijpen dat deze patronen bestaan, maar ook precies wanneer ze verschijnen tijdens het trainingsproces en hoe het systeem zichzelf beschermt als het primaire mechanisme dat verantwoordelijk is voor hen wordt beschadigd. Om dit te doen, analyseerde het team pre-training checkpoints met behulp van een framework dat hen in staat stelde om de ontwikkeling van het model stap voor stap te onderzoeken, waarbij zij het precieze moment identificeerden waarop de interne machinerie verschuift van een staat van verwarring naar een staat van heldere, gestructureerde functie.

De onderzoekers evalueerden transformer checkpoints over 50.000 optimalisatiestappen, waarbij ze de interne staat van het model met regelmatige tussenpozen observeerden. Ze ontdekten dat de bekwaamheid van het model om deze patronen te herkennen in de eerste duizenden stappen zwak en verspreid was over veel verschillende delen van het systeem. Rond de 5.000-stappenmark verdween er echter een dramatische verandering: het model onderging een plotselinge faseovergang, waarbij het vermogen om patronen te voltooien onmiddellijk verscherpte. Vóór dit punt was de aandacht van het model diffuus en verspreidde het zijn focus breed. Na dit punt stortte de focus in tot enkele specifieke, uiterst efficiënte paden. Dit was geen langzame, geleidelijke verbetering, maar een snelle reorganisatie van de interne structuur van het systeem, wat suggereert dat een model niet alleen geleidelijk beter wordt, maar eerder een fundamentele structurele verschuiving ondergaat om nieuwe capaciteiten te verwerven.

Om te testen hoe robuust deze nieuwe circuits waren, voerden de onderzoekers een reeks experimenten uit waarbij ze de primaire delen van het systeem die verantwoordelijk zijn voor deze patroonvoltooieningen tijdelijk uitschakelden. Ze deden dit door effectief de specifieke componenten die het zware werk verrichten uit te schakelen en te observeren wat er gebeurde. In een minder veerkrachtig systeem zou het uitschakelen van de hoofdmotor ervoor zorgen dat het hele proces faalt. Echter, in deze getrainde modellen stortte het systeem niet in. In plaats daarvan namen andere, voorheen stille delen van het netwerk onmiddellijk de taak over. De onderzoekers maten dit vermogen om informatie te herrouteren en ontdekten dat naarmate het model langer trainde, de capaciteit om schade te compenseren sterker werd. Tegen het einde van het trainingsproces had het systeem dergelijke effectieve backuppaden ontwikkeld dat het uitschakelen van het primaire circuit nauwelijks verstoring veroorzaakte in de uiteindelijke output.

Deze ontdekking heeft belangrijke implicaties voor hoe we de veiligheid van kunstmatige intelligentie waarborgen. Een veelvoorkomende hoop in veiligheidsonderzoek is dat als een model iets gevaarlijks of ongewenst leert, we simpelweg het specifieke deel van het systeem dat daarvoor verantwoordelijk is kunnen verwijderen, waardoor het ongewenste gedrag effectief wordt "ontleerd". De bevindingen suggereren echter dat deze aanpak mogelijk onvoldoende is. Omdat het systeem een sterke redundantie opbouwt, leidt het verwijderen van één onderdeel niet noodzakelijkerwijs tot het stoppen van het gedrag; het model roteert de taak simpelweg naar een andere set componenten. De onderzoekers kwantificeerden deze veerkracht met een nieuwe maatstaf voor stabiliteit, die aantoonde dat hooggetrainde modellen er bijzonder goed in zijn om hun functie te behouden, zelfs wanneer hun primaire circuits worden weggehaald. Dit betekent dat veiligheidsinterventies veel uitgebreider moeten zijn dan alleen het richten op een enkele component, aangezien het systeem is ontworpen om zich aan te passen en zijn interne logica te behouden.

De studie bracht ook precies in kaart waar deze kritieke circuits zich binnen de architectuur van het model bevinden. Hoewel de verantwoordelijkheid voor taken in de vroege fase van de training verspreid was, ontdekten de onderzoekers dat zodra het model volwassen werd, het werk geconcentreerd raakte in specifieke lagen in het midden- tot laat stadium van het netwerk. Deze concentratie geeft aan dat het model heeft geleerd om zijn verwerking te organiseren in een gestroomlijnde pijplijn, waarbij informatie door een toegewijd kanaal stroomt in plaats van door het hele systeem te dwalen. Door deze veranderingen te volgen, boden de onderzoekers een helder beeld van hoe een machine learning-model evolueert van een chaotische verzameling gewichten naar een gestructureerde, efficiënte motor die in staat is tot complexe redenering.

Uiteindelijk biedt dit werk een nieuwe manier om de interne werking van kunstmatige intelligentie te auditeren. Door technieken te combineren die de informatiestroom traceren met methoden die de reactie van het systeem op schade testen, hebben de onderzoekers een toolkit gecreëerd om niet alleen te begrijpen wat een model doet, maar ook hoe het het doet en hoe het zijn eigen functies beschermt. Het vermogen om het exacte moment te zien waarop een circuit wordt gevormd en om te meten hoe goed het systeem rond een defect onderdeel kan herrouteren, biedt een concreet fundament voor het bouwen van veiligere, meer transparante AI. Het verplaatst het gesprek van abstracte zorgen over opaakheid naar een precieze begripsvorming van de mechanische processen die deze systemen aandrijven, en biedt een pad om te waarborgen dat naarmate deze modellen krachtiger worden, hun interne structuren begrijpelijk en controleerbaar blijven.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →