← Nieuwste papers
🤖 machine learning

Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning

Dit artikel biedt een uitgebreid overzicht van mechanistische interpreteerbaarheid, waarbij wordt uiteengezet hoe technieken zoals Transformer-circuitanalyse, Sparse Autoencoders en causale interventies neurale netwerken kunnen reverse-engineeren om interne algoritmen te ontdekken, polysemanticiteit op te lossen en representaties te vertalen naar expliciete logische regels voor veiligere AI.

Oorspronkelijke auteurs: Pranav Sawant, Jakub Krejčí

Gepubliceerd 2026-07-09
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Pranav Sawant, Jakub Krejčí

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: Het Openen van de Black Box

Stel je moderne AI-modellen (zoals de modellen die essays schrijven of met je chatten) voor als enorme, verzegelde black boxes. We weten wat erin gaat (een vraag) en wat eruit komt (een antwoord), maar we hebben geen idee wat er gebeurt tussen de miljoenen tandwielen en draden daartussenin.

Traditionele manieren om deze boxen te begrijpen zijn als het bekijken van de uitlaat van een auto om te raden hoe de motor werkt. Ze vertellen je wat de auto doet, maar niet hoe de motor dat voor elkaar krijgt.

Dit paper introduceert een nieuwe aanpak genaamd Mechanistic Interpretability. In plaats van alleen maar te gokken, probeert dit vakgebied de AI te reverse-engineeren. Het is alsof je de black box uit elkaar haalt, elk tandwiel, elke veer en elke draad op tafel legt, en de exacte instructies (pseudocode) opschrijft voor hoe ze samenwerken om een resultaat te produceren.

1. De Snelweg en het Verkeer (Circuits)

Binnen deze AI-modellen is er een centrale "snelweg" genaamd de residual stream. Zie dit als een lopende band die informatie van het begin van het model naar het einde vervoert.

  • De Verkeersregelaars (Attention Heads): Dit zijn als verkeersagenten op de lopende band. Zij beslissen welk stukje informatie naar welk ander stukje informatie moet kijken. Als de zin bijvoorbeeld is "De kat zat op de mat," kan een verkeersagent het woord "het" terugkoppelen aan "kat."
  • De Werkers (MLP Layers): Dit zijn als werkers die de informatie op de band pakken en deze transformeren. Ze voegen nieuwe ideeën toe of veranderen de betekenis.
  • De Magische Truk (Induction Heads): Het paper belicht een specifiek type verkeersagent genaamd een "induction head". Stel je voor dat je een verhaal leest waarin een patroon zich herhaalt: "Tante Sally... Tante Sally." Een induction head is het deel van het brein dat opmerkt: "Hé, ik heb dit patroon eerder gezien! Het volgende woord is waarschijnlijk weer 'Sally'." Dit is hoe de AI nieuwe dingen leert door simpelweg een prompt te lezen, zonder dat hij opnieuw getraind hoeft te worden.

2. Het Probleem: De "Superposition" Soep

Hier wordt het lastig. Als je naar een enkele neuron (een kleine eenheid voor verwerking) in de AI kijkt, doet deze meestal niet slechts één ding. Het is als een Zwitsers zakmes dat tegelijkertijd een schroevendraaier, een flessenopener en een kurkentrekker probeert te zijn.

  • Polysemanticity: Een enkele neuron kan vuren wanneer hij een plaatje van een kat ziet, een vermelding van "Michael Jordan" of het woord "basketbal." Hij doet te veel taken tegelijk.
  • Superposition: De AI is zo efficiënt dat hij duizenden verschillende ideeën in een beperkt aantal neuronen propt. Het is alsof je 100 verschillende smaken ijsjes in één beker probeert te passen; de smaken raken vermengd.

Dit maakt het erg moeilijk om de AI te begrijpen, omdat je niet simpelweg naar één neuron kunt wijzen en kunt zeggen: "Dit is de 'kat'-neuron."

3. De Oplossing: De "Feature Blender" (Sparse Autoencoders)

Om het "Zwitsers zakmes"-probleem op te lossen, bespreekt het paper een hulpmiddel genaamd een Sparse Autoencoder (SAE).

Zie de rommelige, vermengde gedachten van de AI als een smoothie waar alle vruchten door elkaar zijn gemixt. Je kunt de aardbei of de banaan niet meer apart proeven.
De SAE is een machine die die smoothie neemt en deze ontmengt. Het scheidt het mengsel weer in duidelijke, pure ingrediënten.

  • In plaats van een neuron dat half "kat" en half "basketbal" is, vindt de SAE twee aparte "pure" features: één die 100% "kat" is en één die 100% "basketbal" is.
  • Dit stelt onderzoekers in staat om precies te zien waar de AI op dit moment aan denkt.

4. Het Vinden van Verborgen Circuits (Automated Discovery)

Het handmatig traceren van elke draad in de AI is onmogelijk omdat er te veel zijn. Daarom gebruiken onderzoekers geautomatiseerde tools zoals ACDC (Automated Circuit Discovery).

Stel je voor dat de AI een enorme, verwarde kluwen kerstverlichting is. Je wilt de specifieke lichtketting vinden die de boom laat branden.

  • ACDC werkt als een robot die systematisch één draad tegelijk doorknipt.
  • Als het doorknippen van een draad het resultaat niet verandert, is het een nutteloze draad en wordt deze verwijderd.
  • Als het doorknippen van een draad ervoor zorgt dat de boom niet meer brandt, maakt die draad deel uit van het "circuit."
  • Aan het einde heeft de robot alle overbodige zaken weggehaald en heb je een schoon, eenvoudig diagram overgehouden van precies welke draden nodig zijn om de taak te volbrengen.

5. De AI Sturen (De Volumeknop)

Zodra we de circuits begrijpen, kunnen we proberen ze te controleren. Het paper spreekt over Steering Vectors.

Beschouw de interne staat van de AI als een radio. Normaal gesproken moet je instructies roepen (zoals "Wees beleef") om van zender te wisselen.

  • Steering Vectors zijn als een afstandsbediening die direct in de interne bedrading van de radio fluistert.
  • In plaats van te schreeuwen, geef je het interne signaal slechts een klein duwtje in een specifieke richting.
  • Bijvoorbeeld, als je het signaal een duwtje geeft richting "beleefdheid", wordt de AI beleefd zonder dat je zijn hele persoonlijkheid hoeft te herschrijven.
  • Het paper merkt op dat dit gebruikt kan worden om de AI te stoen met liegen (door een "eerlijkheid"-feature te versterken) of om hem beter wiskundige problemen te laten oplossen.

6. Vertalen naar Menselijke Logica (Neurosymbolic AI)

Ten slotte bespreekt het paper Neurosymbolic AI. Dit is als het nemen van de complexe, rommelige code van de AI en het vertalen naar een eenvoudige gebruiksaanwijzing die een mens kan lezen.

  • Stel je voor dat de AI een tovenaar is die een complexe spreuk uitspreekt.
  • Neurosymbolische frameworks nemen die spreuk en schrijven het op als een eenvoudige "Als-Dan"-regel: "Als de afbeelding een bed en een kussen heeft, maar geen wasbak, dan is het een slaapkamer."
  • Dit verandert de "black box" in een transparante set logische regels die we kunnen controleren, verifiëren en vertrouwen.

Samenvatting

Het paper betoogt dat we voorbijgaan aan het tijdperk van het simpelweg raden hoe AI werkt. Door tools te gebruiken om gemengde ideeën te ontmengen (SAEs), de exacte paden van informatie te traceren (Circuits) en de interne signalen te sturen (Steering), beginnen we de interne "tandwielen" van deze machines te begrijpen. Dit is cruciaal om ervoor te zorgen dat deze krachtige instrumenten veilig, eerlijk en precies doen wat we van hen willen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →