← Nieuwste papers
🤖 machine learning

From Mechanistic to Compositional Interpretability

Dit artikel introduceert "compositional interpretability", een categorietheoretisch raamwerk dat mechanistische verklaringen formaliseert als commuterende syntactische en semantische afbeeldingen om objectieve verificatie, optimalisatie en systematische modelverfijning naar beknoptere, met de mens overeenstemmende interpretaties mogelijk te maken.

Oorspronkelijke auteurs: Ward Gauderis, Thomas Dooms, Steven T. Holmer, Kola Ayonrinde, Geraint A. Wiggins

Gepubliceerd 2026-05-12
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ward Gauderis, Thomas Dooms, Steven T. Holmer, Kola Ayonrinde, Geraint A. Wiggins

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een ongelooflijk complexe, black-box machine hebt die wonderlijke dingen kan doen, zoals dieren herkennen of talen vertalen. Je weet wat het doet, maar je hebt geen idee hoe het dat doet. Van binnen is het een verward labyrint van tandwielen, draden en hendels dat geen mens gemakkelijk kan begrijpen. Dit is de huidige staat van veel geavanceerde AI-modellen.

Het artikel dat je hebt aangeleverd, stelt een nieuwe manier voor om dit labyrint te ontrafelen. Het verschuift van het simpelweg "gissen" naar hoe de machine werkt, naar het creëren van een strikt, wiskundig regelboek om het te verklaren. Hier is de kernidee, uiteengezet met eenvoudige analogieën.

1. Het Probleem: Het "Just-So"-Verhaal

Momenteel kijken wetenschappers die proberen deze AI-modellen te verklaren, vaak alleen naar de invoer en uitvoer (bijvoorbeeld: "Het zag een kat, dus zei het 'miauw'"). Ze kunnen wijzen op een specifieke draad en zeggen: "Deze draad licht op wanneer het vacht ziet."

Het artikel stelt dat dit riskant is. Het is alsof je naar een auto-motor kijkt en zegt: "Deze zuiger beweegt wanneer de auto snel rijdt." Dat is misschien waar, maar het verklaart niet het mechanisme van hoe brandstof omzet in beweging. Als je alleen naar het oppervlak kijkt, kun je een verhaal vertellen dat klinkt alsof het klopt, maar dat eigenlijk fout is over hoe de machine echt werkt. Dit wordt een "just-so-verhaal" genoemd – een verhaal dat past bij de feiten, maar het echte interne logische verband mist.

2. De Oplossing: De "Commutatieve" Kaart

De auteurs introduceren een concept genaamd Compositional Interpretability (Compositional Interpretability). Denk hierbij aan een vertaalproject voor een complexe machine.

Om de machine goed te verklaren, heb je twee kaarten nodig die perfect op elkaar moeten aansluiten:

  • Kaart A (Het Blauwdruk): Dit toont de interne structuur van de machine – de draden, de tandwielen, de "syntaxis".
  • Kaart B (Het Gedrag): Dit toont wat de machine daadwerkelijk doet wanneer je op een knop drukt – de "semantiek".

Het artikel stelt dat een goede verklaring alleen geldig is als deze twee kaarten commutatief zijn. In gewone taal betekent dit:

  • Als je het pad van een specifiek tandwiel in het Blauwdruk volgt, moet dit leiden tot exact hetzelfde resultaat als het observeren van dat tandwiel dat beweegt in de Gedragskaart.
  • Als de kaarten niet overeenkomen, is je verklaring gebroken. Je kunt niet zomaar een tandwiel "Snelheidsregelaar" noemen als het eigenlijk iets anders doet.

Dit zorgt ervoor dat je verklaring niet zomaar een gok is; het is een geverifieerde link tussen de binnenkant van de machine en zijn acties.

3. Het Doel: Het "Kortste Verhaal" (Ockhams Scheermes)

Zodra je een geldige kaart hebt, hoe weet je dan welke verklaring de beste is? Het artikel maakt gebruik van een principe genaamd Minimum Description Length (Minimale Beschrijvingslengte).

Stel je voor dat je een complex magisch truuks aan een vriend moet uitleggen.

  • Verklaring 1: "De goochelaar zwaaide met een toverstaf, zei een magisch woord, en het konijn verscheen." (Eenvoudig, maar mist misschien de verborgen valdeur).
  • Verklaring 2: "De goochelaar gebruikte een verborgen valdeur, een veermechanisme en een specifiek belichtingshoek om het konijn te laten verschijnen." (Complexer, maar accuraat).
  • Verklaring 3: "De goochelaar gebruikte een verborgen valdeur, een veer, een belichtingshoek, een specifieke windstroom en een geheime code." (Te complex, over-verklarend).

Het artikel stelt dat de beste verklaring de kortste is die nog steeds perfect accuraat is. Het is het ideale punt waar je geen belangrijke details weglaat (trouwheid), maar ook geen onnodige rommel toevoegt (complexiteit).

4. De Methode: "Compressieve Verfijning"

Hoe vinden we deze perfecte, korte verklaring? De auteurs stellen een proces voor genaamd Compressieve Verfijning.

Denk aan het AI-model als een rommelige stapel Lego-blokjes.

  • Huidige Staat: De blokjes zijn op rare, verwarde manieren aan elkaar gelijmd. Het is moeilijk te zien wat elk stukje doet.
  • Het Proces: Je neemt de klonten voorzichtig uit elkaar en herbouwt ze tot nette, onderscheidende structuren. Je kunt een paar extra "connectoren" (bedrading) toevoegen om de structuur duidelijk te maken, maar je vereenvoudigt de individuele stukjes zodat ze makkelijker te begrijpen zijn.
  • Het Resultaat: Je eindigt met een model waarbij de "atomen van berekening" (de kleinste bruikbare delen) eenvoudig en helder zijn, en de manier waarop ze verbonden zijn logisch is.

Het artikel bewijst dat als je deze "her-assembly" correct uitvoert, je gegarandeerd een eenvoudigere, mensvriendelijkere verklaring krijgt zonder te veranderen wat de machine daadwerkelijk doet.

5. Waarom Dit Werkt: De "Optimistische" Aanname

Het artikel maakt een hoopvolle gok (een conjectuur) om dit werkbaar te maken: De patronen die de AI gebruikt om problemen op te lossen, zijn waarschijnlijk dezelfde patronen die mensen gebruiken om die problemen te begrijpen.

Als de AI goed is in het herkennen van katten, gebruikt het waarschijnlijk eenvoudige, logische kenmerken (oren, snorharen) in plaats van een of vreemde, onbegrijpelijke wiskunde. Door het model te comprimeren om deze eenvoudige patronen te vinden, "filteren" we in feite het ruis eruit en vinden we de voor mensen leesbare logica die erin verborgen zit.

Samenvatting

Kortom, dit artikel zegt:

  1. Stop met gissen: Kijk niet alleen naar wat de AI doet; koppel de interne onderdelen aan zijn acties en zorg dat ze perfect overeenkomen.
  2. Houd het simpel: De beste verklaring is de kortste die nog steeds 100% accuraat is.
  3. Herord de machine: Herschik systematisch de interne bedrading van de AI om het eenvoudiger en duidelijker te maken, wat van nature leidt tot verklaringen die mensen daadwerkelijk kunnen begrijpen.

Dit biedt een wiskundig "regelboek" om de black box van AI om te zetten in een transparante, begrijpelijke machine.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →