← Nieuwste papers
🤖 machine learning

Exemplar Partitioning for Mechanistic Interpretability

Dit artikel introduceert Exemplar Partitioning (EP), een onbewaakte methode die interpreteerbare kenmerkwoordenboeken construeert uit activaties van taalkundige modellen met behulp van waargenomen exemplaren in plaats van geleerde gewichten, waarbij een vergelijkbare prestatie op het gebied van interpreteerbaarheid wordt bereikt als bij sparse auto-encoders met ongeveer 1.000 keer minder trainings tokens, terwijl directe cross-model vergelijkingen mogelijk worden gemaakt en ingebouwde detectie van buiten-de-verdeling-gegevens wordt geboden.

Oorspronkelijke auteurs: Jessica Rumbelow

Gepubliceerd 2026-05-15
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jessica Rumbelow

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een gigantische, chaotische bibliotheek voor waar elk boek een enkele gedachte of zin vertegenwoordigt die een computermodel ooit heeft verwerkt. In deze bibliotheek staan de "ideeën" niet in woorden geschreven; ze zijn verborgen als complexe patronen van licht en elektriciteit.

Lange tijd hebben wetenschappers die deze modellen wilden begrijpen, gebruikgemaakt van een methode genaamd Sparse Autoencoders (SAE). Denk hierbij aan het inhuren van een team van dure, hoogopgeleide bibliothecarissen om elk boek te lezen, ze in duizenden specifieke categorieën in te delen en een nieuwe index te schrijven. Het kost een enorme hoeveelheid tijd en geld (rekenkracht) om deze bibliothecarissen op te leiden, en de categorieën die ze creëren, zijn gebaseerd op wat ze hebben geleerd om te zoeken.

Exemplar Partitioning (EP), de methode die in dit artikel wordt geïntroduceerd, is een volledig andere, veel goedkopere aanpak. In plaats van bibliothecarissen op te leiden, maakt het gebruik van een simpele, geautomatiseerde sorteermachine.

Hier is hoe het werkt, met behulp van alledaagse analogieën:

1. De "Wie Eerst Komt, Malt" Sorteermachine

Stel je voor dat je door een drukke ruimte loopt (de datastroom). Je wilt mensen groeperen op basis van hoe vergelijkbaar ze eruitzien.

  • De Oude Weg (SAE): Je huurt een ontwerper in om een perfecte, vooraf gedefinieerde set van 10.000 "bakken" te maken. Je besteedt vervolgens weken aan het trainen van een systeem om precies uit te zoeken welke persoon in welke bak gaat om fouten te minimaliseren.
  • De Nieuwe Weg (EP): Je loopt gewoon door de ruimte. Wanneer je de eerste persoon ziet, zeg je: "Oké, jij bent de Leider van Groep A." Iedereen die er heel veel op lijkt, sluit zich aan bij Groep A.
    • Als je iemand ziet die er anders uitziet dan de huidige Leiders, zeg je: "Jij bent de Leider van een gloednieuwe Groep B."
    • Je bepaalt niet van tevoren hoeveel groepen er zullen zijn. De groepen vormen zich natuurlijk op basis van hoe de mensen in de ruimte er werkelijk uitzien.

2. Het "Anker" Concept

In deze nieuwe methode wordt elke groep verankerd door een echte persoon die je daadwerkelijk hebt gezien (een "Exemplaar").

  • Waarom dit belangrijk is: In de oude methode kan een groep worden gedefinieerd door een "gemiddelde" van duizenden mensen, wat een spookachtige, imaginaire persoon is die in werkelijkheid niet bestaat. In de nieuwe methode is elke groep gekoppeld aan een echt, specifiek voorbeeld. Als je wilt weten waar "Groep A" over gaat, kijk je gewoon naar de eerste persoon die ermee begon. Je kunt zelfs naar die specifieke persoon wijzen en zeggen: "Als we de invloed van deze persoon weghalen, verdwijnt de groep."

3. De "Gratis Kaart" van de Ruimte

Omdat de groepen worden gevormd door eenvoudige afstand (hoe vergelijkbaar mensen eruitzien), creëert de methode een perfecte kaart van de ruimte.

  • De "Niet-Hier-Horende" Detector: Als je de ruimte binnenloopt en iemand ziet die er totaal anders uitziet dan een van de Leiders, weet het systeem direct: "Deze persoon hoort niet bij een groep die we eerder hebben gezien." Dit is een gratis manier om vreemde of onverwachte invoer te signaleren zonder extra training.

4. Wat het Artikel Eigenlijk Vond

De auteurs testten dit op een specifiek AI-model (Gemma-2-2B) en vonden enkele verrassende dingen:

  • Het is ongelooflijk snel en goedkoop: Ze bouwden deze woordenboeken met ongeveer 1.000 keer minder rekenkracht dan de traditionele methode. Het duurde minuten op één computerchip in plaats van weken van training.
  • Het werkt even goed voor het vinden van concepten: Toen ze het systeem vroegen om specifieke ideeën te vinden (zoals "wiskunde", "code" of "weigeren te antwoorden"), presteerde het bijna even goed als de dure, getrainde methode.
  • Het vond de "Weigering"-schakelaar: Ze ontdekten een specifieke groep invoer waarbij de AI besluit "Nee" te zeggen (een verzoek weigeren). Door naar de "Leider" van die groep te kijken, konden ze bewijzen dat als je dat specifieke patroon verwijdert, de AI stopt met weigeren. Dit laat zien dat de groepen echte, causale onderdelen zijn van hoe de AI denkt.
  • Het ziet de wereld anders: De nieuwe methode groepeert dingen op basis van dichtheid (klonten van vergelijkbare dingen), terwijl de oude methode dingen groepeert op basis van lijnen (wiskundige scheiding). Ze komen overeen bij de meest voor de hand liggende, duidelijke ideeën (de "kern"), maar ze splitsen de rommelige, complexe ideeën anders op.

5. Het Verschil tussen "Trainen" en "Kijken"

De belangrijkste conclusie is dat deze methode niets leert. Het probeert niet te raden wat de beste manier is om dingen in te delen. Het kijkt gewoon naar de datastroom, kiest de eerste paar unieke voorbeelden die het ziet, en sorteert alles anders op basis van hoe dicht het bij die voorbeelden ligt.

Omdat het niet afhankelijk is van een specifieke trainingsrun, kun je de "kaart" van een model vergelijken voor en na het trainen, en kun je precies zien welke groepen hetzelfde bleven en welke veranderden. Het is als het vergelijken van een kaart van een stad voor en na de bouw van een nieuwe snelweg, met behoud van dezelfde herkenningspunten.

Samenvattend: Dit artikel introduceert een manier om AI-modellen te begrijpen door hun gedachten simpelweg te organiseren in natuurlijke clusters op basis van echte voorbeelden, in plaats van ze in vooraf gemaakte dozen te dwingen. Het is sneller, goedkoper en net zo goed in het vinden van de "betekenis" binnen de machine.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →