← Nieuwste papers
💬 NLP

Disentangling MLP Neuron Weights in Vocabulary Space

Deze paper introduceert ROTATE, een datavrije methode die MLP-neuronen in gewichtsruimte ontrafelt door het maximaliseren van kurtosis in de vocabulaire-ruimte, waardoor interpreteerbare vocabulairekanalen worden verkregen die de neuronengedrag nauwkeuriger beschrijven dan bestaande op activatie gebaseerde methoden.

Oorspronkelijke auteurs: Asaf Avrahamy, Yoav Gur-Arieh, Mor Geva

Gepubliceerd 2026-04-08
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Asaf Avrahamy, Yoav Gur-Arieh, Mor Geva

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat een groot taalmodel (zoals Llama of Gemma) een enorme, complexe stad is. In deze stad werken miljoenen kleine arbeiders, de neuronen. Tot nu toe was het heel moeilijk om te begrijpen wat deze arbeiders precies doen. Ze lijken vaak een beetje chaotisch: één arbeider zou tegelijkertijd kunnen denken aan "paarden", "rekenen" en "tijd", wat erg verwarrend is voor onderzoekers die proberen de machine te begrijpen.

Deze paper introduceert een nieuwe methode genaamd ROTATE. Hier is een uitleg in gewone taal, met behulp van analogieën:

1. Het Probleem: De Verwarde Werkplek

Stel je een arbeider (een neuron) voor die een grote, rommelige werktafel heeft. Op die tafel liggen duizenden losse onderdelen (woorden) uit de taal. De arbeider pakt er een paar, maar het is niet duidelijk welke onderdelen bij elkaar horen.

  • Huidige methoden: Meestal kijken onderzoekers naar wat de arbeider doet terwijl hij werkt (bijvoorbeeld: "Hij werkt hard als we over paarden praten"). Maar dit kost veel tijd en energie, en het geeft soms een onvolledig beeld.
  • Het doel: We willen de werktafel zelf analyseren, zonder dat de arbeider hoeft te werken. We willen weten: "Welke specifieke onderdelen liggen hier precies en wat betekenen ze?"

2. De Oplossing: ROTATE (De Magische Draaistoel)

ROTATE is een methode die geen voorbeelden nodig heeft (geen "data-free"). Ze kijkt alleen naar de werktafel (de gewichten van het model) en draait deze een beetje.

  • De Analogie van de Draaistoel:
    Stel je voor dat je een foto van een rommelige kamer hebt, maar de foto staat scheef. Je ziet alleen een wazige brij van meubels. ROTATE is als het draaien van de camera tot de foto perfect recht staat. Plotseling zie je: "Ah! Dat is een bank, dat is een lamp, en dat is een plant."

    In de wereld van AI betekent dit: ROTATE draait de getallen van de arbeider totdat ze zich richten op specifieke, duidelijke concepten.

3. De Sleutel: De "Kurtosis" (De Spits van de Berg)

Hoe weet ROTATE welke kant hij moet draaien? Hij zoekt naar een statistisch patroon dat ze "kurtosis" noemen.

  • De Analogie:
    Stel je een berg voor.

    • Een normale berg (een Gaussische verdeling) is rond en zacht. Dit betekent dat de arbeider een beetje aan alles denkt, maar aan niets echt sterk. Dit is saai en verward.
    • Een spitse berg (hoge kurtosis) heeft een heel scherpe top en steile hellingen. Dit betekent dat de arbeider zich extreem sterk richt op een paar specifieke woorden (bijvoorbeeld alleen "paard" en "rijden") en de rest negeert.

    ROTATE draait de werktafel totdat hij deze spitse bergen vindt. Zodra hij ze vindt, weet hij: "Dit is een duidelijke, begrijpelijke gedachte."

4. Het Resultaat: Woordkanalen (Vocabulary Channels)

Na het draaien en zoeken naar de spitse bergen, splitst ROTATE de arbeider op in kleine, duidelijke stukjes, die ze "woordkanalen" noemen.

  • Voorbeeld: In plaats van één arbeider die "paarden, tijd en minnetekens" door elkaar doet, krijg je nu drie aparte kanalen:
    1. Een kanaal dat alleen gaat over tijdsperiodes ("totdat", "jaren").
    2. Een kanaal dat alleen gaat over negatieve gevoelens ("niet", "geen").
    3. Een kanaal dat alleen gaat over rekenen ("min", "aftrekken").

Elk kanaal is een "spitse berg" die heel duidelijk één ding doet.

5. Waarom is dit geweldig?

  • Geen proefjes nodig: Je hoeft het model niet te laten werken met duizenden zinnen. Je kijkt gewoon naar de blauwdruk (de gewichten) en draait die. Dit is veel sneller en schaalbaarder.
  • Echte oorzaak: Als je één van deze nieuwe kanalen "uitzet" (ablatie), verdwijnt precies dat ene specifieke gedrag. Als je het kanaal voor "tijdsperiodes" uitzet, praat het model niet meer over "totdat". Het werkt als een precieze schakelaar.
  • Beter dan de rest: De auteurs hebben getoond dat deze methode veel beter werkt dan de oude methoden (zoals SAE's), die vaak nog steeds een beetje verward blijven. ROTATE geeft een schoner, duidelijker beeld van wat er in het hoofd van de AI gebeurt.

Samenvattend

ROTATE is als een slimme lens die je op de rommelige werktafel van een AI-neuron zet. Door de tafel te draaien totdat de "spitsen" (de duidelijke gedachten) naar voren komen, kun je zien dat de arbeider eigenlijk uit meerdere, zeer specifieke vakmensen bestaat. Het maakt de "black box" van kunstmatige intelligentie een stuk doorzichtiger, zonder dat je er een seconde tijd in hoeft te steken om het model te laten werken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →