← Nieuwste papers
💬 NLP

A Unifying Perspective on Language Model Representations: From Filler-Role Structure to Mechanistic Interpretability

Dit artikel stelt Tensor Product Representations (TPR's) voor als een verenigend kader dat wiskundig en empirisch aantoont hoe diverse interpreteerbaarheidsmethoden voor taalmodellen, zoals lineaire probing en sparse autoencoders, kunnen worden afgeleid van een enkele onderliggende structuur van filler-role bindings.

Oorspronkelijke auteurs: Zhang Enyan, R. Thomas McCoy

Gepubliceerd 2026-09-01
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zhang Enyan, R. Thomas McCoy

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de stille, zoemende wereld van kunstmatige intelligentie proberen onderzoekers te begrijpen hoe massieve computerprogramma's, bekend als taalmodellen, daadwerkelijk denken. Deze systemen kunnen poëzie schrijven, wiskundige problemen oplossen en gesprekken voeren, maar in hun digitale hersenen wordt informatie opgeslagen als lange lijsten met getallen. Jarenlang hebben wetenschappers diverse instrumenten gebruikt om in deze zwarte dozen te gluren, waarbij ze ontdekten dat de modellen informatie op verrassend ordelijke manieren lijken te organiseren. Sommige instrumenten laten zien dat de modellen puzzels kunnen oplossen door deze getallenlijsten op te tellen en af te trekken, terwijl andere onthullen dat specifieke delen van het model oplichten wanneer ze een bepaald woord of idee tegenkomen. Toch zijn deze ontdekkingen geïsoleerd gebleven, als losse aanwijzingen die in verschillende kamers van een donker huis zijn gevonden. De grote vraag is geweest of er één onderliggende structuur is die al deze verschillende gedragingen verklaart, of dat de modellen slechts een chaotische bijeenkomst van ongerelateerde trucjes zijn.

Een team van onderzoekers aan de Yale University heeft een verenigend antwoord op dit raadsel voorgesteld. Zij suggereren dat deze complexe taalmodellen zijn gebouwd op een specifiek architecturaal principe genaamd Tensor Product Representations. In gewone taal betekent dit dat de modellen informatie opslaan door twee dingen nauw met elkaar te verbinden: de inhoud van een idee (zoals een specifatieword) en de rol in een zin (zoals of het het onderwerp of het lijdend voorwerp is). Stel je een archiefsysteem voor waarin elke stuk informatie niet alleen wordt opgeslagen op basis van wat het is, maar ook op basis van precies waar het in een structuur thuishoort. De onderzoekers ontdekten dat deze eenvoudige, gestructureerde manier van gegevensorganisatie een breed scala aan voorheen ongerelateerde ontdekkingen kan verklaren. Het verklaart waarom de modellen wiskundige analogieën kunnen uitvoeren, waarom eenvoudige tests verborgen concepten kunnen onthullen, en waarom het veranderen van één enkel deel van de interne staat van een model het gedrag op voorspelbare wijze kan veranderen.

Om dit idee te testen, vertrouwde het team niet alleen op theorie; ze bouwden een nieuw soort instrument om als een vertaler te fungeren. Ze creëerden een systeem dat de bekende structuur van een zin neemt — het identificeren van het onderwerp, werkwoord en lijdend voorwerp — en dit omzet in de specifieke getalpatronen die de modellen gebruiken. Vervolgens vergeleken ze deze vertaalde versie met de werkelijke interne werking van verschillende computermodellen, variërend van kleine, eenvoudige netwerken tot massieve, hypermoderne taal-systemen. De resultaten waren opvallend consistent. In tests met reeksen getallen en gestructureerde Engelse zinnen kwam de structurele vertaling van de onderzoekers met extreme precisie overeen met de interne staten van de modellen. Voor de eenvoudigere modellen was de overeenkomst bijna perfect, waarbij bijna alle variatie in de manier waarop de modellen informatie verwerkten, werd gevangen. Zelfs voor de grootste, meest complexe taalmodellen legde de vertaling de overgrote meerderheid van de informatie vast, wat suggereert dat deze gigantische systemen, ondanks hun omvang, vertrouwen op dezelfde fundamentele methode van het verbinden van inhoud aan positie.

De kracht van deze bevinding ligt in de manier waarop het verschillende onderzoeksmethoden met elkaar verbindt. De onderzoekers toonden aan dat de wiskundige logica achter hun structurele vertaling gebruikt kan worden om de resultaten van vier belangrijke interpretabiliteitstechnieken die wetenschappers vandaag de dag gebruiken, te recreëren. Ten eerste verklaarden ze waarom taalmodellen "additieve analogieën" kunnen uitvoeren, een fenomeen waarbij het aftrekken van een concept van een ander en het optellen van een derde een vierde gerelateerd concept oplevert. Hun werk toonde aan dat dit gebeurt omdat de modellen in essentie het verschil berekenen tussen specifieke inhoud-en-rol-koppelingen. Ten tweede toonden ze aan hoe "lineaire probes", eenvoudige tests die worden gebruikt om te detecteren of een model een bepaalde feit kent, eigenlijk een manier zijn om de rol van de inhoud te ontkoppelen om het oorspronkelijke idee terug te halen. Derde legden ze uit hoe "sparse autoencoders", die complexe signalen afbreken in eenvoudigere delen, effectief dezelfde inhoud-en-rol-koppelingen identificeren. Ten slotte demonstreerden ze dat "activation patching", een techniek waarbij onderzoekers delen van het brein van een model verwisselen om te zien hoe dat het gedrag verandert, werkt omdat ze direct deze specifieke structurele koppelingen verwisselen.

In een reeks experimenten bewezen het team dat ze hun structurele vertaling konden gebruiken om deze vier verschillende testinstrumenten vanaf nul op te bouwen, zonder deze eerst op de modellen te hoeven trainen. Wanneer ze deze geconstrueerde instrumenten gebruikten om de modellen te analyseren, presteerden ze even goed als de standaard, intensief getrainde instrumenten die in het vakgebied worden gebruikt. Zo presteerde hun methode bijvoorbeeld bijna identiek aan de beste bestaande methoden wanneer ze voorspelden welk woord volgend in een zin zou verschijnen, of wanneer ze het onderwerp van een zin identificeerden. In één specifieke test met een groot taalmodel was het verschil tussen de structurele voorspelling van de onderzoekers en de standaardmethode zo klein dat het bijna onzichtbaar was, met een correlatiescore van bijna één. Dit suggereert dat de complexe, aangeleerde gedragingen van deze modellen niet mysterieus of toevallig zijn, maar directe gevolgen zijn van deze onderliggende structurele regel.

De onderzoekers verkenden ook hoe goed deze structuur standhoudt wanneer de modellen geconfronteerd worden met nieuwe situaties. Ze trainden hun structurele vertaler op een reeks zinnen en testten deze vervolgens op zinnen met woorden en rollen die het nog nooit eerder had gezien. De vertaler generaliseerde succesvol en reconstrueerde de interne staat van het model voor deze nieuwe combinaties met hoge nauwkeurigheid. Dit geeft aan dat de modellen niet simpelweg specifieke voorbeelden memoriseren, maar een flexibel systeem gebruiken om nieuwe inhoud met bekende rollen te combineren. De studie beweerde niet elk mysterie van kunstmatige intelligentie op te lossen, noch suggereerde het dat alle modellen identiek zijn. Het leverde echter sterk bewijs dat een enkel, samenhangend kader kan verklaren hoe deze systemen de wereld representeren. Door aan te tonen dat diverse interpretabiliteitsmethoden allemaal wijzen naar dezelfde structurele realiteit, brengt het werk het vakgebied dichter bij een verenigd begrip van hoe neurale netwerken functioneren, waardoor een verzameling geïsoleerde observaties wordt omgezet in één samenhangend beeld van de geest van de machine.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →