← Nieuwste papers
💬 NLP

Weights to Code: Extracting Interpretable Algorithms from the Discrete Transformer

Dit paper introduceert de Discrete Transformer, een architectuur die door middel van temperatuur-geannealde bemonstering de representatieverstrengeling in Transformers oplost en zo interpreteerbare, uitvoerbare algoritmen direct uit de modelgewichten kan extraheren.

Oorspronkelijke auteurs: Yifan Zhang, Wei Bi, Kechi Zhang, Dongming Jin, Jie Fu, Zhi Jin

Gepubliceerd 2026-03-20
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yifan Zhang, Wei Bi, Kechi Zhang, Dongming Jin, Jie Fu, Zhi Jin

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, maar mysterieuze robot hebt die heel goed is in het oplossen van wiskundige raadsels. Deze robot, een Transformer (het type AI dat ook achter ChatGPT zit), kan de antwoorden geven, maar niemand weet hoe hij ze precies berekent. Het is alsof de robot een recept in zijn hoofd heeft, maar dat recept is geschreven in een onleesbare, door elkaar gehusselde code van duizenden kleine, overlappende gedachten.

De onderzoekers van dit paper willen die code ontcijferen. Ze willen niet alleen het antwoord, maar het recept zelf: een duidelijk, menselijk leesbaar algoritme.

Hier is hoe ze dat doen, vertaald in een simpel verhaal:

1. Het Probleem: De "Gordijn van Verwarring"

Normale AI-modellen werken als een grote soep van getallen. Alle informatie zit door elkaar heen verweven (dit noemen ze superpositie). Het is alsof je probeert een specifiek recept te vinden in een soep waarin alle ingrediënten al tot een puree zijn vermalen en door elkaar zijn geklopt. Je kunt niet meer zien welke kruiden er precies in zaten.

2. De Oplossing: De "Discrete Transformer"

De onderzoekers hebben een nieuwe versie van deze robot gebouwd, de Discrete Transformer. Ze hebben de robot een nieuwe "hersenstructuur" gegeven die dwingt om dingen te scheiden.

Stel je voor dat ze de robot twee aparte teams hebben gegeven:

  • Team Verwijzing (Attention): Dit team mag alleen maar wijzen. "Kijk naar het getal hier," of "Kijk naar het getal daar." Ze mogen niet rekenen, alleen verwijzen.
  • Team Rekenen (MLP): Dit team mag alleen maar rekenen. "Trek dit van dat af," of "Vermenigvuldig dit." Ze mogen niet wijzen, alleen bewerken.

Door deze strikte scheiding te maken, wordt de soep weer opgesplitst in losse ingrediënten. De robot leert het probleem op te lossen door eerst te wijzen en dan pas te rekenen.

3. De Magische Knop: De Temperatuur

Om de robot te dwingen om deze scheiding te maken, gebruiken ze een techniek die lijkt op het afkoelen van gesmolten glas.

  • Aan het begin is de robot "heet" en onzeker; hij kan wijzen naar een beetje hier en een beetje daar.
  • Langzaam wordt de robot "koud" (dit noemen ze temperatuur-annealing).
  • Naarmate hij afkoelt, wordt hij gedwongen om scherpe keuzes te maken: "Ik wijs precies naar dit getal" of "Ik reken precies dit uit."
  • Uiteindelijk is de robot volledig "bevroren" in een duidelijke, stap-voor-stap logica.

4. Het Ontcijferen: Van Robot naar Python-code

Zodra de robot is afgekoeld en zijn logica vaststaat, kijken de onderzoekers naar de "sporen" die de robot heeft achtergelaten.

  • Ze kijken naar het Team Verwijzing en zeggen: "Ah, je wijst altijd naar het getal van één stap terug. Dat is een 'verwijzing naar het verleden'."
  • Ze kijken naar het Team Rekenen en zeggen: "Ah, je doet hier een optelling en daar een vermenigvuldiging."

Met deze informatie schrijven ze een computerprogramma (in Python) dat precies doet wat de robot deed. Het resultaat is geen mysterieuze zwarte doos meer, maar een helder stukje code dat iedereen kan lezen en begrijpen.

Waarom is dit belangrijk?

Vroeger konden ze dit alleen doen met oudere, langzamere robots (RNN's). Met deze nieuwe methode kunnen ze nu ook complexe, continue taken (zoals het berekenen van vallende voorwerpen of het voorspellen van temperaturen) ontcijferen.

Kortom:
De onderzoekers hebben een manier gevonden om de "dromen" van een complexe AI om te zetten in een helder, menselijk leesbaar instructieboekje. Ze hebben de robot niet alleen gevraagd het antwoord te geven, maar hem gedwongen om het recept op te schrijven in een taal die wij allemaal begrijpen. Dit helpt ons niet alleen om AI te vertrouwen, maar kan ons misschien zelfs nieuwe manieren van denken laten ontdekken die mensen zelf nooit hadden bedacht.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →