← Nieuwste papers
💬 NLP

Learning State-Tracking from Code Using Linear RNNs

Dit artikel overbrugt de kloof tussen state-tracking onderzoek en next-token voorspelling door permutatiecompositie om te zetten in code-gebaseerde REPL-traces, waarbij wordt aangetoond dat hoewel lineaire RNN's op deze taak uitblinken vergeleken met Transformers, ze kunnen onderpresteren ten opzichte van niet-lineaire RNN's wanneer state-onthullingen deterministisch zijn maar acties niet volledig observeerbaar zijn.

Oorspronkelijke auteurs: Julien Siems, Riccardo Grazzi, Korbinian Pöppel, Kirill Kalinin, Hitesh Ballani, Babak Rahmani

Gepubliceerd 2026-06-26
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Julien Siems, Riccardo Grazzi, Korbinian Pöppel, Kirill Kalinin, Hitesh Ballani, Babak Rahmani

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: Het "Bekerspel" van Code

Stel je voor dat je naar een goochelaar kijkt die het "bekerspel" uitvoert. Er staan drie bekers op een tafel en er zit een bal onder één van de bekers. De goochelaar wisselt de bekers om elkaar heen. Jouw taak is om bij te houden waar de bal zich bevindt.

  • De Bal: Een variabele in een computerprogramma (zoals een getal dat in een doosje wordt bewaard).
  • De Wissels: De instructies in de code die variabelen rondverplaatsen.
  • Het Doel: Weten waar de bal precies is na een lange reeks wissels.

Lange tijd testten onderzoekers AI-modellen op dit "bekerspel" met een specifieke opstelling: ze lieten de AI de lijst met wissels zien en vroegen: "Waar is de bal nu?" Het artikel stelt dat dit is alsof je een student vraagt om een heel filmscript uit het hoofd te leren en vervolgens het einde te reciteren. Het test niet hoe goed de AI het verhaal daadwerkelijk begrijpt terwijl het zich afspeelt.

De Nieuwe Aanpak: De "Live Commentaar"

De auteurs veranderden de test om aan te sluiten bij hoe echte AI (zoals degene waarmee je nu praat) leert: Next-Token Prediction.

In plaats van de hele lijst met wissels in één keer te laten zien, gaven ze de AI een live transcript van een computerprogramma dat regel voor regel wordt uitgevoerd.

  • Regel 1: "Verplaats beker A naar B."
  • Regel 2: "Kijk onder beker A!" (De computer print het resultaat).
  • Regel 3: "Wissel beker B en C."
  • Regel 4: "Kijk onder beker C!"

De AI moet het volgende woord in het transcript voorspellen. Om dit te doen, moet de AI de staat van de bekers in zijn geest bijhouden terwijl hij leest, net zoals een mens een verhaal volgt.

De Strijders: De "Lineaire" versus de "Transformer"

Het artikel zet twee soorten AI-architecturen tegenover elkaar:

  1. Transformers (Het "Fotografisch Geheugen"): Dit zijn de huidige kampioenen van de AI (zoals de modellen achter deze chat). Ze zijn erg goed in het onthouden van feiten en het vinden van patronen als de informatie direct voor hun neus ligt.
  2. Lineaire RNN's (De "Mentale Notitie-nemers"): Dit zijn nieuwere, snellere modellen die ontworpen zijn om informatie sequentieel te verwerken, zoals het lezen van een boek woord voor woord.

De Resultaten:

  • Wanneer het "bekerspel" volledig zichtbaar was (de AI kon elke wissel en elke "peek" zien), waren de Lineaire RNN's (specifiek een type genaamd DeltaNet) verbazingwekkend goed. Ze konden de bal perfect volgen, zelfs als het spel erg lang werd.
  • De Transformers hadden moeite. Ze hadden nodig dat de staat heel vaak werd onthuld om het bij te kunnen houden. Als de "peeks" ver uit elkaar geplaatst waren, raakten ze de draad kwijt.

De Twist: Wanneer het Spel "Wazig" Wordt

Het artikel vraagt vervolgens: Wat gebeurt er wanneer het spel niet meer volkomen duidelijk is?

In echte computercode is niet alles altijd deterministisch. Soms maakt de code een willekeurige keuze, of hangt een variabele af van iets wat de AI niet kan zien (zoals een verborgen omgevingsvariabele).

De auteurs creëerden een scenario waarin de AI de staat moet raden op basis van waarschijnlijkheden (bijv. "Er is 50% kans dat de bal naar links is bewogen, en 50% kans dat hij is blijven staan").

Het Probleem met Lineaire RNN's:
Het artikel ontdekte een fundamentele zwakte in Lineaire RNN's bij het omgaan met deze "vage" onzekerheid.

  • De Analogie: Stel je voor dat je probeert een stapel papier in evenwicht te houden. Elke keer als je een nieuwe aanwijzing krijgt (een "reveal"), moet je de stapel reorganiseren.
  • In een Lineaire RNN is de wiskunde die wordt gebruikt om de stapel bij te werken "lineair". Het is als een lekkende emmer. Elke keer dat je een gedeeltelijke aanwijzing krijgt, lekt er een klein beetje van je "vertrouwen" (mathematische massa) weg.
  • Als je een lange reeks gedeeltelijke aanwijzingen krijgt zonder een "volledige reset" (een duidelijke, totale onthulling), krimpt het vertrouwen in je antwoord exponentieel. Uiteindelijk wordt het getal zo klein dat de computer het als nul behandelt. De AI vergeet alles.

De "Adversariële" Val:
De auteurs lieten zien dat je deze Lineaire RNN's kunt misleiden met een specifieke reeks bewegingen:

  1. Meng de bekers willekeurig (creëer onzekerheid).
  2. Onthul de positie van één specifieke beker (geef een gedeeltelijke aanwijzing).
  3. Herhaal dit.

Elke keer dat dit gebeurt, verliest de Lineaire RNN een beetje van zijn vermogen om de andere bekers te volgen. Na genoeg herhalingen verdwijnt het interne "geloof" van de AI over waar de andere bekers zich bevinden volledig, zelfs wanneer een mens nog steeds logisch tot de conclusie zou kunnen komen.

De Conclusie

  1. Lineaire RNN's zijn geweldig in het volgen van staten wanneer de regels duidelijk zijn en het pad deterministisch is (zoals een perfect bekerspel). Ze kunnen zelfs Transformers verslaan als de training goed is ingesteld.
  2. Lineaire RNN's hebben moeite met echte programmeercode waarbij zaken probabilistisch of gedeeltelijk verborgen zijn. Hun wiskundige structuur zorgt ervoor dat ze details in de loop van de tijd "vergeten" wanneer ze met onzekerheid te maken krijgen, omdat ze niet over een mechanisme beschikken om hun vertrouwensniveaus te "hernormaliseren" of te herstellen zonder hun lineaire structuur te breken.

Kortom: Lineaire RNN's zijn uitstekend in het volgen van een duidelijk script, maar ze verliezen hun verstand wanneer het script vaag en willekeurig wordt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →