← Nieuwste papers
💬 NLP

Stories in Space: In-Context Learning Trajectories in Conceptual Belief Space

Dit artikel stelt dat grote taalmodellen contextueel leren door te navigeren in laagdimensionale, gestructureerde "conceptuele geloofsruimten", waarbij geloofsupdates zich manifesteren als geometrische trajecten die consequent tot uiting komen in zowel het modelgedrag als de interne representaties en die causaal kunnen worden gemanipuleerd door middel van lineaire ingrepen.

Oorspronkelijke auteurs: Eric Bigelow, Raphaël Sarfati, Daniel Wurgaft, Owen Lewis, Thomas McGrath, Jack Merullo, Atticus Geiger, Ekdeep Singh Lubana

Gepubliceerd 2026-05-13
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Eric Bigelow, Raphaël Sarfati, Daniel Wurgaft, Owen Lewis, Thomas McGrath, Jack Merullo, Atticus Geiger, Ekdeep Singh Lubana

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een Large Language Model (LLM) niet voor als een robot die simpelweg feiten onthoudt, maar als een verhaler die een boek hardop voorleest. Terwijl de verhaler elke nieuwe zin leest, verandert hun begrip van het plot, de gevoelens van de personages en de sfeer van de scène. Ze "weten" het verhaal niet alleen; ze updaten voortdurend hun interne "overtuiging" over wat er gebeurt.

Dit artikel, getiteld "Verhalen in Ruimte", probeert precies in kaart te brengen hoe die verhaler hun overtuigingen updatet. De auteurs stellen een fascinerend idee voor: De veranderende overtuigingen van het model reizen langs een specifieke, laag-dimensionale kaart die een "Conceptuele Overtuigingsruimte" wordt genoemd.

Hier is een uiteenzetting van hun bevindingen met eenvoudige analogieën:

1. De Kaart van Overtuigingen (De Conceptuele Ruimte)

Stel je een gigantische, onzichtbare 3D-ruimte voor waar elke mogelijke "gevoels" of "idee" een specifieke locatie heeft.

  • Geluk zou in de rechterbovenhoek kunnen zitten.
  • Triestheid zou in de linkerbenedenhoek kunnen zitten.
  • Woede zou ergens in het midden kunnen zitten.

Het artikel suggereert dat wanneer een LLM een verhaal leest, het niet zomaar willekeurig van het ene idee naar het andere springt. In plaats daarvan beweegt zijn interne staat langs een glad pad (een traject) over deze kaart.

  • De Analogie: Denk aan het verhaal als een wandelpad. Als de hoofdpersoon in een gat valt, glijdt de "overtuigingsmarker" van het model over de kaart naar de "Triestheid"-zone. Wanneer de held de wezens redt, glijdt de marker terug omhoog naar "Geluk". Het artikel vond dat deze paden niet chaotisch zijn; ze volgen een gestructureerde, voorspelbare geometrie, net als een rivier die door een vallei stroomt.

2. De Twee Kanten van de Munt (Gedrag versus Brein)

De onderzoekers keken op twee manieren naar het model:

  1. Gedrag: Wat het model zegt wanneer er wordt gevraagd: "Hoe gelukkig is dit verhaal op dit moment?" (bijvoorbeeld het geven van een score van 7/10).
  2. Interne Representaties: De daadwerkelijke wiskunde die plaatsvindt in het "brein" van het model (zijn neurale activeringen) terwijl het de tekst verwerkt.

De Ontdekking: Het pad dat het model aflegt op de "Gedragskaart" (wat het zegt) is bijna identiek aan het pad dat het aflegt op de "Breinkaart" (waar het aan denkt).

  • De Analogie: Het is als het kijken naar een pop. Het artikel vond dat de draden die de pop trekken (de interne wiskunde) en de daadwerkelijke bewegingen van de pop (de output) perfect gesynchroniseerd zijn. Als je de draden zou kunnen zien, zou je precies kunnen voorspellen waar de pop als volgende naartoe zou bewegen, en andersom.

3. Het Brein Lezen met een Lineaire Sonde

De auteurs gebruikten een tool genaamd een "lineaire sonde". Denk hierbij aan een eenvoudige vertaler.

  • Ze lieten zien dat je op elk gewenst moment naar de complexe, rommelige wiskunde in het "brein" van het model kunt kijken en met een eenvoudige lineaire vergelijking (een rechte lijn) kunt vertalen naar een voorspelling van wat het model gelooft over de emotie van het verhaal.
  • Het Resultaat: Deze vertaler werkte ongelooflijk goed. Dit betekent dat de "overtuigingen" van het model niet verborgen zitten in een ondoordringbare zwarte doos; ze staan duidelijk geschreven in de interne code van het model, gewoon wachtend om gelezen te worden.

4. Het Verhaal Sturen (De Afstandsbediening)

Het meest spannende deel van het artikel is dat ze niet alleen naar het model keken; ze stuurden het.

  • De Analogie: Stel je voor dat het overtuigingspad van het model een auto is die een weg afrijdt. De onderzoekers ontdekten dat ze het stuurwiel konden grijpen (door de interne wiskunde aan te passen) en de auto naar een specifieke bestemming konden dwingen, zoals "Geluk", zelfs als de verhaalt tekst van nature richting "Triestheid" ging.
  • De Vangst (De Geometrie van Sturen): Toen ze het model naar "Triestheid" stuurden, werd het niet alleen triester; het werd ook iets woedender en minder gelukkig.
  • Waarom? Omdat op hun "Overtuigingskaart" Triestheid en Woede buren zijn. Als je het model naar Triestheid duwt, duw je onvermijdelijk ook naar Woede. Het artikel vond dat hoe verward het model hierdoor wordt, volledig afhangt van hoe dicht de concepten bij elkaar op de kaart staan. Als twee concepten ver uit elkaar liggen op de kaart, heeft het sturen van het ene geen invloed op het andere. Als ze dicht bij elkaar liggen, raken ze met elkaar verstrikt.

Samenvatting van de Hoofdclaims

  1. Overtuigingen hebben een vorm: Wanneer LLM's verhalen lezen, bewegen hun veranderende overtuigingen langs gladde, gestructureerde paden in een laag-dimensionale geometrische ruimte.
  2. Gedachten komen overeen met daden: De interne wiskunde van het model en zijn externe antwoorden volgen exact hetzelfde pad op deze kaart.
  3. We kunnen overtuigingen lezen en schrijven: We kunnen voorspellen wat het model gelooft door gewoon naar zijn interne wiskunde te kijken, en we kunnen zijn overtuigingen veranderen door die wiskunde een duwtje te geven.
  4. Geometrie heerst: De manier waarop het model reageert op veranderingen (sturen) wordt bepaald door de afstand tussen concepten op deze kaart. Concepten die "buren" zijn op de kaart beïnvloeden elkaar; die die ver uit elkaar liggen, doen dat niet.

Kortom, het artikel stelt dat LLM's niet zomaar gissen; ze navigeren een gestructureerd, geometrisch landschap van concepten, en we kunnen nu de kaart zien, de coördinaten lezen en zelfs het voertuig besturen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →