← Nieuwste papers
💬 NLP

Learning without training: The implicit dynamics of in-context learning

Dit artikel stelt voor dat in-context leren in Large Language Models voortkomt uit een mechanisme waarbij self-attention lagen tijdens de forward pass impliciet laag-rang updates aan de MLP-gewichten induceren, wat wiskundig equivalent is aan trainen op de verstrekte contextvoorbeelden zonder daadwerkelijke wijzigingen in de gewichten.

Oorspronkelijke auteurs: Benoit Dherin, Michael Munn, Hanna Mazzawi, Michael Wunder, Javier Gonzalvo

Gepubliceerd 2026-06-03
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Benoit Dherin, Michael Munn, Hanna Mazzawi, Michael Wunder, Javier Gonzalvo

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Mysterie: Hoe "leert" LLM's on the fly?

Stel je voor dat je praat met een zeer slimme robot. Je geeft het een paar voorbeelden van een nieuwe regel die je hebt bedacht (bijv. "Als ik 'appel' zeg, zeg jij 'rood'. Als ik 'banaan' zeg, zeg jij 'geel'"). Zonder dat je ooit de hersenen van de robot verandert of hem opnieuw traint, begrijpt de robot de regel direct en past hij deze toe op een nieuwe vrucht die je noemt.

Dit wordt In-Context Learning (ICL) genoemd. De robot lijkt te "leren" midden in het gesprek. Maar hier is het mysterie: in standaard machine learning betekent leren het veranderen van de interne gewichten (de bedrading van de hersenen) op basis van data. In dit geval verandert de hersenstructuur van de robot nooit. De gewichten blijven exact hetzelfde. Hoe leert hij dan?

De Ontdekking van het Papier: De "Ghost" Update

De auteurs van dit papier stellen een slimme verklaring voor. Ze beweren dat hoewel de robot zijn hersenen niet fysiek verandert, de handeling van het lezen van jouw voorbeelden een "ghost" update creëert.

Denk aan de hersenen van de robot als een enorme, complexe fabriek.

  1. De Standaard Manier: Normaal gesproken, als je wilt dat de fabriek iets nieuws doet, stuur je een team van ingenieurs om de machines fysiek te herbedraden (dit is training).
  2. De In-Context Manier: De auteurs laten zien dat wanneer je de robot een prompt voert met voorbeelden, de interne machinerie van de robot (specifiek de Self-Attention laag) werkt als een magische projector. Het neemt de informatie uit jouw voorbeelden en projecteert een "schaduw" op de hoofdlopende band van de fabriek (de MLP-laag).

Deze schaduw is wiskundig identiek aan een fysieke herbedrading. Het is alsof de robot doet alsof hij zijn hersenen heeft bijgewerkt, speciaal voor dat specifieke moment. Het papier bewijst dat het lezen van de prompt wiskundig gelijkstaat aan het geheimzinnig updaten van de gewichten, ook al vindt er geen werkelijke update plaats op de computerhardware.

De "Minimal Patch": Een Kleine, Perfecte Fix

Het papier introduceert een concept genaamd de "Minimal Token-Patch."

Stel je voor dat je een schilderij hebt (de oorspronkelijke hersenen van de robot). Je wilt een klein detail aan dat schilderij toevoegen op basis van een nieuwe instructie.

  • Je zou het hele canvas opnieuw kunnen schilderen (te veel werk).
  • Je zou overal verf tegenaan kunnen smijten (rommelig).
  • Het papier laat zien dat de robot de absoluut kleinste, meest precieze sticker vindt die hij op het schilderij kan plakken om het er precies goed uit te laten zien.

Wiskundig gezien is deze "sticker" een Rank-1 Matrix. In gewone taal betekent dit dat het een zeer eenvoudige, laag-dimensionale aanpassing is. Het is de meest efficiënte, minimale verandering mogelijk om de output van de robot te laten overeenkomen met wat het zou zijn geweest als hij de regel daadwerkelijk had geleerd.

De "Thought Patch": Het Gesprek Comprimeren

De onderzoekers ontdekten ook een manier om dit praktisch te maken. Omdat de "ghost update" afhangt van de specifieke vraag die je stelt, verandert deze elke keer. Maar ze lieten zien dat je een "Static Thought Patch" kunt berekenen.

Stel je voor dat je een lang gesprek hebt met de robot. In plaats van het hele gesprek in het geheugen te houden, kun je het destilleren tot één enkele, kleine notitie (de Thought Patch). Als je deze notitie later aan de robot geeft, gedraagt hij zich precies alsof hij het hele gesprek heeft onthouden. Dit is een vorm van prompt compressie: het omzetten van een lange geschiedenis van voorbeelden in een enkele, statische gewicht-update.

Waarom Sommige Robots Beter Zijn Dan Anderen

Het papier testte deze theorie op verschillende soorten robotbreinen:

  • Transformers (de huidige AI-sterren): Zij hebben een "Self-Attention" mechanisme. Het papier laat zien dat dit mechanisme een vloeiende, stabiele "ghost update" creëert die mooi convergeert. Dit verklaart waarom Transformers zo goed zijn in leren van voorbeelden.
  • RNN's (Oudere AI-technologie): Wanneer ze dezelfde theorie testten op Recurrent Neural Networks (RNN's), waren de "ghost updates" chaotisch en instabiel. Ze kwamen niet tot rust. Dit biedt een wiskundige reden waarom RNN's moeite hebben met in-context learning vergeleken met Transformers.

De Connectie met het "Stuurwiel"

Ten slotte verbindt het papier dit met een concept genaamd Model Editing. Wetenschappers hebben eerder ontdekt dat je de hersenen van een robot handmatig kunt bijsturen met een "steering vector" om hem de waarheid te laten spreken of een specifieke stijl te laten volgen.

Het papier onthult dat In-Context Learning simpelweg de robot is die dit bij zichzelf doet. Wanneer je het voorbeelden geeft, genereert de robot automatisch zijn eigen "steering vector" (de Rank-1 update) om zijn gedrag te sturen voor de huidige taak. Het is geen magie; het is de robot die zijn eigen interne mechanismen gebruikt om zichzelf tijdelijk te herconfigureren.

Samenvatting

  • De Claim: Large Language Models hoeven niet opnieuw getraind te worden om te leren van voorbeelden.
  • Het Mechanisme: Het aandachtsmethanisme (attention mechanism) werkt als een projector, die een wiskundige "ghost update" creëert van de gewichten van het model.
  • Het Resultaat: Deze update is een kleine, perfecte "patch" (Rank-1 matrix) die het model laat handelen alsof het de nieuwe regel heeft geleerd.
  • Het Bewijs: Ze hebben dit wiskundig aangetoond en bewezen dat het "ghost"-gedrag identiek is aan het echte ding, wat verklaart waarom Transformers hier zo goed in zijn vergeleken met oudere modellen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →