← Nieuwste papers
🤖 machine learning

Continuous Latent Contexts Enable Efficient Online Learning in Transformers

Dit artikel toont aan dat het toerusten van transformers met continue latente contexttokens hen in staat stelt online-leeralgoritmen zoals gewogen meerderheid en Q-learning efficiënt te implementeren, waardoor kleine modellen aanzienlijk betere prestaties leveren dan veel grotere LLM's op lange termijn adaptieve taken.

Oorspronkelijke auteurs: Emile Anand, Abdullah Ateyeh, Xinyuan Cao, Max Dabagia

Gepubliceerd 2026-05-12
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Emile Anand, Abdullah Ateyeh, Xinyuan Cao, Max Dabagia

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een nieuw spel probeert te leren door een groep van vier experts te kijken spelen. Elke ronde maken de experts een gok, en vervolgens ontdek je wie het goed had. Je doel is om na verloop van tijd de best mogelijke gok te doen door uit te zoeken welke expert het meest betrouwbaar is.

Dit artikel gaat over het leren van AI-modellen (specifiek "Transformers") hoe ze dit soort leren efficiënt kunnen uitvoeren, zonder dat ze elke keer hun volledige "hersenen" (parameters) hoeven te herschrijven wanneer ze nieuwe informatie krijgen.

Hier is de uiteenzetting van hun ontdekking met behulp van eenvoudige analogieën:

1. Het Probleem: De "Korte-termijngeheugen" AI

Standaard Large Language Models (LLM's) zijn uitstekend in het bekijken van een lang gesprek en het raden van wat er als volgende komt. Dit wordt "in-context learning" genoemd. Echter, wanneer het spel lang doorgaat (honderden rondes), worstelen deze modellen. Ze hebben de neiging om het grote plaatje te vergeten of in de war te raken door de enorme hoeveelheid eerdere gissen. Ze gedragen zich als iemand die probeert een 100-pagina's tellend verhaal te onthouden door alleen naar de laatste paar zinnen te kijken, in plaats van een lopend samenvatting in het hoofd te houden.

2. De Oplossing: Het "Doorlopende Schrijfblok"

De auteurs stellen voor de AI een speciaal hulpmiddel te geven: Continuous Latent Context Tokens.

  • De Oude Manier (Discrete Tokens): Stel je voor dat de AI probeert een scorebord bij te houden door woorden op te schrijven zoals "Expert A is goed" of "Expert B is slecht". Dit neemt veel ruimte in beslag en wordt rommelig.
  • De Nieuwe Manier (Continue Tokens): Stel je voor dat de AI een klein, onzichtbaar schrijfblok heeft waarop het getallen kan schrijven die geen woorden zijn. Het kan deze getallen met elkaar vermengen, zoals verf mengen.
    • In plaats van te schrijven "Expert A is 80% betrouwbaar", houdt het een enkele, vloeiende "kleur" vast die die 80% betrouwbaarheid vertegenwoordigt.
    • Wanneer een nieuwe ronde plaatsvindt, hoeft het geen nieuwe zin te schrijven. Het verschuift gewoon subtiel de kleur op het schrijfblok om de score bij te werken.

Dit "schrijfblok" is compact (het neemt zeer weinig ruimte in beslag) en persistent (het blijft bij de AI van de ene ronde naar de volgende).

3. Het Bewijs: De AI Wiskunde Leren

De onderzoekers hoopten niet alleen dat dit zou werken; ze bewezen het wiskundig en trainden vervolgens een kleine AI om het te doen.

  • Het Gewogen Meerderheidsalgoritme: Ze toonden aan dat met dit schrijfblok een kleine AI een beroemd wiskundig algoritme perfect kan nabootsen dat wordt gebruikt om de betrouwbaarheid van experts bij te houden. Het is alsof je de AI een rekenmachine geeft die automatisch en direct de "vertrouwensscore" voor elke expert bijwerkt.
  • Q-Learning (De Videospel-Analogie): Ze leerden de AI ook om een eenvoudig videospel te spelen (een Markov-beslissingsproces). In dit spel moet de AI leren welke zetten de beste beloningen opleveren.
    • Normaal gesproken heeft een AI een enorme tabel nodig om de waarde van elke mogelijke zet te onthouden.
    • Met het continue schrijfblok slaat de AI deze hele "waardetabel" op als een paar gemengde getallen. Het kan zijn strategie direct na elke zet bijwerken, net als een menselijke speler die leert van ervaring.

4. De Verrassing: Kleine AI versus Reuzen-AI

Het meest verrassende deel van het artikel is het experiment met "Frontier"-modellen (enorme, krachtige AI's zoals DeepSeek-V3 en Qwen-3-14B).

  • De Opzet: Ze vroegen deze reuzen-AI's om het spel van het raden van experts te spelen.
  • Het Resultaat:
    • Zonder het Schrijfblok: De reuzen-AI's worstelden. Ze vertrouwden op korte-termijngeheugen (zoals "de laatste persoon had gelijk, dus ik zal dat gokken") en presteerden slecht over lange reeksen.
    • Met het Schrijfblok (De "Notitie"): De onderzoekers stonden de reuzen-AI's toe om na elke ronde een korte "notitie" te schrijven om samen te vatten wat ze hadden geleerd.
    • De Uitkomst: Toen de reuzen-AI's deze notities mochten schrijven, schoot hun prestatie omhoog. Ze begonnen te gedragen als de kleine, wiskundig perfecte AI die de auteurs hadden gebouwd.

De Haken: De reuzen-AI's wisten van nature niet hoe ze een goede notitie moesten schrijven. Ze moesten erop worden aangespoord dit te doen. Toen ze dat deden, realiseerden ze zich dat het samenvatten van het verleden (bijvoorbeeld "Expert A is 90% accuraat") veel beter was dan gewoon het ruwe verleden te onthouden.

5. De Conclusie

Het artikel betoogt dat continue latente contexten (het onzichtbare, gemengde-getallen schrijfblok) de sleutel zijn om AI efficiënt te maken voor langetermijnleren.

  • Kleine AI + Schrijfblok: Kan complexe online strategieën perfect en efficiënt leren.
  • Enorme AI + Schrijfblok: Kan plotseling veel beter worden in langetermijnbesluitvorming, en presteert zelfs beter dan grotere modellen die niet over dit "toestands"-mechanisme beschikken.

Kortom, het artikel suggereert dat we, om AI echt slim te maken in het leren over tijd, de modellen niet alleen groter moeten maken; we moeten ze een betere manier geven om een samenvatting van wat ze hebben geleerd vast te houden, door gebruik te maken van een "continue" interne staat in plaats van alleen maar een lange lijst woorden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →