← Nieuwste papers
🤖 AI

Closing the Feedback Loop: From Experience Extraction to Insight Governance in Verbal Reinforcement Learning

Dit artikel behandelt het retentie-vergetelheidsdilemma in training-vrije verbale reinforcement learning door een drielaagse architectuur voor te stellen met een feedbackgestuurde curatie-loop die de levenscyclus van geëxtraheerde regels en bewijsvoering beheert, waardoor LLM-agenten effectief kunnen adapteren aan niet-stationaire omgevingen zonder catastrofale vergetelheid of negatieve transfer.

Oorspronkelijke auteurs: Yanwei Cui, Xing Zhang, Yulong Zhang, Li Shao, Xiaofeng Shi, Guanghui Wang, Peiyang He

Gepubliceerd 2026-06-17
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yanwei Cui, Xing Zhang, Yulong Zhang, Li Shao, Xiaofeng Shi, Guanghui Wang, Peiyang He

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, maar licht koppige robotassistent leert hoe hij met aandelen moet handelen. Elke dag doet de robot een voorspelling, beweegt de markt, en krijgt de robot een resultaat: "Je hebt geld verdiend" of "Je hebt geld verloren."

De grote vraag is: Hoe leert de robot van deze resultaten zonder in de war te raken of te vergeten wat eerder werkte?

Dit artikel behandelt een specifiek probleem dat de "Retention-Forgetting Dilemma" (het dilemma tussen behoud en vergeten) wordt genoemd. Hier is de eenvoudige uitleg van het probleem en de oplossing die zij voorstellen.

Het Probleem: De Geheugencrisis van de Robot

De auteurs stellen dat wanneer een robot leert van feedback uit de echte wereld (zoals de stijgingen en dalingen op de aandelenmarkt), hij voor twee slechte keuzes staat:

  1. De "Verzamelaar" Robot (Retention/Behoud): Als de robot alles wat hij ooit heeft geleerd onthoudt, raakt zijn brein verstopt. Hij blijft oude regels gebruiken die werkten in 2013, maar vreselijk zijn in 2017. Het is alsoals proberen een auto te besturen met een kaart van 50 jaar geleden; de wegen zijn veranderd, maar de robot houdt vol dat hij de oude instructies moet volgen. Dit zorgt ervoor dat de robot slechter presteert dan wanneer hij helemaal niets had geleerd.
  2. De "Vergetelijke" Robot (Forgetting/Vergeten): Als de robot alles wat misging direct verwijdert, kan hij een regel die slechts één keer fout ging vanwege een vreemde eenmalige gebeurtenis, per ongeluk weggooien. Later, wanneer diezelfde vreemde gebeurtenis zich weer voordoet, heeft de robot geen geheugen meer van hoe hij hiermee om moet gaan en moet hij weer helemaal bij af beginnen.

Het Dilemma: Hoe behoud je de goede lessen zonder de slechte te bewaren, en zonder de lessen die je later misschien nodig hebt te verwijderen?

De Oplossing: Een Drielagige "Keuken"

De auteurs stellen een nieuw systeem voor dat werkt als een professionele keuken met drie afzonderlijke stations, beheerd door een feedbackloop. In plaats van simpelweg nieuwe aantekeningen in het brein van de robot te dumpen, organiseren ze deze zorgvuldig.

Laag 1: Het Receptenboek (Regels)

Hier slaat de robot zijn "regels" of "recepten" op (bijv. "Als een aandeel op een dag met 5% daalt, koop het dan").

  • De Oude Manier: Als een recept mislukte, zou je het kunnen doorstrepen of herschrijven, waardoor je de geschiedenis van waarom het mislukte verliest.
  • De Nieuwe Manier: Als een recept mislukt, verwijder je het niet. Je markeert het als "Deprecated" (verouderd/niet meer bruikbaar – zoals een "Niet Gebruiken"-sticker erop plakken). Het recept blijft in het boek staan, zodat de robot onthoudt waarom het mislukte, maar het wordt niet meer gebruikt tijdens het koken.

Laag 2: Het Logboek van de Chef (Bewijs)

Dit is het belangrijkste onderdeel. Elke keer dat een regel wordt gebruikt, schrijft de robot een gedetailleerde notitie in een logboek.

  • Het zegt niet alleen "Goed" of "Slecht".
  • Het zegt: "Deze regel werd gebruikt op dinsdag toen de markt onrustig was. Het veroorzaakte een verlies. Werd opnieuw gebruikt op vrijdag toen de markt rustig was. Het maakte winst."
  • Waarom dit belangrijk is: Als een regel vaak faalt, bewijst het logboek dat het een slechte regel is. Als een regel slechts één keer faalde in een vreemde situatie, laat het logboek zien dat het nog steeds een goede regel is voor normale dagen. Dit voorkomt dat de robot goede hulpmiddelen weggooit, alleen omdat ze één keer kapot gingen.

Laag 3: De Chef de Cuisine (Vaardigheden)

Dit is de manager die beslist welke recepten uit het boek gehaald moeten worden en op het aanrecht geplaatst moeten worden.

  • De Chef leest de Logboeken (Bewijs).
  • Als het logboek laat zien dat een regel faalt, zegt de Chef tegen de robot: "Gebruik die niet."
  • Als twee regels elkaar tegenspreken, beslist de Chef welke hij vertrouwt op basis van het bewijs.
  • De Chef weet ook wanneer hij moet zeggen: "Ik weet het niet, laten we niet gokken."

De "Curatie-Loop" (Het Feedbackmechanisme)

De magie vindt plaats in een loop waarbij drie rollen betrokken zijn:

  1. De Criticus: Bekijkt de voorspelling van de robot en het werkelijke resultaat van de markt. Hij schrijft een rapport: "Deze regel hielp, die regel deed pijn."
  2. De Voorsteller: Neemt dat rapport en voegt het toe aan het Logboek (Bewijs). Hij kan ook een nieuw recept voorstellen als de robot een fout maakte waar hij nog geen regel voor had.
  3. De Curator: Leest de Logboeken. Hij beslist welke regels "Deprecated" worden gemaakt (gezien met een sticker) en werkt de instructies van de Chef de Cuisine (Vaardigheden) bij over hoe regels geprioriteerd moeten worden.

De Resultaten: Waarom het Werkt

De auteurs testten dit op het voorspellen van de aandelenkoersen van vijf grote bedrijven (zoals Apple en Amazon).

  • Zonder dit systeem: De robot probeerde te leren van zijn fouten uit het verleden, maar raakte in de war. Hij presteerde zelfs slechter dan een robot die niets wist (Zero-Shot). Het was als een student die de verkeerde antwoorden bestudeerde en vervolgens zakte voor het examen.
  • Met dit systeem: De robot gebruikte dezelfde data, maar organiseerde deze met de drie lagen.
    • Hij werd 5,3% nauwkeuriger in het voorspellen van de richting.
    • Hij maakte twee keer zoveel winst relatief aan het risico.
    • Hij verloor 60% minder geld tijdens slechte periodes.

De Belangrijkste Les

Het artikel betoogt dat het probleem niet gaat over het extraheren van meer regels uit ervaring (de robot is daar al goed in). Het probleem is het besturen van die regels.

Het gaat er niet om hoeveel recepten je in je keuken hebt; het gaat erom dat je een slimme Chef de Cuisine hebt die weet welke recepten hij moet gebruiken, welke hij in de prullenbak moet gooien (maar waar hij een verslag van bewaart), en welke hij moet bewaren voor een regenachtige dag. Zonder dit "bestuur" maakt meer ervaring de robot juist dommer. Met dit bestuur maakt diezelfde ervaring de robot een genie.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →