← Nieuwste papers
💻 computer science

Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning

Deze survey presenteert een gemodulariseerd kader voor Reinforcement Learning in LLM's door algoritmeontwerp te categoriseren in de stadia van MDP-creatie, exploratie en leren, waarbij een significante onderzoeksbias naar critic-vrije policy gradients en Monte Carlo-methoden wordt onthuld terwijl onontgonnen mogelijkheden in value-based, off-policy en bootstrapping technieken worden benadrukt.

Oorspronkelijke auteurs: Zhao Yang, Yuxuan Jiang, Ting-Chih Chen, Lincen Yang, Annie Wong, Chao Gao, Jacob E. Kooi, Zhong Li, Jiayang Shi, Kevin Qiu, Qi Huang, Xinrui Zu, Shiping Yang, Hengyuan Zhang, Ngai Wong, Filip Ilievsk
Gepubliceerd 2026-06-23
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zhao Yang, Yuxuan Jiang, Ting-Chih Chen, Lincen Yang, Annie Wong, Chao Gao, Jacob E. Kooi, Zhong Li, Jiayang Shi, Kevin Qiu, Qi Huang, Xinrui Zu, Shiping Yang, Hengyuan Zhang, Ngai Wong, Filip Ilievski, Shujian Yu, Aske Plaat, Zhaochun Ren, Mark Hoogendoorn, Vincent François-Lavet

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante maar zeer letterlijke student (het Large Language Model, of LLM) leert hoe hij een perfect essay moet schrijven, een complexe wiskundige som moet oplossen of code moet schrijven. Je kunt niet simpelweg op elk woord dat ze typen een cijfer geven terwijl ze bezig zijn. In plaats daarvan wacht je tot ze het hele werk hebben voltooid en zeg je dan: "Goed gedaan!" of "Probeer het opnieuw."

Dit is de kern van de uitdaging van Reinforcement Learning (RL) voor AI: hoe leer je een student wanneer de feedback vertraagd, schaars en pas aan het einde beschikbaar is?

Dit artikel is een enorme "kaart" of "survey" die organiseert op welke verschillende manieren onderzoekers proberen dit probleem op te lossen. De auteurs stellen dat, hoewel iedereen momenteel een paar populaire methoden gebruikt (zoals PPO en GRPO), er een hele gereedschapskist aan andere technieken uit de wereld van robotica en spel-AI is die nog niet zijn geprobeerd. Ze breken het probleem af in vier hoofdfasen, zoals het bouwen van een huis:

1. Het fundament leggen: Het spel definiëren (MDP-creatie)

Voordat de AI kan leren, moet je de regels van het spel definiëren. Het artikel noemt dit het creëren van een "Markov Decision Process" (MDP).

  • De Beloning (Het Cijfer): Dit is het belangrijkste deel. Als je de AI zegt "wees behulpzaam", hoe meet je dat dan?
    • Het Inzicht van het Papier: De meeste mensen gebruiken een "Reward Model" (een tweede AI die getraind is om te raden wat mensen leuk vinden) of eenvoudige regels (bijv. "Is de code uitgevoerd?").
    • De Valstrik: Soms wordt de AI op een slechte manier "slim". Als je het beloont voor het schrijven van lange antwoorden, kan het simpelweg onzin schrijven om een hoge score te halen. Dit wordt Reward Hacking genoemd. Het artikel waarschuwt dat als je regels niet perfect zijn, de AI mazen in de wet zal vinden.
  • De Toestand (De Context): De AI moet weten wat hij al heeft geschreven. Meestal is dit de tekst tot nu toe. Maar als de tekst te lang wordt, raakt de AI overweldigd. Sommige onderzoekers proberen het verleden samen te vatten of delen ervan te verbergen om de AI gefocust te houden.
  • De Actie (Het Volgende Woord): Meestal kan de AI elk woord uit zijn woordenboek kiezen. Sommige onderzoekers proberen dit te beperken (zoals de AI dwingen om alleen woorden te kiezen die in een specieke grammatica passen) om het leren gemakkelijker te maken.
  • Het Einde (Terminatie): Wanneer stopt de AI? Meestal stopt hij wanneer hij een speciaal "einde van de zin"-token typt. Maar soms praat de AI te veel. Het artikel merkt op dat onderzoekers experimenteren met manieren om de AI te vertellen: "Stop als je klaar bent," zonder hem simpelweg af te kappen.

2. De Kunst van het Raden: Exploratie

De AI begint met niets te weten. Hij moet verschillende dingen proberen om te zien wat werkt. Dit wordt Exploratie genoemd.

  • Temperatuur (De Dobbelsteenworp): Stel je voor dat de AI een woord kiest. Als je de "temperatuur" laag instelt, kiest hij het veiligste, meest voor de hand liggende woord. Als je de temperatuur hoog instelt, doet hij wildere gokken. Dit is de eenvoudigste manier om de AI nieuwe dingen te laten proberen.
  • Entropie (De "Word niet Verveeld"-bonus): Om te voorkomen dat de AI in een lus terechtkomt waarin hij steeds dezelfde veilige woorden zegt, voegen onderzoekers een bonus toe voor het zijn van "onzeker" of divers. Het is alsof je de student vertelt: "Ik geef je extra punten als je een andere aanpak probeert, zelfs als dat misschien mislukt."
  • Nieuwsgierigheid (Intrinsieke Motivatie): Wat als de AI een beloning krijgt voor het doen van iets wat hij nog niet eerder heeft gezien? Sommige methoden geven de AI een "nieuwsgierigheidsscore" voor het proberen van nieuwe paden, zelfs als hij nog geen perfect antwoord heeft.
  • Boomstructuur Zoeken (Het "Wat als"-spel): In plaats van slechts één zin per keer te schrijven, stel je voor dat de AI zich uitbreidt als een boom. Hij schrijft drie verschillende zinnen, ziet waar ze toe leiden, en kiest dan het beste pad. Dit is als een schaker die drie zetten vooruit denkt.
  • Curriculum Learning (De Ladder): Begin niet met een PhD-thesis. Begin met een kleuterverhaal. Deze methode leert de AI eerst eenvoudige problemen, en maakt ze dan geleidelijk moeilijker, zodat hij niet ontmoedigd raakt.

3. Het Leerproces: Hoe de AI verbetert

Zodra de AI dingen heeft geprobeerd en feedback heeft gekregen, hoe leert hij dan echt? Het artikel categoriseert dit in vier grote keuzes:

  • Model-Free vs. Model-Based:
    • Model-Free: De AI onthoudt gewoon "Ik deed X, ik kreeg een goed cijfer. Ik zal X weer doen." Hij leert door vallen en opstaan. Dit is wat de meeste huidige AI doet.
    • Model-Based: De AI probeert eerst een mentale kaart van de wereld te bouteren ("Als ik X zeg, gebeurt meestal Y"), en plant vervolgens op basis van die kaart. Dit is moeilijker maar kan efficiënter zijn.
  • Value-Based vs. Policy-Based vs. Actor-Critic:
    • Policy-Based: De AI leert simpelweg een reeks gewoonten (een "policy") om goede cijfers te halen.
    • Value-Based: De AI leert te voorspellen "Hoe goed is deze situatie?" voordat hij überhaupt handelt.
    • Actor-Critic: Een teambenadering. Eén deel (de Actor) beslist wat te doen, en een tweede deel (de Critic) beoordeelt hoe goed die beslissing was. Het artikel merkt op dat hoewel "Actor-Critic" de gouden standaard is in de robotica, de meeste AI-onderzoekers momenteel "Critic-vrije" methoden gebruiken omdat deze goedkoper zijn om op enorme computers te draaien.
  • On-Policy vs. Off-Policy:
    • On-Policy: De AI leert alleen van de exacte dingen die hij net heeft gedaan. Als hij een fout maakt, gooit hij die data weg en probeert hij het opnieuw. Dit is veilig maar verspillend.
    • Off-Policy: De AI leert van zijn verleden fouten en successen, zelfs als hij nu een iets andere strategie gebruikt. Dit is als een student die zijn oude toetsen herbekijkt om te leren van fouten. Het artikel wijst erop dat nog maar heel weinig AI-onderzoekers dit doen, ook al is het een enorm voordeel in andere velden.
  • Credit Assignment (Wie krijgt de eer?):
    • Als de AI een essay van 100 woorden schrijft en een "A" krijgt, welke 5 woorden waren dan het belangrijkst?
    • Huidige Standaard: De meeste methoden zeggen gewoon: "Goed gedaan met het hele essay!" en geven elke woord evenveel krediet.
    • Het Gat: Het artikel betoogt dat we betere manieren nodig hebben om precies te achterhalen welke woorden tot succes hebben geleid, vooral voor lange, complexe redeneertaken.

4. Het Grote Plaatje: Wat ontbreekt er?

De belangrijkste conclusie van de auteurs is dat het veld uit balans is.

  • De Massa: Bijna iedereen gebruikt dezelfde paar instrumenten (Critic-vrije methoden, Monte Carlo credit assignment). Het is also려 dat iedereen in een stad in dezelfde auto over dezelfde weg rijdt.
  • De Lege Lotes: Er zijn grote, goed geasfalteerde wegen in de wereld van Reinforcement Learning (zoals Off-Policy leren, Value-based methoden en Bootstrapping) die volledig leeg zijn in de wereld van AI.
  • De Kans: Het artikel suggereert dat door deze "vergeten" technieken te lenen uit de bredere wereld van RL, we AI beter kunnen leren redeneren, sneller kunnen leren en moeilijkere taken kunnen afhandelen zonder dat er zoveel rekenkracht nodig is.

Kortom: Dit artikel is een oproep om niet het wiel opnieuw uit te vinden. Het zegt: "We gebruiken een zeer beperkt scala aan instrumenten om AI te trainen. Er is een hele opslagplaats aan andere krachtige instrumenten die geweldig werken in andere velden, en we zouden ermee moeten beginnen te experimenteren in de wereld van taalmodellen."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →