← Nieuwste papers
🤖 machine learning

ExpRL: Exploratory RL for LLM Mid-Training

ExpRL introduceert een geautomatiseerd mid-training framework dat door mensen geschreven oplossingen gebruikt als verborgen beloningssteigers om dichte, procesniveau-feedback voor LLM's te genereren, waardoor de beperkingen van ijle beloningen en handmatige vaardigheidsspecificatie worden overwonnen om modellen effectiever voor te bereiden op complexe redeneertaken.

Oorspronkelijke auteurs: Violet Xiang, Amrith Setlur, Chase Blagden, Nick Haber, Aviral Kumar

Gepubliceerd 2026-06-16
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Violet Xiang, Amrith Setlur, Chase Blagden, Nick Haber, Aviral Kumar

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante maar onervaren student (het Base LLM) probeert te leren hoe hij extreem moeilijke wiskundepuzzels kan oplossen.

Het Probleem: De "Alles-of-Niets"-valstrik

Op dit moment is de standaardmanier om deze student te onderwijzen het geven van een puzzel met de tekst: "Als je het uiteindelijke antwoord goed hebt, krijg je een gouden ster. Als je het fout hebt, krijg je niets."

Dit wordt Sparse Reward Reinforcement Learning genoemd. Het probleem is dat voor zeer moeilijke puzzels de student zelden bij de eerste poging het uiteindelijke antwoord goed heeft. Omdat ze bijna nooit de gouden ster krijgen, weten ze niet wat ze fout hebben gedaan. Begonnen ze met het juiste idee? Maakten ze een kleine rekenfout? Zijn ze halverwege de draad kwijtgeraakt? Zonder feedback blijft de student maar willekeurig gokken, in de hoop toevallig op het juiste antwoord te stuiten. Ze missen coverage — ze hebben niet genoeg verschillende manieren geleerd om het probleem aan te pakken om een goede kans te hebben om het uiteindelijk op te lossen.

De Oplossing: ExpRL (De "Coach met een Spiekbriefje")

De auteurs stellen een nieuwe trainingsmethode voor genaamd ExpRL (Exploratory Reinforcement Learning). Zie dit als een "Mid-Training" fase waarin de student een speciale coach krijgt voordat het eindexamen begint.

Zo werkt ExpRL, met een eenvoudige analogie:

  1. Het Spiekbriefje (Referentie-oplossingen): De coach heeft een perfecte, stapsgewijze oplossing voor de puzzel (de "referentie-oplossing").
  2. De Geheime Regel: De student ziet het spiekbriefje niet. Hij moet de puzzel op eigen kracht proberen op te lossen, net als in de echte wereld.
  3. Het Beoordelingsschema (De Rechter): Nadat de student zijn poging heeft opgeschreven, vergelijkt de coach deze met het spiekbriefje. Maar in plaats van alleen "Fout" te zeggen, gedraagt de coach zich als een strenge maar behulpzame beoordelaar.
    • Ben je begonnen met de juiste formule? (Ja? +1 punt).
    • Heb je de vergelijking correct vereenvoudigd? (Ja? +1 punt).
    • Ben je halverwege de draad kwijtgeraakt? (Geen punten voor dat deel).
    • Is het uiteindelijke antwoord fout? (Oké, maar je hebt nog steeds punten gekregen voor de goede stappen die je eerder zette).

Dit is de kerninnovatie: ExpRL beloont gedeeltelijke voortgang. Zelfs als de student het uiteindelijke antwoord niet heeft, krijgt hij "dense rewards" (veel kleine punten) voor de correcte stappen die hij onderweg heeft gezet.

Twee Manieren van Beoordelen

Het artikel test twee manieren om deze punten te geven:

  • ExpRL-Outcome: De coach wacht tot het einde van de poging van de student om een score te geven op basis van hoe dicht het hele betoog bij de perfecte oplossing ligt.
  • ExpRL-Process: De coach onderbreekt de student elke paar zinnen om directe feedback te geven. "Goed gedaan met die eerste stap! Maar de volgende stap ziet er wankel uit." Dit helpt de student te leren hoe hij een oplossing moet opbouwen, niet alleen hoe het uiteindelijke antwoord eruitziet.

De Resultaten: Een Betere Fundering Bouwen

Na deze "Mid-Training" fase is de student veel beter voorbereid op het eindexamen (de echte sparse-reward RL).

  • Betere Coverage: De student heeft geleerd om veel verschillende strategieën te proberen. Ze zijn niet alleen aan het gokken; ze weten hoe ze een probleem moeten afbreken, hun werk moeten controleren en zichzelf kunnen corrigeren.
  • Sterker Begin: Wanneer de student uiteindelijk het eindexamen maakt (waar ze alleen een gouden ster krijgen voor het perfecte antwoord), hebben ze al een veel grotere kans op succes omdat ze al de procedure van het oplossen van moeilijke problemen hebben geoefend.
  • De Concurrentie Verslaan: Het artikel laat zien dat deze methode beter werkt dan:
    • SFT (Supervised Fine-Tuning): De student simpelweg dwingen om het spiekbriefje uit het hoofd te leren (wat hen rigide en minder creatief maakt).
    • Standaard RL: Gewoon wachten op de gouden ster (wat te traag en frustrerend is).
    • Zelf-distillatie: Proberen te leren van hun eigen beste gissingen (wat onbetrouwbaar kan zijn).

De "Mixed Domain" Test

De onderzoekers hebben dit ook getest op een mix van wiskunde-, wetenschaps- en programmeerproblemen.

  • Wiskunde & Wetenschap: Het werkte geweldig. Het "spiekbriefje" hielp de student de logica en de stappen te begrijpen.
  • Programmeren: Het hielp een beetje, maar niet zo veel. Waarom? Omdat je bij programmeren de code gewoon kunt draaien om te zien of het werkt (een duidelijk "pass/fail" signaal). Het "spiekbriefje" is minder noodzakelijk wanneer de computer zelf vertelt of je het goed of fout hebt.

De Kernboodschap

ExpRL is als het geven van een oefenexamen waarbij de student voor elke goede stap gedeeltelijke punten krijgt, geleid door een perfect antwoordmodel dat hij niet mag zien. Dit bouwt een sterke fundering van probleemoplossende vaardigheden, waardoor ze veel grotere kans hebben om te slagen wanneer ze geconfronteerd worden met het echte, hoog-risico examen waar alleen het uiteindelijke antwoord telt. Het verandert de "alles-of-niets" gok in een gestructureerde leerreis.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →