← Nieuwste papers
🤖 AI

ReSkill: Reconciling Skill Creation with Policy Optimization in Agentic RL

ReSkill is een nieuw agentisch RL-framework dat de creatie van vaardigheden verzoent met beleidsoptimalisatie door assertiegestuurde vaardigheidsrevisie, binnen-groep rollout-sampling en Thompson Sampling in het GRPO-algoritme in te bedden, waardoor de automatische co-evolutie van herbruikbare strategieën en beleid mogelijk wordt om superieure generalisatie op ongeziene taken te bereiken.

Oorspronkelijke auteurs: Zelin He, Haotian Lin, Boran Han, Wei Zhu, Haoyang Fang, Bernie Wang, Xuan Zhu, Runze Li, Matthew Reimherr

Gepubliceerd 2026-06-02
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zelin He, Haotian Lin, Boran Han, Wei Zhu, Haoyang Fang, Bernie Wang, Xuan Zhu, Runze Li, Matthew Reimherr

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Idee: Een Robot Leren Leren Tijdens het Leren

Stel je voor dat je een robot leert om een complex computerspel te spelen.

  • De Oude Manier: Je leert de robot de regels, laat hem spelen, en wanneer hij faalt, schrijf je handmatig een nieuwe regel (een "skill") op die hij de volgende keer moet volgen. Maar hier is het probleem: de robot verandert constant zijn eigen speelstijl naarmate hij beter wordt. Als je een nieuwe regel schrijft op basis van hoe hij gisteren speelde, kan die regel hem vandaag juist in de war brengen, omdat hij al geëvolueerd is. Het is alsof je een peuter leert hoe hij zijn veters moet strikken met een handleiding die geschreven is voor een volwassene; de peuter is de oude instructies al ontgroeid, maar de nieuwe zijn nog niet getest.
  • De RESKILL-Manier: In plaats van regels in een apart schrift te schrijven, maakt RESKILL het proces van regelgeving onderdeel van het spel zelf. Het creëert een "regel-makende fabriek" die binnen de trainingslus draait. De robot probeert nieuwe regels uit terwijl hij nog aan het leren is, ziet of ze helpen, en houdt de goede regels vast terwijl hij de slechte weggooit, allemaal in real-time.

Het Kernprobleem: De "Mismatch"

Het paper stelt dat huidige methoden lijden onder een Skill-Policy Conflict.

  • De Policy: Dit is het brein van de robot (zijn strategie om te spelen). Dit verandert constant terwijl hij leert.
  • De Skills: Dit zijn herbruikbare trucjes of snelkoppelingen (zoals "check altijd eerst de koelkast" of "zoek voordat je gokt").
  • Het Conflict: Bestaande methoden creëren skills apart van de training van het brein. Ze kunnen een skill creëren die werkte voor het "oude" brein, maar die botst met het "nieuwe" brein. Het is alsof een coach een nieuwe playbook geeft aan een speler terwijl de speler midden in een wedstrijd zit, zonder te controleren of de speler de nieuwe zetten wel begrijpt.

Hoe RESKILL Werkt: De "Proeverij"-Keuken

RESKILL lost dit op door de creatie van skills direct te integreren in het trainingsproces met drie belangrijke mechanismen, die de auteurs Reconciling Skill Creation with Policy Optimization noemen.

1. De "Groeps-Proeverij" (Within-Group Sampling)

Stel je een kookwedstrijd voor waarbij een chef (de AI) een gerecht moet maken.

  • Standaard Methode: De chef maakt 10 gerechten met hetzelfde recept. Daarna schrijft een criticus een nieuw recept. De chef probeert het nieuwe recept later.
  • RESKILL Methode: De chef krijgt een groep van 10 bestellingen. Voor 5 bestellingen gebruikt hij het Oude Recept. Voor de andere 5 bestellingen gebruikt hij een Nieuw Recept (ter plekke gecreëerd).
  • Waarom het werkt: Omdat de chef in exact dezelfde gemoedstoestand en staat is voor alle 10 de bestellingen, is het enige verschil het recept. Het systeem kan direct zien: "Hielp het Nieuwe Recept de chef om op dit moment een hogere score te halen?" Dit maakt een eerlijke, gecontroleerde vergelijking mogelijk zonder extra tijd of middelen nodig te hebben.

2. Het "Zelfherstellende" Regelboek (Assertion-Driven Creator)

Wanneer de chef een gerecht mislukt, moet er meestal een mens bij komen die zegt: "Je bent vergeten te zouten." RESKILL automatiseert dit.

  • Het houdt een Reservoir (een emmer) bij van elke keer dat de chef slaagde en elke keer dat hij faalde.
  • Het gebruikt een "detective" (een LLM) om naar de emmer te kijken en te vragen: "Wat ging er mis? Zijn we vergeten de oven te controleren? Hebben we naar het verkeerde ingrediënt gezocht?"
  • Op basis van deze patronen schrijft het systeem automatisch een nieuwe "Skill" (een regel zoals: Als je een pan ziet, controleer dan de temperatuur voordat je roert).
  • Cruciaal: Het raadt niet alleen maar wat. Het test deze nieuwe regel onmiddellijk tegen de oude regel met behulp van de "Groeps-Proeverij" die hierboven werd beschreven.

3. De "Slimme Gokker" (Thompson Sampling)

Hoe beslist het systeem hoe vaak het het Nieuwe Recept versus het Oude Recept moet proberen?

  • Als het Nieuwe Recept veelbelovend lijkt, probeert het systeem het vaker.
  • Als het Nieuwe Recept slecht lijkt, probeert het het minder vaak.
  • De Twist: Het brein van de robot evolueert elke seconde. Een regel die 10 minuten geleden werkte, kan nu verouderd zijn. RESKILL gebruikt een wiskundige truc genaamd Thompson Sampling met Adaptive Discounting.
    • Denk aan een gokker die weet dat de winnende loterijnummers van gisteren nutteloos zijn voor vandaag.
    • Als de robot het Nieuwe Recept onlangs veel heeft geprobeerd, vertrouwt het systeem op de nieuwste data en vergeet het de oude data (discounting).
    • Als de robot het niet vaak heeft geprobeerd, behoudt het de oude data om te voorkomen dat er een overhaaste beslissing wordt genomen op basis van slechts één slechte poging.
    • Dit zorgt ervoor dat het systeem altijd wedt op de skill die het beste werkt voor het huidige brein van de robot, niet het brein uit het verleden.

De Resultaten: Waarom het Ertoe Doet

Het paper heeft RESKILL getest op verschillende "games" (taken):

  1. Huishoudelijke Taken (ALFWorld): Het rondverplaatsen van objecten in een virtueel huis.
  2. Zoekmachines: Het beantwoorden van complexe vragen door het web te doorzoeken.
  3. Wetenschap & Codering: Het oplossen van natuurkundeproblemen en het schrijven van SQL-code.

De Bevindingen:

  • Beter in de Moeilijke Zaken: RESKILL deed het niet alleen iets beter; het verpletterde de concurrentie op onbekende taken (taken die het nog nooit eerder had gezien). Dit komt omdat de geleerde skills flexibel en algemeen waren, en niet simpelweg uit het hoofd geleerde antwoorden.
  • Geen Extra Kosten: Het vereiste niet dat de robot twee keer zo lang het spel speelde. Het testte de skills tijdens de normale trainingsstappen.
  • Zelfcorrectie: Het systeem "snoeide" (verwijderde) automatisch skills die niet meer werkten naarmate de robot slimmer werd. Het is een levende bibliotheek van skills die groeit en krimpt waar nodig.

Samenvattende Analogie

Stel je een Voetbalteam voor:

  • Oude Methode: De coach kijkt naar de wedstrijd, schrijft een nieuwe tactiek op een whiteboard en vertelt het team dat ze die volgende week moeten proberen. Ondertimaal is de formatie van de spelers veranderd, waardoor de nieuwe tactiek niet meer past.
  • RESKILL: De coach staat tijdens de wedstrijd op het veld. Elke keer als het team aanvalt, probeert de helft van de spelers de oude tactiek, en de andere helft een nieuwe tactiek die ter plekke is bedacht op basis van de laatste fout. De coach ziet direct welke tactiek er op dit moment een doelpunt scoort en vertelt het team om daarmee door te gaan. Het team evolueert zijn strategie en zijn playbook tegelijkertijd, in perfecte harmonie.

Kortom: RESKILL stopt met het behandelen van "leren spelen" en "het leren van de regels" als twee aparte taken. Het voegt ze samen, waardoor de AI tegelijkertijd een beter brein en een beter regelboek kan bouwen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →