← Nieuwste papers
🤖 AI

SKILLC: Learning Autonomous Skill Internalization in LLM Agents via Contrastive Credit Assignment

Het artikel stelt SkillC voor, een raamwerk dat de autonome internalisatie van vaardigheden in LLM-agenten verbetert door Contrastieve Vaardigheidskrediettoewijzing in te voeren om beleidslijnen rechtstreeks te optimaliseren naar succes zonder vaardigheden via gekoppelde rollouts en adaptief curriculumleren, en dat presteert beter dan bestaande basismethoden op taken met een lange horizon zonder toegang tot vaardigheden tijdens de uitvoering.

Oorspronkelijke auteurs: Hongxiang Lin, Zhirui Kuai, Erpeng Xue, Lei Wang

Gepubliceerd 2026-05-28
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Hongxiang Lin, Zhirui Kuai, Erpeng Xue, Lei Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme robot leert complexe puzzels op te lossen, zoals een rommelig huis opruimen of specifieke items online kopen. Om de robot sneller te laten leren, geef je hem een "spiekbriefje" (een vaardigheid) dat hem precies vertelt welke stappen hij moet nemen.

Er zijn twee hoofdmanieren om de robot te leren:

  1. De "Spiekbriefje voor Altijd"-methode: Je laat de robot het spiekbriefje voor altijd houden. Hij leert de puzzel op te lossen, maar leert nooit om het zonder het papier te doen. Als je het papier weghaalt, faalt hij.
  2. De "Afwennen"-methode: Je geeft de robot eerst het spiekbriefje, maar begint het langzaam weg te halen. Het doel is dat de robot uiteindelijk de puzzel volledig zelfstandig oplost.

Het Probleem: "Internalisatie-Blindheid"
Het artikel stelt dat de huidige "Afwennen"-methoden een groot gebrek hebben, wat de auteurs Internalisatie-Blindheid noemen.

Stel je een leraar voor die een toets van een student corrigeert.

  • Bij de oude methode kijkt de leraar naar een toets waarbij de student een spiekbriefje gebruikte en krijgt een A. Vervolgens kijkt de leraar naar een toets waarbij de student geen spiekbriefje gebruikte en krijgt een B.
  • De leraar zegt: "Geweldig werk voor die A!" en geeft de student een hoge score.
  • Het Gebrek: De leraar beseft niet dat de "A" alleen mogelijk was vanwege het spiekbriefje. De leraar blijft de student belonen voor het gebruik van het spiekbriefje, terwijl het doel is dat de student de stof zonder het leert. De robot raakt in de war: "Ben ik geslaagd omdat ik slim ben, of omdat ik hulp had?" Hij maakt het onderscheid niet, dus leert hij nooit echt onafhankelijk te zijn.

De Oplossing: SKILLC (De "Zij-aan-Zij"-Coach)
De auteurs stellen een nieuw kader voor, genaamd SKILLC, om dit op te lossen. Ze maken gebruik van een techniek genaamd Contrastieve Vaardigheidskrediettoewijzing.

Zo werkt het, met een eenvoudige analogie:

1. De "Zij-aan-Zij"-Race (Gekoppelde Uitrollingen)

In plaats van alleen te kijken naar de robot die één keer met hulp en één keer zonder hulp probeert, laat SKILLC de robot twee races tegelijkertijd uitvoeren voor elke enkele taak:

  • Race A: De robot probeert de puzzel op te lossen met het spiekbriefje.
  • Race B: De robot probeert exact dezelfde puzzel op te lossen zonder het spiekbriefje.

2. De "Eerlijke Rechter" (Dubbel-Stroom Voordeel)

Nu kijkt de leraar (het leeralgoritme) naar beide races naast elkaar.

  • Als de robot Race A wint (met hulp) maar Race B verliest (zonder hulp), beseft de leraar: "Ah, de robot slaagde alleen vanwege het spiekbriefje. Ik moet hem nog niet volledige krediet geven voor zijn intelligentie."
  • Als de robot beide races wint, zegt de leraar: "Geweldig! Je hebt het zonder hulp opgelost. Dat is echte vaardigheid!"

Het systeem belooont de robot specifiek meer voor het winnen van Race B (de onafhankelijke winst) en belooont hem minder voor het winnen van Race A als hij Race B verloor. Dit dwingt de robot om te leren dat het enige wat echt telt, het oplossen van het probleem op zichzelf is.

3. De "Slimme Coach" (Adaptief Curriculum)

Het systeem fungeert ook als een slimme coach die de voortgang van de robot in real-time observeert.

  • Aan het begin: De robot is vreselijk zonder het spiekbriefje. De coach zegt: "Blijf het spiekbriefje gebruiken, maar laten we proberen het een beetje zonder te doen."
  • Midden: De robot begint beter te worden. De coach merkt op dat de kloof tussen "met hulp" en "zonder hulp" kleiner wordt. De coach begint het spiekbriefje sneller weg te halen.
  • Aan het einde: De robot doet het geweldig alleen. De coach zegt: "Je hebt het spiekbriefje niet meer nodig. Laten we het volledig op pensioen sturen en stoppen met het trainen op deze specifieke taak."

Waarom Dit Belangrijk Is

Het artikel testte dit op twee omgevingen:

  1. ALFWorld: Een tekstgebaseerd spel waarbij een agent huishoudelijke klusjes moet doen (zoals "zet het schone overhemd in de la").
  2. WebShop: Een gesimuleerde online winkelopdracht waarbij de agent specifieke items moet vinden en kopen.

De Resultaten:

  • SKILLC leerde deze taken op te lossen zonder spiekbriefjes aan het einde.
  • Het presteerde aanzienlijk beter dan eerdere "Afwennen"-methoden (met een verbetering van de slagingspercentages van ongeveer 4-5%).
  • Het presteerde zelfs net zo goed als methoden die de spiekbriefjes voor altijd behielden, wat bewijst dat de robot de vaardigheden echt intern kan leren.

De Haken en Ogen (Beperkingen)

Het artikel geeft toe dat deze methode niet perfect is:

  • Het is duur: Het uitvoeren van twee races tegelijk (met en zonder hulp) kost aan het begin ongeveer 26% meer rekenkracht.
  • Het heeft goede data nodig: Als de robot al erg goed is in een taak, of als de taken zeer zeldzaam zijn, kan het systeem in de war raken over wanneer het moet stoppen met het gebruik van het spiekbriefje.

Samenvattend:
SKILLC is een nieuwe manier om AI-agenten te trainen. In plaats van hulp gewoon langzaam weg te halen, vergelijkt het voortdurend "geholpen" pogingen met "ongeholpen" pogingen. Door de agent specifiek te belonen voor slagen zonder hulp, dwingt het de AI om vaardigheden echt te internaliseren, en verandert het een "spiekbrief-gebruiker" in een "zelfstandige expert".

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →