← Nieuwste papers
💻 computer science

LEACL: LLM-Enhanced Automatic Curriculum Learning for Reinforcement Learning in Long-Horizon Manipulation Tasks

Dit artikel stelt LEACL voor, een framework dat gebruikmaakt van grote taalmodellen om langdurige manipulatietaken automatisch te ontleden en de noodzakelijke specificaties te genereren, waardoor reinforcement learning-agenten superieure prestaties kunnen behalen door middel van automatisch curriculumleren met uitsluitend ijle beloningen (sparse rewards), zonder de noodzaak van handmatig ontworpen dichte beloningsfuncties (dense reward functions).

Oorspronkelijke auteurs: Faraz Heravi, James Ouyang, Zifan Xu, Arjun Kumar, Yoonchang Sung, Peter Stone

Gepubliceerd 2026-07-28
📖 8 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Faraz Heravi, James Ouyang, Zifan Xu, Arjun Kumar, Yoonchang Sung, Peter Stone

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren om een complexe maaltijd te maken, zoals een gourmet sandwich. Je kunt de robot niet simpelweg vertellen: "Maak een sandwich," en verwachten dat hij zelf uitzoekt hoe hij de tomaat snijdt, het brood botert en de lagen perfect opstapelt. Als je de robot alleen maar een signaal van "goed gedaan" of "slecht gedaan" geeft aan het einde, zal hij waarschijnlijk jarenlang doelloos ronddwalen zonder ooit de specifieke stappen te leren. Dit is de wereld van Reinforcement Learning (RL), waarbij softwareagenten leren door middel van trial-and-error. Het lastige deel is het "sparse reward"-probleem: als de robot pas een beloning krijgt wanneer de taak voor 100% voltooid is, heeft hij geen idee of hij dichterbij of verder van het doel af is. Om dit op te lossen, gebruiken wetenschappers vaak Curriculum Learning, een methode waarbij de robot eerst oefent met eenvoudige versies van een taak (zoals alleen het oppakken van het brood) voordat hij overgaat naar moeilijkere taken (zoals het snijden van de tomaat). Maar hier zit de crux: het ontwerpen van deze stappen van makkelijk naar moeilijk vereist meestal dat een menselijke expert elke regel en elke moeilijkheidsinstelling handmatig uitschrijft, wat traag, saai en moeilijk te doen is voor elke nieuwe taak.

Hier komt LEACL (LLM-Enhanced Automatic Curriculum Learning) kijken, een nieuwe aanpak die een zeer intelligente vraag stelt: "Kunnen we een superintelligente AI-taalmodel het saaie planningswerk voor ons laten doen?" De onderzoekers achter dit papier wilden zien of ze een Large Language Model (LLM) — dezelfde technologie die chatbots aandrijft — konden gebruiken om als een meesterleraar te fungeren. In plaats van dat mensen handmatig de lesplannen schrijven, zou de LLM een natuurlijke taaldoel (zoals "open de lade") kan lezen en dit automatisch kan opdelen in een reeks kleinere, beheersbare stappen. Nog beter: de LLM zou vervolgens de specifieke "trainingswieltjes" (de moeilijkheidsinstellingen en parameters) voor elke stap ontwerpen, waardoor de robot kan leren met alleen het eenvoudige "succes/falen"-signaal aan het einde, zonder dat er complexe, handgeschreven beloningsinstructies nodig zijn voor elke kleine beweging.

Het onderzoek test dit idee op vijf lastige robottaken, zoals het openen van een kastlade, het zetten van een kom op een bord of het aanzetten van een fornuis. De resultaten zijn zeer veelbelovend. De onderzoekers ontdekten dat wanneer ze de LLM het curriculum lieten ontwerpen, de robot deze lange, complexe taken veel sneller en succesvoller leerde dan wanneer hij ze allemaal tegelijk probeerde te leren zonder hulp. Sterker nog, het door de LLM ontworpen systeem presteerde net zo goed als, en soms zelfs beter dan, systemen waarbij menselijke experts urenlang handmatig de trainingsstappen en beloningsregels hadden ontworpen. De studie suggereert dat door AI het "lesplanning"-werk te laten afhandelen, we robots kunnen leren om complexe, meerstaps-taken uit te voeren zonder dat een mens elk detail van het trainingsproces hoeft te micromanagen.

De School Dag van de Robot: Hoe LEACL Werkt

Denk aan een robot die probeert een "long-horizon task" (een "long-horizon" taak is gewoon een chique manier om te zeggen dat een klus vele stappen nodig heeft om te voltooien) te leren, als een student die probeert een eindexamen te halen. Als de docent pas aan het einde een cijfer geeft, kan de student de verkeerde dingen bestuderen of helemaal opgeven. Automatic Curriculum Learning (ACL) is als een tutor die een syllabus maakt, beginnend met makkelijke vragen en deze langzaam moeilijker maakt. Maar meestal moet een mens die syllabus schrijven.

LEACL verandert het spel door een LLM in te zetten als de hoofddocent. Het proces vindt plaats in drie leuke stadia:

  1. De Opdeling (Task Decomposition):
    Stel je voor dat je tegen de robot zegt: "Open de bovenste lade van de kast." Een mens zou denken: "Oké, dat is gewoon één taak." Maar de LLM kijkt ernaar en zegt: "Nee hoor! Dat zijn eigenlijk drie taken: Eerst de lade bereiken. Tweede, de handgreep vastpakken. Derde, hem opentrekken." De LLM gebruikt zijn enorme kennis van hoe de wereld werkt (zoals weten dat je een lade niet kunt trekken als je de handgreep niet vasthoudt) om het grote doel op te delen in een logische keten van kleinere subtaken. Het schrijft deze op in een speciale "receptentaal" genaamd PDDL, die de robot kan begrijpen.

  2. Het Lesplan (Meta-Task Generation):
    Nu de robot de stappen heeft, moet hij weten hoe hij ze moet oefenen. Moet hij beginnen met de lade die een klein beetje open staat? Of volledig dicht? Moet de handgreep dichtbij of ver weg zijn? Hier blinkt de LLM opnieuw uit. Het fungeert als een creatieve curriculumontwerper die een "taakruimte" genereet voor elke stap. Het creëert een Python-script dat duizenden lichtelijk verschillende versies van de "pak de handgreep"-taak kan genereren. Sommige zijn supermakkelijk (de handgreep is direct voor de robot) en andere zijn moeilijker (de handgreep is iets verder weg). De LLM bepaalt ook welke versies "moeilijker" zijn dan andere, waardoor een perfecte ladder van moeilijkheidsgraden ontstaat waar de robot op kan klimmen.

  3. De Oefening (Automatic Curriculum Learning):
    Ten slotte begint de robot met trainen. Hij gebruikt een algoritme dat observeert hoe goed de robot presteert. Als de robot de "makkelijke" versies van de taak moeiteloos uitvoert, schakelt het systeem automatisch over naar de "gemiddelde" moeilijkheidsgraden. Als de robot worstelt, gaat hij terug naar de makkelijke versies. De robot leert door alleen een simpele "1" voor succes en een "0" voor falen te gebruiken aan het einde van elke subtaak. Hij heeft geen mens nodig om te zeggen: "Goed gedaan, je hebt je arm 2 inch dichterbij bewogen." Het vooraf door de LLM geplande curriculum doet al het zware werk om de robot te begeleiden.

De Resultaten: Is de Robot Geslaagd voor de Test?

De onderzoekers testten dit systeem op vijf verschillende uitdagingen met behulp van een simulatie genaamd LIBERO (waarmee ze de simulatie hebben geüpgraded naar LIBERO+ om deze nieuwe soorten taken aan te kunnen). De taken waren onder andere:

  • Een onderlade openen.
  • Een witte kom op een bord zetten.
  • Ketchup oppakken en in een mandje leggen.
  • Een fornuis aanzetten en een pan erop plaatsen.
  • Een mok in de magnetron zetten en de deur sluiten.

Ze vergeleken dit door de LLM aangedreven systeem (LEACL) met verschillende andere methoden:

  • De "Doe Niets"-benadering: De robot simpelweg laten leren met een sparse reward. (Spoiler: Het faalde volledig, met een succespercentage van 0% op de meeste taken).
  • De "Geen Curriculum"-benadering: De taak opdelen, maar de robot elke stap laten leren zonder een slimme moeilijkheidsladder. (Dit faalde ook rampzalig, met succespercentages nabij de 0% of zeer laag).
  • De "Menselijke Expert"-benadering: Waarbij mensen handmatig de stappen en de beloningsfuncties ontwierpen (de robot extra punten gaf voor het dichter bij het doel komen). Dit wordt meestal beschouwd als de gouden standaard.
  • De "LEAGUE"-benadering: Een eerdere methode die LLM's gebruikt om dense reward functies (complexe score-regels) voor elke stap te schrijven.

Dit is wat er gebeurde:
Het LEACL-systeem, dat de LLM gebruikte om het curriculum te plannen maar vertrouwde op het eenvoudige "succes/falen"-signaal, presteerde beter dan de systemen die probeerden te leren zonder curriculum. Nog indrukwekkender: het presteerde beter dan het LEAGUE-systeem (dat complexe, handmatig afgestemde beloningsregels gebruikte) op vier van de vijf taken.

Wat betreft de ruwe cijfers behaalde het LEACL-systeem succespercentages zoals 99,8% voor het openen van de lade en 90,7% voor het zetten van de kom op het bord. Deze cijfers lagen heel dicht bij, en in sommige gevallen gelijk aan, de prestaties van het "Menselijk Curriculum" waarbij experts alles handmatig ontwierpen. Bijvoorbeeld, bij de taak "open de onderlade" behaalde het door mensen ontworpen systeem 99,8 ± 0,2%, terwijl LEACL 99,8 ± 0,1% behaalde. Bij de taak "zet de mok in de magnetron" behaalde het menselijke systeem 89,0 ± 7,5%, terwijl LEACL 75,9 ± 3,4% behaalde.

Waarom Dit Belangrijk Is (en Wat Het Niet Doet)

De belangrijkste conclusie is dat het ontwerpen van complexe beloningsfuncties moeilijk en vaak onnodig is. Het artikel betoogt dat proberen de robot een "dense" beloning te geven (zoals "je krijgt 0,5 punt voor het dichter bij het doel bewegen") eigenlijk een valstrik is. Het kan de robot verwarren, waardoor hij prioriteit geeft aan de verkeerde zaken of "slordige" gewoontes ontwikkelt waarbij hij wel dicht bij het doel komt, maar de taak nooit echt afmaakt. Door de LLM het structuur van het leren te laten regelen (het curriculum) en de robot te laten leren van de simpele waarheid van succes of falen, leert de robot preciezere en betrouwbaardere vaardigheden.

Het paper merkt echter ook enkele beperkingen op. De LLM heeft nog steeds een "woordenboek" nodig van wat mogelijk is (een vooraf gedefinieerde set regels of predicaten) om te kunnen werken. Het kan niet uit het niets nieuwe fysica of objecten verzinnen; het moet binnen de regels van de simulatie werken (zoals de LIBERO+-omgeving). Ook al deed de LLM het erg goed, het door mensen ontworpen curriculum presteerde op drie van de vijf taken nog steeds iets beter, wat suggereert dat menselijke intuïtie nog steeds een rol speelt, ook al wordt de LLM er zeer goed in.

Kortom, LEACL suggereert dat we niet langer degenen hoeven te zijn die de gedetailleerde instructiehandleidingen voor robots schrijven. We kunnen simpelweg de robot een doel geven, een AI-taalmodel het beste manier laten uitzoeken om hem te onderwijzen, en vervolgens toekijken hoe de robot leert om complexe, meerstaps-taken zelfstandig uit te voeren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →