← Nieuwste papers
💻 computer science

CRAFT: Coaching Reinforcement Learning Autonomously using Foundation Models for Multi-Robot Coordination Tasks

Het artikel stelt CRAFT voor, een framework dat Large Language Models gebruikt om complexe multi-robot coördinatietaken autonoom op te splitsen in subtaken en Vision Language Models om beloningsfuncties te verfijnen, waardoor effectief leren en de real-world transfer van coördinatiegedrag mogelijk wordt zonder handmatig beloningsontwerp.

Oorspronkelijke auteurs: Seoyeon Choi, Kanghyun Ryu, Jonghoon Ock, Negar Mehr

Gepubliceerd 2026-06-08
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Seoyeon Choi, Kanghyun Ryu, Jonghoon Ock, Negar Mehr

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een team van twee honden probeert te leren een complexe dansroutine uit te voeren, zoals door een smalle poort lopen zonder tegen elkaar aan te botsen, of samen een zware pot optillen zonder de soep te morsen.

Als je ze gewoon de kamer in gooit en zegt: "Doe het!", zullen ze waarschijnlijk in de war raken, over elkaar heen struikelen en nooit leren. Dit is het probleem waar onderzoekers van UC Berkeley tegenaan liepen met robots. Ze wilden dat robots samenwerkten, maar standaard computer trainingsmethoden faalden omdat de taken te lang, te ingewikkeld waren en de robots niet met elkaar konden "praten" om vooraf te plannen.

Maak kennis met CRAFT.

Beschouw CRAFT als een superintelligente, door AI aangedreven coach die niet alleen naar de robots kijkt, maar ze ook actief leert hoe ze moeten leren. Hier is hoe deze "coach" werkt, opgedeeld in eenvoudige stappen:

1. De coach verdeelt de grote taak in kleine oefeningen (Curriculum Generation)

Stel je een voetbalcoach voor. Ze vertellen een nieuw team niet meteen: "Ga de Wereldbeker winnen!" In plaats daarvan breken ze het af: "Vandaag oefenen we met passen. Morgen oefenen we met schieten. Volgende week oefenen we met verdedigen."

CRAFT gebruikt een Large Language Model (LLM) — een type AI dat erg goed is in het begrijpen van taal en logica — om als deze coach te fungeren. Wanneer de coach wordt geconfronteerd met een grote, intimiderende taak (zoals "Twee robots moeten een poort passeren"), breekt de coach deze af in een lijst van kleinere, makkelijkere stappen:

  • Stap 1: Leer eerst gewoon lopen zonder de poort te raken.
  • Stap 2: Leer om langs de poort te lopen.
  • Stap 3: Leer te coördineren zodat de één wacht terwijl de ander erdoorheen gaat.

2. De coach schrijft de spelregels (Reward Generation)

Bij het trainen van robots leren robots door "punten" (beloningen) te krijgen voor goede acties en punten te verliezen voor slechte acties. Meestal moeten mensen deze regels schrijven, wat erg moeilijk is.

De coach van CRAFT gebruikt de AI om de score-regels voor elke kleine oefening te schrijven.

  • Voorbeeld: Voor de oefening "langs de poort lopen" schrijft de AI een regel die zegt: "Je krijgt punten voor het dichter bij de poort komen, maar je verliest punten als je ertegenaan botst."
  • De AI schrijft deze regel in computercode die de robots daadwerkelijk kunnen begrijpen.

3. De coach kijkt toe en geeft kritiek (Policy Evaluation)

Zodra de robots de oefening proberen, kijkt een Vision-Language Model (VLM) — een AI die video kan "zien" en begrijpt wat er gebeurt — naar de robots. Het fungeert als een scheidsrechter.

  • Is het gelukt? Zo ja, dan zegt de coach: "Goed gedaan! Laten we naar de volgende oefening gaan."
  • Is het mislukt? Als ze botsten of vastliepen, zegt de scheidsrechter niet alleen "Gefaald". Het kijkt naar de video en de scoregeschiedenis om te achterhalen waarom. Misschien probeerden de robots te hard te balanceren en vergaten ze vooruit te bewegen.

4. De coach past de regels aan (Reward Refinement)

Dit is het magische deel. Als de robots falen, geeft de coach niet op.

  • De "Scheidsrechter-AI" geeft advies: "De robots krijgen te veel punten voor het balanceren en niet genoeg voor het vooruit bewegen. De regel voor beweging moet sterker zijn."
  • De "Coach-AI" neemt dit advies aan en schrijft de score-regels opnieuw om het probleem op te lossen.
  • De robots proberen het opnieuw met de nieuwe regels. Ze blijven deze lus herhalen (Proberen -> Kijken -> Regels aanpassen -> Opnieuw proberen) totdat ze die specifieke kleine oefening beheersen.

Het resultaat: Van simulatie naar realiteit

De onderzoekers testten dit op twee hoofduitdagingen:

  1. Quadruped Navigation: Twee viervoetige robots (zoals honden) die leren om door een smalle poort te lopen zonder tegen elkaar aan te botsen.
  2. Bimanual Manipulation: Twee robotarmen die samen leren een zware pot op te tillen terwijl ze deze recht houden.

Wat gebeurde er?

  • Zonder deze coach faalden andere methoden of leerden de robots vreemde, onnatuurlijke bewegingen (zoals het draaien van hun gewrichten op onmogelijke manieren, puur om punten te scoren).
  • Met CRAFT leerden de robots vloeiend te coördineren. Ze leerden eerst de basis en bouwden dat vervolgens uit naar de moeilijke onderdelen.
  • De test in de echte wereld: Het beste deel? De onderzoekers namen de robots die in de computersimulatie waren getraind en plaatsten ze op echte fysieke robots (Unitree Go1 en Go2). Zonder enige extra afstemming liepen de robots succesvol door de poort in de echte wereld, wat bewees dat de training buiten de computer werkte.

Samenvattend

CRAFT is als een geduldige, intelligente tutor voor robots. In plaats van te hopen dat robots complexe teamwork uit zichzelf ontdekken, doet het:

  1. Vereenvoudigt de grote taak in kleine stappen.
  2. Creëert aangepaste regels voor elke stap.
  3. Kijkt naar de robots en past de regels aan wanneer ze fouten maken.
  4. Begeleidt hen van eenvoudige oefeningen naar complexe coördinatie, waardoor ze uiteindelijk in staat zijn om real-world taken uit te voeren die ze op geen enkele andere manier hadden kunnen leren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →