← Nieuwste papers
🤖 AI

CLAM: Continuous Latent Action Models for Robot Learning from Unlabeled Demonstrations

Dit artikel introduceert CLAM, een raamwerk dat robots in staat stelt om effectieve controlebeleid te leren van ongelabelde observatiesequenties door continue latente acties af te leiden via zelfgesuperviseerde dynamische voorspelling en deze te funderen met taak-agnostische speeldata, waardoor prestaties worden behaald die vergelijkbaar zijn met behavior cloning met expertlabels zonder dat daarvoor kostbare met acties gelabelde demonstraties nodig zijn.

Oorspronkelijke auteurs: Anthony Liang, Pavel Czempin, Matthew M. Hong, Yutai Zhou, Jingzhen Wang, Erdem Biyik, Stephen Tu

Gepubliceerd 2026-07-31
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Anthony Liang, Pavel Czempin, Matthew M. Hong, Yutai Zhou, Jingzhen Wang, Erdem Biyik, Stephen Tu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren hoe hij iets moet doen, zoals het stapelen van blokken of het inschenken van een drankje. Meestal is de beste manier om een robot te leren dit door hem stap voor stap precies te laten zien wat hij moet doen, terwijl je zijn hand vasthoudt en elke kleine beweging van zijn motoren opneemt. Dit is als het geven van een tekstboek aan een student met de antwoorden achterin geschreven. Maar hier zit de crux: het opnemen van die motorbewegingen is ontzettend moeilijk, duur en saai. Het vereist een menselijke expert die de robot urenlang fysiek bestuurt, wat traag en kostbaar is.

Stel je nu een ander soort leraar voor. Deze leraar heeft geen robot; die heeft alleen een videocamera. Die filmt zichzelf terwijl hij de taak uitvoert, of vindt video's op het internet van mensen die de taak uitvoeren. De robot kan zien wat er gebeurt — de blokken bewegen, de beker vult zich — maar hij heeft geen idee hoe de mens zijn hand bewoog om dat voor elkaar te krijgen. De "motorsignalen" ontbreken. Dit is het puzzelstuk waar wetenschappers in het vakgebied van de robotica een oplossing voor zoeken: Hoe kan een robot zelfstandig leren bewegen door alleen naar video's te kijken waarbij de "hoe-te-doen"-instructies verborgen zijn? Dit artikel pakt exact dat probleem aan, met als doel robots te laten leren van goedkope, gemakkelijk te verzamelen video's zonder dat ze dure, handmatige trainingsessies nodig hebben.

De onderzoekers achter dit artikel, Anthony Liang en zijn team, introduceren een nieuwe methode genaamd CLAM (Continuous Latent Action Models). Denk aan CLAM als een super slimme detective die naar twee opeenvolgende frames van een video kan kijken en de "onzichtbare kracht" kan raden die de verandering veroorzaakte. Als je in een video ziet dat een beker van de linkerkant van de tafel naar de rechterkant beweegt, probeert CLAM de specifieke, continue beweging te achterhalen die daartussenin plaatsvond, ook al heeft hij de hand die de beker bewoog nooit gezien.

Zo werkt de magie. Eerst kijkt de robot naar een enorme berg ongelabelde video's (alleen observaties, geen instructies). De robot probeert te voorspellen hoe het volgende frame eruit zal zien op basis van het huidige frame en een "gok" over de verborgen actie. Als de gok fout is, mislukt de voorspelling en leert de robot zijn gok aan te passen. Na verloop van tijd bouwt het een bibliotheek op van deze "verborgen acties" die de wereld begrijpelijk maken. Maar er is een struikelblok: deze verborgen acties zijn slechts getallen in het brein van de robot; ze zijn nog geen echte motorische commando's.

Om dit op te lossen, gebruikt het team een tweede, kleinere verzameling gegevens: "speel"-data. Dit is simpelweg de robot die ronddwaalt, tegen dingen aanbotst en zijn armen willekeurig beweegt, maar dit keer neemt de computer de motorische commando's wél op. Het is alsof de robot met klei speelt zonder een doel, maar wel een dagboek bijhoudt van hoe zijn vingers bewogen. CLAM gebruikt dit dagboek om zichzelf te leren hoe het de "verborgen actie"-gokken moet vertalen naar echte, fysieke bewegingen. De belangrijkste innovatie hier is dat ze het "raden"-gedeelte en het "vertalen"-gedeelte samen trainen. Dit zorgt ervoor dat de gokken simpel en nuttig blijven, in plaats van een chaotische bende te worden die de robot niet kan uitvoeren.

De resultaten zijn behoorlijk indrukwekkend. Het team heeft CLAM op twee manieren getest: in computer-simulaties (zoals een videogame-wereld) en op een echte fysieke robotarm genaamd WidowX. Ze ontdekten dat CLAM complexe taken kon leren oplossen, zoals het assembleren van onderdelen of het oppakken van objecten, met een succespercentage dat 2 tot 3 keer hoger was dan eerdere methoden die hetzelfde probeerden te doen. In veel gevallen leerde de robot bijna net zo goed presteren als wanneer hij getraind zou zijn met de dure, perfecte "motorische commando"-data, ook al heeft hij die data nooit echt gezien.

Cruciaal is dat het artikel laat zien dat deze aanpak het beste werkt wanneer de "verborgen acties" continu zijn (vloeiend en soepel) in plaats van opgedeeld in kleine, discrete stappen, en wanneer de robot leert deze acties te vertalen met behulp van die kleine hoeveelheid ongeordende "speel"-data. Als ze probeerden de acties in een rigide, stap-voor-stap formaat te dwingen, of als ze probeerden het vertaalgedeelte apart te trainen, kreeg de robot moeite. Het artikel demonstreert dat door dit zelfgesuperviseerde detectivewerk te combineren met een beetje rommelige, ongelabelde speel-data, we robots nieuwe vaardigheden kunnen aanleren zonder de noodzaak van dure, door experts geleide teleoperatie. Het is een grote stap naar het laten leren van robots van de enorme hoeveelheid videocontent die al op het internet beschikbaar is, in plaats van dat we elke enkele beweging handmatig moeten opnemen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →