← Nieuwste papers
🤖 machine learning

Accelerating Visual Policy Learning with Sampling-Based Model Predictive Control

Dit artikel stelt Sampling-Guided Policy Search (SGPS) voor, een framework dat sampling-gebaseerde model voorspellende controle combineert met eerste-orde beleidsoptimalisatie om efficiënt visuele beleid te trainen voor complexe robotische voortbewegings- en manipulatietaken, waarbij zero-shot transfer naar real-world hardware wordt bereikt.

Oorspronkelijke auteurs: Yilang Liu, Haoxiang You, Qian Wang, Daniel Rakita, Ian Abraham

Gepubliceerd 2026-09-18
📖 8 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yilang Liu, Haoxiang You, Qian Wang, Daniel Rakita, Ian Abraham

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Robots die over ruig terrein kunnen lopen, zware objecten kunnen duwen of rommelige kamers kunnen navigeren zijn niet langer sciencefiction, maar het leren van deze taken is een enorme uitdaging. Voor een machine om effectief te bewegen, moet deze voortdurend haar ledematen coördineren met de fysieke wereld, door precies te beslissen wanneer en waar een voet of een hand geplaatst moet worden. Traditioneel hebben ingenieurs geprobeerd dit op te lossen door elke mogelijke beweging handmatig te programmeren, een tijdrovend proces dat vaak faalt wanneer de robot iets onverwachts tegenkomt. Recentelijk hebben wetenschappers zich gericht op een methode genaamd reinforcement learning (versterkend leren), waarbij een robot leert door middel van vallen en opstaan, net zoals een kind dat leert lopen. De robot probeert een beweging, ziet of ze valt of slaagt, en past haar interne regels aan om het de volgende keer beter te doen. Dit leerproces is echter ongelooflijk kostbaar. Het vereist enorme hoeveelheden computerkracht en tijd, vooral wanneer de robot moet leren de wereld te zien via camera's in plaats van alleen te vertrouwen op interne sensoren. De robot moet leren wat zij ziet te vertalen naar fysieke acties, een taak die vaak leidt tot onhandige, onbedoelde bewegingen als de training niet zorgvuldig wordt begeleid.

Een team van onderzoekers aan de Yale University en de University of Sydney heeft een nieuwe aanpak ontwikkeld om dit probleem op te lossen, waardoor robots complexe visuele gedragingen veel sneller en betrouwbaarder kunnen leren dan voorheen. Ze creëerden een systeem dat ze Sampling-Guided Policy Search noemen. In plaats van de robot blind door miljoenen willekeurige pogingen te laten dwalen, gebruikt dit systeem een slim planningsinstrument om eerst een ruwe schets van de juiste beweging te genereren. Denk bij dit planningsinstrument aan een coach die in zijn hoofd een snelle simulatie uitvoert om de beste opeenvolging van stappen te bepalen voor een specifieke taak, zoals het over een hindernis stappen of het duwen van een krat. De robot gebruikt deze schets vervolgens als startpunt. De onderzoekers ontdekten dat door deze initiële begeleiding te combineren met een methode waarmee de robot direct van camerabeelden kan leren, zij hoogwaardige robots konden trainen in een fractie van de tijd die normaal gesproken nodig is.

De kern van hun ontdekking ligt in hoe zij het leerproces afhandelen. In veel eerdere pogingen trainden onderzoekers een robot met perfecte interne gegevens over het eigen lichaam en de omgeving, en probeerden zij vervolgens een tweede versie van de robot te leren enkel te leren van wat een camera ziet. Dit tweestaps-proces was traag en resulteerde vaak in een robot die de imperfecties van de echte wereld niet aankon. De nieuwe methode slaat de tussenpersoon over. Het traint de robot om direct te leren van dieptebeelden — visuele gegevens die laten zien hoe ver objecten verwijderd zijn — terwijl tegelijkertijd het planningsinstrument wordt gebruikt om de doelen van de robot te verfijnen. Het systeem werkt in een cyclus: het genereert een doelbeweging, laat de robot deze volgen, en gebruikt vervolgens het planningsinstrument om het doel te corrigeren als de robot iets uit koers raakt. Deze constante wisselwerking zorgt ervoor dat de robot niet alleen leert om een perfect pad na te bootsen, maar ook om te herstellen van fouten en zich aan te passen aan veranderingen in het terrein of het gewicht van de objecten die het draagt.

De onderzoekers testten dit systeem op twee verschillende soorten robots: een viervoetige hondachtige robot en een tweevoetige humanoïde robot. In de simulaties leerde de viervoetige robot om te trotteren over vlak terrein, onder een lage balk door te kruipen en over een hindernis te springen. De humanoïde robot leerde een zware krat over de vloer te duwen en een doos te dragen terwijl zij jogde. Wat deze resultaten bijzonder indrukwekkend maakte, was dat de robots deze vaardigheden leerden met slechts één grafische kaart, een standaard stuk computerhardware dat in veel gamingcomputers te vinden is. In het verleden zou het trainen van dergelijke complexe gedragingen enorme supercomputers of weken aan continue simulatie vereist hebben. Hier leerde het systeem deze taken te volbrengen in slechts enkele uren. De onderzoekers toonden ook aan dat het planningsinstrument meer deed dan alleen een startpunt bieden; het verbeterde het leerproces actief gedurende de hele training, waardoor de robot efficiëntere manieren ontdekte om te bewegen en te voorkomen dat zij in slechte gewoontes verviel.

Om te bewijzen dat deze methode werkt in de echte wereld, namen de onderzoekers de getrainde software en installeerden deze op een fysieke viervoetige robot zonder verdere aanpassingen te maken. Dit staat bekend als zero-shot transfer, wat betekent dat de robot de echte wereld nog nooit eerder had gezien, maar toch onmiddellijk de taken kon uitvoeren die zij in de simulatie had geleerd. De robot trotterde succesvol door een kamer, kroop onder een barrière door en klom over een doos, terwijl zij uitsluitend haar ingebouwde camera gebruikte om te zien waar zij heen ging. Zij had geen externe sensoren, motion capture-camera's of menselijke begeleiding nodig om te navigeren. De robot nam haar eigen beslissingen over wanneer zij haar lichaam moest verlagen om te kruipen of wanneer zij haar poten moest optillen om te springen, en reageerde direct op de obstakels voor haar. Dit bewees dat het leerproces een robuust begrip van beweging had gecreëerd dat kon overleven in de rommelige, onvoorspelbare aard van de echte wereld.

De studie benadrukte ook waarom eerdere methoden vaak faalden. Wanneer de onderzoekers probeerden een robot te trainen zonder de begeleiding van het planningsinstrument, ontwikkelde de robot vaak vreemde, ongecoördineerde bewegingen. Bijvoorbeeld, wanneer gevraagd werd om te trotteren, kon een robot die zonder deze begeleiding getraind was, haar voeten op een manier voortschuiven die totaal niet leek op een fatsoenlijke gang. Het planningsinstrument fungeerde als een stabilisator, die ervoor zorgde dat de robot vanaf het begin het juiste ritme en de juiste coördinatie leerde. Dit was met name belangrijk voor taken waarbij contact met de omgeving betrokken was, zoals het duwen van een zwaar object. Zonder de begeleiding zou de robot in de verkeerde richting kunnen duwen of het evenwicht kunnen verliezen. Met de begeleiding leerde zij haar lichaam en armen te coördineren om het object soepel en efficiënt te bewegen.

Een van de meest significante aspecten van dit werk is hoe het met de visuele informatie omgaat. Robots hebben vaak moeite om te leren van camerabeelden omdat het proces van het omzetten van een afbeelding in een fysieke opdracht wiskundig moeilijk is. De onderzoekers losten dit op door de visuele verwerking te scheiden van de fysieke berekeningen. Dit stelde de robot in staat om van de beelden te leren zonder te verdrinken in de complexe wiskunde van hoe de camera werkt. In plaats daarvan richtte zij zich op het leren van de relatie tussen wat zij zag en hoe zij moest bewegen. Deze scheiding maakte het leerproces veel sneller en stabieler, waardoor de robot complexe vaardigheden zoals het dragen van een doos tijdens het joggen kon leren zonder om te vallen.

De onderzoekers verkenden ook hoe zij verschillende vaardigheden in één enkele robot konden combineren. Zij trainden aparte experts voor trotteren, kruipen en springen, en leerden vervolgens één enkele robot om zelfstandig tussen deze gedragingen te schakelen. Wanneer de robot een lage balk zag, wist zij dat zij moest kruipen. Wanneer zij een hindernis zag, wist zij dat zij moest springen. Zij had geen mens nodig om haar te vertellen welke modus zij moest gebruiken; zij keek simpelweg naar de wereld en koos de juiste actie. Dit vermogen om verschillende gedragingen samen te voegen tot één enkel, flexibel systeem is een grote stap voorwaarts voor de robotica. Dit betekent dat robots potentieel complexe omgevingen kunnen navigeren, bewegend van vlak terrein naar obstakels en weer terug, zonder dat er voor elke nieuwe situatie een nieuw programma nodig is.

Het succes van deze methode suggereert een nieuwe weg voor de toekomst van de robotica. Door een planningsinstrument te gebruiken om het leerproces te begeleiden, kunnen onderzoekers robots leren om complexe, fysieke taken veel sneller uit te voeren dan voorheen. Deze aanpak vermindert de noodzaak voor enorme hoeveelheden computerkracht en stelt robots in staat om direct te leren van wat zij zien. Hoewel de huidige experimenten in simulatie en op een enkele fysieke robot werden uitgevoerd, wijzen de resultaten erop dat deze methode kan worden opgeschaald om robots nog moeilijkere taken te leren, zoals het hanteren van gereedschap of het navigeren door drukke ruimtes. De cruciale inzichten zijn dat leren niet een blinde zoektocht naar het juiste antwoord hoeft te zijn; het kan een geleide reis zijn waarbij een slimme planner de robot helpt haar weg te vinden.

Uiteindelijk toont dit werk aan dat de kloof tussen simulatie en realiteit effectiever overbrugd kan worden dan voorheen gedacht. De robots leerden niet alleen om een perfect pad na te bootsen; zij leerden zich aan te passen, te herstellen en beslissingen te nemen op basis van wat zij zagen. De viervoetige robot, ooit een simulatie, werd een echte machine die in staat was tot autonome beweging in een fysieke ruimte. Zij kroop, trotterde en sprong met een vloeiendheid die suggereerde dat zij een diep begrip had van haar eigen lichaam en de wereld om haar heen. Dit is niet alleen een technische prestatie; het is een stap naar een toekomst waarin robots vrij en veilig naast mensen kunnen bewegen, waarbij zij taken kunnen uitvoeren die zowel kracht als behendigheid vereisen. De onderzoekers hebben aangetoond dat machines, met de juiste begeleiding, kunnen leren bewegen met dezelfde gratie en aanpassingsvermogen als wij die als vanzelfsprekend beschouwen in de natuurlijke wereld.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →