← Nieuwste papers
🤖 machine learning

VGFM: Expressive Robot Policies via Dense Value Guidance in Flow Matching

Het artikel stelt Value-Guided Flow Matching (VGFM) voor, een schaalbaar offline reinforcement learning-framework dat dichte waarde-gebaseerde sturing integreert in expressieve flow-matching-policies voor robotbesturing zonder backpropagation door de tijd of extra algoritmische overhead te vereisen, waarbij sterke prestaties wordt behaald over diverse locomotie- en manipulatietaken.

Oorspronkelijke auteurs: Prajwal Koirala, Mark Campbell

Gepubliceerd 2026-09-15
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Prajwal Koirala, Mark Campbell

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Robots zijn al lang meesters in repetitieve, voorspelbare taken, maar het aanleren van het omgaan met de rommelige, onvoorspelbare variëteit van de echte wereld is een hardnekkige uitdaging gebleven. Jarenlang hebben onderzoekers geprobeerd dit op te lossen door robots enorme bibliotheken van eerdere bewegingen te voeren, in de hoop dat de machine menselijke vaardigheid kon nabootsen zonder ooit in de echte wereld te hoeven oefenen. Deze aanpak, bekend als offline leren, biedt een veilige en efficiënte weg voor training, maar loopt tegen een muur aan wanneer de robot een situatie tegenkomt die net iets anders is dan de trainingsdata. De robot moet dan beslissen hoe te handelen, waarbij hij vaak moet kiezen tussen veel verschillende geldige manieren om te bewegen, vergelijkbaar met een bestuurder bij een complex kruispunt die links kan afslaan, rechtdoor kan gaan of door het verkeer kan manoeuvreren. Traditionele methoden worstelen met het vastleggen van deze rijke variëteit aan keuzes, en dwingen de robot vaak in een enkel, rigide pad dat faalt wanneer de omstandigheden veranderen. Om voorbij deze beperkingen te gaan, wenden wetenschappers zich tot generatieve modellen, een type kunstmatige intelligentie dat in staat is om een breed spectrum aan mogelijke acties te verbeelden in plaats van slechts één.

De kern van de moeilijkheid ligt in het feit dat deze verbeeldende modellen niet alleen creatief, maar ook slim moeten worden geleerd. Een robot moet weten welke van zijn vele verbeelde acties daadwerkelijk tot succes zullen leiden. In het verleden vereiste het sturen van de verbeelding van een robot naar een goed resultaat een rekenintensief proces waarbij de computer elke stap van het denkproces van de robot achteruit moest volgen om te zien waar het misging. Dit was traag, instabiel en maakte het trainingsproces vaak te complex om op te schalen. Onderzoekers aan de Cornell University hebben nu een nieuwe methode geïntroduceerd genaamd Value-Guided Flow Matching, die deze flessenhals volledig omzeilt. In plaats van de computer te dwingen om zijn stappen door de tijd heen terug te volgen, staat deze nieuwe aanpak de robot toe om op elk moment van zijn besluitvormingsproces begeleiding te ontvangen, wat ervoor zorgt dat zelfs zijn tussenliggende gedachten hem naar een succesvolle uitkomst sturen.

Het team, onder leiding van Prajwal Koirala en Mark Campbell, ontwierp een systeem waarbij het beleid van de robot, ofwel zijn strategie voor beweging, is opgebouwd als een continue stroom in plaats van een reeks losstaande sprongen. Stel je een rivier voor die van een bron naar een bestemming stroomt; de robot begint met een simpel, willekeurig idee van beweging en vormt dit geleidelijk om tot een specifieke actie. De innovatie hier is dat het systeem de kwaliteit van deze actie controleert op elk punt langs het pad van de rivier, niet alleen aan het einde. Door de uiteindelijke bestemming van de beweging op elk tussenliggend punt te voorspellen, kan het systeem een "waarde"-signaal toepassen — een maatstaf voor hoe goed die actie is — zonder het hele generatieve proces te hoeven ontrafelen. Dit betekent dat de robot leert zijn bewegingen continu te verfijnen, geleid door een criticus die de kwaliteit van de actie in realtime evalueert, terwijl hij tegelijkertijd de zware computationele kosten van het terugkeren door de tijd vermijdt.

Om dit idee te testen, onderwierpen de onderzoekers hun systeem aan een strenge reeks uitdagingen met behulp van een standaard benchmark genaamd OGBench, die een breed scala aan moeilijke taken bevat. Deze taken varieerden van het navigeren door complexe labyrinten met vierpotige en humanoïde robots tot het manipuleren van objecten met robotarmen. In de labyrintscenario's moesten de robots hun weg vinden door kronkelende gangen, terwijl de manipulatietaken vereisten dat ze kubussen stapelden of interactie hadden met objecten in rommelige omgevingen. Het systeem werd getraind op statische datasets van eerdere bewegingen, wat betekent dat het de omgeving tijdens de leerfase nooit zag, alleen de opgenomen gegevens. De resultaten waren opmerkelijk: de nieuwe methode presteerde consequent beter dan of kwam overeen met de beste bestaande technieken in bijna al deze diverse taken. Het behaalde hoge succespercentages in het navigeren door de AntMaze- en HumanoidMaze-omgevingen en blonk uit in de precieze bewegingen die vereist zijn voor de Cube- en Scene-manipulatietaken.

Een belangrijk kenmerk van deze aanpak is de flexibiliteit tijdens het daadwerkelijke gebruik van de robot. Zodra het systeem is getraind, kunnen ingenieurs de hoeveelheid rekenkracht aanpassen die wordt gebruikt om een enkele actie te genereren, zonder het model opnieuw te hoeven trainen. De onderzoekers ontdekten dat door simpelweg het aantal stappen te verhogen dat de computer neemt om de uiteindelijke beweging te berekenen, de robot meer precieze en complexe taken kan uitvoeren. Deze afruil tussen snelheid en nauwkeurigheid is cruciaal voor real-world toepassingen, waarbij een robot snel kan bewegen in een eenvoudige situatie, maar kan vertragen om precies te zijn in een delicate situatie. De studie toonde aan dat deze schaalbaarheid komt met bijna geen extra kosten in termen van tijd, waardoor de robot expressiever en capabeler kan worden door simpelweg meer rekenkracht te gebruiken op het moment van besluitvorming.

Het succes van deze methode suggereert een nieuwe weg voorwaarts voor robotbesturing, een die een balans vindt tussen de behoefte aan veiligheid en data-efficiëntie met de vraag naar complex, aanpasbaar gedrag. Door de zware computationele last van het terug volgen van elke stap te verwijderen, hebben de onderzoekers het mogelijk gemaakt om robots te trainen die lange, ingewikkelde sequenties van acties kunnen afhandelen met een niveau van expressiviteit dat voorheen onbereikbaar was. Het systeem vertrouwt niet op magie of sluiproutes; het herdenkt simpelweg hoe begeleiding wordt toegepast, waardoor de robot kan leren van een dichte stroom feedback gedurende zijn gehele besluitvormingsreis. Terwijl het vakgebied van de robotica zich blijft voortbewegen naar machines die kunnen opereren in ongestructureerde menselijke omgevingen, bieden methoden zoals deze een schaalbare en effectieve manier om hen de subtiele kunst te leren om de juiste actie te kiezen uit een wereld van mogelijkheden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →