← Nieuwste papers
💻 computer science

ViBe: Visual Behavior Adaptation for Perceptive Humanoid Whole-Body Control

ViBe is een parameter-efficiënt, post-training framework dat bewegingstrackers aanpast voor perceptieve humanoïde whole-body controle door taakrelevante visuele feedback te enten via low-rank adapters, wat robuuste zero-shot sim-to-real transfer mogelijk maakt over diverse locomotie- en manipulatietaken.

Oorspronkelijke auteurs: Lokesh Krishna, Sarvesh Venkatesan, An Zhang, Quan Nguyen

Gepubliceerd 2026-09-10
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Lokesh Krishna, Sarvesh Venkatesan, An Zhang, Quan Nguyen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Robots die lopen en bewegen als mensen zijn al lang een doel van engineering, maar het aanleren hiervan in de echte wereld is een puzzel die uit twee afzonderlijke delen bestaat. Ten eerste is er het vermogen om menselijke bewegingen na te bootsen, een vaardigheid die onderzoekers hebben beheerst door machines te trainen om enorme bibliotheken aan menselijke bewegingsdata te kopiëren. Deze "trackers" zijn uitstekend in het volgen van een script, waarbij ze hun ledematen op natuurlijke, vloeiende wijze bewegen over vlakke, voorspelbare grond. Ze zijn echter bewust zo ontworpen dat ze blind zijn voor hun omgeving; ze zien geen stoeprand, een bal of een doos. Ten tweede is er het vermogen om de wereld waar te nemen en er op te reageren. Traditioneel hebben ingenieurs dit opgelost door een apart systeem te bouwen dat fungeert als een planner: het kijkt naar de omgeving, beslist wat de robot moet doen, en vertelt de blinde tracker vervolgens dat hij dat plan moet uitvoeren. Deze scheiding werkt, maar het creëert een kloof. De tracker kan geen kleine, directe aanpassingen maken, zoals een voet verplaatsen om een steen te vermijden of een binnenkomend object te ontwijken, omdat hij wacht op instructies van bovenaf. Het mist de visuele reflexen die een mens in staat stellen om te struikelen en te herstellen zonder na te denken.

Een team van onderzoekers aan de University of Southern California heeft een nieuwe manier ontwikkeld om deze kloof te overbruggen, waardoor een robot direct kan zien en reageren terwijl hij beweegt. Ze noemen hun systeem ViBe, een methode die een robot die al geleerd heeft om als een mens te lopen, de mogelijkheid geeft om zijn bewegingen aan te passen op basis van wat hij ziet, zonder dat hij opnieuw hoeft te leren lopen vanaf nul. In plaats van een nieuw brein of een nieuwe planner te bouwen, hebben ze een kleine, efficiënte interface tussen de ogen en de spieren van de robot geplaatst. Deze interface leert de specifieke visuele details te selecteren die belangrijk zijn voor een taak — zoals de rand van een stoeprand of de positie van een bal — en voert die informatie rechtstreeks in het bewegingssysteem van de robot. Het resultaat is een machine die complexe, dynamische taken in de echte wereld kan uitvoeren, zoals het rennen van parkour over ongelijkmatig terrein, het ontwijken van een gegooid object, of het heroriënteren van een kubus in zijn hand, terwijl de oorspronkelijk aangeleerde natuurlijke, menselijke beweging behouden blijft.

De onderzoekers begonnen met een robot die al perfect menselijke bewegingen kon volgen op vlakke grond. Deze robot was "blind" in de zin dat hij geen camerabeelden gebruikte om zijn stappen te sturen; hij volgde simpelweg een vooraf ingestelde sequentie van bewegingen. Om hem zicht te geven, koppelde het team een vooraf getraind visueel systeem, dat al had geleerd objecten en scènes te herkennen uit miljoenen afbeeldingen. Het tonen van een camerabeeld aan de robot was echter niet voldoende; de robot moest weten welke delen van de afbeelding belangrijk waren. Een muur van pixels bevat te veel informatie, en het grootste deel daarvan is irrelevant voor de taak van het lopen of het ontwijken. Het team ontwierp een klein module, een extractor, die fungeert als een filter. Het kijkt naar de huidige lichaamspositie van de robot en de taak die hij probeert uit te voeren, en gebruikt die context vervolgens om de camerabeelden te scannen en alleen de meest nuttige visuele aanwijzingen te selecteren. Als de robot over een stoeprand probeert te springen, focust de extractor op de rand van de stoeprand. Als de robot een bal probeert te vangen, focust hij op de baan van de bal.

Deze geselecteerde visuele informatie wordt vervolgens in het bewegingssysteem van de robot geïnjecteerd via een techniek die slechts een fractie van de interne instellingen van de robot verandert. De onderzoekers hielden de oorspronkelijke bewegingstracker bevroren, waardoor de natuurlijke, menselijke gang behouden bleef, en pasten alleen de kleine paden aan die de nieuwe visuele gegevens vervoerden. Deze aanpak stelde hen in staat om de robot voor specifieke taken te trainen met behulp van een methode genaamd reinforcement learning, waarbij de robot leert door middel van trial-and-error en beloningen ontvangt voor succesvolle acties. Ze testten dit systeem op vier zeer verschillende uitdagingen. In de ene moest de robot over stoepranden en ongelijkmatig terrein lopen en rennen, waarbij hij zijn voetplaatsing in realtime aanpaste om struikelen te voorkomen. In een andere moest de robot parkour uitvoeren, waarbij hij over gaten sprong en op smalle oppervlakken landde. Een derde taak betrof het verplaatsen van grote objecten, waarbij de robot zijn balans en grip moest aanpassen terwijl hij een koffer of een vuilnisbak droeg. De laatste uitdaging was dodgeball, waarbij de robot stil moest staan, een bal die naar hem toe vloog moest observeren, en zijn lichaam uit de weg moest bewegen zonder om te vallen.

De resultaten lieten zien dat deze methode opmerkelijk goed werkte. Bij tests in de echte wereld voerde de robot deze taken met een hoge mate van succes uit, waarbij hij vaak de prestaties evenaarde van systemen die over perfecte, geprivilegieerde informatie beschikten over de omgeving die echte robots niet kunnen hebben. In de parkourtaak navigeerde de robot bijvoorbeeld succesvol door obstakels die een blinde versie van dezelfde robot lieten crashen en vallen. In het dodgeball-scenario leerde de robot de bal te ontwijken terwijl hij zijn balans behield, een prestatie die vereiste dat hij op een gecontroleerde, reactieve manier afweek van zijn standaardstaande houding. De onderzoekers ontdekten ook dat het systeem robuust was; het werkte goed, zelfs wanneer de verlichting veranderde van fel zonlicht naar gedimde binnenomstandigheden, of wanneer de kleuren van de objecten verschoven. Dit suggereert dat de robot leerde de vorm en positie van dingen te begrijpen, in plaats van alleen specifieke kleuren of texturen te onthouden.

Om te bewijzen dat de robot echt reageerde op wat hij zag, vergeleken de onderzoekers hun systeem met een versie die niet kon zien. De blinde robot, zelfs met dezelfde onderliggende bewegingstraining, slaagde er niet in om stoepranden te passeren of obstakels te vermijden, en raakte vaak uit koers of botste tegen objecten. De versie met zicht maakte echter nauwkeurige, lokale correcties in zijn beweging. Hij paste zijn voetplaatsing aan om op een stoeprand te landen, verplaatste zijn gewicht om een zwaar object te dragen, en bewoog zijn lichaam om een bal te ontwijken. Dit waren geen grote, vooraf geplande manoeuvres, maar kleine, onmiddellijke aanpassingen die gebeurden terwijl de robot bewoog. Het team demonstreerde ook dat deze visuele aanpassing gecombineerd kon worden met een eenvoudige, hoogwaardige planner. In een taak waarbij de robot een kubus moest heroriënteren zodat een specifieke gekleurde zijde bovenop lag, koos een zeer basale planner simpelweg een sequentie van bewegingen. Het visuele systeem van de robot nam vervolgens het moeilijke werk op zich om de kubus te vinden, deze te grijpen en de grip aan te passen om de beweging succesvol te maken, zelfs als de kubus in een iets andere positie stond dan verwacht.

De studie benadrukt een significante verschuiving in hoe robots kunnen worden aangeleerd om met de wereld te interageren. In plaats van een robot vanaf nul te trainen voor elke nieuwe taak, of te vertrouwen op complexe, afzonderlijke planningssystemen, is het mogelijk om een robot die al weet hoe hij moet bewegen te nemen en hem het vermogen te geven om te zien en te reageren. De onderzoekers toonden aan dat door de kernbewegingen intact te houden en alleen de kleine verbinding tussen visie en actie te trainen, zij een robot konden creëren die zowel natuurlijk in zijn beweging is als in staat is om om te gaan met de onvoorspelbaarheid van de echte wereld. Hoewel het systeem niet perfect is en soms in de war kan raken door snel bewegende objecten of ongebruikelijke visuele afleidingen, vertegenwoordigt het een krachtige stap voorwaarts. Het demonstreert dat een robot niet alles vanaf het begin hoeft te leren; hij kan leren zijn bestaande vaardigheden aan te passen aan nieuwe situaties door simpelweg te leren waar hij naar moet kijken. Deze aanpak biedt een praktisch pad naar het creëren van humanoids die zich met dezelfde vloeiendheid en aanpassingsvermogen door onze wereld kunnen bewegen als wat we van een mens verwachten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →