← Nieuwste papers
💻 computer science

HumanoidVLN: A Physics-Grounded Simulator and Benchmark for Vision-Language Navigation Across Diverse Humanoid Embodiments

Dit artikel introduceert HumanoidVLN, een op fysica gebaseerde simulator en benchmark gebouwd op NVIDIA Isaac Sim die de unieke uitdagingen van vision-language navigatie voor diverse humanoïde robots aanpakt door het ondersteunen van meerdere belichamingen, het genereren van botsingsbewuste instructiedatasets en het demonstreren van sterke sim-to-real transfercapaciteiten.

Oorspronkelijke auteurs: Quan-Dung Pham, Anh Dao, The-Anh Nguyen, Minh Nguyen-Dinh, Phuong Nam Dang, Tri Pham, Hung Tran, Bach Dao, Tuyen P. Le, Truong Nguyen, Quan Nguyen

Gepubliceerd 2026-08-14
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Quan-Dung Pham, Anh Dao, The-Anh Nguyen, Minh Nguyen-Dinh, Phuong Nam Dang, Tri Pham, Hung Tran, Bach Dao, Tuyen P. Le, Truong Nguyen, Quan Nguyen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin robots niet alleen op wielen rollen als op afstand bestuurbare auto's, maar leren lopen, struikelen en balanceren op twee benen, net als wij. Dit is de grens van "humanoid robotica", een vakgebied dat probeert machines te bouwen die door onze rommelige, echte huizen en kantoren kunnen navigeren. Om deze robots te leren hoe ze moeten bewegen, gebruiken wetenschappers een veld genaamd Vision-Language Navigation (VLN). Denk bij VLN aan een spelletje "Simon zegt" voor robots: een mens geeft een gesproken instructie zoals "loop naar de keuken en stop bij de koelkast", en de robot moet om zich heen kijken, de woorden begrijpen en fysiek naar de juiste plek bewegen.

Het lastige deel is dat de meeste robots van vandaag worden getest in videogames of simulaties waar ze gewoon van de ene naar de andere plek kunnen "teleporteren", waarbij ze zwaartekracht, balans en het feit dat lopen moeilijk is, negeren. Maar echt lopen zit vol met natuurkunde; als een robot te snel probeert af te draaien, kan hij omvallen. Dit artikel pakt de grote vraag aan: Hoe leren we deze lopende robots instructies op te volgen wanneer ze daadwerkelijk moeten lopen zonder te vallen, en hoe testen we ze eerlijk wanneer elke robot er net even anders uitziet en beweegt?


Het Papier: HumanoidVLN

De onderzoekers achter dit papier, HumanoidVLN, realiseerden zich dat de oude manieren van het testen van robotnavigatie leken op het testen van een Formule 1-auto op een onverhard pad en het vervolgens behandelen als een fiets. Ze bouwden een gloednieuwe, superrealistische "speeltuin" (een simulator) specif으로 voor lopende robots. In plaats van robots te laten teleporteren, dwingt hun systeem hen om de wetten van de natuurkunde te gehoorzamen. Als een robot een stap probeert te zetten die te groot is of een bocht te scherp neemt, zal hij daadwerkelijk struikelen en vallen, precies zoals een echt persoon dat zou kunnen doen.

Ze richtten deze speeltuin in met vier verschillende soorten "humanoid" robots. Deze zijn niet allemaal hetzelfde; ze variëren van een korte robot van 1,17 meter (ongeveer de hoogte van een lange tiener) tot een reus van 1,80 meter. Ze hebben ook een verschillend aantal gewrichten in hun benen, wat betekent dat sommige flexibeler zijn dan andere. Het team creëerde een "hiërarchisch controlesysteem" om hen te beheren. Je kunt dit zien als een tweepersoons team: een "locomotie-coach" (een Reinforcement Learning policy) die de robot leert hoe hij moet balanceren en lopen zonder te vallen, en een "navigator" (een padtracker) die de coach vertelt waar hij heen moet op basis van de stemopdracht van de mens. Deze opstelling zorgt ervoor dat elke test een echte fysieke uitdaging is, en geen videospel-trucje.

Om de test eerlijk en realistisch te maken, gebruikte het team niet alleen cartooneske 3D-modellen. Ze bouwden 87 verschillende omgevingen, variërend van gezellige woonkamers tot drukke werkplekken. Ze zorgden ervoor dat elke kamer groot genoeg was (minstens 100 vierkante meter), zodat de robots niet vast kwamen te zitten in kleine, onmogelijke hoekjes. Sommige van deze kamers waren getekend door kunstenaars, terwijl andere werden gescand uit de echte wereld met een coole technologie genaamd "3D Gaussian Splatting", die foto's in 3D-werelden verandert. Ze zorgden er zelfs voor dat het camerabeeld schokte en wiebelde precies zoals het zou doen als een echte robot zou lopen, waarbij de wiebel van een bipedale gang werd gevangen.

De instructies die aan de robots werden gegeven, waren ook zorgvuldig opgesteld. In plaats van willekeurige zinnen te typen, gebruikten ze een "Multi-Agent Annotation" systeem. Stel je een team van AI-schrijvers, redacteuren en factcheckers voor die samenwerken. Twee AI-"generatoren" maken een route op basis van een video van de robot die loopt, een AI-"reviewer" controleert of de route logisch is in verhouding tot de kaart, en een "paraphraser" herschrijft de instructies in drie verschillende stijlen: Formeel (als een baas), Natuurlijk (als een vriend) en Casual (als een tekstbericht). Ten slotte controleerden echte mensen het werk om er zeker van te zijn dat de instructies veilig en accuraat waren. Dit resulteerde in 933 unieke testepisoden.

Toen ze de tests uitvoerden, kwamen ze enkele verrassende dingen tegen. Ze testten vier verschillende AI-navigatiemodellen om te zien welk model het beste was in het volgen van instructies zonder te vallen. Het model genaamd JanusVLN presteerde het best; het bereikte het doel ongeveer 43,55% van de tijd en volgde het pad nauwgezet. Echter, de resultaten lieten zien dat het lichaam van de robot er veel toe doet. De grotere robot (Unitree H1) had veel meer moeite dan de anderen en viel in bijna 70% van de pogingen om met sommige modellen, terwijl de kortere, stabielere robots veel minder vaak vielen. Dit bewijst dat je een navigatie-AI niet op één robot kunt testen en er dan vanuit mag gaan dat het op een andere robot ook zal werken; de fysieke vorm en balans van de robot veranderen alles.

Het team deed ook een "sim-to-real" pilot-test, waarbij ze een van de AI-modellen uit de computer haalden en op een echte robot in een echte kamer plaatsten. Ze ontdekten dat de prestaties van de robot in de computer-simulatie bijna identiek waren aan hoe hij presteerde in de echte wereld, met een zeer sterke correlatie in hoe ver hij van het pad af kwam. Dit suggereert dat hun op natuurkunde gebaseerde simulator een betrouwbare voorspeller is van echt gedrag.

Kortom, HumanoidVLN is niet alleen een nieuwe dataset; het is een nieuwe manier van denken over robotnavigatie. Het betoogt dat als we willen dat robots door onze straten lopen en onze huizen schoonmaken, we moeten stoppen met ze te testen in een wereld waarin ze niet kunnen vallen. Door de tests te funderen in echte natuurkunde en diverse robotlichamen, laat het papier ons zien dat het pad naar een behulpzame lopende robot geplaveid is met balans, niet alleen met code.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →