LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation
LightNav-0 is een compact, generalistisch embodied navigatiemodel dat een verenigde token-interface gebruikt om de ruimtelijke intelligentie van vooraf getrainde vision-language modellen te ontsluiten en af te stemmen op robotbesturing, waarmee het een state-of-the-art prestatie en zero-shot generalisatie bereikt over diverse taken, omgevingen en belichamingen zonder taakspecifieke voorspellingskoppen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Robots worstelen al heel lang met het feit dat ze niet met dezelfde gemakkelijkheid door de wereld kunnen bewegen als mensen. Terwijl een persoon een kamer in kan lopen, een blauwe stoel kan opmerken en om een tafel heen kan navigeren terwijl hij naar een gesproken instructie luistert, ziet een robot vaak alleen een chaotische bende van pixels en geluiden. Om deze kloof te overbruggen, hebben wetenschappers jarenlang gewerkt aan gespecialiseerde systemen die zien, denken en bewegen als aparte taken behandelen. Een deel van de software herkent misschien objecten, een ander tekent een kaart, en een derde bepaalt welke kant de robot op moet draaien. Deze aanpak werkt goed in gecontroleerde omgevingen, maar faalt vaak wanneer de robot een nieuwe kamer, een ander type machine of een complexe opdracht tegenkomt. De uitdaging is geweest om één enkele geest te creëren die een scène kan begrijpen, kan redeneren over waarheen te gaan, en het lichaam kan aansturen om daar te komen, allemaal tegelijkertijd.
Een team van onderzoekers heeft nu een nieuw systeem geïntroduceerd genaamd LightNav-0, dat probeert dit op te lossen door een robot te leren zoals een mens denkt: door naar een afbeelding te kijken, aan te wijzen waar hij naartoe wil gaan, en dan te bewegen. In plaats van voor elke taak aparte hulpmiddelen te bouwen, hebben de onderzoekers een groot, vooraf getraind computermodel genomen dat al taal en afbeeldingen begrijpt, en dit geleerd om te navigeren. Dit model hoeft niet voor elke nieuwe robot of elke nieuwe kamer opnieuw geprogrammeerd te worden. Het kijkt simpelweg naar wat het ziet, luistert naar een opdracht en bepaalt een pad. Het resultaat is een compact systeem dat instructies kan opvolgen, specifieke objecten kan vinden en zelfs bewegende doelwitten kan volgen, terwijl het op verschillende soorten machines werkt, van karren op wielen tot viervoetige robots, zonder dat er speciale aanpassingen nodig zijn.
De kern van dit systeem is een slimme manier om de gedachten van een robot te vertalen naar acties. Stel je voor dat een robot naar een scherm kijkt dat een gang laat zien. Wanneer hij de opdracht hoort: "loop naar het blauwe menubord naast het stenen gebouw", begint hij niet meteen met zijn wielen te bewegen. Eerst gebruikt hij zijn interne redenering om naar twee specifiek punten op het scherm te wijzen. Eén punt geeft een veilige plek aan om naartoe te bewegen, zoals een open stuk vloer, en het andere punt identificeert het eigenlijke doel, het blauwe bord. Deze handeling van het aanwijzen dient als een duidelijke, gedeelde taal tussen de hersenen van de robot en zijn lichaam. Zodra deze punten zijn vastgesteld, voorspelt de robot een kort pad van tien stappen om dat punt te bereiken. Vervolgens voert hij dit pad uit, bekijkt hij het nieuwe beeld en herhaalt hij het proces. Door de reis op te delen in deze kleine, doordachte stappen, kan de robot complexe omgevingen aan zonder de weg kwijt te raken of in de war te raken.
Om de robot deze vaardigheid te leren, hebben de onderzoekers hem niet slechts een paar voorbeelden getoond. Ze creëerden een enorme trainingsbibliotheek met meer dan 2.000 verschillende scènes en meer dan 4.000 uur aan navigatiegegevens. Deze bibliotheek bevatte instructies voor het vinden van objecten, het volgen van mensen en het bewegen door zowel binnen- als buitenruimtes. Het trainingsproces verliep in fasen. Eerst werd het model geleerd om ruimtelijke relaties te begrijpen en om nauwkeurig naar objecten en locaties in afbeeldingen te wijzen. Daarna werd het geleerd om dit aanwijzen te combineren met de werkelijke bewegingsopdrachten die nodig zijn om te navigeren. Ten slotte werd het systeem verfijnd door een proces van vallen en opstaan, waarbij het leerde om zijn eigen fouten te corroren en zijn padplanning in de loop van de tijd te verbeteren. Deze rigoureuze training stelde het model in staat om te generaliseren, wat betekent dat het wat het heeft geleerd in de trainingsdata kan toepassen op volledig nieuwe situaties die het nog nooit eerder heeft gezien.
De resultaten van dit werk zijn significant omdat ze laten zien dat één relatief klein computermodel veel grotere, complexere systemen die afhankelijk zijn van veel verschillende gespecialiseerde onderdelen, kan overtreffen. In tests over tien verschillende simulatieomgevingen behaalde het nieuwe systeem de hoogste succespercentages voor het opvolgen van instructies en het vinden van objecten, zelfs wanneer het slechts toegang had tot één enkel camerabeeld en geen toegang had tot dieptesensoren of vooraf gemaakte kaarten. Het presteerde goed in binnenkamers, buitengebieden en zelfs in spelwerelden met totaal andere visuele stijlen. Misschien wel het meest indrukwekkend is dat de onderzoekers dezelfde software testten op vier zeer verschillende fysieke robots: een humanoïde robot, een viervoetige robot, een drone en een voertuig op wielen. Zonder een enkele regel code te veranderen of het model opnieuw te trainen, leidde het systeem al deze vier soorten machines succesvol door real-world taken, zoals het volgen van een persoon of het vinden van een specif kind object.
Deze aanpak daagt het oude idee uit dat robots een uniek brein nodig hebben voor elke nieuwe taak of elk nieuw type lichaam. Door een verenigde methode te gebruiken waarbij de robot naar zijn doelen wijst en vervolgens een kort pad plant, hebben de onderzoekers aangetoond dat één compact systeem een grote verscheidenheid aan navigatietaken kan afhandelen. Het systeem vertrouwt niet op magie of complexe, verborgen berekeningen; het leert simpelweg de wereld te zien, een opdracht te begrijpen en de weg vooruit aan te wijzen. Hoewel het werk voornamelijk in simulaties en gecontroleerde real-world omgevingen is getest, suggereert het vermogen om deze vaardigheid over te dragen op verschillende robots en omgevingen een toekomst waarin robots in nieuwe plaatsen kunnen worden ingezet en nieuwe taken kunnen krijgen zonder de noodzaak van uitgebreide herprogrammering. Het succes van LightNav-0 geeft aan dat de weg naar meer capabele en aanpasbare robots wellicht niet ligt in het bouwen van grotere, meer gespecialiseerde machines, maar in het leren van hen om te denken en aan te wijzen met dezelfde eenvoud en flexibiliteit die mensen dagelijks gebruiken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.