← Nieuwste papers
🤖 AI

Visual Navigation Transformer with Pose Attention

Het artikel stelt VNT-PA voor, een transformer-gebaseerde navigatieplanner die camerapozen gebruikt als positionele encodings om dieptekeyframes te indexeren, wat efficiënt hergebruik van ruimtelijke ervaring over verschillende trajecten mogelijk maakt en state-of-the-art prestaties bereikt in long-horizon point-goal navigatie.

Oorspronkelijke auteurs: Beiming Li, Jaime Romero, Jonathan Diller, Vijay Kumar, Alejandro Ribeiro

Gepubliceerd 2026-09-21
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Beiming Li, Jaime Romero, Jonathan Diller, Vijay Kumar, Alejandro Ribeiro

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Robots die zich door de wereld bewegen, worden geconfronteerd met een fundamenteel geheugenprobleem. Om van punt A naar punt B te komen, moet een machine onthouden wat hij heeft gezien, maar hij moet ook weten waar die herinneringen in de ruimte thuishoren. Traditionele navigatiesystemen behandelen de reis van een robot vaak als een videoband, waarbij observaties in de exacte volgorde waarin ze plaatsvonden worden opgeslagen. Dit werkt goed voor een enkele rit, maar het creëert een puinhoop wanneer de robot oude ervaringen probeert te hergebruiken. Als een robot vandaag een gang bezoekt en er volgende week naar terugkeert, heeft een geheugen in videostijl moeite om deze twee bezoeken samen te voegen tot één samenhangende kaart. Het kan niet gemakkelijk begrijpen dat een deur die gisteren werd gezien dezelfde deur is als die van vandaag, of dat een bocht die in een andere volgorde werd genomen tot dezelfde bestemming leidt. Om dit op te lossen, hebben ingenieurs vaak expliciete kaarten gebouwd, waarbij ze rasters of grafieken van de wereld tekenen voordat de robot beweegt. Echter, deze kaarten vereisen complexe constructie en kunnen breken als de sensoren van de robot er net iets naast zitten. De vraag blijft: kan een robot leren navigeren door simpelweg te onthouden waar hij was toen hij iets zag, zonder eerst een kaart te hoeven tekenen?

Een team van onderzoekers aan de Universiteit van Pennsylvania heeft een nieuwe manier ontwikkeld waarop robots over ruimte kunnen denken, die zij de Visual Navigation Transformer with Pose Attention noemen. In plaats van de herinneringen van een robot te organiseren op basis van tijd, organiseren zij ze op basis van locatie. Stel je een verzameling foto's voor die zijn gemaakt tijdens een wandeling door een huis. Bij een standaardbenadering worden deze foto's op een stapel gelegd in de volgorde waarin ze zijn genomen. In dit nieuwe systeem wordt elke foto voorzien van de exacte positie en hoek van de camera op het moment dat deze werd genomen. De robot kijkt niet in volgorde naar de stapel; hij kij je de verzameling als geheel door te vragen: "Waar ben ik nu, en waar is het doel?" Het systeem doorzoekt vervolgens alle opgeslagen foto's om de foto's te vinden die ruimtelijk relevant zijn voor de huidige situatie, waarbij de tijd van opname wordt genegeerd. Dit stelt de robot in staat om herinneringen van verschillende ritten samen te voegen tot één flexibel begrip van de omgeving.

De onderzoekers testten dit idee in een computersimulatie met behulp van een dataset van echte binnenomgevingen, specifelijk de Habitat-Matterport 3D-dataset, die 3D-scans van echte gebouwen bevat. Ze gaven de robot een reeks dieptebeelden—visuele gegevens die de afstand tot objecten vastleggen—verzameld tijdens een initiële verkenning van een gebouw. Deze beelden werden gefilterd tot een set "keyframes", wat de meest nuttige snapshots zijn die nieuwe delen van de kamer laten zien, in plaats van redundante weergaven van dezelfde muur. De robot kreeg vervolgens de taak om een specifiek doelpunt te vinden, uitgaande van een willekeurige locatie, waarbij hij alleen deze opgeslagen afbeeldingen en zijn huidige positie gebruikte. Hij vertrouwde niet op een vooraf gebouwde kaart of een videostroom van zijn huidige beweging. In plaats daarvan gebruikte hij een type kunstmatige intelligentie genaamd een transformer, die ontworpen is om het belang van verschillende stukken informatie te wegen. In dit geval gebruikte de transformer de positie en hoek van de camera als gids om te beslissen aan welke herinneringen hij aandacht moest besteden.

De resultaten toonden aan dat deze aanpak zeer effectief was. In een reeks tests bereikte de robot zijn doel in 93,3% van de pogingen, een significante verbetering ten opzichte van andere methoden die dezelfde herinneringen behandelden als een chronologische sequentie. Wanneer het doel ver weg was of een lang, kronkelend pad vereiste, behield het nieuwe systeem zijn nauwkeurigheid, terwijl andere systemen vaak de weg kwijtraakten of inefficiënte routes namen. De onderzoekers ontdekten dat de sleutel tot dit succes de manier was waarop de robot zijn herinneringen verbond. Door zich te concentreren op het verschil in positie tussen de huidige locatie en de opgeslagen afbeeldingen, in plaats van op het tijdsverschil tussen hen, kon de robot effectiever redeneren over de geometrie van de kamer. Het leerde te herkennen dat een bocht die nu werd gemaakt gerelateerd was aan een bocht die in een ander deel van het gebouw werd gemaakt, simpelweg omdat de ruimtelijke relatie tussen de twee punten consistent was.

Een van de meest opvallende bevindingen was hoe goed het systeem omging met fouten in zijn eigen lokalisatiegevoel. In de echte wereld hebben robots vaak imperfecte sensoren en weten ze hun exacte positie misschien niet tot op de millimeter nauwkeurig. Wanneer de onderzoekers ruis introduceerden om deze fouten te simuleren, bleef het nieuwe systeem robuust en verloor het slechts een klein deel van zijn prestaties. In contrast hiermee faalde een traditioneel systeem dat een rigide kaart bouwt vanuit dezelfde gegevens dramatisch, door open gangen te identificeren als geblokkeerde muren omdat de ruisige positiegegevens de muren op de verkeerde plekken plaatsten. Het nieuwe systeem, door de omgeving te behandelen als een flexibele set locatie-gelabelde herinneringen, kon deze onnauwkeurigheden tolereren zonder in te storten. Het hoefde zich niet te committeren aan één enkel, perfect raster van de wereld; het kon simpelweg zijn herinneringen opvragen op basis van waar het dacht te zijn, en zijn pad aanpassen terwijl het bewoog.

De onderzoekers ontdekten ook dat het systeem kon leren van meer dan alleen de initiële verkenning. Als de robot tijdens zijn reis een nieuwe hoek van een kamer of een eerder onbekend gebied tegenkwam, kon hij die nieuwe weergave onmiddellijk aan zijn geheugenset toevoegen, zonder dat er opnieuw getraind hoefde te worden. Dit betekent dat de robot een rijker begrip van zijn omgeving kon opbouwen tijdens het proces, waarbij hij waarnemingen van verschillende paden gebruikt om de gaten op te vullen. Het systeem werd getraind om een expert-planner na te bootsen die het perfecte pad door het gebouw kende, en het leerde de volgende zet te voorspellen door naar de ruimtelijke context van de omgeving te kijken. Het had niet de huidige weergave nodig om een beslissing te nemen; het had alleen de huidige locatie en het doel nodig, om vervolgens de relevante delen van zijn geheugen op te roepen.

Dit werk suggereert dat voor robots om te navigeren in complexe, veranderende omgevingen, zij niet noodzakelijkerwijs een statische kaart van de wereld hoeven te bouwen. In plaats daarvan kunnen zij vertrouwen op een dynamische verzameling ervaringen, geïndexeerd door waar ze plaatsvonden. De studie demonstreert dat het organiseren van het geheugen op basis van locatie in plaats van tijd zorgt voor sneller leren en betere prestaties bij lange, moeilijke taken. Hoewel de experimenten in een simulatie werden uitgevoerd, rusten de principes op geometrisch redeneren dat van toepassing is op de fysieke wereld. De onderzoekers merken op dat hun systeem momenteel in twee dimensies werkt, uitgaande van de aanname dat de robot over een vlakke vloer beweegt, maar dat de onderliggende methode kan worden uitgebreid naar driedimensionale beweging. Door aan te tonen dat een robot effectief kan navigeren met alleen een set pose-gestempelde herinneringen, biedt dit onderzoek een nieuwe weg naar het creëren van machines die zich met dezelfde flexibiliteit en aanpassingsvermogen door de wereld kunnen bewegen als mensen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →