← Nieuwste papers
💻 computer science

GLAM: Training a latent world model over global spatiotemporal memory for active exploration and navigation

Het artikel presenteert GLAM, een doelgeconditioneerd latent wereldmodel getraind op globale spatiotemporele geheugen die toekomstige kaartrepresentaties en navigatie-waypoints voorspelt om verbeterde actieve exploratie en semantische navigatie mogelijk te maken, aangetoond door het GLAM NAV-systeem dat de BSC-Nav baseline overtreft op HM3D-ObjectNav taken.

Oorspronkelijke auteurs: I-Tak Ieong, Ruizhi Feng, Zhaoyang Lu, Yifei Cao, Jiayao Zhao, Leon Li, Senhua Zhu, Wenbo Ding

Gepubliceerd 2026-09-16
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: I-Tak Ieong, Ruizhi Feng, Zhaoyang Lu, Yifei Cao, Jiayao Zhao, Leon Li, Senhua Zhu, Wenbo Ding

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een robot voor die een kamer binnenkomt die hij nog nooit eerder heeft gezien, met de taak om een specifiek object te vinden, zoals een rode stoel, dat hij vanaf zijn huidige standpunt niet kan zien. Om te slagen, kan de robot niet simpelweg reageren op wat er direct voor zijn camera staat. Hij moet een mentaal beeld van de ruimte opbouwen terwijl hij beweegt, zich herinneren waar hij is geweest, en inschatten wat er om de volgende hoek ligt. Dit vermogen om een kaart in het geheugen vast te houden, te anticiperen hoe die kaart zal veranderen terwijl de robot naar voren beweegt, en die anticipatie te gebruiken om de volgende stap te plannen, vormt de kern van de uitdaging van actieve exploratie. Jarenlang hebben onderzoekers geprobeerd machines deze vaardigheid aan te leren door hen de wereld in hoge definitie te laten reconstrueren, pixel voor pixel, of door te vertroukken op vooraf gemaakte kaarten. Echter, een nieuwe aanpak suggereert dat een robot niet elke baksteen en schaduw hoeft te zien om te navigeren; hij hoeft alleen de structuur van de ruimte en het waarschijnlijke pad naar zijn doel te begrijpen.

Een team van onderzoekers heeft een systeem ontwikkeld genaamd GLAM, wat staat voor een goal-conditioned latent world model getraind over globale spatiotemporele geheugenstructuren. In simpelere termen is dit een navigatiesysteem dat leert de toekomstige lay-out van een kamer en het beste pad naar een bestemming te voorspellen zonder de visuele wereld in perfect detail te hoeven recreëren. In plaats van te proberen een nieuwe videoframe te genereren van hoe de kamer er in de volgende seconde uit zal zien, voorspelt het systeem een gecomprimeerde, abstracte representatie van de kaart en een verborgen plan voor waar het vervolgens naartoe moet gaan. Deze aanpak is geïnspireerd door hoe biologische hersenen, in het bijzonder de hippocampus, ruimtelijke herinneringen organiseren en deze gebruiken om toekomstige scenario's te simuleren. De onderzoekers bouwden een compleet navigatiesysteem rond dit model, genaamd GLAM NAV, dat online mapping, geheugenretrieval en voorspellende planning combineert in een enkele lus.

Het systeem werkt door voortdurend een ijle, digitale geheugenstructuur van de omgeving bij te werken terwijl de robot beweegt. Dit geheugen is geen volledige 3D-foto, maar een verzameling van belangrijke oriëntatiepunten (landmarks) en ruimtelijke relaties. Wanneer de robot een doelwit moet vinden, gebruikt hij zijn huidige positie en het geheugen van wat hij al heeft gezien om een eenvoudige vraag te stellen: "Als ik in deze richting beweeg, hoe ziet de kaart er dan uit en kom ik dan dichter bij mijn doel?" Het GLAM-model beantwoordt dit door simultaan twee dingen te voorspellen. Ten eerste voorspelt het hoe de kaart-tokens — de abstracte bouwstenen van zijn geheugen — zullen evolueren terwijl de robot verkent. Ten tweede voorspelt het een latente waypoint, wat een verborgen representatie is van de volgende stap die de robot moet nemen. Deze voorspellingen vinden plaats in een gedeelde ruimte, wat betekent dat het model leert om de veranderende kaart direct te koppelen aan de noodzakelijke beweging, en dat alles zonder ooit te proberen de ruwe visuele beelden van de toekomst te reconstrueren.

Om dit systeem te trainen, hebben de onderzoekers robots niet de echte wereld in gestuurd om fouten te maken. In plaats daarvan gebruikten ze een hoogwaardige simulator genaamd Habitat, die honderden gedetailleerde 3D-scans bevat van echte binnenomgevingen zoals appartementen en kantoren. Ze speelden expert-trajecten af — paden genomen door een perfecte, door de computer gestuurde agent die precies wist waar de objecten waren — en hakten deze paden in duizenden trainingsmonsters. Het model leerde om naar een geschiedenis van kaart-tokens en een doel te kijken, en vervolgens de toekomstige kaart en de volgende waypoint te voorspellen. Cruciaal was dat het systeem werd geleerd om de taak van het recreëren van de visuele wereld te negeren. Het richtte zich volledig op het voorspellen van de structuur van de ruimte en het plan om erdoorheen te navigeren. Voordat het hoofdmodel werd getraind, trainden de onderzoekers ook een apart onderdeel om te begrijpen hoe deze verborgen waypoint-plannen vertaald kunnen worden naar daadwerkelijke fysieke bewegingen, om er zeker van te zijn dat de voorspellingen in echte commando's konden worden omgezet.

Bij tests in de simulator toonden de resultaten aan dat deze voorspellende aanpak beter werkte dan eerdere methoden die vertrouwden op andere soorten geheugenstructuren. Op een specifieke set van vijftig procent van de testscènes slaagde het nieuwe systeem, GLAM NAV, erin om het doelobject in 86,89 procent van de pogingen te vinden, een significante verbetering ten opente van de succesratio van 78,50 procent van het baseline-systeem waarmee het werd vergeleken. Het slaagde er ook in om het doel efficiënter te bereiken, waarbij een metriek genaamd Success weighted by Path Length steeg van 47,70 procent naar 48,35 procent. Deze cijfers suggereren dat door de toekomstige structuur van de kaart en het pad samen te voorspellen, de robot betrouwbaarder werd in het vinden van zijn weg, zelfs wanneer het doel aanvankelijk buiten het zicht was. Het systeem memoriseerde niet alleen een route; het leerde de lay-out van de omgeving te anticiperen en het plan aan te passen op basis van die anticipatie.

Om te bewijzen dat dit niet louter een resultaat was van de simulator, hebben de onderzoekers het systeem ingezet op een fysieke robot, een mensachtige met wielen en dubbele armen, in een echte kantooromgeving. In de eerste echte test in de wereld werd de robot gevraagd om een kamerplant te vinden in een kamer die hij nog nooit eerder had gezien, zonder dat er een vooraf gebouwde kaart beschikbaar was. Terwijl hij bewoog, bouwde hij zijn eigen geheugen van de ruimte op, waarbij hij nieuwe visuele waarnemingen verbond aan zijn groeiende kaart. Hij navigeerde er succesvol naar de plant, wat aantoonde dat het systeem in staat is om vanuit het niets een nuttig ruimtelijk geheugen op te bouwen in een echte, fysieke setting. In een tweede test werd de robot gevraagd om te herinneren waar hij de plant had gezien nadat het object uit het zicht was geraakt. Het systeem haalde de opgeslagen locatie uit zijn geheugen op en navigeerde er succesvol naar terug. Deze demonstraties bevestigden dat de abstracte voorspellingen van het model een echte robot door een echte omgeving kunnen leiden, waarbij geheugen wordt gebruikt om de kloof te overbruggen tussen wat gezien wordt en wat nodig is.

Ondanks deze successen benadrukken de onderzoekers de grenzen van hun werk. Het systeem leert van de paden die door expert-agents in de simulator zijn afgelegd, waardoor het het meest effectief is wanneer het gedrag van de robot binnen de patronen blijft die tijdens de training zijn gezien. Het is geen algemene simulator die de uitkomst van elke willekeurige actie kan voorspellen; het is eerder een doelgericht instrument dat de meest waarschijnlijke kaart en het pad voor een specifiek doel inschat. Het model produceert ook een enkele, definitieve voorspelling in plaats van een reeks mogelijkheden, wat betekent dat het niet expliciet de onzekerheid van zijn gissingen berekent. Als de robot een lay-out tegenkomt die sterk afwijkt van wat hij heeft geleerd, of als zijn sensoren afwijken en de positie kwijtraken, kan het systeem moeite hebben. De onderzoekers benadrukken dat de robot nog steeds vertrouwt op realtime waarnemingen om zijn locatie te verifiëren en botsingen te voorkomen, waarbij de voorspellingen alleen worden gebruikt om de zoektocht te sturen.

Dit werk vertegenwoordigt een verschuiving in hoe we over robotnavigatie denken. In plaats van te proberen een perfecte, hoogwaardige replica van de wereld in een computer te bouwen, leert het systeem te werken met een functionele, abstracte versie van de kaart die voldoende is voor planning. Door het voorspellen van de toekomstige kaart en het plannen van de volgende beweging als één verbonden taak te behandelen, hebben de onderzoekers een systeem gecreëerd dat zowel betrouwbaarder is in het vinden van doelwitten als in staat is om in echte omgevingen te opereren. De bevindingen suggereren dat voor een effectieve exploratie een robot niet alles hoeft te zien; hij moet de structuur van de ruimte goed genoeg begrijpen om te kunnen voorstellen wat er volgt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →