← Nieuwste papers
💻 computer science

AdaGeoVLN: Selective Geometry Across Representation Depth and Navigation Time for Vision-Language Navigation

AdaGeoVLN is een streaming vision-language navigatieframework dat de prestaties verbetert door hiërarchische geometrische foundation model-representaties op verschillende diepten selectief te fuseren en door navigatiebewuste historische geometrische bewijslast vast te houden via een begrensd geheugenmechanisme.

Oorspronkelijke auteurs: Quan-Dung Pham, Anh Dao, Danh Vinh Le, Nguyen Viet Tri Pham, The-Anh Nguyen, Zhirui Dai, Yiyu Chen, Tuyen P. Le, Truong Nguyen, Quan Nguyen

Gepubliceerd 2026-09-17
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Quan-Dung Pham, Anh Dao, Danh Vinh Le, Nguyen Viet Tri Pham, The-Anh Nguyen, Zhirui Dai, Yiyu Chen, Tuyen P. Le, Truong Nguyen, Quan Nguyen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een robot voor die probeert een gesproken reeks instructies op te volgen in een huis dat hij nog nooit eerder heeft gezien. Om te slagen, kan de robot niet simpelweg herkennen dat een stoel een stoel is of een deur een deur is. Het moet begrijpen hoe die objecten zich ruimtelijk tot elkaar verhouden, hoe zijn eigen gezichtspunt verandert terwijl hij beweegt, en hoe het pad dat hij bewandelt verbonden is met de instructies die hij hoort. Deze uitdaging, bekend als vision-language navigation, vereist dat een agent een mentale kaart van de wereld opbouuwt in realtime, met behulp van alleen een camera en een stemcommando. Jarenlang hebben onderzoekers geprobeerd machines deze vaardigheid aan te leren door ze enorme hoeveelheden visuele data te voeren, maar een cruciale vraag bleef onbeantwoord: hoe zou een robot de diepe, gelaagde geometrische kennis die moderne AI-modellen bezitten moeten gebruiken, en hoeveel van het verleden moet hij onthouden om goede beslissingen te nemen in de toekomst?

Een team van onderzoekers heeft een nieuw systeem geïntroduceerd genaamd AdaGeoVLN dat deze vragen beantwoordt door te veranderen hoe een robot naar de wereld kijkt en hoe hij zijn herinneringen opslaat. In plaats van te vertrouwen op een enkele, definitieve snapshot van zijn omgeving, leert het systeem om nuttige geometrische informatie te halen uit meerdere stadia van zijn eigen denkproces. Bovendien probeert het niet elk enkel beeld dat het ooit heeft gezien te onthouden, wat het geheugen snel zou overweldigen. In plaats daarvan handelt het als een zorgvuldige archivaris, die alleen de belangrijkste historische momenten bewaart die helpen begrijpen waar het is en waar het naartoe moet. Deze aanpak stelt de robot in staat om complexe, onbekende omgevingen te navigeren met behruik van alleen een standaard videofeed, zonder dat er extra sensoren zoals dieptecamera's of vooraf gemaakte kaarten nodig zijn.

De kern van deze nieuwe methode ligt in de manier waarop de robot visuele informatie verwerkt. Moderne kunstmatige intelligentiemodellen die geometrie begrijpen, zijn gebouwd als diepe stapels lagen, waarbij elke laag de afbeelding iets anders verwerkt. Eerdere lagen kunnen eenvoudige vormen en randen opvangen, terwijl diepere lagen complexe structureen en ruimtelijke relaties begrijpen. Eerdere systemen negeerden deze vroege lagen meestal en wachtten tot het einde van het proces om een enkele, definitieve samenvatting van de scène te gebruiken. De onderzoekers ontdekten dat dit een fout was. Door de besluitvormingsstappen van de robot te verbinden aan meerdere lagen van het geometrische model tegelijk — door gebruik te maken van de vroege, middelste en late stadia simultaan — kreeg de robot een veel rijker begrip van zijn omgeving. Deze meerlagige aanpak bleek veel effectiever dan simpelweg de definitieve samenvatting herhaaldelijk injecteren, wat suggereert dat de robot baat heeft bij het zien van de wereld door verschillende "lenzen" op hetzelfde moment.

De tweede grote innovatie adresseert het probleem van het geheugen. Terwijl een robot door een huis loopt, genereert hij een continue stroom visuele data. Het opslaan van elk stukje van deze data zou een onmogelijke hoeveelheid geheugen vereisen, vooral voor lange reizen. Oudere methoden hielden vaak de meest recente frames of een vast aantal eerdere beelden vast, uitgaande van het idee dat wat er zojuist gebeurde het belangrijkst was. De onderzoekers realiseerden zich echter dat een oud beeld cruciaal kan zijn als het een specifiek landmerk bevat dat in de instructies wordt genoemd, of als het een unieke bocht in het pad laat zien. AdaGeoVLN lost dit op door te selecteren welke herinneringen te bewaren op basis van drie specifieke criteria: hoe relevant de herinnering is voor de huidige instructie, hoe zelfverzekerd de robot is over de geometrische details van dat beeld, en hoe verschillend dat beeld is van alles wat hij tot nu toe heeft gezien. Dit stelt de robot in staat om redundante informatie weg te gooien terwijl hij de specifieke momenten vasthoudt die hem later zullen helpen navigeren.

Om deze ideeën te testen, trainden de onderzoekers hun systeem op duizenden gesimuleerde navigatietaken en evalueerden het vervolgens op twee standaard benchmarks die worden gebruikt door de wetenschappelijke gemeenschap. De resultaten toonden aan dat het nieuwe systeem de vorige methoden aanzienlijk overtrof. In één testset bereikte het succesvol zijn bestemming in 55,7 procent van de gevallen, een opmerkelijke verbetering ten opzichte van de beste bestaande systemen die geen extra externe data gebruikten. Belangrijker nog, het systeem behaalde dit hoge prestatieniveau terwijl het veel minder computergeheugen gebruikte dan andere benaderingen die probeerden grote hoeveelheden historie op te slaan. De onderzoekers toonden aan dat door selectief te zijn in wat het onthoudt, de robot zijn ruimtelijke bewustzijn kon behouden zonder te verdrinken in onnodige data.

Het team stopte niet bij computersimulaties. Ze namen het getrainde beleid (policy) en zetten het in op een fysieke, mensgrote robot uitgerust met een standaard camera. In praktijktesten volgde de robot succesvol meerstapsinstructies, zoals weglopen van een haardvuur, een gebogen trap beklimmen en stoppen bij een specifieke deuropening. De robot slaagde erin om een plant aan de juiste zijde te passeren en irrelevante deuropeningen te vermijden, wat bewees dat het selectieve geheugen en de meerlagige geometrische redenering werkten in de fysieke wereld, en niet alleen in een virtuele. De onderzoekers merkten op dat hoewel het systeem zeer effectief is, er nog ruimte is om te verfijnen hoe de verschillende geheugensignalen worden gebalanceerd, maar de fundamentele aanpak van het selecteren van geometrie over verschillende dieptes en tijden heeft bewezen een krachtige manier te zijn om machines te leren hoe ze door de wereld bewegen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →