AgenticNav: Zero-Shot Vision-and-Language Navigation as a Tool-Calling Harness
AgenticNav introduceert een lichtgewicht, zero-shot vision-and-language navigatieframework dat de VLM-omgevingsinteractie herinterpreteert als een tool-calling harness, wat directe pixelgebaseerde actieselectie, on-demand dieptevragen en selectieve geheugenopvraging mogelijk maakt om state-of-the-art prestaties te bereiken zonder geleerde waypoint-voorspellers.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot leert hoe hij door een gloednieuw huis moet navigeren. Je geeft het een eenvoudige opdracht: "Ga naar de keuken, draai rechtsaf en stop bij de bank." Dit is de wereld van Vision-and-Language Navigation (VLN). Het is een tak van de robotica waarbij een agent menselijke spraak en visuele aanwijzingen moet begrijpen om zich door een 3D-ruimte te bewegen die hij nog nooit eerder heeft gezien. Lange tijd moesten robots getraind worden op duizenden specifieke huizen om te leren hoe ze moeten bewegen, wat betekende dat ze de weg kwijtraakten als je ze naar een ander gebouw bracht. Maar onlangs hebben we "Large Vision-Language Models" (VLMs) ontwikkeld—superintelligente AI-hersenen die al afbeeldingen en woorden kunnen begrijpen zonder dat ze voor elke nieuwe taak opnieuw getraind hoeven te worden. De grote vraag voor wetenschappers is: Hoe verbinden we dit slimme brein met de benen van een robot? Hoe laten we de AI beslissen waar hij precies moet stappen zonder in de war te raken door de rommelige, continue realiteit van de echte wereld?
Dit is waar het artikel AgenticNav om de hoek komt kijken. De auteurs stellen dat de oude manier van AI aan robots koppelen leek op het geven van een kaart aan een chauffeur met slechts drie vooraf getekende wegen om uit te kiezen. Als de bestemming niet op een van die drie wegen lag, zat de chauffeur vast. De nieuwe methode, AgenticNav, verandert het spel volledig. In plaats van de robot te dwingen om te kiezen uit een beperkte lijst met vooraf goedgekeurde bewegingen, geeft het de AI een set "gereedschappen" die hij kan aanroepen wanneer hij dat nodig heeft. Denk aan de AI als een detective in een mysteriegame. In plaats van dat de game de detective dwingt om te kiezen tussen "Ga links", "Ga rechts" of "Ga rechtuit", kan de detective nu zeggen: "Ik moet de diepte van die specifieke pixel op de muur controleren," of "Laat me de kaart zien van waar ik ben geweest," of "Ik wil direct naar die stoel lopen die ik daar zie."
Het artikel introduceert een systeem genaamd AgenticNav, dat fungeert als een "harnas" of een bedieningspaneel voor deze slimme AI-hersenen. De onderzoekers ontdekten dat door de AI drie specifieke gereedschappen te geven, deze veel beter kon navigeren in onbekende omgevingen dan voorheen, zelfs zonder extra training. Het eerste gereedschap is de Action Tool. In plaats van te kiezen uit een kleine lijst met voorgestelde plekken, kan de AI direct naar elke pixel in het camerabeeld wijzen en zeggen: "Ga daarheen." Het systeem doet vervolgens de wiskunde om die pixel om te zetten in een veilig pad. Het tweede gereedschap is de Depth Tool. Soms moet de AI precies weten hoe ver iets weg is. In plaats van de AI een enorme, verwarrende 3D-kaart van de diepte te tonen, laat dit gerek de AI vragen: "Hoe ver is de muur op dit specifieke punt?" en een precies getal te krijgen. Het derde gereedschap is de Memory Tool. Terwijl de robot loopt, bouwt hij een compacte kaart op. Als de robot in de war raakt of een bordje wil onthouden dat hij eerder zag, kan hij het systeem vragen om dat specifieke moment te "herinneren", in plaats van te proberen elk enkel frame van de hele reis te onthouden, wat zijn brein zou overweldigen.
De auteurs testten dit systeem in een computer simulatie genaamd R2R-CE (met behulp van de Habitat simulator) en ook op een echte robot. De validatie in de echte wereld omvatte 30 specifieke episodes verspreid over laboratorium-, kantoor- en buitenplaatsen, waarbij de nadruk lag op taken zoals het lezen van borden, navigatie op lange afstand en het nauwkeurig bereiken van een doel. Ze ontdekten dat wanneer ze een krachtig AI-brein gebruikten (GPT-5.5), hun nieuwe methode een succespercentage van 55% behaalde in het bereiken van het doel, wat een aanzienlijke sprong was ten opzichte van de vorige beste methode (SmartWay) die slechts 44% bereikte. Wat betreft efficiëntie (hoe goed het succes combineerde met het nemen van een kort pad), verbeterden ze van 35,04% naar 48,41%. Het artikel suggereert dat de flessenhals niet alleen de intelligentie van het AI-brein is, maar hoe goed we het de instrumenten geven om met de wereld te interageren. Door de AI toe te staan zijn eigen doelen te kiezen en specifieke informatie op te vragen, wordt het veel beter in staat om te navigeren in de echte wereld, zelfs op plaatsen die het nog nooit heeft bezocht. De onderzoekers merkten ook op dat deze aanpak goed werkt met verschillende soorten AI-hersenen, wat suggereert dat deze "tool-calling" stijl een veelbelovende weg vooruit is om robots te maken die werkelijk onze complexe wereld kunnen begrijpen en doorlopen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.