← Nieuwste papers
💻 computer science

HarnessVLN: Unifying Training-Free Embodied Navigation through an Agent Harness

HarnessVLN introduceert een zero-shot, training-vrij framework dat belichaamde navigatie verenigt door een Agent Harness te gebruiken om perceptie, geheugen en actievalidatie te coördineren via een gestructureerde tool-interface, waarmee het state-of-the-art prestaties bereikt op meerdere benchmarks zonder taakspecifieke training te vereisen.

Oorspronkelijke auteurs: Yang Chen, Lirong Che, Zhenyu Huang, Wenbo Fu, Chuang Wang, Xu Cao, Daqi Liu, Yuzhe Yang, Jian Su, Lan-Zhe Guo

Gepubliceerd 2026-09-16
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yang Chen, Lirong Che, Zhenyu Huang, Wenbo Fu, Chuang Wang, Xu Cao, Daqi Liu, Yuzhe Yang, Jian Su, Lan-Zhe Guo

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Robots die zelfstandig door de wereld kunnen bewegen, zijn al lang een droom van sciencefiction, maar voor ingenieurs is de uitdaging veel praktischer. Om te navigeren, moet een machine drie dingen tegelijkertijd doen: begrijpen wat hij ziet, onthouden waar hij is geweest en beslissen wat hij vervolgens gaat doen. Jarenlang probeerden onderzoekers robots te onderwijzen door hen duizenden voorbeelden van succesvolle ritten te tonen, in de hoop dat de machine het patroon zou leren. Deze aanpak faalt echter vaak wanneer de robot een nieuwe kamer tegenkomt of een licht gewijzigde instructie krijgt. Een recenter idee was om robots een krachtig taalbrein te geven, vergelijkbaar met de grote kunstmatige intelligentiemodellen die verhalen kunnen schrijven of vragen kunnen beantwoorden. De hoop was dat deze modellen hun weg door een gebouw konden redeneren zonder specifieke training nodig te hebben. Toch bleef er een kloof bestaan: hoewel deze modellen over een plan konden praten, hadden ze vaak moeite om te controleren of dat plan ook daadwerkelijk mogelijk was in de fysieke wereld, wat leidde tot verwarring of het vastlopen.

Een team van onderzoekers heeft een nieuw systeem geïntroduceerd genaamd HarnessVLN dat deze kloof overbrugt. In plaats van te vertrouwen op één enkel model dat alles doet, bouwden zij een centrale manager, of "harness" (harnas), die fungeert als een strikte supervisor voor het brein van de robot. Deze manager laat de robot niet zomaar gokken; hij controleert voortdurend elke voorgestelde beweging tegen wat de robot daadwerkelijk ziet en onthoudt. Het systeem werd getest in complexe digitale omgevingen en op een echte, volwaardige humanoïde robot. In deze tests volgde de robot gedetailleerde verbale instructies succesvol om specifieke objecten te vinden of bepaalde locaties te bereiken, waarbij de succespercentages de eerdere methoden overtroffen die geen specifieke training voor taken vereisten. De belangrijkste bevinding is dat door een laag van verificatie toe te voegen — waarbij de robot moet bewijzen dat een doel zichtbaar en bereikbaar is voordat hij beweegt — het systeem door onbekende ruimtes kan navigeren met een betrouwbaarheid die puur gokken niet kan evenaren.

De kern van deze nieuwe aanpak is het idee dat een robot een verenigde manier nodig heeft om verschillende soorten navigatietaken af te handelen. Of het doel nu is om "naar de keuken te lopen en rechts af te slaan" of simpelweg "de vaatwasser te vinden", de robot staat voor hetzelfde fundamentele probleem: hij moet woorden verbinden met de fysieke ruimte. De onderzoekers ontwierpen een framework waarbij een centrale controller, de Harness, alle hulpmiddelen van de robot coördineert. Dit omvat de ogen van de robot, die beelden en diepte vastleggen; zijn geheugen, dat opslaat wat hij heeft gezien; en zijn benen, die hem vooruit bewegen. Wanneer het taalbrein van de robot een beweging suggereert, pauzeert de Harness om dit te valideren. De Harness vraagt: Is er bewijs voor dit? Is het pad vrij? Komt dit overeen met het huidige doel? Als het antwoord "nee" is, beweegt de robot niet blindelings voort; hij wordt teruggestuurd om opnieuw te overwegen of om meer informatie te zoeken.

Dit verificatieproces steunt op twee verschillende soorten geheugen die samenwerken. De eerste is een verslag van gebeurtenissen, dat de directe geschiedenis van de robot bijhoudt, zoals welke subdoelen zijn voltooid en waar hij onlangs is gefaald. De tweede is een persistente kaart van de omgeving, die een verslag bijhoudt van plaatsen die de robot heeft bezocht en de objecten die hij heeft gezien, samen met de tijd en locatie van die waarnemingen. Deze kaart stelt de robot in staat om onderscheid te maken tussen verse informatie en oude, verouderde ideeën. Als een robot eerder probeerde door een deur te gaan en merkte dat deze op slot zat, onthoudt dit systeem die mislukking en voorkomt dat de robot dezelfde onmogelijke route opnieuw probeert. Door een duidelijke scheiding aan te brengen tussen het redeneren van de robot en zijn fysieke acties, zorgt het systeem ervoor dat elke stap geworteld is in de realiteit.

De onderzoekers testten dit systeem op vier benchmarks, wat standaard sets van uitdagingen zijn die worden gebruikt om navigatievaardigheden te meten. In tests waarbij de robot een route moest volgen die in woorden werd beschreven, slaagde hij in 60,8% van de gevallen in één belangrijke test en in 53,9% in een andere. Wanneer de taak was om een specifiek object te vinden, zoals een stoel of een bed, slaagde het systeem in 76,0% van de pogingen in één omgeving en in 59,3% in een andere. Deze cijfers vertegenwoordigen een aanzienlijke verbetering ten opzichte van andere methoden die geen specifieke trainingsdata gebruiken. De onderzoekers merkten op dat het systeem beter presteerde dan eerdere pogingen omdat het niet alleen vertrouwde op het vertrouwen van het taalmodel; het vereiste fysiek bewijs dat het doel bereikbaar was voordat er tot de actie werd overgegaan.

Om te bewijzen dat dit systeem buiten een computersimulatie werkt, heeft het team het ingezet op een echte humanoïde robot van 1,74 meter hoog. Deze robot, uitgerust met camera's en sensoren, kreeg de taak om door een echt gebouw te navigeren. In één experiment kreeg de robot de opdracht om naar een kruispunt te lopen, links af te slaan, te stoppen bij een vuilnisbak nabij een waterdispenser, en vervolgens een koelkast te vinden. In een ander experiment moest hij een rode brandblusser lokaliseren zonder vooraf precies te weten hoe deze eruitzag. De robot gebruikte hetzelfde Harness-systeem om deze taken te beheren, waarbij hij bij elke stap zijn visuele bewijs controleerde. Hij slaagde erin zijn voortgang bij te houden, oriëntatiepunten te identificeren en zijn stoppunten te valideren op basis van wat hij daadwerkelijk zag. Het feit dat dezelfde software de robot door een complex traject kon leiden en vervolgens een onbekend object kon zoeken zonder herprogrammering, toonde de flexibiliteit van de aanpak aan.

Het succes van HarnessVLN suggereert dat de toekomst van robotnavigatie niet ligt in het aanleren van elke mogelijke route aan machines, maar in het geven van een betrouwbare manier om hun eigen werk te controleren. Door de acties van de robot te behandelen als een reeks geverifieerde stappen in plaats van één enkele continue gok, vermijdt het systeem de veelvoorkomende valkuilen van het verdwalen of het herhalen van fouten. De onderzoekers ontdekten dat de combinatie van een krachtige taalplanner en een strikte, op bewijs gebaseerde manager de robot in staat stelde om taken uit te voeren die hij nog nooit eerder had gezien. Hoewel het systeem nog steeds vertrouwt op vooraf gedefinieerde regels voor het controleren en bijwerken van zijn geheugen, laten de resultaten zien dat deze methode van coördinatie een praktische stap is naar robots die echt kunnen bewegen en werken in de menselijke wereld. Het project blijft open voor verdere ontwikkeling, waarbij het team van plan is te onderzoeken hoe deze systemen nog meer kunnen leren en zich kunnen aanpassen door interactie in open omgevingen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →