← Nieuwste papers
💻 computer science

VerNav: Verifier-First Low-Latency Vision-and-Language Navigation

VerNav is een verifier-first framework voor Vision-and-Language Navigation dat de latentie in de beslissingsfase aanzienlijk vermindert door per stap autoregressieve generatie te vervangen door gebatchte actieverificatie en een op entropie gebaseerde adaptieve generator, terwijl het een tweestaps uitlijningsschema gebruikt om een concurrerende navigatieprestatie op de R2R-benchmark te behouden.

Oorspronkelijke auteurs: Zhixin Wang, Chengzheyi Yao, Leyuan Liu, Xiaosong Zhang, Yongzhao Zhang

Gepubliceerd 2026-09-02
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zhixin Wang, Chengzheyi Yao, Leyuan Liu, Xiaosong Zhang, Yongzhao Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een robot voor die probeert zijn weg te vinden door een huis dat hij nog nooit eerder heeft gezien, geleid door slechts één gesproken zin zoals: "ga naar de keuken, draai links bij de blauwe stoel en stop." Dit is de uitdaging van vision-and-language navigation (visie-en-taalnavigatie). De robot moet naar zijn omgeving kijken, de woorden van de mens begrijpen en beslissen waar hij precies naartoe moet bewegen. Lange tijd hebben onderzoekers geprobeerd dit op te lossen door de robot een krachtig brein te geven dat zichzelf bij elke stap doorpraat. Voordat de robot een beweging maakte, genereerde hij een lange stroom gedachten, waarin hij zijn redenering uitlegde, zijn omgeving controleerde en zijn volgende draai plande. Hoewel dit expliciete denken de robot helpt om complexe instructies te begrijpen, is het ongelooflijk traag. Net zoals een mens die elke stap van een wandeling hardop verwoordt, veel langzamer zou lopen dan iemand die gewoon loopt, is een robot die voor elke enkele stap een volledige paragraaf aan redeneringen genereert, veel te traag om een beslissing te nemen. In de echte wereld, waar snelheid ertoe doet, maakt deze vertraging de technologie onpraktisch.

Een team onderzoekers van de University of Electronic Science and Technology of China heeft een andere manier voorgesteld om dit probleem aan te pakken. Zij stellen voor dat, in plaats van de robot te dwingen voor elke beweging een lang verhaal te schrijven, hij eerst snel een lijst met mogelijke bewegingen moet controleren en de beste moet kiezen. Ze noemen hun nieuwe systeem VerNav. De kern van het idee is om de trage, stap-voor-stap generatie van gedachten te vervangen door een snel proces van verificatie. In plaats van het brein van de robot te vragen om vanuit het niets een nieuw pad uit te vinden, presenteert het systeem een reeks beschikbare richtingen — zoals "ga vooruit", "draai links" of "stop" — en vraagt het brein om simpelweg "ja" of "nee" te zeggen tegen elk van deze opties. Dit stelt de robot in staat om al zijn opties tegelijkertijd te evalueren, in plaats van één voor één. Door dit te doen, verkort het systeem de tijd die nodig is om een beslissing te nemen met meer dan tien keer vergeleken met de traditionele methoden, terwijl de robot nog steeds op het juiste pad blijft.

Het is echter niet genoeg om simpelweg opties snel te controleren. De onderzoekers ontdekten dat als ze alleen deze snelle controlemethode gebruikten, de robot verward zou raken en fouten zou maken, vooral in lastige situaties. De snelle checker is goed in het uitsluiten van slechte ideeën, maar heeft soms moeite met het selecteren van het beste idee wanneer de opties erg op elkaar lijken. Om dit op te lossen, voegde het team een slim veiligheidsnet toe. Ze bouwden een systeem dat de mate van vertrouwen van de robot in de gaten houdt. Als de robot zeker weet welke kant hij op moet gaan, houdt hij zich aan de snelle controlemethode. Maar als de robot onzeker is — aangegeven door een hoog niveau van verwarring tussen de mogelijke keuzes — pauzeert het systeem en vraagt het een krachtiger, trager denkend systeem om een korte, gerichte samenvatting van de situatie te geven. Deze samenvatting werkt als een snelle hint om de snelle checker te helpen de juiste beslissing te nemen. Op deze manier gebruikt de robot alleen de trage, dure denkkracht wanneer dat absoluut noodzakelijk is, waardoor het hele proces snel en efficiënt blijft.

Om er zeker van te zijn dat dit snelle controlesysteem ook daadwerkelijk goed werkt voor navigatie, moesten de onderzoekers het leren hoe het bewegingen correct beoordeelt. Ze ontwikkelden een tweetraps trainingsproces. Eerst leerden ze het systeem te herkennen welke directe bewegingen beter zijn dan andere, wat de robot hielp om acties te verkiezen die hem dichter bij het doel brengen. Daarna lieten ze het systeem hele paden navigeren, waarbij het niet alleen werd beloond voor de uiteindelijke bestemming, maar voor elke kleine stap die vooruitgang boekte. Deze training zorgde ervoor dat de snelle checker niet zomaar willekeurige bewegingen koos, maar leerde om de instructies nauwkeurig over lange afstanden te volgen. Bij tests op een standaard set navigatie-taken presteerde het nieuwe systeem net zo goed als de beste bestaande robots die gebruikmaken van zwaar, traag denken, maar het nam beslissingen in een fractie van de tijd. De resultaten laten zien dat door opties snel te controleren en pas om diep nadenken te vragen wanneer dat nodig is, robots complexe omgevingen veel sneller kunnen navigeren zonder hun weg kwijt te raken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →