← Nieuwste papers
💻 computer science

GPT-6-Astra in a Navigation Workflow: Behavioral Analysis in Zero-Shot Vision-and-Language Navigation in Continuous Environments

Dit artikel evalueert de zero-shot prestaties van GPT-6-Astra in continue Vision-and-Language Navigation, waarbij wordt aangetoond dat hoewel het model instructies effectief interpreteert en om verduidelijking vraagt, het moeite heeft om correcte lokale oordelen te vertalen naar aanhoudende autonome vooruitgang en gepast stoppen, met een succespercentage van 52,0% op de R2R-CE val-unseen benchmark.

Oorspronkelijke auteurs: Guangzhao Dai, Qi Wu, Bin Zhu

Gepubliceerd 2026-09-18
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Guangzhao Dai, Qi Wu, Bin Zhu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een robot voor die in een kamer wordt geplaatst die hij nog nooit eerder heeft gezien en die een eenvoudige gesproken instructie krijgt zoals: "verlaat de slaapkamer, ga links in de gang en stop bij de tafel." De taak is niet alleen om de woorden te begrijpen, maar om zich fysiek door de ruimte te bewegen, te interpreteren wat hij ziet en precies te weten wanneer hij moet stoppen. Deze uitdaging, bekend als vision-and-language navigation, bevindt zich op het snijvlak van hoe machines de wereld zien en hoe ze menselijke taal begrijpen. Jarenlang hebben onderzoekers geprobeerd robots te leren deze instructies te volgen door hen te trainen op enorme hoeveelheden data, waarbij ze hen in essentie duizenden voorbeelden van kamers en routes lieten zien totdat ze de patronen leerden. Echter, een nieuwere benadering stelt een andere vraag: kan een krachtige kunstmatige intelligentie, die niet specifiek is getraind om te navigeren, uitzoeken hoe hij zich door een nieuwe omgeving moet bewegen door simpelweg naar foto's te kijken en de instructies te lezen? Dit is het terrein van "zero-shot" navigatie, waarbij het systeem moet vertrouwen op zijn algemene begrip van de wereld in plaats van op een gespecialiseerd geheugen van specifieke kamers.

Een team van onderzoekers heeft dit idee onlangs getest met behulp van een geavanceerd kunstmatige intelligentiemodel genaamd GPT-6-Astra. Ze hebben geen aangepaste robot gebouwd of het model getraind op navigatiedata. In plaats daarvan hebben ze een workflow gecreëerd waarin het model fungeert als de hersenen van een virtuele agent. In deze opstelling ontvangt het model een panoramisch beeld van de omgeving en een natuurlijke taalinstructie. Het moet vervolgens beslissen wat de volgende stap is: vooruit bewegen, naar links draaien, naar rechts draaien of stoppen. Cruciaal is dat de onderzoekers het model niet alleen lieten gokken; ze bouwden een systeem dat de gedachten van het model vastlegt, de beslissingen controleert tegen de fysieke realiteit van de simulatie en het model toestaat om om nieuwe beelden te vragen als het onzeker is. Het doel was om te zien of deze algemene intelligentie een agent succesvol naar een bestemming kon leiden en, misschien nog belangrijker, of hij wist wanneer hij was gearriveerd.

De onderzoekers hebben dit systeem door vijftig verschillende navigatietaken geleid in een verscheidenheid aan onbekende binnenomgevingen, variërend van appartementen tot kantoorruimtes. De resultaten waren een mix van indrukwekkend begrip en frustrerende beperkingen. Het systeem presteerde redelijk goed en bereikte in ongeveer de helft van de pogingen de algemene omgeving van de bestemming. Wanneer het slaagde, was de afgelegde route vaak zeer efficiënt en kwam deze nauw overeen met de ideale route die een mens zou nemen. Het model toonde een opmerkelijk vermogen om de verbanden te leggen tussen wat het zag en wat het werd verteld. Als de instructie bijvoorbeeld was om de "tweede deur aan de linkerkant" te vinden, kon het model die specifieke deur onderscheiden van de eerste of de deur aan de rechterkant, zelfs als ze erg op elkaar leken. Het kon ook terugkijken op zijn geschiedenis, onthouden dat het net een hoek om was gegaan, en die herinnering gebruiken om te bevestigen dat het op de goede weg was.

Een van de meest interessante gedragingen die de onderzoekers observeerden, was de bereidheid van het model om te pauzeren en om meer informatie te vragen wanneer het in de war was. Als het model een deuropening zag maar niet zeker wist of deze naar de juiste plek leidde, stond het systeem het model toe om om een nadere blik of een ander perspectief te vragen. In veel gevallen onthulde dit extra kijkje verborgen details, zoals een doorgang die geblokkeerd werd door een deur of een plank die bewees dat een gang een doodlopende weg was. Het model kon vervolgens zijn plan herzien, een foutief pad verwerpen of een juist pad bevestigen. Dit vermogen om bewijs te zoeken en van mening te veranderen op basis van nieuwe visuele informatie was een duidelijke kracht, wat aantoonde dat het model kon handelen als een zorgvuldige ontdekkingsreiziger in plaats van een robot die blindelings een script volgt.

De studie benadrukte echter ook een aanzienlijke kloof tussen het begrijpen van een taak en het voltooien ervan. Het model was vaak uitstekend in het bepalen waar het was en wat het had gedaan, waarbij het correct onderscheid maakte tussen voltooide acties en lopende acties, maar het systeem bleef roteren zonder een drempel over te steken, zelfs nadat het model de situatie herkende. In andere gevallen beoordeelde het model de aankomst correct via zijn specifieke rol voor aankomstbeoordeling, maar de uiteindelijke beslissing om te stoppen vereiste een combinatie van de eigen beoordeling van het model en externe workflow-controles om te worden geaccepteerd. De data toonden aan dat hoewel het systeem in veel episodes de juiste buurt bereikte, het slechts in ongeveer zesendertig procent van de gevallen stopte op de juiste plaats met een door de workflow geaccepteerde beslissing. Dit suggereert dat hoewel de "hersenen" de kaart en de instructies konden begrijpen, het vertalen van dat begrip naar de uiteindelijke, precieze stopbeslissing niet altijd automatisch verliep.

De onderzoekers ontdekten dat het succes van het systeem sterk afhankelijk was van de externe tools die zij eromheen hadden gebouwd. Het model zelf vervulde specifieke rollen, waaronder "aankomstbeoordeling", maar de workflow was verantwoordelijk voor het controleren van de voltooiing voordat een STOP-commando werd geaccepteerd. Zonder deze gecombineerde controles was het oordeel van het model zelf niet voldoende om een succesvolle voltooiing te garanderen. Dit onderscheid is essentieel: de intelligentie was in staat om over de omgeving te redeneren en de aankomst te beoordelen, maar kon de cirkel niet betrouwbaar zelfstandig sluiten. De studie concludeert dat de uitdaging voor de toekomst niet alleen ligt in het slimmer maken van modellen bij het herkennen van oriëntatiepunten, maar in het leren dat ze hun eigen oordeel moeten vertrouwen om te stoppen met bewegen wanneer ze zijn gearriveerd. De weg vooruit ligt in het overbruggen van de kloof tussen weten dat je er bent en daadwerkelijk stoppen op die plek, zodat het moment van begrip direct leidt tot het moment van voltooiing.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →