← Neueste Arbeiten
💻 computer science

GPT-6-Astra in a Navigation Workflow: Behavioral Analysis in Zero-Shot Vision-and-Language Navigation in Continuous Environments

Diese Arbeit evaluiert die Zero-Shot-Leistung von GPT-6-Astra in der kontinuierlichen Vision-and-Language Navigation und zeigt auf, dass das Modell zwar Anweisungen effektiv interpretiert und Rückfragen stellt, jedoch Schwierigkeiten hat, korrekte lokale Urteile in nachhaltigen autonomen Fortschritt und angemessenes Anhalten zu übersetzen, wobei es eine Erfolgsquote von 52,0 % auf dem R2R-CE val-unseen Benchmark erreicht.

Ursprüngliche Autoren: Guangzhao Dai, Qi Wu, Bin Zhu

Veröffentlicht 2026-09-18
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Guangzhao Dai, Qi Wu, Bin Zhu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich einen Roboter vor, der in einem Raum platziert wird, den er noch nie gesehen hat, und dem eine einfache verbale Anweisung gegeben wird wie: „Verlasse das Schlafzimmer, biege im Flur links ab und halte am Tisch an.“ Seine Aufgabe besteht nicht nur darin, die Worte zu verstehen, sondern sich physisch durch den Raum zu bewegen, zu interpretieren, was er sieht, und genau zu wissen, wann er anhalten muss. Diese Herausforderung, bekannt als Vision-and-Language Navigation, liegt an der Schnittstelle zwischen der Art und Weise, wie Maschinen die Welt sehen, und der Art und Weise, wie sie menschliche Sprache verstehen. Jahrelang haben Forscher versucht, Roboter das Befolgen dieser Anweisungen beizubringen, indem sie sie mit massiven Mengen an Daten trainierten – im Grunde zeigten sie ihnen tausende Beispiele von Räumen und Routen, bis sie die Muster lernten. Ein neuerer Ansatz stellt jedoch eine andere Frage: Kann eine leistungsstarke künstliche Intelligenz, die nicht speziell für die Navigation trainiert wurde, herausfinden, wie sie sich durch eine neue Umgebung bewegt, indem sie einfach nur Bilder betrachtet und die Anweisungen liilt? Dies ist das Terrain der „Zero-Shot“-Navigation, bei der das System auf sein allgemeines Verständnis der Welt vertrauen muss, anstatt auf ein spezialisiertes Gedächtnis für bestimmte Räume.

Ein Team von Forschern hat diese Idee kürzlich mit einem hochentwickelten KI-Modell namens GPT-6-Astra getestet. Sie haben kein maßgeschneidertes Robotermodell gebaut und das Modell auch nicht mit Navigationsdaten trainiert. Stattdessen entwickelten sie einen Workflow, bei dem das Modell als Gehirn eines virtuellen Agenten fungiert. In diesem Setup erhält das Modell eine Panoramaansicht seiner Umgebung und eine natürliche Sprachanweisung. Es muss dann entscheiden, was es als Nächstes tut: vorwärts gehen, nach links drehen, nach rechts drehen oder anhalten. Entscheidend war, dass die Forscher das Modell nicht einfach raten ließen; sie bauten ein System, das die Gedanken des Modells aufzeichnet, seine Entscheidungen mit der physischen Realität der Simulation abgleicht und es ihm ermöglicht, nach neuen Ansichten zu fragen, wenn es unsicher ist. Das Ziel war es zu sehen, ob diese allgemeine Intelligenz in der Lage ist, einen Agenten erfolgreich zu einem Ziel zu führen und, was vielleicht noch wichtiger ist, zu wissen, wann es angekommen ist.

Die Forscher ließen dieses System durch fünfzig verschiedene Navigationsaufgaben in einer Vielzahl ungesehener Innenräume laufen, die von Wohnungen bis hin zu Büroräumen reichten. Die Ergebnisse waren eine Mischung aus beeindruckendem Verständnis und frustrierenden Einschränkungen. Das System zeigte eine angemessene Leistung und erreichte in etwa der Hälfte der Versuche das allgemeine Zielgebiet. Wenn es erfolgreich war, war der gewählte Pfad oft recht effizient und entsprach eng der idealen Route, die ein Mensch nehmen würde. Das Modell zeigte eine bemerkenswerte Fähigkeit, die Verbindung zwischen dem, was es sah, und dem, was ihm gesagt wurde, herzustellen. Wenn die Anweisung beispielsweise lautete, die „zweite Tür auf der linken Seite“ zu finden, konnte das Modell diese spezifische Tür von der ersten oder der auf der rechten Seite unterscheiden, selbst wenn sie sehr ähnlich aussahen. Es konnte auch auf seine Historie zurückblicken, sich daran erinnern, dass es gerade um eine Ecke gebogen war, und diese Erinnerung nutzen, um zu bestätigen, dass es auf dem richtigen Weg war.

Eines der interessantesten Verhaltensweisen, die die Forscher beobachteten, war die Bereitschaft des Modells, innezuhalten und nach weiteren Informationen zu fragen, wenn es verwirrt war. Wenn das Modell eine Türöffnung sah, sich aber nicht sicher war, ob sie zum richtigen Ort führte, erlaubte das System ihm, einen genaueren Blick oder einen anderen Winkel anzufordern. In vielen Fällen enthüllte dieser zusätzliche Blick verborgene Details, wie etwa einen durch eine Tür blockierten Durchgang oder ein Regal, das bewies, dass ein Flur eine Sackgasse war. Das Modell konnte daraufhin seinen Plan revidieren, einen falschen Pfad ablehnen oder einen richtigen bestätigen. Diese Fähigkeit, Beweise zu suchen und seine Meinung basierend auf neuen visuellen Informationen zu ändern, war eine klare Stärke und zeigte, dass das Modell wie ein vorsichtiger Entdecker agieren konnte, statt wie ein Roboter, der blind einem Skript folgt.

Die Studie verdeutlichte jedoch auch eine signifikante Lücke zwischen dem Verständnis einer Aufgabe und deren Ausführung. Das Modell war oft exzellent darin, zu erfassen, wo es sich befand und was es getan hatte, wobei es korrekt zwischen abgeschlossenen und ausstehenden Aktionen unterschied; dennoch konnte das System in einer Sequenz an einer Türschwelle verharren, in der es zwar den Status der Bewegung korrekt erkannte, aber die physische Aktion nicht abschloss. In anderen Fällen bewertete das Modell die Ankunft durch seine dedizierte Rolle zur Ankunftsbewertung korrekt, doch die endgültige Entscheidung zum Anhalten erforderte eine Kombination aus seiner eigenen Bewertung und externen Workflow-Prüfungen, um akzeptiert zu werden. Die Daten zeigten, dass das System zwar in vielen Episoden die richtige Umgebung erreichte, aber nur in etwa sechsunddreißig Prozent der Fälle mit einer vom Workflow akzeptierten Entscheidung am richtigen Ort anhielt. Dies deutet darauf hin, dass das „Gehirn“ zwar in der Lage war, die Karte und die Anweisungen zu verstehen, die Übersetzung dieses Verständnisses in die endgültige, präzise Stopp-Entscheidung jedoch nicht immer automatisch erfolgte.

Die Forscher fanden heraus, dass der Erfolg des Systems stark von den externen Werkzeugen abhing, die sie darum herum gebaut hatten. Das Modell selbst übernahm spezifische Rollen, einschließlich der „Ankunftsbewertung“, doch der Workflow war für die Überprüfung der Vollendung zuständig, bevor ein STOPP-Befehl akzeptiert wurde. Ohne diese kombinierten Prüfungen war das Urteil des Modells allein nicht ausreichend, um einen erfolgreichen Abschluss zu garantieren. Diese Unterscheidung ist entscheidend: Die Intelligenz war in der Lage, über die Umgebung zu argumentieren und die Ankunft zu bewerten, konnte aber den Kreislauf nicht zuverlässig eigenständig schließen. Die Studie kommt zu dem Schluss, dass die Herausforderung für die Zukunft nicht nur darin besteht, Modelle besser darin zu machen, Orientierungspunkte zu erkennen, sondern sie zu lehren, ihrem eigenen Urteil genug zu vertrauen, um aufzuhalten, wenn sie angekommen sind. Der Weg nach vorn besteht darin, die Lücke zwischen dem Wissen, dass man da ist, und dem tatsächlichen Anhalten zu schließen, um sicherzustellen, dass der Moment des Verständnisses direkt zum Moment des Abschlusses führt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →