← Neueste Arbeiten
💻 computer science

VerNav: Verifier-First Low-Latency Vision-and-Language Navigation

VerNav ist ein Verifizierer-fokussiertes Framework für Vision-and-Language Navigation, das die Latenz in der Entscheidungsphase signifikant reduziert, indem es die schrittweise autoregressive Generierung durch batched Aktionsverifizierung und einen entropiebasierten adaptiven Generator ersetzt, während es ein zweistufiges Alignment-Schema verwendet, um eine wettbewerbsfähige Navigationsleistung auf dem R2R-Benchmark aufrechtzuerhalten.

Ursprüngliche Autoren: Zhixin Wang, Chengzheyi Yao, Leyuan Liu, Xiaosong Zhang, Yongzhao Zhang

Veröffentlicht 2026-09-02
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Zhixin Wang, Chengzheyi Yao, Leyuan Liu, Xiaosong Zhang, Yongzhao Zhang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich einen Roboter vor, der versucht, sich durch ein Haus zu bewegen, das er noch nie zuvor gesehen hat, geleitet nur durch einen gesprochenen Satz wie „Gehe zur Küche, biege am blauen Stuhl links ab und halte an“. Dies ist die Herausforderung der Vision-and-Language-Navigation. Der Roboter muss seine Umgebung betrachten, die Worte des Menschen verstehen und genau entscheiden, wohin er als Nächstes steuern soll. Lange Zeit haben Forscher versucht, dies zu lösen, indem sie dem Roboter ein leistungsfähiges Gehirn gaben, mit dem er sich jeden einzelnen Schritt selbst erklärt. Bevor der Roboter eine Bewegung ausführte, generierte er einen langen Strom von Gedanken, erklärte seine Beweggründe, überprüfte seine Umgebung und plante seine nächste Abbiegung. Während dieses explizite Nachdenken dem Roboter hilft, komplexe Anweisungen zu verstehen, ist es unglaublich langsam. Genau wie ein Mensch, der jeden Schritt eines Spaziergangs laut durchspricht, viel langsamer gehen würde als einer, der einfach nur läuft, benötigt ein Roboter, der vor jedem einzelnen Schritt einen ganzen Absatz an Begründungen generiert, viel zu lange, um eine Entscheidung zu treffen. In der realen Welt, in der Geschwindigkeit entscheidend ist, macht diese Verzögerung die Technologie unpraktikabel.

Ein Forschungsteam der University of Electronic Science and Technology of China hat einen anderen Weg vorgeschlagen, dieses Problem zu denken. Sie schlagen vor, dass der Roboter, anstatt gezwungen zu werden, vor jeder Bewegung eine lange Geschichte zu schreiben, zuerst schnell eine Liste möglicher Züge überprüfen und den besten auswählen sollte. Sie nennen ihr neues System VerNav. Die Kernidee besteht darin, das langsame, schrittweise Generieren von Gedanken durch einen schnellen Prozess der Verifizierung zu ersetzen. Anstatt das Gehirn des Roboters zu bitten, einen neuen Pfad von Grund auf neu zu erfinden, präsentiert das System eine Reihe verfügbarer Richtungen – wie „vorwärts bewegen“, „links abbiegen“ oder „anhalten“ – und bittet das Gehirn, zu jeder dieser Optionen einfach „Ja“ oder „Nein“ zu sagen. Dies ermöglicht es dem Roboter, alle seine Optionen gleichzeitig zu bewerten, anstatt sie nacheinander abzuarbeiten. Durch dies senkt das System die Zeit, die für eine Entscheidung benötigt wird, im Vergleich zu herkömmlichen Methoden um mehr als das Zehnfache, während der Roboter dennoch auf dem richtigen Weg bleibt.

Doch das schnelle Überprüfen von Optionen allein reicht nicht aus. Die Forscher fanden heraus, dass der Roboter verwirrt würde und Fehler machen würde, wenn sie nur diese schnelle Prüfmethode anwendeten, insbesondere in schwierigen Situationen. Der schnelle Prüfer ist gut darin, schlechte Ideen auszuschließen, aber er hat manchmal Schwierigkeiten, die eine beste Idee auszuwählen, wenn die Optionen sich sehr ähnlich sehen. Um dies zu beheben, fügte das Team ein intelligentes Sicherheitsnetz hinzu. Sie bauten ein System, das die Zuverlässigkeit des Roboters überwacht. Wenn der Roboter sicher ist, in welche Richtung er gehen soll, hält er an der schnellen Prüfmethode fest. Aber wenn der Roboter unsicher ist – angezeigt durch ein hohes Maß an Verwirrung unter den möglichen Entscheidungen – hält das System inne und bittet eine leistungsfähigere, langsamere Denkmaschine, eine kurze, fokussierte Zusammenfassung der Situation zu liefern. Diese Zusammenfassung fungiert als schneller Hinweis, der dem schnellen Prüfer hilft, die richtige Entscheidung zu treffen. Auf diese Weise nutzt der Roboter die langsame, teure Denkleistung nur dann, wenn er sie absolut benötigt, was den gesamten Prozess schnell und effizend hält.

Um sicherzustellen, dass dieses schnelle Prüfsystem tatsächlich gut für die Navigation funktioniert, mussten die Forscher es lehren, Bewegungen korrekt zu beurteilen. Sie entwickelten einen zweistufigen Trainingsprozess. Zuer ich brachten dem System bei, zu erkennen, welche unmittelbaren Bewegungen besser als andere sind, was ihm half zu lernen, Aktionen zu bevorzugen, die ihn näher an das Ziel bringen. Danach ließen sie das System ganze Pfade navigieren und belohnten es nicht nur für das Endziel, sondern für jeden kleinen Schritt, der Fortschritte brachte. Dieses Training stellte sicher, dass der schnelle Prüfer nicht nur zufällige Bewegungen wählte, sondern lernte, den Anweisungen über lange Distanzen präzise zu folgen. Bei Tests mit einem Standard-Datensatz von Navigationsaufgaben schnitt das neue System genauso gut ab wie die besten existierenden Roboter, die über schwerfälliges, langsames Denken verfügen, aber es traf Entscheidungen in einem Bruchteil der Zeit. Die Ergebnisse zeigen, dass Roboter durch das schnelle Überprüfen von Optionen und das gezielte Einsetzen von tiefem Nachdenken nur bei Bedarf, komplexe Umgebungen viel schneller navigieren können, ohne den Weg zu verlieren.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →