← Neueste Arbeiten
💻 computer science

AgenticNav: Zero-Shot Vision-and-Language Navigation as a Tool-Calling Harness

AgenticNav führt ein leichtgewichtiges Zero-Shot-Vision-and-Language-Navigationsframework ein, das die VLM-Umweltinteraktion als ein Tool-Calling-Harness neu interpretiert und dadurch eine direkte pixelbasierte Aktionsauswahl, Tiefenabfragen auf Abruf sowie selektiven Speicherabruf ermöglicht, um ohne gelernte Wegpunkt-Prädiktoren eine State-of-the-Art-Leistung zu erzielen.

Ursprüngliche Autoren: Yijian Li, Changze Li, Hantian Shi, Jiaying Luo, Jiyuan Cai, Ming Yang, Tong Qin

Veröffentlicht 2026-07-28
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Yijian Li, Changze Li, Hantian Shi, Jiaying Luo, Jiyuan Cai, Ming Yang, Tong Qin

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie bringen einem Roboter bei, wie er sich in einem brandneuen Haus bewegt. Sie geben ihm einen einfachen Befehl: „Gehe zur Küche, drehe dich nach rechts und halte beim Sofa an.“ Dies ist die Welt der Vision-and-Language Navigation (VLN). Es ist ein Zweig der Robotik, in dem ein Agent lernen muss, menschliche Sprache und visuelle Hinweise zu verstehen, um sich durch einen 3D-Raum zu bewegen, den er zuvor noch nie gesehen hat. Lange Zeit mussten Roboter an tausenden spezifischen Häusern trainiert werden, um zu lernen, wie man sich bewegt, was bedeutete, dass sie sich verloren hatten, wenn man sie in ein anderes Gebäude brachte. Aber vor kurzem haben wir „Large Vision-Language Models“ (VLMs) entwickelt – superintelligente KI-Gehirne, die bereits Bilder und Wörter verstehen können, ohne für jede einzelne Aufgabe neu trainiert werden zu müssen. Die große Frage für Wissenschaftler ist: Wie verbinden wir dieses intelligente Gehirn mit den Beinen eines Roboters? Wie lassen wir die KI entscheiden, wohin sie genau tritt, ohne dass sie durch die chaotische, kontinuierliche Realität der echten Welt verwirrt wird?

Hier kommt das Paper AgenticNav ins Spiel. Die Autoren argumentieren, dass die alte Art, KI mit Robotern zu verbinden, so war, als würde man einem Fahrer eine Karte geben, auf der nur drei vorgezeichnete Straßen zur Auswahl stehen. Wenn das Ziel nicht auf einer dieser drei Straßen lag, war der Fahrer steckengeblieben. Die neue Methode, AgenticNav, verändert das Spiel grundlegend. Anstatt die KI dazu zu zwingen, aus einer begrenzten Liste vorgegebener Bewegungen zu wählen, gibt sie der KI eine Reihe von „Werkzeugen“, die sie immer dann anrufen kann, wenn sie sie braucht. Denken Sie an die KI als einen Detektiv in einem Krimispiel. Anstatt dass das Spiel den Detektiv dazu zwingt, zwischen „Gehe links“, „Gehe rechts“ oder „Gehe geradeaus“ zu wählen, kann der Detektiv nun sagen: „Ich muss die Tiefe dieses spezifischen Pixels an der Wand prüfen“, oder „Zeige mir die Karte dessen, wo ich gewesen bin“, oder „Ich möchte direkt zu diesem Stuhl gehen, den ich sehe“.

Das Paper stellt ein System namens AgenticNav vor, das als „Harness“ oder Kontrollpanel für diese intelligenten KI-Gehirne fungiert. Die Forscher fanden heraus, dass die KI durch die Bereitstellung von drei spezifischen Werkzeugen in ungesehenen Umgebungen viel besser navigieren konnte als zuvor, selbst ohne zusätzliches Training. Das erste Werkzeug ist das Action Tool (Aktionswerkzeug). Anstatt aus einer kleinen Liste vorgeschlagener Punkte zu wählen, kann die KI direkt auf jeden beliebigen Pixel in der Kamarasicht zeigen und sagen: „Gehe dorthin.“ Das System berechnet dann die Mathematik, um diesen Pixel in einen sicheren Gehweg zu verwandelt. Das zweite Werkzeug ist das Depth Tool (Tiefenwerkzeug). Manchmal muss die KI genau wissen, wie weit etwas entfernt ist. Anstatt der KI eine riesige, verwirrende 3D-Tiefenkarte zu zeigen, lässt dieses Werkzeug die KI fragen: „Wie weit ist die Wand an dieser spezifischen Stelle?“ und eine präzise Zahl erhalten. Das dritte Werkzeug ist das Memory Tool (Gedächtniswerkzeug). Während der Roboter läuft, erstellt er eine kompakte Karte. Wenn der Roboter verwirrt ist oder sich an ein Schild erinnern muss, das er früher gesehen hat, kann er das System bitten, diesen spezifischen Moment „abzurufen“, anstatt versuchen zu müssen, jeden einzelnen Frame der gesamten Reise zu erinnern, was sein Gehirn überfordern würde.

Die Autoren testeten dieses System in einer Computersimulation namens R2R-CE (unter Verwendung des Habitat-Simulators) und auch auf einem echten Roboter. Die Validierung in der realen Welt umfasste 30 spezifische Episoden, die Labor-, Büro- und Außenhof-Szenen abdeckten, wobei Aufgaben wie das Lesen von Schildern, die Navigation über lange Distanzen und das präzise Ankommen am Ziel im Vordergrund standen. Sie fanden heraus, dass die Methode unter Verwendung eines leistungsstarken KI-Gehirns (GPT-5.5) eine Erfolgsquote von 55 % beim Erreichen des Ziels erzielte, was einen signifikanten Sprung gegenüber der bisher besten Methode (SmartWay) darstellte, die nur 44 % erreichte. In Bezug auf die Effizienz (wie gut Erfolg mit einem kurzen Weg kombiniert wurde) verbesserten sie sich von 35,04 % auf 48,41 %. Das Paper legt nahe, dass der Engpass nicht nur die Intelligenz des KI-Gehirns ist, sondern wie gut wir ihm die Werkzeuge geben, um mit der Welt zu interagieren. Indem wir der KI erlauben, ihre eigenen Ziele zu wählen und nach spezifischen Informationen zu fragen, wird sie viel fähiger darin, in der realen Welt zu navigieren, selbst an Orten, die sie noch nie besucht hat. Die Forscher merkten auch an, dass dieser Ansatz gut mit verschiedenen Arten von KI-Gehirnen funktioniert, was darauf hindeutet, dass dieser „Tool-Calling“-Stil (Werkzeugaufruf-Stil) ein vielversprechender Weg nach vorne ist, um Roboter zu erschaffen, die unsere komplexe Welt wirklich verstehen und sich in ihr bewegen können.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →