← Neueste Arbeiten
💻 computer science

HarnessVLN: Unifying Training-Free Embodied Navigation through an Agent Harness

HarnessVLN führt ein Zero-Shot-, trainingsfreies Framework ein, das die verkörperte Navigation durch den Einsatz eines Agent Harness vereinheitlicht, welches Wahrnehmung, Gedächtnis und Aktionsvalidierung durch eine strukturierte Tool-Schnittstelle koordiniert und dabei eine Spitzenleistung auf mehreren Benchmarks erzielt, ohne dass ein aufgabenspezifisches Training erforderlich ist.

Ursprüngliche Autoren: Yang Chen, Lirong Che, Zhenyu Huang, Wenbo Fu, Chuang Wang, Xu Cao, Daqi Liu, Yuzhe Yang, Jian Su, Lan-Zhe Guo

Veröffentlicht 2026-09-16
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Yang Chen, Lirong Che, Zhenyu Huang, Wenbo Fu, Chuang Wang, Xu Cao, Daqi Liu, Yuzhe Yang, Jian Su, Lan-Zhe Guo

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Roboter, die sich eigenständig durch die Welt bewegen können, sind seit langem ein Traum der Science-Fiction, doch für Ingenieure ist die Herausforderung weitaus praktischer Natur. Um zu navigieren, muss eine Maschine drei Dinge gleichzeitig tun: verstehen, was sie sieht, sich erinnern, wo sie gewesen ist, und entscheiden, was sie als Nächstes tun soll. Jahrelang versuchten Forscher, Roboter zu lehren, indem sie ihnen tausende Beispiele erfolgreicher Fahrten zeigten, in der Hoffnung, dass die Maschine das Muster lernen würde. Dieser Ansatz scheiterte jedoch oft, wenn der Roboter auf einen neuen Raum oder eine leicht abweichende Anweisung stieß. Eine jüngere Idee bestand darin, Robotern ein leistungsfähiges „Sprachgehirn“ zu geben, ähnlich den großen KI-Modellen, die Geschichten schreiben oder Fragen beantworten können. Die Hoffnung war, dass diese Modelle in der Lage wären, sich durch ein Gebäude zu „denken“, ohne dass ein spezifisches Training erforderlich wäre. Dennoch blieb eine Lücke: Während diese Modelle zwar über einen Plan sprechen konnten, hatten sie oft Schwierigkeiten zu prüfen, ob dieser Plan in der physischen Welt tatsächlich umsetzbar war, was zu Verwirrung oder dem Steckenbleiben führte.

Ein Team von Forschern hat ein neues System namens HarnessVLN vorgestellt, das diese Lücke schließt. Anstatt sich auf ein einzelnes Modell zu verlassen, das alles erledigt, bauten sie einen zentralen Manager, einen „Harness“ (Joch/Harnisch), der als strenger Aufseher für das Gehirn des Roboters fungiert. Dieser Manager lässt den Roboter nicht einfach raten; er überprüft ständig jeden vorgeschlagenen Schritt gegen das, was der Roboter tatsächlich sieht und sich erinnert. Das System wurde in komplexen digitalen Umgebungen und an einem echten, lebensgroßen humanoiden Roboter getestet. In diesen Tests folgte der Roboter detaillierten verbalen Anweisungen, um bestimmte Objekte zu finden oder bestimmte Orte zu erreichen, wobei er Erfolgsraten erzielte, die vorangegangene Methoden, die kein spezifisches Training erforderten, übertrafen. Die zentrale Erkenntnis ist: Durch das Hinzufügen einer Ebene der Verifizierung – bei der der Roboter beweisen muss, dass ein Ziel sichtbar und erreichbar ist, bevor er sich bewegt – kann das System unbekannte Räume mit einer Zuverlässigkeit navigieren, die reines Raten nicht leisten kann.

Der Kern dieses neuen Ansatzes ist die Idee, dass ein Roboter eine einheitliche Methode benötigt, um verschiedene Arten von Navigationsaufgaben zu bewältigen. Ob das Ziel darin besteht, „in die Küche zu gehen und rechts abzubiegen“ oder einfach nur „die Spülmaschine zu finden“ – der Roboter steht vor demselben grundlegenden Problem: Er muss Wörter mit dem physischen Raum verbinden. Die Forscher entwarfen ein Framework, in dem ein zentraler Controller, der „Harness“, alle Werkzeuge des Roboters koordiniert. Dies umfasst die Augen des Roboters, die Bilder und Tiefeninformationen erfassen, sein Gedächtnis, das speichert, was er gesehen hat, und seine Beine, die ihn vorwärtsbewegen. Wenn das Sprachgehirn des Roboters einen Schritt vorschlägt, hält der Harness inne, um diesen zu validieren. Er fragt: Gibt es Beweise dafür? Ist der Weg frei? Entspricht dies dem aktuellen Ziel? Wenn die Antwort „Nein“ lautet, bewegt sich der Roboter nicht blindlings weiter; stattdlich wird er zurückgeschickt, um das Vorhaben zu überdenken oder nach weiteren Informationen zu suchen.

Dieser Validierungsprozess beruht auf zwei unterschiedlichen Arten von Gedächtnis, die zusammenarbeiten. Das erste ist ein Ereignisprotokoll, das die unmittelbare Historie des Roboters verfolgt, wie etwa welche Teilziele bereits abgeschlossen wurden und wo er kürzlich gescheitert ist. Das zweite ist eine beständige Karte der Umgebung, die einen Datensatz der Orte führt, die der Roboter besucht hat, sowie der Objekte, die er gesehen hat, zusammen mit dem Zeitpunkt und dem Ort dieser Beobachtungen. Diese Karte ermöglicht es dem Roboter, zwischen frischen Informationen und veralteten Ideen zu unterscheiden. Wenn ein Robbot zuvor versucht hat, durch eine Tür zu gehen und feststellte, dass diese verschlossen war, erinnert sich das System an dieses Scheitern und verhindert, dass der Roboter denselben unmöglichen Pfad erneut versucht. Durch die klare Trennung zwischen dem Denken des Roboters und seinen physischen Handlungen stellt das System sicher, dass jeder Schritt in der Realität verwurzelt ist.

Die Forscher testeten dieses System anhand von vier verschiedenen Benchmarks – standardisierte Testreihen, die zur Messung von Navigationsfähigkeiten verwendet werden. In Tests, bei denen der Roboter einer verbal beschriebenen Route folgen musste, war er in 60,8 % der Fälle in einem großen Test und in 53,9 % in einem anderen erfolgreich. Wenn die Aufgabe darin bestand, ein bestimmtes Objekt wie einen Stuhl oder ein Bett zu finden, erreichte das System eine Erfolgsquote von 76,0 % in einer Umgebung und 59,3 % in einer anderen. Diese Zahlen stellen eine signifikante Verbesserung gegenüber anderen Methoden dar, die keine spezifischen Trainingsdaten verwenden. Die Forscher stellten fest, dass das System besser abschnitt als frühere Versuche, weil es nicht einfach dem Vertrauen des Sprachmodells vertraute, sondern einen physischen Beweis forderte, dass das Ziel erreichbar ist, bevor es die Aktion vollzog.

Um zu beweisen, dass dieses System auch außerhalb einer Computersimulation funktioniert, setzte das Team es auf einem echten humanoiden Roboter ein, der 1,74 Meter groß ist. Dieser Roboter, ausgestattet mit Kameras und Sensoren, hatte die Aufgabe, sich in einem echten Gebäude zu bewegen. In einem Experiment wurde der Roboter angewiesen, zu einer Kreuzung zu gehen, links abzubiegen, an einem Mülleimer neben einem Wasserspender anzuhalten und dann einen Kühlschrank zu finden. In einem anderen Experiment musste er einen roten Feuerlöscher lokalisieren, ohne vorher genau zu wissen, wie dieser aussieht. Der Roboter nutzte dasselbe Harness-System, um diese Aufgaben zu steuern und bei jedem Schritt seine visuellen Beweise zu prüfen. Er verfolgte erfolgreich seinen Fortschritt, identifizierte Orientierungspunkte und validierte seine Haltepunkte basierend auf dem, was er tatsächlich sah. Die Tatsache, dass dieselbe Software den Roboter durch eine komplexe Route führen und anschließend nach einem unbekannten Objekt suchen konnte, ohne dass eine Umprogrammierung nötig war, demonstrierte die Flexibilität des Ansatzes.

Der Erfolg von HarnessVLN legt nahe, dass die Zukunft der Roboter-Navigation nicht darin liegen könnte, Maschinen jeden möglichen Pfad beizubringen, sondern ihnen eine zuverlässige Methode zu geben, ihre eigene Arbeit zu überprüfen. Indem das System die Handlungen des Roboters als eine Serie verifizierter Schritte statt als eine einzige kontinuierliche Vermutung behandelt, vermeidet es die typischen Fallstricke des Ver Irrens oder des Wiederholens von Fehlern. Die Forscher fanden heraus, dass die Kombination aus einem leistungsfähigen Sprachplaner und einem strengen, evidenzbasierten Manager es dem Roboter ermöglichte, Aufgaben zu bewältigen, die er zuvor noch nie gesehen hatte. Obwohl das System immer noch auf vordefinierten Regeln für die Überprüfung und Aktualisierung seines Gedächtnisses basiert, zeigen die Ergebnisse, dass diese Methode der Koordination ein praktischer Schritt hin zu Robotern ist, die wirklich in der menschlichen Welt agieren und arbeiten können. Das Projekt bleibt offen für weitere Entwicklungen, wobei das Team plant, zu untersuchen, wie diese Systeme durch Interaktion in offenen Umgebungen noch mehr lernen und sich anpassen können.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →