← Neueste Arbeiten
💻 computer science

LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation

LightNav-0 ist ein kompaktes, generalistisches Embodied-Navigation-Modell, das eine vereinheitlichte Token-Schnittstelle nutzt, um die räumliche Intelligenz vortrainierter Vision-Language-Modelle mit der Robotersteuerung zu verknüpfen und auszurichten, wodurch es eine erstklassige Leistung sowie Zero-Shot-Generalisierung über verschiedene Aufgaben, Umgebungen und Verkörperungen hinweg ohne aufgabenspezifische Vorhersageköpfe erreicht.

Ursprüngliche Autoren: Shaoan Wang, Aocheng Luo, Fei Huang, Jingyi Xu, Xiaoyang Wang, Yueyu Wang, Qianli Ma, Fan Yang, Ran Mei, Jia Wei, Jiangpeng Hu, Xuhao Liu, Hongming Chen, Yuanbin Shao, Yiyang Lin, Ziliang Li, Liang Pa
Veröffentlicht 2026-09-01
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Shaoan Wang, Aocheng Luo, Fei Huang, Jingyi Xu, Xiaoyang Wang, Yueyu Wang, Qianli Ma, Fan Yang, Ran Mei, Jia Wei, Jiangpeng Hu, Xuhao Liu, Hongming Chen, Yuanbin Shao, Yiyang Lin, Ziliang Li, Liang Pan, Xinhang Liu, Yuntao Ma, Tingxiang Fan

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Roboter haben lange Zeit damit gekämpft, sich mit der gleichen Leichtigkeit wie Menschen durch die Welt zu bewegen. Während ein Mensch einen Raum betreten, einen blauen Stuhl entdecken und um einen Tisch herum navigieren kann, während er einer gesprochenen Anweisung zuhört, sieht ein Roboter oft nur ein chaotisches Durcheinander aus Pixeln und Klängen. Um diese Lücke zu schließen, haben Wissenschaftler jahrelang spezialisierte Systeme entwickelt, die das Sehen, Denken und Bewegen als getrennte Aufgaben behandeln. Ein Teil der Software erkennt vielleicht Objekte, ein anderer zeichnet eine Karte und ein dritter entscheidet, in welche Richtung sich gedreht werden soll. Dieser Ansatz funktioniert gut in kontrollierten Umgebungen, scheitert aber oft, wenn der Roboter auf einen neuen Raum, eine andere Art von Maschine oder einen komplexen Befehl trifft. Die Herausforderung bestand darin, einen einzigen Geist zu erschaffen, der eine Szene versteht, darüber nachdenkt, wohin er gehen soll, und gleichzeitig den Körper steuert, um dorthin zu gelangen.

Ein Team von Forschern hat nun ein neues System namens LightNav-0 vorgestellt, das versucht, dies zu lösen, indem es einen Roboter lehrt, wie ein Mensch zu denken: indem er sich ein Bild ansieht, darauf zeigt, wohin er gehen möchte, und sich dann bewegt. Anstatt für jede Aufgabe separate Werkzeuge zu bauen, nahmen die Forscher ein großes, vortrainiertes Computermodell, das bereits Sprache und Bilder versteht, und brachten ihm die Navigation bei. Dieses Modell muss nicht für jeden neuen Roboter oder jedes neue Zimmer umprogrammiert werden. Es schaut einfach auf das, was es sieht, hört einen Befehl und entscheidet sich für einen Pfad. Das Ergebnis ist ein kompaktes System, das Anweisungen befolgen, spezifische Objekte finden und sogar beweglichen Zielen folgen kann, während es auf verschiedenen Arten von Maschinen arbeitet – von Wagen mit Rädern bis hin zu vierbeinigen Robotern – ohne dass spezielle Anpassungen erforderlich sind.

Der Kern dieses Systems ist eine clevere Art und Weise, die Gedanken eines Roboters in Handlungen zu übersetzen. Stellen Sie sich vor, ein Roboter blickt auf einen Bildschirm, der einen Flur zeigt. Wenn er den Befehl hört: „Gehe zum blauen Menüschild neben dem Steingebäude“, beginnt er nicht sofort, seine Räder zu bewegen. Zuerst nutzt er sein internes Denken, um auf zwei spezifische Stellen auf dem Bildschirm zu zeigen. Ein Punkt gibt einen sicheren Ort an, auf den man sich zubewegen kann, wie etwa eine freie Bodenfläche, und der andere Punkt identifiziert das eigentliche Ziel, das blaue Schild. Dieser Akt des Zeigens dient als eine klare, gemeinsame Sprache zwischen dem Gehirn des Roboters und seinem Körper. Sobach diese Punkte festgelegt sind, sagt der Roboter einen kurzen Pfad von zehn Schritten voraus, um diesen Ort zu erreichen. Er führt diesen Pfad dann aus, betrachtet die neue Ansicht und wiederholt den Prozess. Durch das Aufteilen der Reise in diese kleinen, begründeten Schritte kann der Roboter komplexe Umgebungen bewältigen, ohne sich zu verirren oder verwirrt zu werden.

Um dem Roboter diese Fähigkeit beizubringen, zeigten die Forscher ihm nicht nur ein paar Beispiele. Sie erstellten eine massive Trainingsbibliothek, die über 2.000 verschiedene Szenen und mehr als 4.000 Stunden Navigationsdaten enthielt. Diese Bibliothek umfasste Anweisungen zum Finden von Objekten, zum Folgen von Menschen und zur Bewegung sowohl in Innenräumen als auch im Freien. Der Trainingsprozess erfolgte in Phasen. Zuerit wurde das Modell gelehrt, räumliche Beziehungen zu verstehen und präzise auf Objekte und Orte in Bildern zu zeigen. Dann wurde es gelehft, diese Zeigefähigkeit mit den tatsächlichen Bewegungsbefehlen zu kombinieren, die für die Navigation nötig sind. Schließlich wurde das System durch einen Prozess von Versuch und Irrtum verfeinert, bei dem es lernte, seine eigenen Fehler zu korrigieren und seine Pfadplanung im Laufe der Zeit zu verbessern. Dieses strenge Training ermöglichte es dem Modell zu generalisieren, was bedeutet, dass es das Gelernte aus den Trainingsdaten auf völlig neue Situationen anwenden konnte, die es zuvor noch nie gesehen hatte.

Die Ergebnisse dieser Arbeit sind bedeutend, da sie zeigen, dass ein einzelnes, relativ kleines Computermodell viel größere, komplexere Systeme übertreffen kann, die auf vielen verschiedenen spezialisierten Teilen basieren. In Tests über zehn verschiedene Simulationsumgebungen hinweg erreichte das neue System die höchsten Erfolgsraten beim Befolgen von Anweisungen und beim Finden von Objekten, selbst wenn es nur eine einzige Kameransicht nutzen durfte und keinen Zugriff auf Tiefensensoren oder vorgefertigte Karten hatte. Es funktionierte gut in Innenräumen, Außenbereichen und sogar in Spielwelten mit völlig anderen visuellen Stilen. Vielleicht am beeindruckendsten ist, dass die Forscher dieselbe Software auf vier sehr unterschiedliche physische Roboter getestet haben: einen humanoiden Roboter, einen vierbeinigen Roboter, eine Drohne und ein fahrbares Gefährt. Ohne eine einzige Zeile Code zu ändern oder das Modell neu zu trainieren, führte das System alle vier Arten von Maschinen erfolgreich durch reale Aufgaben, wie etwa das Folgen einer Person oder das Finden eines spezifischen Objekts.

Dieser Ansatz stellt die alte Vorstellung infrage, dass Roboter für jede neue Aufgabe oder jeden neuen Körper ein einzigartiges Gehirn benötigen. Durch die Verwendung einer einheitlichen Methode, bei der der Roboter auf seine Ziele zeigt und dann einen kurzen Pfad plant, haben die Forscher gezeigt, dass ein einziges, kompaktes System eine Vielzahl von Navigationsaufgaben bewältigen kann. Das System verlässt sich nicht auf Magie oder komplexe, verborgene Berechnungen; es lernt einfach, die Welt zu sehen, einen Befehl zu verstehen und den Weg nach vorne aufzuzeigen. Obwohl die Arbeit primär in Simulationen und kontrollierten realen Umgebungen getestet wurde, deutet die Fähigkeit, diese Fertigkeit auf verschiedene Roboter und Settings zu übertragen, auf eine Zukunft hin, in der Roboter an neuen Orten eingesetzt und mit neuen Aufgaben betraut werden können, ohne dass eine umfangreiche Umprogrammierung nötig ist. Der Erfolg von LightNav-0 deutet darauf hin, dass der Weg zu fähigeren und anpassungsfähigeren Robotern nicht im Bau größerer, spezialisierterer Maschinen liegt, sondern darin, ihnen beizubringen, mit derselben Einfachheit und Flexibilität zu denken und zu zeigen, wie Menschen es jeden Tag tun.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →