← Neueste Arbeiten
💻 computer science

AnchorVLN: Geometry-Anchored Vision-Language Grounding Reasoning for Open-Vocabulary Navigation

Das Papier stellt AnchorVLN vor, ein Open-Vocabulary Vision-Language Navigation System, das einen Model Context Protocol (MCP) Server nutzt, um eine strikte Trennung durchzusetzen, bei der Vision-Language-Modelle die semantische Argumentation übernehmen, während geometrische Werkzeuge unabhängig metrische Größen bestimmen, wodurch die Genauigkeit der Befolgung von Anweisungen sowie die Präzision der Objektlokalisierung in unbekannten Umgebungen im Vergleich zur direkten Koordinatenschätzung signifikant verbessert werden.

Ursprüngliche Autoren: Long Giang Vu, Chengkai Yao, Yuxin Liu, FNU Aryan, Rajath Chandrashekar Aralikatti

Veröffentlicht 2026-09-14
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Long Giang Vu, Chengkai Yao, Yuxin Liu, FNU Aryan, Rajath Chandrashekar Aralikatti

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich einen Roboter vor, der einen Raum betritt, den er noch nie gesehen hat, und die Aufgabe hat, ein bestimmtes Objekt basierend auf einer gesprochenen Beschreibung wie „der Hocker unter dem Bild“ zu finden. Jahrzehntelang lösten Roboter dies, indem sie eine präzise, mathematische Karte der Welt mithilfe von Lasern und Kameras erstellten und dann diese Karte nach vorprogrammierten Objektnamen absuchten. Dies funktionierte gut, um einen „Stuhl“ oder einen „Tisch“ zu finden, scheiterte jedoch, wenn die Anweisungen kreativ oder spezifisch wurden, wie etwa „der rote Stuhl am Fenster“. Das Vokabular des Roboters war eingefroren; er konnte keine neuen Beschreibungen verstehen. In den letzten Jahren sind leistungsstarke Modelle der künstlichen Intelligenz entstanden, die in der Lage sind, ein Bild zu betrachten und fast jede Beschreibung zu verstehen, die ein Mensch geben könnte. Diese Modelle sind jedoch hervorragend in der Sprache, aber schlecht in der Mathematik. Sie können Ihnen sagen, was ein Objekt ist, aber sie raten oft wild, wenn man sie fragt, wie weit es entfernt ist oder wohin sie sich genau bewegen müssen, um das Ziel zu erreichen. Wenn ein Roboter sich ausschließlich auf ein solches Modell verlässt, um zu navigieren, könnte er selbstbewusst auf einen Punkt zusteuern, der gar nicht existiert, weil das Modell eine Entfernung erfunden hat, die nicht real ist.

Die Forscher hinter dieser Arbeit, bekannt als AnchorVLN, gingen dieses Problem an, indem sie ein System entwickelten, das strikt zwischen dem trennt, was der Roboter weiß, und wie er sich bewegt. Sie erkannten, dass der beste Ansatz darin besteht, die künstliche Intelligenz die Sprache und die Identifizierung von Objekten handhaben zu lassen, während die physischen Sensoren des Roboters für die Messung von Distanz und Richtung zuständig sind. Sie bauten ein System, in dem die KI als ein Führer fungiert, der aufzeigt, „was“ zu suchen ist, aber niemals versucht zu sagen, „wie weit“ man gehen muss. Stattdessen nutzt das System eine Reihe digitaler Werkzeuge, die die Beschreibungen der KI in physische Koordinaten unter Verwendung echter Lasardaten aus der Umgebung des Roboters übersetzen. Dies stellt sicher, dass der Roboter niemals nach einer erfundenen Zahl handelt. Das System wurde in einem Wettbewerb getestet, der aus fünfzehn verschiedenen Innenräumen bestand, in dem der Roboter dreißig komplexen Anweisungen folgen und fünfundvierzig Fragen über den Standort von Objekten beantworten musste. Die Ergebnisse zeigten, dass das System, wenn es diese Trennung der Aufgaben nutzte, den Anweisungen zu 64,4 Prozent der Zeit erfolgreich folgte. Wenn die Forscher den Teil entfernten, der die physischen Distanzen überprüfte, sank die Erfolgsquote signifikant. Darüber hinaus war das System, das echte Sensordaten verwendete, wenn es darum gebeten wurde, den exakten Standort eines Objekts anzuzeigen, weita viel genauer als ein System, das versuchte, den Standort zu erraten; es reduzierte den durchschnittlichen Fehler bei der Bestimmung der Mitte eines Objekts von über drei Metern auf weniger als zwei und ein halb Meter.

Der Kern dieser Errungenschaft ist eine neue Art und Weise, das Gehirn des Roboters mit seinem Körper zu verbinden. Die Forscher entwarfen ein Kommunikationsprotokoll, bei dem die künstliche Intelligenz nur in Phrasen und Namen sprechen kann, niemals in Zahlen. Wenn der Roboter ein Bild eines Raumes sieht, identifiziert die KI vielleicht einen „Hocker“ und gibt ihm einen temporären Namen, wie etwa „Objekt sieben“. Die KI bittet das System dann, den Hocker zu finden. Das System fragt die KI nicht, wie weit der Hocker entfernt ist. Stattdessen schaut das System auf den eigenen Laserscanner des Roboters, der die tatsächliche Distanz zum Boden und zu den Wänden misst. Es findet den Hocker in den Lasardaten, berechnet die reale Distanz und sagt dem Roboter, dass er sich auf diesen spezifischen Punkt bewegen soll. Wenn die KI versucht, eine Entfernung zu erraten, ignoriert das System die Zahl einfach, weil die Werkzeuge, die es verwendet, nicht darauf programmiert sind, solche Zahlen zu akzeptieren. Dies zwingt den Roboter dazu, sich auf seine eigenen Sinne für die Bewegung zu verlassen, so wie ein Mensch sich auf seine Augen verlassen würde, um die Distanz einzuschätzen, während er den Anweisungen eines Freundes zuhört. Der Roboter kann immer noch komplexe Anweisungen verstehen, wie etwa „gehe zu dem Stuhl, der am nächsten am Fernseher steht“, weil das System die realen Distanzen aller gesehenen Stühle zum Fernseher vergleichen kann, anstatt die KI die Mathematik machen zu lassen.

Dieser Ansatz löst auch das Problem, dass der Roboter stecken bleibt oder in den leeren Raum hineinfährt. Wenn die KI ein Objekt nicht finden kann, zwingt das System den Roboter nicht zum Raten. Stattdessen weist es den Roboter an, an einen neuen Ort zu fahren, von dem aus er möglicherweise eine bessere Sicht hat. Der Roboter scannt den Bereich dann erneut, und das System aktualisiert seine interne Liste von Objekten. Diese Liste ist wie ein wachsendes Gedächtnis des Raumes, in dem jedes Objekt, das der Roboter sieht, mit seiner realen Größe und Position aufgezeichnet wird. Wenn der Robot dasselbe Objekt aus einem anderen Winkel sieht, aktualisiert das System den Datensatz, um die Form genauer zu machen, anstatt einen neuen, verwirrenden Eintrag zu erstellen. Dies ermöglicht es dem Roboter, im Laufe der Zeit ein zuverlässiges Verständnis des Raumes aufzubauen, selbst wenn er ohne Karte und ohne Vorwissen über den Raum beginnt. Die Forscher fanden heraus, dass diese Methode es dem Roboter ermöglichte, erfolgreich in Umgebungen zu navigieren, die er noch nie zuvor besucht hatte, ohne für jeden neuen Raum oder jede neue Art von Objekt umprogrammiert werden zu müssen.

Die Studie unterstreicht einen grundlegenden Wandel in der Art und Weise, wie Roboter mit der Welt interagieren. Anstatt zu versuchen, ein einziges Modell der künstlichen Intelligenz alles machen zu lassen – von der Sprachverständlichkeit bis hin zur Berechnung der Physik –, entwickelten die Forscher ein Team, bei dem jeder Teil das tut, was er am besten kann. Die künstliche Intelligenz kümmert sich um die Kreativität und die Sprache, während die Sensoren des Roboters für die Präzision und die Bewegung zuständig sind. Diese Arbeitsteilung verhindert, dass der Roboter gefährliche Fehler aufgrund von selbstbewussten Vermutungen macht. Die Ergebnisse aus der Testreihe zeigen, dass diese Methode nicht nur eine theoretische Idee ist, sondern eine praktische Lösung, die in realen Szenarien funktioniert. Indem sie Sprache und Mathematik getrennt halten, kann der Roboter komplexen Anweisungen folgen und Objekte mit einer Genauigkeit finden, die für Systeme, die auf einem einzigen Modell basieren, bisher unmöglich war. Die Arbeit legt nahe, dass Roboter, um in der unvorhersehbaren menschlichen Welt wirklich navigieren zu können, ihren eigenen Sinnen für die harten Zahlen vertrauen müssen, während sie die künstliche Intelligenz mit Worten führen lassen sollten.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →