← Neueste Arbeiten
💻 computer science

NaviTrace: Evaluating Embodied Navigation of Vision-Language Models

Dieser Beitrag stellt NaviTrace vor, einen hochwertigen Benchmark für visuelles Beantworten von Fragen, der über 3000 von Experten erstellte Navigationspfade in unterschiedlichen Szenarien und für verschiedene Embodiment-Typen umfasst und zeigt, dass aktuelle Vision-Sprach-Modelle bei der Bewertung mit einem neuartigen, semantikbewussten Pfad-Score in Bezug auf die räumliche Verankerung und Ziellokalisierung immer noch hinter der menschlichen Leistung zurückbleiben.

Ursprüngliche Autoren: Tim Windecker, Manthan Patel, Moritz Reuss, Richard Schwarzkopf, Cesar Cadena, Rudolf Lioutikov, Marco Hutter, Jonas Frey

Veröffentlicht 2026-03-10
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Tim Windecker, Manthan Patel, Moritz Reuss, Richard Schwarzkopf, Cesar Cadena, Rudolf Lioutikov, Marco Hutter, Jonas Frey

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie unterrichten einen brillanten, aber unerfahrenen Touristen darin, wie er sich in einer neuen Stadt zurechtfindet. Sie zeigen ihm ein Foto einer Straße und sagen: „Laufen Sie zu jenem roten Auto." Ein menschlicher Tourist würde das Foto betrachten, das Auto lokalisieren, die Treppe bemerken, das Schild „Nicht betreten" sehen und einen Pfad auf dem Foto einzeichnen, der genau zeigt, wo er treten muss.

Diese Arbeit stellt NaviTrace vor, einen neuen „Test", der prüfen soll, ob moderne KI-Roboter (speziell Vision-Language-Modelle) dasselbe leisten können.

Hier ist eine Aufschlüsselung der Arbeit mit einfachen Analogien:

1. Das Problem: Der „Roboter-Tourist" verirrt sich

Roboter werden immer besser darin, Sprache zu verstehen und Bilder zu sehen. Aber wenn Sie einen Roboter bitten, „die Treppe hinunterzugehen" oder „der Straße zu folgen", wissen wir nicht wirklich, wie gut er den Pfad berechnet.

  • Der alte Weg: Um Roboter zu testen, schickten Forscher sie früher in die reale Welt. Das ist wie das Testen eines Fahrers, indem man ihn jedes Mal quer durch das Land fahren lässt, wenn man seine Fähigkeiten überprüfen möchte. Es ist teuer, langsam und schwer zu wiederholen.
  • Der Simulations-Weg: Andere verwenden Videospiel-Simulationen. Das ist wie das Testen eines Fahrers in einem Flugsimulator. Es ist günstig und wiederholbar, aber die „Straßen" im Spiel sind oft zu einfach und fehlen reale Details wie unebener Belag oder soziale Regeln (wie das Warten auf Fußgänger).

2. Die Lösung: Eine „Papier-und-Bleistift"-Navigationsprüfung

Die Autoren haben NaviTrace entwickelt, was wie eine standardisierte Prüfung für die Roboter-Navigation ist.

  • Das Setup: Statt einen Roboter loszuschicken, zeigen sie einer KI ein einzelnes Foto einer realen Szene (wie eine belebte Straße oder ein Park) und geben ihr einen Befehl (z. B. „Gehen Sie ans Ende der Straße").
  • Die Wendung: Sie bitten die KI, eine 2D-Linie (eine „Trace") direkt auf dem Foto zu zeichnen, die zeigt, wohin ein bestimmter Reisendertyp gehen sollte.
  • Die Reisenden: Sie testen vier verschiedene „Embodiments" (Reisendertypen):
    1. Mensch: Kann überallhin laufen, kann aber keine hohen Wände erklimmen.
    2. Bein-Roboter: Wie ein Hund auf vier Beinen; kann mit rauem Untergrund umgehen, ist aber klein.
    3. Rad-Roboter: Wie ein Lieferbot oder Rollstuhl; benötigt glatte Pfade und Rampen.
    4. Fahrrad: Muss auf Straßen oder Radwegen bleiben; hasst Treppen.

3. Das Benotungssystem: Das „intelligente Lineal"

Wie bewertet man eine Zeichnung? Man kann nicht einfach die Distanz von Anfang bis Ende messen. Die Autoren entwickelten ein spezielles Punktesystem, das wie ein intelligentes Lineal funktioniert:

  • Form-Abgleich: Sieht die gezeichnete Linie wie ein Pfad aus, den ein menschlicher Experte zeichnen würde? (Sie verwenden einen mathematischen Trick namens „Dynamic Time Warping", um die Formen zu vergleichen).
  • Ziel-Check: Endete die Linie tatsächlich am Zielort?
  • Die „Geh dort nicht hin"-Strafe: Das ist der clevere Teil. Das System weiß, was auf dem Foto zu sehen ist (z. B. Gras, Treppen, eine belebte Straße). Wenn die KI eine Linie für einen Rollstuhl zeichnet, der eine Treppe hinauffährt, gibt das System eine schwere Strafe. Zeichnet sie eine Linie für einen Menschen, der auf einem Radweg läuft, gibt es eine geringere Strafe.

4. Die Ergebnisse: Die KI ist intelligent, aber nicht „verankert"

Die Autoren testeten erstklassige KI-Modelle (wie Gemini, GPT-5 und andere) gegen menschliche Experten.

  • Die Lücke: Menschen erreichten etwa 75/100. Die besten KI-Modelle erreichten etwa 34/100. Die KI leistet besser als zufälliges Raten, liegt aber immer noch weit hinter einem Menschen zurück.
  • Der Hauptfehler: Das größte Problem ist nicht, dass die KI nicht weiß, wie man läuft; es ist, dass sie das Ziel nicht findet.
    • Analogie: Wenn man der KI sagt „Gehen Sie zum roten Auto", zeichnet sie oft einen Pfad, der vernünftig aussieht, aber bei dem falschen Auto endet, oder sie zeichnet einen Pfad, der komplett aus der Karte führt.
    • Als die Forscher die KI zwangen, nur das Ziel zu erraten und dann eine gerade Linie dorthin zu ziehen, verbesserte sich die Punktzahl nicht viel. Das bedeutet, dass die KI Schwierigkeiten hat zu verstehen, wo sich Dinge auf dem Bild befinden, nicht nur, wie man sich bewegt.
  • Die „Schlussfolgerungs"-Falle: Einige KI-Modelle (wie o3) schrieben perfekte logische Schritte in Textform auf: „Ich muss nach links gehen, die Treppe vermeiden und zum Auto fahren." Doch als sie tatsächlich die Linie zogen, ignorierten sie ihren eigenen Text und zeichneten einen Pfad, der in eine Wand führte. Das „Gehirn" der KI (Text) und ihre „Augen" (Zeichnung) sprechen nicht richtig miteinander.

5. Warum das wichtig ist

Die Arbeit argumentiert, dass wir, bevor wir Robotern vertrauen können, Pakete zu liefern, älteren Menschen zu helfen oder nach Überlebenden zu suchen, eine Möglichkeit brauchen, sie fair, günstig und unter Berücksichtigung realer Komplexität zu testen. NaviTrace bietet diesen Test. Es zeigt uns, dass KI zwar großartig im Chatten und beim Erkennen von Objekten ist, aber immer noch Schwierigkeiten hat, die Welt so zu „sehen", dass sie sich sicher und logisch darin bewegen kann.

Kurz gesagt: Die Arbeit entwickelte einen Navigationstest, bei dem Roboter eine Karte auf einem Foto zeichnen müssen. Die Ergebnisse zeigen, dass die Roboter zwar besser werden, aber immer noch schrecklich darin sind, sich zurechtzufinden, und oft die physischen Regeln der Straße ignorieren (wie Treppen für Rollstühle).

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →