← Neueste Arbeiten
💻 computer science

NavWAM: A Navigation World Action Model for Goal-Conditioned Visual Navigation

NavWAM ist eine Diffusion-Transformer-Policy, die zukünftige visuelle Vorhersage, Schätzung des Zielfortschrittswerts und Aktionsgenerierung in einer gemeinsamen latenten Sequenz vereint und es einem Roboter ermöglicht, eine geschlossene Regelkreis-Navigation direkt auszuführen, ohne auf externe Planer oder Aktionssuche angewiesen zu sein.

Ursprüngliche Autoren: Daichi Azuma, Taiki Miyanishi, Koya Sakamoto, Shuhei Kurita, Yaonan Zhu, Petr Khrapchenkov, Motoaki Kawanabe, Yusuke Iwasawa, Yutaka Matsuo

Veröffentlicht 2026-06-12
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Daichi Azuma, Taiki Miyanishi, Koya Sakamoto, Shuhei Kurita, Yaonan Zhu, Petr Khrapchenkov, Motoaki Kawanabe, Yusuke Iwasawa, Yutaka Matsuo

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie bringen einem Roboter bei, ein bestimmtes Zimmer in einem Haus zu finden, aber der Roboter kann nur das sehen, was direkt vor seinen „Augen“ (einer Kamera) liegt. Er hat keine Karte und kann nicht um Ecken sehen. Dies ist die Herausforderung der zielgerichteten visuellen Navigation (goal-conditioned visual navigation).

Hier ist die Geschichte darüber, wie die Autoren, Daichi Azuma und sein Team, dieses Problem mit einem neuen System namens NavWAM gelöst haben.

Das Problem: Die „Kristallkugel“ vs. der „Fahrer“

In der Vergangenheit versuchten Forscher, Roboter durch den Einsatz von zwei separaten Werkzeugen die Navigation beizubringen:

  1. Die Kristallkugel (Weltmodell): Dieses Werkzeug ist großartig darin, zu erraten, was der Roboter sehen wird, wenn er sich vorwärts bewegt. „Wenn ich nach links drehe, werde ich eine Küche sehen.“ „Wenn ich geradeaus gehe, stoße ich gegen eine Wand.“
  2. Der Fahrer (Planer): Dieses Werkzeug betrachtet die Vermutungen der Kristallkugel und entscheidet: „Okay, die Küche sieht gut aus, also drehe ich nach links.“

Der Fehler: Das Paper argumentiert, dass es ineffizient ist, diese beiden Werkzeuge getrennt zu halten. Es ist, als hätte man einen Beifahrer, der ständig Befehle schreit („Links abbiegen!“), während der Fahrer anhalten, nachdenken und dann erst abbiegen muss. Dies erzeugt einen Engpass. Die „Kristallkugel“ sagt die Zukunft voraus, weiß aber nicht, wie man das Auto steuert, um dorthin zu gelangen.

Die Lösung: NavWAM (Der „Fahrer-Prädiktor“)

Die Autoren entwickelten NavVM (Navigation World Action Model). Betrachten Sie NavWAM als einen Super-Fahrer, der gleichzeitig auch in die Zukunft sehen kann.

Anstatt eine separate „Kristallkugel“ und einen „Fahrer“ zu haben, vereint NavWAM diese zu einem einzigen Gehirn. Es rät nicht nur, was es sehen wird, sondern es rät gleichzeitig, was es sehen wird, wie nah es am Ziel ist und exakt welche Lenkbefehle zu geben sind – und das alles zur selben Zeit.

Die kreative Analogie: Die „Gemeinsame Leinwand“

Um zu verstehen, wie NavWAM funktioniert, stellen Sie sich einen Maler vor, der an einer einzigen Leinwand mit neun verschiedenen Paneelen arbeitet:

  • Die unteren Paneele (Was wir wissen): Diese zeigen die aktuelle Sicht des Roboters, wo er sich gerade befindet, und das Bild des Ziels (z. B. ein Foto eines bestimmten Stuhls).
  • Die oberen Panele (Was wir vorhersagen): Der Roboter malt diese Paneele, um zu zeigen:
    1. Was der Roboter in der Zukunft sehen wird.
    2. Wie nah er dem Ziel sein wird.
    3. Der wichtigste Teil: Die eigentlichen Lenkbefehle (der „Action Chunk“), die nötig sind, um dorthin zu gelangen.

Der Roboter lernt durch das „Denoising“ (Entrauschen) dieser Leinwand. Er beginnt mit einer unordentlichen, verschwommenen Version der Zukunft und bereinigt sie, bis er ein klares Bild des Pfades, des Ziels und der zu vollziehenden Schritte hat. Da die „Lenkbefehle“ auf derselben Leinwand wie die „Zukunftssicht“ gemalt werden, lernt der Roboter, dass er diese spezifischen Aktionen ausführen muss, um das Ziel zu sehen.

Wie es die Konkurrenz schlägt

Das Paper testete NavWAM gegen zwei andere Arten von Robotern:

  1. Der alte Weg (NWM): Der Roboter sagt die Zukunft voraus und nutzt dann eine komplexe, langsame mathematische Suche (genannt CEM), um herauszufinden, welche Aktion er ausführen soll. Es ist wie ein Schachspieler, der 100 Züge berechnet, bevor er einen einzigen macht.
  2. Der direkte Weg (OmniVLA): Der Robot schaut nur auf das Ziel und rät den nächsten Schritt, ohne über die Zukunft nachzudenken. Es ist wie ein Fahrer, der nur auf die Straße reagiert, ohne nach vorne zu schauen.

Die Ergebnisse:

  • NavWAM vs. Der alte Weg: NavWAM war viel schneller und genauer, da es keine komplexe Suche durchführen musste. Es „wusste“ einfach den richtigen Zug. Es erreichte das Ziel in 79 % der realen Tests, während der alte Weg nur in 16 % der Fälle erfolgreich war.
  • NavWAM vs. Der direkte Weg: NavWAM war genauso leistungsfähig wie der direkte Weg (der ein viel größeres, stärkeres Computergehirn nutzt), aber NavWAM besaß die zusätzliche Superkraft, die Zukunft tatsächlich vorherzusagen.

Der Praxistest

Das Team hat NavWAM nicht nur in einer Computersimulation getestet. Sie installierten NavWAM auf einem echten Roboter namens Diablo und schickten ihn in vier verschiedene Innenräume (ein Büro, einen Lagerraum, einen Besprechungsraum und einen Flur).

  • Das Ziel: Ein spezifisches Bild zu finden, das in diesem Raum aufgenommen wurde.
  • Das Ergebnis: NavWAM navigierte erfolgreich in 19 von 24 Versuchen zum Ziel.
  • Der „Foresight“-Check: Obwohl NavWAM die Zukunftsvorhersagen nicht zwingend für die Bewegung benötigte (es nutzte prim also die Lenkbefehle), zeigt das Paper, dass seine Vorhersagen überraschend genau waren. Wenn der Roboter vorhersagte: „Ich werde in 4 Sekunden eine Tür sehen“, sah er tatsächlich in 4 Sekunden eine Tür.

Das Wichtigste in Kürze

Das Paper kommt zu dem Schluss, dass ein Roboter, um gut zu navigieren, nicht nur ein „Prädiktor“ oder nur ein „Fahrer“ sein sollte. Er muss beides gleichzeitig sein. Indem der Roboter lernt, die Zukunft zu Ende zu denken und die Aktionen vorherzusagen, die notwendig sind, um diese Zukunft zu erschaffen – und zwar in einem einzigen Schritt –, wird er viel besser darin, sich zurechtzufinden, selbst an Orten, die er noch nie zuvor gesehen hat.

Kurz gesagt: NavWAM lehrt den Roboter, „während des Vorausblickens zu fahren“, anstatt „vorauszuschauen, anzuhalten, zu berechnen und dann zu fahren“.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →