← Neueste Arbeiten
💻 computer science

Hydra: A Navigation World Action Model with Discrete Latent Planning and Continuous Flow-Matching Execution

Hydra ist ein neuartiges Framework für die Robotersteuerung, das die Lücke zwischen Weltmodellen und Echtzeit-Ausführung schließt, indem es visuelle Zustände und Aktionen in einem diskreten latenten Raum zur effizienten Planung vereinigt, während es kontinuierliches Flow-Matching nutzt, um diese diskreten Pläne in glatte physische Befehle zu übersetzen.

Ursprüngliche Autoren: Mohammad Nazeri, Alexandyr Card, Samira Huber, Anuj Pokhrel, Yujun Wang, Ruben Hammele, Daeun Song, Sören Pirk, Xuesu Xiao

Veröffentlicht 2026-09-01
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Mohammad Nazeri, Alexandyr Card, Samira Huber, Anuj Pokhrel, Yujun Wang, Ruben Hammele, Daeun Song, Sören Pirk, Xuesu Xiao

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Roboter kämpfen schon lange damit, sich mit der Voraussicht eines Lebewesens durch die Welt zu bewegen. Während moderne Maschinen zwar sofort auf das reagieren können, was sie sehen, fehlt ihnen oft die Fähigkeit, sich vorzustellen, was als Nächstes passieren wird. Traditionelle Navigationssysteme arbeiten wie ein Fahrer, der nur auf die Straße direkt vor dem Auto blickt – er reagiert auf Hindernisse, sobald sie auftauchen, ist aber nicht in der Lage, eine Route um eine Sackgasse herum zu planen, bevor es zu spät ist. Um Robotern diese Art von Voraussicht zu geben, haben Wissenschaftler „Weltmodelle“ entwickelt, bei denen es sich im Wesentlichen um interne Simulatoren handelt, die einer Maschine erlauben, verschiedene Zukünfte zu imaginieren, bevor sie sich bewegt. Ein großes Hindernis hat jedoch verhindert, dass diese Simulatoren in Echtzeit auf physischen Robotern eingesetzt werden können: Der Prozess des Überprüfens dieser imaginierten Zukünfte ist zu langsam. Aktuelle Methoden erfordern, dass der Roboter Tausende von potenziellen Pfaden generiert, jeden davon in ein detailliertes Bild umwandelt, um die Sicherheit zu prüfen, und dann die schlechten verwirft. Dieser Zyklus aus Erstellen und Überprüfen von Bildern ist so rechenintensiv, dass der Roboter einfriert, was eine Navigation in Echtzeit unmöglich macht.

Ein neuer Ansatz namens Hydra, der von Forschern mehrerer Universitäten entwickelt wurde, löst dieses Problem, indem er die Art und Weise ändert, wie der Roboter über Bewegung nachdenkt. Anstatt zu versuchen, jede mögliche Zukunft in hochauflösender Detailtreue zu imaginieren, lernt Hydra, in breiten, diskreten Konzepten der Bewegung zu denken – ähnlich wie ein Mensch, der an eine „Linkskurve“ oder einen „geraden Pfad“ denkt, anstatt den exakten Winkel jeder Radrotation zu berechnen. Die Forscher bauten ein System, in dem der Planer des Roboters innerhalb des Simulators selbst lebt und innerhalb einer komprimierten, abstrakten Karte von Möglichkeiten nach dem besten Pfad sucht, anstatt in einem riesigen, offenen Raum aus Pixeln. Dies ermöglicht es dem Roboter, tausende potenzielle Zukünfte in einem Bruchteil einer Sekunde zu bewerten und gefährliche Pfade zu verwerfen, noch bevor sie vollständig gezeichnet sind. Sobald ein sicherer Pfad gewählt wurde, übersetzt das System dieses abstrakte Konzept zurück in glatte, kontinuierliche Bewegungen, die die Motoren des Roboters ausführen können.

Die zentrale Innovation liegt in einer Technik, die die Autoren „diskrete latente Planung“ (discrete latent planning) nennen. In früheren Systemen, in denen ein Roboter, der durch einen Flur navigiert, einen kontinuierlichen Strom möglicher Trajektorien generierte, führten viele dieser Wege direkt gegen eine Wand. Das System musste dann jede dieser Trajektorien in ein visuelles Bild rendern, um zu sehen, ob eine Kollision stattfand – ein Prozess, der für einen fahrenden Roboter zu lange dauert. Hydra vermeidet diesen Engpass, indem es die Vorhersagen durch einen spezialisierten Filter leitet, der ähnliche Bewegungen in ein kleines, fest definiertes Vokabular von Intentionen gruppiert. Wenn der Roboter eine Zukunft in Betracht zieht, generiert er kein verschwommenes Bild eines Aufpralls; stattdessen wählt er ein Token aus seinem gelernten Vokabular, das eine „sichere Kurve“ oder eine „Kollision“ repräsentiert. Da diese Token aus einer endlichen Liste physisch möglicher Aktionen stammen, kann der Roboter sofort erkennen, dass ein Pfad, der in eine Wand führt, ungültig ist, ohne die Kollision jemals visualisieren zu müssen. Dieser Wechsel vom kontinuierlichen Raten zum diskreten Auswählen ermöglicht es dem System, gefährliche Optionen fast unmittelbar auszusortieren und seine Rechenleistung nur auf Pfade zu konzentrieren, die bereits als plausibel gelten.

Um sicherzustellen, dass diese abstrakten Entscheidungen zu einer glatten physischen Bewegung führen, koppelt Hydra diese diskrete Planung mit einer kontinuierlichen Ausführungsmethode. Sobald der Roboter den besten abstrakten Pfad ausgewählt hat, wandelt ein sekundäres System diese Wahl in die präzisen, flüssigen Befehle um, die für das Antrieb der Räder nötig sind. Dieser zweistufige Prozess – das Planen in einem vereinfachten, abstrakten Raum und das anschließende Ausführen in der realen Welt – erlaubt es dem Roboter, die Sicherheit eines Simulators mit der Geschwindigkeit eines reaktiven Fahrers zu vereinen. Die Forscher testeten dieses System an zwei verschiedenen physischen Robotern, einem fahrbaren Fahrzeug und einem vierbeinigen, hundähnlichen Roboter, in verschiedenen Umgebungen, einschließlich enger Korridore und Bereichen mit versteckten Hindernissen. In diesen Versuchen plante das System erfolgreich kollisionsfreie Pfade zu Zielen in etwa acht Metern Entfernung in weniger als einer Sekunde – eine Geschwindigkeit, die etwa fünfhundertmal schneller ist als bei bisherigen Methoden, die auf der Generierung und Überprüfung vollständiger Bilder basierten.

Die Ergebnisse dieser physischen Tests verdeutlichen die signifikante Lücke zwischen der alten Denkweise und der neuen. Wenn die Forscher Hydra mit bestehenden Systemen verglichen, die kontinuierliches Sampling nutzen, scheiterten die älteren Methoden oft daran, Hindernisse zu umfahren, und kollidierten häufig, weil sie zu viel Zeit mit der Berechnung unmöglicher Pfade verbrachten. Hydra hingegen erreichte eine perfekte Erfolgsquote in ungehinderten Umgebungen und navigierte in der überwiegenden Mehrheit der Versuche erfolgreich um versteckte Ecken und Hindernisse herum. Das System war zudem in der Lage, drohende Kollisionen zu erkennen, indem es bemerkte, wenn ein vorgeschlagener Pfad nicht in sein gelerntes Vokabular sicherer Bewegungen passte – ein Signal, das auftrat, lange bevor der Roboter physisch mit etwas zusammenstoßen würde. Diese Fähigkeit, unsichere Pfade basierend auf ihrer abstrakten Struktur statt auf ihrem visuellen Erscheinungsbild abzulehnen, erwies sich als robuster Weg, um Sicherheit zu gewährleisten, ohne den Entscheidungsprozess zu verlangsamen.

Trotz dieser Erfolge räumen die Forscher ein, dass das System nicht frei von Einschränkungen ist. Die Methode, Bewegungen in ein festes Vokabular zu gruppieren, führt dazu, dass der Roboter manchmal Schwierigkeiten hat, zwischen einem echten Hindernis und einem visuell komplexen, aber sicheren Bereich, wie etwa einem dichten Gebüsch, zu unterscheiden. Da das System darauf angewiesen ist, wie schwierig es ist, eine Szene aus ihren abstrakten Codes zu rekonstruieren, können hochgradig texturierte Umgebungen manchmal Fehlalarme auslösen, was dazu führt, dass der Roboter zögert, obwohl er sicher passieren könnte. Zudem hat das aktuelle System Schwierigkeiten, dynamische Objekte wie Menschen darzustellen, da es diese oft eher als Teil des Hintergrunds glättet, anstatt sie als eigenständige Entitäten zu behandeln. Diese Herausforderungen legen nahe, dass zukünftige Versionen die Art und Weise, wie sie die Welt repräsentieren, verfeinern müssen, um die volle Komplexität menschlicher Umgebungen zu bewältigen.

Letztendlich zeigt diese Arbeit, dass Roboter durch das Denken in Konzepten statt in Pixeln eine Echtzeit-Zielplanung erreichen können. Durch die Verlagerung des Planungsprozesses in den Simulator und die Beschränkung der Suche auf einen gelernten Satz gültiger Bewegungen haben die Forscher ein System geschaffen, das sowohl schnell als auch sicher ist. Die Ergebnisse legen nahe, dass der Schlüssel zur Skalierung von Weltmodellen für physische Roboter nicht darin besteht, sie detaillierter zu machen, sondern sie strukturierter zu gestalten, sodass sie die Zukunft auf eine Weise imaginieren können, die rechnerisch effizient und physisch fundiert ist. Dieser Ansatz bietet einen vielversprechenden Weg zu Robotern, die in der Lage sind, sich mit der gleichen intuitiven Voraussicht durch die reale Welt zu bewegen, wie Menschen es jeden Tag tun.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →