← Neueste Arbeiten
💻 computer science

GLAM: Training a latent world model over global spatiotemporal memory for active exploration and navigation

Das Papier präsentiert GLAM, ein zielgesteuertes latentes Weltmodell, das auf globalem spatiotemporalem Gedächtnis trainiert wurde und zukünftige Kartenrepräsentationen sowie Navigationswaypoints vorhersagt, um eine verbesserte aktive Exploration und semantische Navigation zu ermöglichen, was durch das GLAM NAV System demonstriert wird, welches die BSC-Nav Baseline bei HM3D-ObjectNav Aufgaben übertrifft.

Ursprüngliche Autoren: I-Tak Ieong, Ruizhi Feng, Zhaoyang Lu, Yifei Cao, Jiayao Zhao, Leon Li, Senhua Zhu, Wenbo Ding

Veröffentlicht 2026-09-16
📖 7 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: I-Tak Ieong, Ruizhi Feng, Zhaoyang Lu, Yifei Cao, Jiayao Zhao, Leon Li, Senhua Zhu, Wenbo Ding

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich einen Roboter vor, der einen Raum betritt, den er noch nie gesehen hat, und die Aufgabe hat, ein bestimmtes Objekt zu finden, wie zum Beispiel einen roten Stuhl, den er von seinem aktuellen Standpunkt aus nicht sehen kann. Um erfolgreich zu sein, darf der Roboter nicht einfach nur auf das reagieren, was unmittelbar vor seiner Kamera liegt. Er muss ein mentales Bild des Raums aufbauen, während er sich bewegt, sich erinnern, wo er gewesen ist, und vermuten, was um die nächste Ecke herum liegen könnte. Diese Fähigkeit, eine Karte im Gedächtnis zu behalten, vorherzusagen, wie sich diese Karte verändert, während der Roboter vorwärts schreitet, und diese Antizipation zu nutzen, um den nächsten Schritt zu planen, ist der Kern der Herausforderung der aktiven Exploration. Jahrelang haben Forscher versucht, Maschinen diese Fähigkeit beizubringen, indem sie die Welt in hoher Auflösung, Pixel für Pixel, rekonstruieren ließen oder sich auf vorgefertigte Karten verließen. Ein neuer Ansatz legt jedoch nahe, dass ein Roboter nicht jeden Ziegelstein und jeden Schatten sehen muss, um zu navigieren; er muss lediglich die Struktur des Raums und den wahrscheinlichen Pfad zu seinem Ziel verstehen.

Ein Team von Forschern hat ein System namens GLAM entwickelt, was für ein zielgerichtetes latentes Weltmodell steht, das über ein globales spatiotemporales Gedächtnis trainiert wurde. Einfacher ausgedrückt handelt es sich hierbei um ein Navigationssystem, das lernt, das zukünftige Layout eines Raums und den besten Pfad zu einem Ziel vorherzusagen, ohne die visuelle Welt in perfekter Detailtreue rekonstruieren zu müssen. Anstatt zu versuchen, einen neuen Videorahmen zu generieren, der zeigt, wie der Raum in der nächsten Sekunde aussehen wird, sagt das System eine komprimierte, abstrakte Repräsentation der Karte und einen verborgenen Plan vor, wohin es als Nächstes steuern soll. Dieser Ansatz ist inspiriert von der Art und Weise, wie biologische Gehirne, insbesondere der Hippocampus, räumliche Erinnerungen organisieren und zukünftige Szenarien simulieren. Die Forscher bauten ein vollständiges Navigationssystem um dieses Modell herum, genannt GLAM NAV, das Online-Kartierung, Gedächtnisabruf und prädiktive Planung in einer einzigen Schleife kombiniert.

Das System arbeitet, indem es während der Bewegung des Roboters ständig ein spärliches, digitales Gedächtnis der Umgebung aktualisiert. Dieses Gedächtnis ist kein vollumfängliches 3D-Foto, sondern eine Sammlung von Schlüsselmerkmalen und räumlichen Beziehungen. Wenn der Roboter ein Ziel finden muss, nutzt er seine aktuelle Position und die Erinnerung an das, was er bereits gesehen hat, um eine einfache Frage zu stellen: „Wenn ich mich in diese Richtung bewege, wie wird die Karte aussehen und werde ich meinem Ziel näher kommen?“ Das GLAM-Modell beantwortet dies durch die gleichzeitige Vorhersage zweier Dinge. Erstens prognostiziert es, wie sich die Karten-Token – die abstrakten Bausteine seines Gedächtnisses – im Zuge der Erkundung durch den Roboter entwickeln werden. Zweitens sagt es einen latenten Wegpunkt voraus, was eine verborgene Repräsentation des nächsten Schrittes ist, den der Roboter unternehmen sollte. Diese Vorhersagen finden in einem gemeinsamen Raum statt, was bedeutet, dass das Modell lernt, die sich verändernde Karte direkt mit der notwendigen Bewegung zu verknüpfen, ohne jemals zu versuchen, die rohen visuellen Bilder der Zukunft zu rekonstruieren.

Um dieses System zu trainieren, schickten die Forscher keine Roboter in die reale Welt, um Fehler zu machen. Stattdessen verwendeten sie einen hochpräzisen Simulator namens Habitat, der hunderte detaillierter 3D-Scans realer Innenräume wie Wohnungen und Büros enthält. Sie spielten Experten-Trajektorien ab – Pfade, die von einem perfekten, computergesteuerten Agenten genommen wurden, der genau wusste, wo sich die Objekte befanden – und zerlegten diese Pfade in tausende Trainingsproben. Das Modell lernte, eine Historie von Karten-Token und ein Ziel zu betrachten und dann die zukünftige Karte sowie den nächsten Wegpunkt vorherzusagen. Entscheidend war, dass das System darauf getrimmt wurde, die Aufgabe der Rekonstruktion der visuellen Welt zu ignorieren. Es konzentrierte sich vollständig darauf, die Struktur des Raums und den Plan zur Navigation vorherzusagen. Vor dem Training des Hauptmodells trainierten die Forscher zudem eine separate Komponente vor, um zu verstehen, wie diese verborgenen Wegpunkt-Pläne in tatsächliche physische Bewegungen übersetzt werden können, um sicherzustellen, dass die Vorhersagen in reale Befehle umgewandelt werden konnten.

In Tests im Simulator zeigten die Ergebnisse, dass dieser prädiktive Ansatz besser funktionierte als bisherige Methoden, die auf unterschiedlichen Arten von Gedächtnisstrukturen basierten. Auf einem spezifischen Satz von fünfzig Prozent der Test-Szenen fand das neue System, GLAM NAV, das Zielobjekt in 86,89 Prozent der Versuche erfolgreich, was eine signifikante Verbesserung gegenüber der Erfolgsquote von 78,50 Prozent des Vergleichssystems darstellte. Es erreichte das Ziel zudem effizienter, wobei ein Metrik namens „Success weighted by Path Length“ von 47,70 Prozent auf 48,35 Prozent anstieg. Diese Zahlen legen nahe, dass der Roboter durch die gleichzeitige Vorhersage der zukünftigen Struktur der Karte und des Pfades zuverlässiger beim Auffinden des Weges wurde, selbst wenn das Ziel anfangs außer Sichtweite war. Das System hat nicht bloß eine Route auswendig gelernt; es hat gelernt, das Layout der Umgebung zu antizipieren und seinen Plan basierend auf dieser Antizipation anzupassen.

Um zu beweisen, dass dies nicht lediglich ein Resultat des Simulators war, setzten die Forscher das System auf einem physischen Roboter ein – einem humanoiden Radroboter mit zwei Armen – in einer realen Büroumgebung. Im ersten realen Test wurde der Roboter gebeten, eine Topfpflanze in einem Raum zu finden, den er noch nie gesehen hatte und für den keine fertige Karte bereitgestellt wurde. Während er sich bewegte, baute er sein eigenes Gedächtnis des Raums auf, indem er neue visuelle Beobachtungen mit seiner wachsenden Karte verknüpfte. Er navigierte erfolgreich zur Pflanze und demonstrierte damit, dass das System in der Lage ist, aus dem Nichts ein nützliches räumliches Gedächtnis aufzubauen. In einem zweiten Test wurde der Roboter gebeten, sich daran zu erinnern, wo er die Pflanze gesehen hatte, nachdem das Objekt wieder außer Sicht geraten war. Das System rief den gespeicherten Ort aus seinem Gedächtnis ab und navigierte erfolgreich zurück zu dieser Stelle. Diese Demonstrationen bestätigten, dass die abstrakten Vorhersagen des Modells einen echten Roboter durch eine echte Umgebung führen konnten, indem das Gedächtnis die Lücke zwischen dem, was gesehen wird, und dem, was benötigt wird, überbrückte.

Trotz dieser Erfolge sind die Forscher sorgfältig darin, die Grenzen ihrer Arbeit zu benennen. Das System lernt von den Pfaden, die Experten-Agenten im Simulator genommen haben, und ist daher am effektivsten, wenn sich das Verhalten des Roboters innerhalb der Muster bewegt, die während des Trainings gesehen wurden. Es ist kein allgemeiner Simulator, der das Ergebnis jeder beliebigen Aktion vorhersagen kann; vielmehr ist es ein zielgerichtetes Werkzeug, das die wahrscheinlichste Karte und den Pfad für ein spezifisches Ziel schätzt. Das Modell liefert zudem eine einzige, definitive Vorhersage anstelle einer Bandbreite an Möglichkeiten, was bedeutet, dass es die Unsicherheit seiner Vermutungen nicht explizit berechnet. Wenn der Roboter auf ein Layout stößt, das sich stark von dem gelernten unterscheidet, oder wenn seine Sensoren driften und die Positionsbestimmung verlieren, könnte das System Schwierigkeiten bekommen. Die Forscher betonen, dass der Roboter weiterhin auf Echtzeit-Beobachtungen angewiesen ist, um seinen Standort zu verifizieren und Kollisionen zu vermeiden, wobei die Vorhersagen nur zur Führung seiner Suche dienen.

Die Arbeit stellt einen Wandel in der Art und Weise dar, wie wir über die Roboternavigation denken. Anstatt zu versuchen, ein perfektes, hochauflösendes Abbild der Welt in einem Computer zu bauen, lernt das System, mit einer funktionalen, abstrakten Version der Karte zu arbeiten, die für die Planung ausreichend ist. Indem die Forscher die Vorhersage der zukünftigen Karte und die Planung des nächsten Schrittes als eine einzige, verbundene Aufgabe behandelt haben, haben sie ein System geschaffen, das sowohl zuverlässiger beim Finden von Zielen als auch in der Lage ist, in realen Umgebungen zu operieren. Die Ergebnisse legen nahe, dass ein Roboter für eine effektive Exploration nicht alles sehen muss; er muss die Struktur des Raums gut genug verstehen, um sich vorstellen zu können, was als Nächstes kommt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →