JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling
JEPA-WAM führt ein latentes Weltaktionsmodell ein, das auf einem vortrainierten V-JEPA-Raum aufbaut und durch einen gemeinsamen Prädiktor räumlich strukturierte Zukunftsvorhersage sowie kontinuierliche Aktionsgenerierung vereinigt, wodurch es ohne die Notwendigkeit eines groß angelegten Policy-Pretrainings Spitzenleistungen auf Benchmarks für robotische Manipulation erzielt.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie bringen einem Roboter das Kochen bei. Sie könnten ihm einfach ein Video zeigen, in dem ein Koch Zwiebeln schneidet, und sagen: „Mach das.“ Aber wenn der Roboter nur das exakte Aussehen dieses spezifischen Videos auswendig lernt, gerät er vielleicht in Panik, wenn der Koch einen anderen Hut trägt oder sich die Küchenbeleuchtung ändert. Dies ist die Herausforderung von Vision-Language-Action (VLA) Modellen: Sie sind großartig darin, Anweisungen in vertrauten Umgebungen zu befolgen, aber sie stolpern oft, wenn die Welt ein wenig anders aussieht als das, worauf sie trainiert wurden.
Um dies zu beheben, haben Wissenschaftler versucht, Roboter zu „Prädiktoren“ zu machen. Anstatt nur zu reagieren, versucht der Roboter sich vorzustellen, was als Nächstes passieren wird. Wenn er vorhersagen kann: „Wenn ich diese Tasse drücke, wird sie vom Tisch rutschen“, kann er besser planen. Doch einen Roboter zu bauen, der vollständige High-Definition-Videos der Zukunft generiert, ist so, als würde man von einem Schüler verlangen, einen ganzen Roman zu schreiben, nur um zu entscheiden, was als Nächstes zu tun ist – das kostet zu viel Zeit und Rechenleistung. Also suchten Forscher nach einer Abkürzung: einem „latenten“ Modell, das die Idee der Zukunft vorhersagt, ohne das ganze Bild zeichnen zu müssen. Aber hier ist der Haken: Viele dieser Abkürzungen verlieren entweder zu viele Details oder behandeln die Vorhersage und die Aktion als zwei separate, voneinander getrennte Aufgaben.
Dies führt uns zu JEPA-WAM, einem neuen Ansatz, der versucht, Roboter dazu zu bringen, den „Fluss der Zeit zu fühlen“, ohne sich mit dem Zeichnen jedes einzelnen Frames aufzuhalten. Er stellt eine einfache Frage: Können wir einen Roboter lehren, zu verstehen, wie sich die Welt verändert, und dieses Verständnis nutzen, um sich besser zu bewegen, alles in einer fließenden Bewegung?
Die Abkürzung des Roboters zum „Zeitgefühl“
Treffen Sie JEPA-WAM. Betrachten Sie es als einen Roboter, der nicht nur ein Foto der Gegenwart betrachtet und das nächste Foto errät; stattdessen lernt er die Beziehung zwischen den beiden.
Stellen Sie sich vor, Sie beobachten einen Zaubertrick. Ein Magier legt einen roten Ball in eine Box und zieht dann einen blauen Ball heraus. Ein Standard-Roboter würde vielleicht nur „Roter Ball → Blauer Ball“ auswendig lernen. Aber JEPA-WAM ist wie ein Detektiv, der den Übergang bemerkt: „Der rote Ball verschwand, die Box wackelte und ein blauer Ball erschien.“ Er lernt die Geschichte der Veränderung, nicht nur das Davor und Danach.
Die Forscher bauten dieses System auf einem vortrainierten „visuellen Gehirn“ namens V-JEPA auf. Sie können sich V-JEPA als einen Roboter vorstellen, der bereits Millionen von Videos gesehen und gelernt hat, wie Objekte sich bewegen und interagieren. JEPA-WAM nimmt dieses Gehirn und fügt ein spezielles „Zeitreise“-Modul hinzu.
Hier ist der Zaubertrick: Anstatt den Roboter zu bitten, ein verschwommenes Video der Zukunft zu generieren (was langsam und teuer ist), bittet JEPA-WAM den Roboter, eine gemeinsame Karte (Joint Map) vorherzusagen. Stellen Sie sich vor, Sie machen jetzt ein Foto der Küche und fünf Sekunden später ein Foto der Küche und stapeln sie übereinander. JEPA-WAM versucht nicht, das zukünftige Foto von Grund auf neu zu zeichnen. Stattdessen betrachtet es den Unterschied zwischen den beiden gestapelten Fotos und lernt vorherzusagen, wie genau die Pixel verschoben wurden. Es lernt, dass „die Tasse zwei Zoll nach links bewegt wurde“ und „die Schublade geöffnet wurde“, wodurch die feinen Details dessen, wo Dinge passierten, erhalten bleiben.
Das gemeinsame Gehirn: Ein Prädiktor, zwei Aufgaben
Der klügste Teil von JEPA-WAM ist die Art und Weise, wie es sein Gehirn nutzt. In vielen alten Systemen waren der Teil, der die Zukunft vorhersagt, und der Teil, der die Arme des Roboters bewegt, wie zwei verschiedene Personen, die durch eine Wand miteinander sprechen. Der eine rät die Zukunft, und der andere versucht zuzuhören.
JEPA-WAM verwendet einen Shared Predictor (Gemeinsamen Prädiktor). Stellen Sie sich einen einzelnen, superintelligenten Studenten vor, der eine Prüfung ablegt.
- Aufgabe A: Der Student betrachtet die aktuelle Szene und sagt voraus, wie sich die Welt verändern wird (das „Zeitgefühl“).
- Aufgabe B: Der Student nutzt dasselbe Verständnis, um zu entscheiden, wie er die Arme des Roboters bewegt (die „Aktion“).
Da der Student beide Aufgaben gleichzeitig ausführt, formt das Lernen der Zukunftsvorhersage direkt die Art und Weise, wie der Student sich bewegt. Die Arbeit legt nahe, dass diese enge Kopplung den Roboter viel intelligenter macht. Es ist wie ein Tänzer, der nicht nur Schritte auswendig lernt, sondern den Rhythmus der Musik versteht; die Bewegung fließt natürlich, weil Vorhersage und Aktion aus demselben Verständnis entstehen.
Funktioniert es tatsächlich?
Die Forscher testeten diese Idee in drei verschiedenen Welten: einer Standard-Videospiel-Simulation, einer chaotischeren Simulation mit zufälligen Objekten und einem echten Roboterarm in einem Labor.
In den Simulationen:
In einem Benchmark namens LIBERO-Plus, der testet, wie gut Roboter Veränderungen in der Umgebung handhaben (wie unterschiedliche Beleuchtung oder Objektpositionen), erreichte JEPA-WAM 79,2 %. Dies war das beste Ergebnis unter Robotern, die nicht auf massiven Mengen an Roboterdaten vortrainiert wurden. Noch beeindruckender: Als sie diesen „Zeitgefühl“-Trick auf ein bereits leistungsstarkes Robotergehirn namens π0.5 anwandten, sprang die Punktzahl von 84,5 % auf 86,3 %. Dies deutet darauf hin, dass selbst intelligente Roboter noch intelligenter werden können, wenn sie lernen, den Fluss der Zeit vorherzusagen.
In der realen Welt:
Das Team nahm seinen Roboter mit in ein echtes Labor mit einem Dual-Arm-Setup (zwei Roboterarme, die zusammenarbeiten). Sie gaben ihm Aufgaben wie das Stapeln von Blöcken, das Platzieren von Obst auf einem Teller oder das Öffnen einer Schublade.
- Wenn der Aufbau exakt wie erwartet war (In-Distribution), erreichte JEPA-WAM etwa 59,8 %.
- Wenn sie den Hintergrund veränderten oder die Objekte umstellten (Out-of-Distribution), bewältigte JEPA-WAM immer noch 54,2 %.
- Im Vergleich dazu sank ein Standard-Roboter (π0) von 51,8 % auf schwache 22,5 %, als sich die Umgebung änderte.
Dies zeigt, dass JEPA-WAM viel robuster ist. Es memoriert nicht eine spezifische Szene, sondern lernt die Logik, wie Objekte sich bewegen, sodass es mit Überraschungen umgehen kann.
Was es nicht ist (und was es ausschließt)
Das Paper weist sorgfältig darauf hin, was JEPA-WAM nicht ist.
- Es ist kein Videogenerator. Es versucht nicht, ein neues High-Definition-Video der Zukunft zu erstellen. Die Autoren argumentieren, dass der Versuch, jeden Pixel zu generieren, zu kostspielig und oft unnötig für die Steuerung eines Roboters ist.
- Es geht nicht nur darum, den Endzustand vorherzusagen. Die Forscher testeten eine Version, die nur das „Zukunftsbild“ ohne das „Gegenwartsbild“ betrachtete, und diese schnitt schlechter ab (77,3 % gegenüber 79,2 %). Dies beweist, dass das Verständnis der Beziehung zwischen „Jetzt“ und „Später“ wichtiger ist als nur das bloße Erraten des Endergebnisses.
- Es ist kein Allheilmittel für alles. Die Autoren merken an, dass, wenn dieselbe visuelle Szene zu zwei sehr unterschiedlichen Ergebnissen basierend auf einer spezifischen Anweisung führt (z. B. „drücke die Tasse“ vs. „ziehe die Tasse“), das Modell Schwierigkeiten haben könnte, da es sich auf visuelle Veränderungen statt auf sprachspezifische Ziele konzentriert.
Das Fazit
JEPA-WAM legt nahe, dass das Geheimnis, Roboter anpassungsfähiger zu machen, nicht nur darin besteht, ihnen mehr Daten oder größere Gehirne zu geben, sondern sie zu lehren, den Fluss der Zeit auf eine Weise zu verstehen, die ihre Handlungen direkt beeinflusst. Durch die Nutzung eines gemeinsamen Gehirns, um vorherzusagen, wie sich die Welt verändert und wie man sich bewegt, wird der Roboter eher wie ein geschickter Mensch, der sich an eine unordentliche Küche anpassen kann, ohne in Panik zu geraten.
Die Ergebnisse, gemessen in Simulationen und realen Versuchen, legen nahe, dass dieser „gemeinsame Vorhersage“-Ansatz ein leistungsstarker Weg ist, um Roboter zu bauen, die mit der Unvorhersehbarkeit der realen Welt umgehen können. Während es kein gelöstes Problem für jede mögliche Aufgabe ist, bietet es einen vielversprechenden neuen Weg für Roboter, die nicht nur gehorsam, sondern wirklich anpassungsfähig sind.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.