← Neueste Arbeiten
🤖 AI

Sword: Style-Robust World Models as Simulators via Dynamic Latent Bootstrapping for VLA Policy Post-Training

Das Papier schlägt Sword vor, ein robustes World-Model-Framework, das strukturgeleitete Stil-Augmentierung und dynamisches latentes Bootstrapping einsetzt, um Generalisierungsfehler und Fehlerakkumulation in geschlossenen Rollouts zu mindern und dadurch die Fidelity sowie den Erfolg des Reinforcement-Learning-Nachtrainings von Vision-Language-Action-Richtlinien auf dem LIBERO-Benchmark erheblich zu verbessern.

Ursprüngliche Autoren: Jiaxuan Gao, Yongjian Guo, Zhong Guan, Wen Huang, Wanlun Ma, Xi Xiao, Junwu Xiong, Sheng Wen

Veröffentlicht 2026-05-11
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Jiaxuan Gao, Yongjian Guo, Zhong Guan, Wen Huang, Wanlun Ma, Xi Xiao, Junwu Xiong, Sheng Wen

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie lehren einen Roboter eine Aufgabe, wie etwa das Aufheben einer Tasse. Normalerweise müssen Sie den Roboter in der realen Welt üben lassen, was langsam, teuer und riskant ist, falls er etwas zerbricht. Um dies zu lösen, verwenden Wissenschaftler „Weltmodelle". Betrachten Sie ein Weltmodell als einen superintelligenten Videospiel-Engine, den der Roboter nutzen kann, um innerhalb seines eigenen Geistes zu üben. Anstatt seinen echten Arm zu bewegen, „stellt" sich der Roboter die Zukunft vor: „Wenn ich meinen Arm so bewege, wird die Tasse im nächsten Moment so aussehen."

Allerdings haben aktuelle Videospiel-Engines für Roboter zwei große Probleme:

  1. Sie sind zu wählerisch bezüglich der Szenerie. Wenn Sie die Beleuchtung oder die Farbe des Tisches in der realen Welt ändern, gerät die Vorstellungskraft des Roboters durcheinander und beginnt zu halluzinieren (Dinge zu sehen, die nicht vorhanden sind).
  2. Sie werden schlechter, je länger sie spielen. Wenn der Roboter versucht, eine lange Abfolge von Ereignissen vorzustellen, häufen sich winzige Fehler in den ersten paar Sekunden an und verwandeln den Rest des Videos in einen verschwommenen, unsinnigen Durcheinander.

Die Arbeit stellt ein neues System namens Sword vor, um diese Probleme zu beheben. Hier ist die Funktionsweise, unter Verwendung einfacher Analogien:

1. Das „Stil-wechselnde" Fitnessstudio (Strukturgeführte Stil-Augmentierung)

Das Problem: Stellen Sie sich einen Roboter vor, der nur in einem Raum mit blauen Wänden und hellem Licht geübt hat. Wenn Sie ihn in einen Raum mit gelben Wänden und gedämpftem Licht stellen, gerät er in Panik, weil er nie gelernt hat, dass „Wände" Wände sind, unabhängig von ihrer Farbe. Er hat die Farbe auswendig gelernt statt die Physik.

Die Sword-Lösung: Die Autoren setzen den Roboter in ein „stil-wechselndes Fitnessstudio". Sie verwenden ein spezielles Werkzeug, um das Aussehen der Trainingsvideos ständig zu verändern – die Wände werden rot, das Licht gedimmt, der Tisch hat eine Holzmaserung oder der Roboterarm eine andere Farbe.

  • Der Haken: Sie ändern die Farben nicht einfach zufällig; sie verwenden ein „Sicherheitsnetz" (geometrische Führung), um sicherzustellen, dass der Roboter den Überblick darüber verliert, wo sich die Objekte befinden. Der Tisch kann die Farbe ändern, aber er kann sich nicht plötzlich in eine schwebende Wolke verwandeln.
  • Das Ergebnis: Der Roboter hört auf, spezifische Farben auswendig zu lernen, und beginnt, die wahren Regeln der Physik zu verstehen. Er lernt, dass „wenn ich die Tasse schiebe, sie rutscht", egal wie die Tasse aussieht. Dies macht den Roboter viel besser darin, neue, unbekannte Umgebungen zu bewältigen.

2. Das „Selbstkorrigierende Proben" (Dynamisches Latentes Bootstrapping)

Das Problem: Stellen Sie sich einen Schüler vor, der eine Prüfung ablegt. Im Unterricht (Training) gibt der Lehrer ihm die Antworten auf die vorherigen Fragen, damit er sich auf die nächste konzentrieren kann. Dies nennt man „Teacher Forcing". Aber bei der echten Prüfung (Inferenz) muss der Schüler sich an seine eigenen vorherigen Antworten erinnern, um das nächste Problem zu lösen. Wenn er früh einen kleinen Fehler macht, gerät er in eine Schleife von Fehlern.

Die Sword-Lösung: Die Autoren entwickelten eine Methode namens „Selbstkorrigierendes Proben", die Dynamisches Latentes Bootstrapping heißt.

  • Anstatt dem Roboter während des Trainings immer die perfekten „Ground-Truth"-Antworten zu geben, lassen sie ihn langsam beginnen, seine eigenen Vorhersagen als Ausgangspunkt für den nächsten Schritt zu verwenden.
  • Der „Gedächtnis-Trick": Um dies zu tun, ohne dass das Gedächtnis des Roboters explodiert (was massiven Computerspeicher erfordern würde), komprimieren sie die „Gedanken" des Roboters in einen winzigen, effizienten Cache (wie ein Hochgeschwindigkeits-Notizblock), anstatt vollständige Videoframes zu speichern.
  • Das Ergebnis: Der Roboter lernt, sich von seinen eigenen Fehlern zu erholen, während er noch lernt. Er übt genau so, wie er es in der realen Welt durchführen wird, sodass er, wenn er die Aufgabe tatsächlich ausführen muss, nicht nach ein paar Sekunden zusammenbricht.

Die Ergebnisse

Das Team testete Sword an einem Standard-Roboter-Benchmark namens LIBERO.

  • Visuelle Qualität: Als aufgefordert, eine lange Abfolge von Ereignissen vorzustellen, hielt Sword das Video scharf und klar. Die alte Methode (WoVR) wurde verschwommen und begann, Dinge zu sehen, die nicht vorhanden waren (Halluzinationen).
  • Robustheit: Wenn sich die Beleuchtung oder der Hintergrund änderte, funktionierte Sword weiterhin perfekt. Die alte Methode versagte sofort.
  • Erfolgsrate: Als sie Sword verwendeten, um eine Roboter-Policy mittels Reinforcement Learning zu trainieren, gelang dem Roboter die Bewältigung von Aufgaben viel häufiger als beim Training mit dem alten Simulator.

Kurz gesagt: Sword ist eine bessere „Traummaschine" für Roboter. Es lehrt sie, oberflächliche Ablenkungen (wie Lichtänderungen) zu ignorieren, und trainiert sie, mit ihren eigenen Fehlern umzugehen, was zu einem Roboter führt, der die Zukunft genau vorstellen und sicher in der realen Welt handeln kann.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →