← Neueste Arbeiten
💻 computer science

Discrete-WAM: Unified Discrete Vision-Action Token Editing for World-Policy Learning

Discrete-WAM führt ein einheitliches diskretes latentes Framework ein, das Vision- und Action-Token aufeinander abstimmt, um durch die gemeinsame Modellierung von Weltdynamiken und Entscheidungsstrategien mittels eines geteilten diskreten Diffusionsprozesses kompositorische kausale Argumentation, kontrollierbare Generierung und kontrafaktische Planung für das autonome Fahren zu ermöglichen.

Ursprüngliche Autoren: Ziyang Yao, Haochen Liu, Yuncheng Jiang, Zeyu Zhu, Zibin Guo, Jingru Wang, Tianle Liu, Jianwei Cui, Kuiyuan Yang, Hongwei Xie, Jingwei Zhao, Guang Chen, Hangjun Ye

Veröffentlicht 2026-06-05
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Ziyang Yao, Haochen Liu, Yuncheng Jiang, Zeyu Zhu, Zibin Guo, Jingru Wang, Tianle Liu, Jianwei Cui, Kuiyuan Yang, Hongwei Xie, Jingwei Zhao, Guang Chen, Hangjun Ye

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie bringen einem Roboter das Autofahren bei. Die meisten aktuellen Methoden sind so, als würde man einem Schüler das Autofahren beibringen, indem man ihm ein Video eines perfekten Fahrers zeigt und sagt: „Kopiere exakt das, was du siehst.“ Der Roboter lernt, die Bewegungen nachzuahmen, aber er versteht nicht wirklich, warum der Fahrer das Lenkrad gedreht hat oder wie diese Drehung beeinflusst, was als Nächstes passiert. Er merkt sich nur ein Muster.

Andere Methoden versuchen, ein „Weltmodell“ aufzubauen – eine mentale Simulation der Zukunft. Diese sind jedoch oft so, als würde man versuchen, das Wetter anhand einer verschwommenen, kontinuierlichen Wolke aus Daten vorherzusagen. Es ist schwer, diese Wolke in spezifische, logische Schritte zu unterteilen wie: „Wenn ich nach links abbiege, bewegt sich das Auto neben mir nach rechts.“

Discrete-WAM (von Xiaomi) ist ein neuer Ansatz, der versucht, beide Probleme zu lösen. So funktioniert es, einfach erklärt:

1. Der „Lego“-Ansatz (Diskrete Token)

Anstatt die Welt als ein glattes, verschwommenes Video oder eine komplexe mathematische Gleichung zu sehen, zerlegt Discrete-WAM alles in Lego-Steine (genannt „diskrete Token“).

  • Visuelles: Jeder Teil des Kamerabildes wird in einen spezifischen Lego-Stein verwandelt.
  • Aktionen: Jede Bewegung, die das Auto macht (Beschleunigen, Lenken), ist ebenfalls ein spezifischer Lego-Stein.
  • Die Magie: Da sowohl das Bild als auch die Aktion aus der gleichen Art von Lego-Steinen bestehen, kann die KI sie ganz einfach mischen und kombinieren. Sie kann ein Bild der Straße betrachten, einen „Linksabbiegen“-Stein aufheben und ihn an das Bild anheften, um zu sehen, wie die Zukunft aussieht.

2. Der „Edit“-Button (Vereinheitlichte Generierung)

Betrachten Sie die KI nicht als eine Maschine, die nur die Zukunft vorhersagt, sondern als einen Editor mit einem „Suchen und Ersetzen“-Werkzeug.

  • Der Prozess: Die KI beginnt mit einem groben Entwurf der Zukunft (eine verschwommene Vermutung der Straße und des Pfades des Autos).
  • Iterative Verfeinerung: Sie geht diesen Entwurf dann mehrmals durch, wie ein Autor, der eine Geschichte bearbeitet. In jeder Runde schaut sie sich die „Lego-Steine“ an, die falsch oder unsicher erscheinen, und tauscht sie gegen bessere aus.
  • Warum das hilft: Dies ermöglicht es der KI, verschiedene „Was-wäre-wenn“-Szenarien auszuprobieren. Sie kann fragen: „Was, wenn ich hier nach links abbiege?“ und sofort das zukünftige Bild bearbeiten, um das Ergebnis zu zeigen, und dann fragen: „Was, wenn ich nach rechts abbiege?“ und auch das bearbeiten. Sie muss sich nicht sofort auf nur einen Weg festlegen.

3. „Kapitän und Crew“ (Hierarchische Planung)

Das Paper führt eine intelligente Art der Entscheidungsfindung ein, indem es die Aufgabe in zwei Rollen aufteilt:

  • Der Kapitän (Hochgradige Entscheidung): Dieser Teil der KI trifft die großen, einfachen Entscheidungen: „Ich werde die Spur wechseln“ oder „Ich werde anhalten“. Es ist wie ein Kapitän, der einen allgemeinen Befehl brüllt.
  • Die Crew (Niedergradige Aktion): Sobald der Kapitän den Befehl gibt, findet die Crew die flüssigen, detaillierten Bewegungen, um dies umzusetzen. Sie kümmern sich um die spezifischen Lenk- und Geschwindigkeitsanpassungen.
  • Der Vorteil: Dies verhindert, dass die KI verwirrt wird. Wenn sie versucht, jede winzige Radbewegung gleichzeitig zu berechnen, könnte sie stecken bleiben. Durch die Trennung der „großen Idee“ von den „feinen Details“ bleibt sie stabil und sicher.

4. Der „Sicherheitssimulator“ (Kontrafaktisches Denken)

Da die KI die Zukunft so einfach bearbeiten kann, fungiert sie wie ein Flugsimulator für das Auto.

  • Sie kann eine Simulation laufen lassen, in der das Auto normal fährt, und sehen, ob es sicher ist.
  • Dann kann sie die Simulation „editieren“, um zu fragen: „Was, wenn ein Fußgänger auf die Straße tritt?“ oder „Was, wenn ich zu spät bremse?“
  • Wenn die Simulation einen Crash zeigt (eine „Überraschung“, die die KI nicht erwartet hat), weiß das System, dass dieser Pfad gefährlich ist. Dies hilft dem Auto, Unfälle zu vermeiden, bevor sie passieren, indem es gefährliche Szenarien zuerst im Geist testet.

Die Ergebnisse

Das Paper testete dieses System auf riesigen Datensätzen realer Fahrszenarien.

  • Leistung: Es fuhr genauso gut wie oder besser als die derzeitigen Top-Systeme.
  • Sicherheit: Es war besser darin, Kollisionen zu vermeiden und Verkehrsregeln zu befolgen.
  • Kreativität: Im Gegensatz zu anderen Systemen, die nur das kopieren, was sie gesehen haben, konnte dieses System neue, sichere Fahrwege generieren, die es zuvor noch nicht gesehen hatte, was beweist, dass es die Regeln des Straßenverkehrs tatsächlich versteht.

Kurz gesagt: Discrete-WAM lehrt ein selbstfahrendes Auto, in „Lego-Steinen“ zu denken. Dies ermöglicht es ihm, die Zukunft wie ein Videoeditor zu bearbeiten, große Entscheidungen von kleinen Details zu trennen und mentale Simulationen durchzuführen, um zu prüfen, ob ein Manöver sicher ist, bevor es tatsächlich ausgeführt wird.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →