← Neueste Arbeiten
💻 computer science

minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models

Das Papier stellt minWM vor, ein vollständiges Open-Source-Framework, das bestehende bidirektionale Videofundamentmodelle durch eine umfassende Pipeline aus Feinabstimmung, kausalem Erzwingen des Trainings und Destillation in Echtzeit-fähige, kamerasteuerbare, wenige Schritte umfassende autoregressive Weltmodelle verwandelt.

Ursprüngliche Autoren: Min Zhao, Hongzhou Zhu, Bokai Yan, Zihan Zhou, Yimin Chen, Wenqiang Sun, Kaiwen Zheng, Guande He, Xiao Yang, Chongxuan Li, Fan Bao, Jun Zhu

Veröffentlicht 2026-05-29
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Min Zhao, Hongzhou Zhu, Bokai Yan, Zihan Zhou, Yimin Chen, Wenqiang Sun, Kaiwen Zheng, Guande He, Xiao Yang, Chongxuan Li, Fan Bao, Jun Zhu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie haben einen brillanten High-End-Filmregisseur (ein Video-Foundation-Modell), der auf Basis eines Drehbuchs atemberaubende, hochwertige Filme erstellen kann. Dieser Regisseur arbeitet jedoch sehr langsam: Er plant den gesamten Film Szenen für Szenen, bevor er Ihnen auch nur ein einziges Bild zeigt. Wenn Sie mitten im Film die Kameraeinstellung ändern möchten, muss er anhalten, den gesamten Film neu planen und von vorne beginnen. Das ist großartig für die Herstellung eines polierten Films, aber katastrophal für ein Videospiel oder einen Live-Chat, bei dem Sie sofortige Reaktionen benötigen.

minWM ist ein neues „Trainingslager" und ein „Werkzeugkasten", der entwickelt wurde, um diesen langsamen, perfektionistischen Regisseur in einen Echtzeit-Interaktionsregisseur zu verwandeln, der sofort auf Ihre Befehle reagieren kann, ohne dabei seine künstlerische Qualität zu verlieren.

So funktioniert minWM, aufgeschlüsselt in einfache Schritte:

1. Das Problem: Der „langsame Regisseur"

Aktuelle Video-KI-Modelle sind wie der langsame Regisseur. Sie sind erstaunlich darin, schöne Videos zu erstellen, aber sie sind bidirektional. Das bedeutet, sie betrachten Anfang, Mitte und Ende eines Videos gleichzeitig, um sicherzustellen, dass alles perfekt zusammenpasst.

  • Das Problem: Wenn Sie die Kamera in Echtzeit bewegen oder die Szene ändern möchten, kann dieses Modell dies nicht schnell tun. Es dauert zu lange, über das gesamte Video „nachzudenken", bevor es Ihnen das erste Bild zeigt.

2. Die Lösung: Das minWM „Trainingslager"

minWM ist ein Full-Stack-Framework (ein vollständiger Satz von Werkzeugen), das einen bestehenden langsamen Regisseur nimmt und ihn trainiert, zu einem schnellen, interaktiven Darsteller zu werden. Dies geschieht in zwei Hauptphasen:

Phase 1: Lernen, die Kamera zu bewegen (Die „Kamerasteuerung"-Lektion)

Zuerst lehrt das Framework den langsamen Regisseur, wie er spezifische Kamerainstruktionen befolgt.

  • Die Analogie: Stellen Sie sich vor, Sie bringen dem Regisseur bei, eine Kamera auf einem Gimbal zu halten. Anstatt nur zu raten, wo die Kamera sein sollte, lernen sie, einem präzisen Pfad zu folgen, den Sie für sie zeichnen.
  • Wie: Das Team verwendet eine spezielle Technik namens PRoPE. Denken Sie daran, als würden Sie dem Regisseur eine Brille mit „Smart Glasses" geben, die genau versteht, wo sich die Kamera im 3D-Raum befindet. Sie üben an Videos, bei denen die Kamerabewegung perfekt bekannt ist (wie bei einer 3D-Animation), damit der Regisseur die exakte Beziehung zwischen „nach links bewegen" und „die Ansicht verschiebt sich nach links" lernt.

Phase 2: Beschleunigung des Prozesses (Die „Distillation"-Lektion)

Jetzt, wo der Regisseur Kamerabewegungen folgen kann, ist er immer noch zu langsam. Er plant immer noch den gesamten Film, bevor er ein Bild zeigt. minWM verwendet eine Technik namens Causal Forcing, um ihn zu beschleunigen.

  • Die Analogie: Stellen Sie sich einen Schüler (das neue schnelle Modell) vor, der neben einem Meisterlehrer (dem langsamen, hochwertigen Modell) sitzt.
    1. Teacher Forcing: Der Schüler lernt, die Geschichte Satz für Satz (Bild für Bild) zu schreiben, anstatt das ganze Buch auf einmal zu planen. Das macht ihn schneller.
    2. Die „Spickzettel" (Distillation): Um den Schüler noch schneller zu machen, wird er trainiert, Schritte zu überspringen. Anstatt 50 kleine Schritte zu machen, um ein Bild zu zeichnen, lernt er, es in nur 4 große, selbstbewusste Striche zu tun.
    3. Das Sicherheitsnetz (Asymmetric DMD): Es besteht das Risiko, dass der Schüler beim Beschleunigen anfängt, unordentliche Bilder zu zeichnen. Um dies zu beheben, überprüft der Schüler gelegentlich seine Arbeit gegen den ursprünglichen Meisterlehrer. Wenn die schnelle Zeichnung des Schülers etwas abwegig aussieht, korrigiert der Lehrer ihn sanft, sodass das Endergebnis immer noch von hoher Qualität ist.

3. Die Ergebnisse: Vom „Kino" zum „Videospiel"

Die Arbeit zeigt, dass dieser Prozess unglaublich gut funktioniert:

  • Geschwindigkeit: Die neuen Modelle sind über 200-mal schneller beim Anzeigen des ersten Bildes als die ursprünglichen langsamen Modelle.
    • Vorher: Sie warten über 10 Sekunden, bis Sie das erste Bild sehen.
    • Nachher: Sie sehen das erste Bild in etwa 1 Sekunde.
  • Kontrolle: Die schnellen Modelle können Ihre Kamerabefehle immer noch perfekt befolgen. Sie können dem Video sagen, es soll „nach links schwenken" oder „heranzoomen", und es passiert sofort.
  • Flexibilität: Das Team hat dies an zwei verschiedenen Arten von „Regisseuren" (den Modellen Wan2.1 und HY1.5) getestet, und es funktionierte für beide, was beweist, dass die Methode ein universelles Werkzeugkasten ist und nicht nur eine einmalige Lösung.

4. Wichtige Erkenntnisse (Die „Ablationsstudien")

Die Arbeit teilt auch einige praktische Tipps, die sie beim Aufbau entdeckt haben, die wie „Faustregeln" für jeden sind, der dies versucht:

  • Gute Daten sind der Schlüssel: Sie können den Regisseur nicht einfach mit unscharfen, geratenen Kamerabewegungen unterrichten. Sie benötigen „Ground Truth"-Daten – Videos, bei denen der Kamerapfad mathematisch perfekt ist (wie 3D-Rekonstruktionen). Wenn Sie unordentliche Daten verwenden, gerät der Regisseur in Verwirrung.
  • Übung macht den Meister: Der Regisseur muss eine Weile trainieren (etwa 8.000 Schritte), bevor er wirklich versteht, wie man die Kamera bewegt. Wenn Sie zu früh aufhören, wird er Ihren Befehlen nicht folgen.
  • Sparen Sie nicht an der Klassengröße: Sie benötigen eine angemessene Anzahl von Beispielen (eine „Batch-Größe"), damit der Regisseur lernen kann. Wenn die Klasse zu klein ist (weniger als 4 Beispiele), scheitert er beim Erlernen der Kamerabewegungen.

Zusammenfassung

minWM ist ein Open-Source-Rezept, das ein hochwertiges, langsames Video-KI-Modell in eine Echtzeit-Interaktions-Video-Engine verwandelt. Es lehrt die KI, Kamerabefehle zu befolgen, und beschleunigt sie dann, sodass sie Video generieren kann, während Sie zuschauen. Dies macht es möglich, interaktive Video-Welten (wie Videospiele oder Live-Simulationen) zu erstellen, die mit herkömmlicher Video-KI zuvor unmöglich waren.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →