← Neueste Arbeiten
💻 computer science

4Director: Controlling Video World Models with Rigid 3D Geometry

Das Paper stellt 4Director vor, ein Video-World-Model, das durch die Konditionierung der Generierung auf explizite 4D-Rigid-Geometrie und einen Motion Adapter eine präzise Kamera- und Objektsteuerung erreicht, was durch einen neuen Datensatz und eine neue Metrik validiert wurde, um bestehende Methoden in Bezug auf visuelle Qualität und Bewegungskonsistenz zu übertreffen.

Ursprüngliche Autoren: Wei Cao, Hao Zhang, Vikram Voleti, Yuqun Wu, Mallikarjun B R, Shimon Vainer, Mark Boss, Yaoyao Liu

Veröffentlicht 2026-10-02
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Wei Cao, Hao Zhang, Vikram Voleti, Yuqun Wu, Mallikarjun B R, Shimon Vainer, Mark Boss, Yaoyao Liu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich eine Welt vor, in der ein Computer ein einzelnes Foto betrachten und sich dann vorstellen kann, wie ein Film aus diesem Standmoment heraus abläuft. Dies ist das Versprechen von Video-Weltmodellen, einem sich rasant entwickelnden Feld der künstlichen Intelligenz, in dem Maschinen lernen, vorherzusagen, wie sich eine Szene im Laufe der Zeit verändert. Jahrelang haben Forscher diesen Systemen beigebracht, bewegte Bilder zu erzeugen, indem sie ihnen tausende Stunden Videomaterial zeigten, in der Hoffnung, dass der Computer die Regeln der Physik und Bewegung von selbst lernt. Doch ein erhebliches Hindernis blieb bestehen: Während diese Computer immer besser darin werden, realistische Bewegungen zu erzeugen, sind sie notorisch schwer zu steuern. Wenn ein Nutzer möchte, dass sich ein bestimmtes Objekt um die eigene Achse dreht oder eine Kamera um eine Ecke schwenkt, ignoriert der Computer oft die Anweisung oder erzeugt ein Ergebnis, das zwar plausibel aussieht, aber geometrisch falsch ist. Das Objekt könnte schrumpfen, anstatt sich zu entfernen, oder es könnte zu einem geisterhaften Wischer verschwimmen, während sich die Kamera bewegt. Die Kernherausforderung bestand darin, die Lücke zwischen der klaren, dreidimensionalen Absicht eines Menschen und der Tendenz des Computers, basierend auf flachen, zweidimensionalen Mustern zu raten, zu schließen.

Ein Forscherteam von Stability AI und der University of Illinois Urbana-Champaign hat mit 4Director einen neuen Ansatz vorgestellt, um dieses Problem zu lösen. Anstatt den Computer raten zu lassen, welchen Pfad ein Objekt nimmt, gibt 4Director dem Computer eine vollständige, dreidimensionale Karte der Szene, noch bevor die Videogenerierung überhaupt beginnt. In diesem System wird jedes Objekt in einem Ausgangsfoto als ein solides, digitales 3D-Modell rekonstruiert, ganz ähnlich wie ein Bildhauer, der eine Tonfigur erschafft, die eine Vorder-, eine Rück- und Seitenansicht besitzt, selbst wenn das ursprüngliche Foto nur die Vorderseite zeigte. Auch der Hintergrund wird in eine Punktwolke im Raum gehoben. Sobald diese digitale Welt gebaut ist, kann der Nutzer einen Pfad für die Kamera und einen Pfad für das Objekt zeichnen, genau wie ein Filmregisseur eine Einstellung plant. Der Computer bewegt diese soliden 3D-Modelle dann entlang der vorgegebenen Pfade mit perfekter Starrheit, wodurch sichergestellt wird, dass sich ein Objekt als geschlossene Einheit dreht, wenn es sich dreht, und dass sich der Hintergrund korrekt verschiebt, wenn sich die Kamera bewegt.

Die Innovation liegt darin, wie dieses starre Skelett verwendet wird, um das endgültige Video zu leiten. Das System erstellt zuerst eine einfache, schwarz-weiß Tiefenkarte der Szene, die lediglich den Abstand jeder Oberfläche von der Kamera zeigt, während sich die Objekte entlang ihrer Pfade bewegen. Diese Tiefenkarte fungt als strenges Gerüst, das exakt definiert, wo sich jeder Pixel in Bezug auf Raum und Zeit befinden muss. Ein spezialisiertes Trainingsmodul, das die Forscher als „Motion Adapter“ bezeichnen, nimmt dieses starre Skelett und füllt die fehlenden Details auf. Es lernt, die Oberflächentexturen, die Beleuchtung und die subtilen, nicht-starren Bewegungen – wie das Schwingen eines Arms oder das Flattern einer Flagge – auf die feste 3D-Struktur aufzutragen. Dies stellt sicher, dass das endgültige Video den exakten Anweisungen des Nutzers bezüglich Position und Orientierung folgt und dennoch wie eine natürliche, lebendige Szene wirkt.

Um diesem System beizubringen, wie es funktioniert, mussten die Forscher einen massiven neuen Datensatz erstellen, da keine bestehende Videosammlung über die notwendigen 3D-Karten verfügt. Sie entwickelten eine automatisierte Pipeline, die über 20.000 Videoclips nahm und sie rückwärts entwickelte, indem sie jeden Clip in eine starre 3D-Szene mit einem Kamerapfad und Objektpfaden verwandelte. Dieser Datensatz, namens RealCOD-Rigid, ermöglichte es dem Motion Adapter, den Unterschied zwischen der starren Bewegung eines festen Objekts und der flexiblen Bewegung von realen Details zu erlernen. Die Ergebnisse zeigen eine deutliche Verbesserung gegenüber bisherigen Methoden. In Tests war 4Director in der Lage, Objekte konsistent und erkennbar zu halten, selbst wenn sie sich komplett um die eigene Achse drehten oder sich aus der Sicht der Kamera bewegten und wieder auftauchten – eine Aufgabe, bei der andere Systeme oft scheiterten, indem sie die Identität des Objekts verloren oder es in den Hintergrund verschwimmen ließen.

Die Forscher entwickelten auch eine neue Art, den Erfolg zu messen, da sie erkannten, dass es nicht ausreicht, lediglich zu prüfen, ob sich ein Objekt am richtigen Ort befindet, wenn das Objekt selbst sich verändert hat. Ihre neue Metrik prüft sowohl die Position als auch die Identität des Objekts und stellt sicher, dass ein Auto, das um eine Ecke fährt, immer noch wie dasselbe Auto aussieht. Im Vergleich zu anderen führenden Werkzeugen zur Videogenerierung produzierte 4Director konsistent Videos mit höherer visueller Qualität und einer wesentlich präziseren Kontrolle über sowohl die Kamera als auch die Objekte innerhalb der Szene. Das System zeigt, dass es durch die Bereitstellung eines klaren, dreidimensionalen Verständnisses der Welt vor Beginn der Videogenerierung möglich ist, ein Maß an Kontrolle zu erreichen, das zuvor unerreichbar war, und es Nutzern erlaubt, den Fluss einer Szene mit der Präzision eines professionellen Filmemachers zu dirigieren.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →