← Neueste Arbeiten
💻 computer science

AnyScene: Towards Highly Controllable Driving Scene Generation at Anywhere and Beyond

Das Papier schlägt AnyScene vor, ein einheitliches, auf der Okklusion ausgerichtetes Framework, das einen Spatial-Temporal Occupancy Diffusion Transformer und ein Geometry-Grounded View Expansion-Modul nutzt, um hochkontrollierbare, hochauflösende und zeitlich konsistente Mehransichtsfahrzeugvideos aus beliebigen BEV-Layouts zu generieren, ohne auf Referenzrahmen zurückzugreifen.

Ursprüngliche Autoren: Haiming Zhang, Junfei Zhou, Feng Jiang, Jingzhong Li, Zhenglong Guo, Penglin Dai, Jifeng Dai, Yan Xie, Benjin Zhu

Veröffentlicht 2026-05-26
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Haiming Zhang, Junfei Zhou, Feng Jiang, Jingzhong Li, Zhenglong Guo, Penglin Dai, Jifeng Dai, Yan Xie, Benjin Zhu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie möchten einen perfekten, realistischen Film einer Stadtstraße erstellen, aber Sie haben kein Filmteam, keine Schauspieler und keine echten Autos. Stattdessen verfügen Sie lediglich über eine einfache, top-down-Karte (wie eine Minikarte in einem Videospiel), auf der Sie einzeichnen können, wo die Straßen verlaufen, wo die Autos sein sollen, und sogar das Wetter mit einer Textnotiz ändern können.

Genau das ist es, was AnyScene im Kern tut. Es ist ein neues Computerprogramm, das diese einfachen, zweidimensionalen Top-down-Skizzen in vollständige, dreidimensionale, hochauflösende Fahrvideos verwandelt, die realistisch aussehen und sich so anfühlen.

So funktioniert es, aufgeteilt in drei einfache Schritte unter Verwendung alltäglicher Analogien:

1. Der „Architekten-Grundriss" (Umwandlung von Karten in 3D-Raum)

Die meisten alten Methoden versuchten, das Video direkt aus der Karte zu zeichnen, was oft zu seltsamen Fehlern führte – etwa ein Auto, das in der Luft schwebt, oder ein Gebäude, das verschwindet, wenn sich die Kamera bewegt.

AnyScene geht einen anderen Weg. Zuerst agiert es wie ein 3D-Architekt. Es nimmt Ihre 2D-Top-down-Karte (das „BEV-Layout") und baut ein „digitales Tonmodell" der gesamten Szene. In der Arbeit nennen sie dies Semantische Belegung (Semantic Occupancy).

  • Die Analogie: Stellen Sie sich dies wie ein riesiges, unsichtbares Gitter aus winzigen Lego-Steinen vor, das die Luft füllt. Einige Steine sind „Straße", einige „Auto", einige „Baum" und einige „leere Luft".
  • Die Magie: Das System baut dieses Lego-Modell Bild für Bild auf. Da es die 3D-Struktur zuerst aufbaut, stellt es sicher, dass ein Auto, das auf der Karte auf der linken Straßenseite steht, auch in der 3D-Welt auf der linken Seite bleibt, egal wie sich die Kamera bewegt. Dies löst das Problem von „zitternden" oder inkonsistenten Darstellungen.

2. Die „Regisseur-Kamera" (Umwandlung des Modells in einen Film)

Sobald das 3D-Lego-Modell gebaut ist, muss das System es in ein Video verwandeln. Alte Methoden waren wie ein Regisseur, der an ein bestimmtes Kameragestell gebunden war; sie konnten nur aus festen Winkeln filmen oder benötigten ein „Referenzvideo" zum Kopieren.

AnyScene verwendet ein neues Modul namens Geometrie-basierte Sicht-Erweiterung (Geometry-Grounded View Expansion, GGVE).

  • Die Analogie: Stellen Sie sich vor, Sie haben eine perfekte 3D-Skulptur einer Stadt. AnyScene ist wie ein Regisseur, der mit einer Kamera um diese Skulptur herumlaufen und sie aus jedem gewünschten Winkel filmen kann, sogar aus Winkeln, die in der realen Welt nicht existieren.
  • Die Magie: Es benötigt kein Referenzvideo zum Kopieren. Es betrachtet das 3D-Lego-Modell, berechnet genau, wie Licht und Schatten aus einem neuen Winkel aussehen sollten, und generiert die Videopixel. Das bedeutet, Sie können ein Video von einer Drohne, einem Auto oder sogar einer an einem Fahrrad montierten Kamera anfordern, und es wird sofort generiert, ohne dass ein erneutes Training erforderlich ist.

3. Der „Unendliche Spielplatz" (Warum dies wichtig ist)

Die Arbeit hebt hervor, dass dieses System „steuerbar" ist und „überall" funktioniert.

  • Die Analogie: Stellen Sie es sich als ein Lego-Set vor, bei dem die Teile nie ausgehen. Sie können einen Stau in New York einzeichnen, dann die Karte sofort in eine regnerische Straße in Singapur ändern oder sogar eine völlig erfundene Kreuzung zeichnen, die nie existiert hat. Das System wird für alle davon einen realistischen Film generieren.
  • Das Ergebnis: Es kann Videos mit 12 verschiedenen Kameraperspektiven gleichzeitig erstellen, oder sogar mehr, wobei alle perfekt miteinander konsistent bleiben. Wenn Sie die Karte bearbeiten, um ein Auto zu entfernen, aktualisiert sich das Video sofort und zeigt eine leere Straße, wobei sich Schatten und Reflexionen automatisch anpassen.

Zusammenfassung

Die Arbeit behauptet, dass AnyScene eine zweistufige Maschine ist:

  1. Schritt 1: Es liest eine einfache Top-down-Zeichnung und baut eine präzise 3D-„Lego-Welt" (Belegung/Occupancy).
  2. Schritt 2: Es nutzt diese 3D-Welt, um einen Film aus jedem gewünschten Kamerawinkel zu drehen, mit jedem Wetter oder jedem Verkehrsfluss, den Sie einzeichnen.

Die Autoren testeten dies an einem neuen, hochgeschwindigkeitsfähigen Datensatz, den sie selbst erstellt haben (nuCraftv2), und zeigten, dass ihre Methode sauberere, konsistentere und besser steuerbare Fahrvideos erzeugt als frühere Systeme, die oft Schwierigkeiten hatten, die Geometrie konsistent zu halten oder starre Kamerasetups benötigten.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →