← Neueste Arbeiten
🤖 machine learning

Vidu S1: A Real-Time Interactive Video Generation Model

Vidu S1 ist ein interaktives Echtzeit-Videogenerationsmodell, das es Benutzern ermöglicht, digitale Charaktere über Sprachbefehle zu steuern, um unendlich lange, hochwertige 540p-Videos mit bis zu 42 FPS auf Consumer-GPUs ohne visuelle Verschlechterung zu erzeugen.

Ursprüngliche Autoren: Jintao Zhang, Kai Jiang, Jintao Chen, Xu Wang, Yang Luo, Yuji Wang, Dechuang Chen, Jungang Li, Chengyang Ye, Marco Chen, Hongzhou Zhu, Min Zhao, Yuxuan Jiang, Zhengkun Huang, Chendong Xiang, Kaiwen Zh
Veröffentlicht 2026-07-22
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Jintao Zhang, Kai Jiang, Jintao Chen, Xu Wang, Yang Luo, Yuji Wang, Dechuang Chen, Jungang Li, Chengyang Ye, Marco Chen, Hongzhou Zhu, Min Zhao, Yuxuan Jiang, Zhengkun Huang, Chendong Xiang, Kaiwen Zheng, Haoxu Wang, Xiaohang Wang, Qi Jia, Xin Chen, Yimin Chen, Youhe Jiang, Fangcheng Fu, Zhijie Deng, Fan Bao, Jianfei Chen, Jun Zhu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie schauen einen Film, in dem die Charaktere Sie nicht hören können, egal wie sehr Sie in den Bildschirm schreien. Sie können ihnen nicht sagen, sie sollen winken, überrascht schauen oder die Szene ändern; Sie müssen einfach nur zurücklehnen und warten, bis der Regisseur den gesamten Schnitt abgeschlossen hat, bevor Sie das Ergebnis sehen. So funktioniert die meiste Videogenerierung durch KI heute: Sie geben eine Anfrage ein, warten lange und erhalten einen fertigen Clip. Aber was wäre, wenn Sie mit dem Charakter sprechen könnten, während er erschaffen wird? Was wäre, wenn Sie sagen könnten: „Hey, gib mir einen Daumen nach oben!“, und er es sofort tut, mitten im Gespräch? Dies ist der Traum der interaktiven Echtzeit-Videogenerierung. Es ist ein Feld, das versucht, die Lücke zwischen statischen, vorgefertigten Filmen und der flüssigen, sofortigen Natur eines Live-Gesprächs zu schließen. Um dies zu erreichen, bauen Wissenschaftler Modelle, die ein Video nicht nur als Ganzes „malen“, sondern es Frame für Frame „streamen“, wobei sie auf Ihre Stimme reagieren, während sie geschieht – ganz ähnlich wie ein menschlicher Schauspieler, der eine Szene basierend auf den unmittelbaren Anweisungen des Regisseurs improvisiert.

Hier kommt Vidu S1 ins Spiel, ein neues Modell, das wie ein superschneller, supersensibler digitaler Schauspieler agiert, der keinen Takt verpasst. Die Forscher hinter diesem Projekt wollten das Problem der „Offline“-Videogenerierung lösen, bei der man Minuten oder sogar Stunden auf ein Ergebnis warten muss. Stattdessen haben sie ein System entwickelt, mit dem man einen digitalen Charakter durch seine Stimme in Echtzeit steuern kann. Denken Sie an einen Videospiel-Charakter, der nicht nur einem vorgegebenen Skript folgt, sondern auf Ihre Sprachbefehle hört und sofort reagiert, egal ob Sie ihn bitten zu winken, sich hinzusetzen oder eine Herzform mit seinen Händen zu machen. Das Coole daran ist, dass dies nicht nur für ein paar Sekunden funktioniert; das Paper legt nahe, dass Vidu S1 dies für eine „unendliche“ Zeit beibehalten kann, ohne dass das Gesicht des Charakters verschwimmt oder seine Bewegungen seltsam und sprunghaft werden – ein Problem, das normalerweise auftritt, wenn KI versucht, lange Videos zu erstellen.

Das Team hinter Vidu S1 hat nicht nur das Gehirn gebaut, sondern auch eine supereffiziente Engine, um es schnell laufen zu lassen. Sie haben spezielle Tricks angewandt (die sie „TurboDiffusion“ und „TurboServe“ nennen), um die Videogenerierung auf gewöhnliche Grafikkarten zu komprimieren, wie man sie in einem Gamer-Setup findet. Das Ergebnis? Das Modell kann Videos mit einer Auflösung von 540p und einer Geschwindigkeit von 42 FPS (Frames pro Sekunde) ausgeben. Um das in Perspektive zu setzen: Standard-Videos laufen mit 30 FPS, also ist dies tatsächlich schneller als Echtzeit, was bedeutet, dass die KI mit einem Live-Gespräch Schritt halten kann, ohne zu laggen. Die Forscher testeten dies, indem sie Nutzer baten, Fotos von sich selbst, Anime-Charakteren oder sogar Haustieren hochzuladen, und dann Sprachanweisungen gaben. Das Modell generierte erfolgreich Videos, in denen die Charaktere den Kommandos folgten, wie etwa ein Bein zu heben oder einen Daumen nach oben zu geben, während das Gesicht exakt so aussah wie auf dem hochgeladenen Foto.

Eine der größten Hürden, die das Paper angeht, ist das „Drift“-Problem. Stellen Sie sich vor, Sie versuchen ein Bild einer Person zu zeichnen, aber jedes Mal, wenn Sie ein neues Detail hinzufügen, beginnt das ganze Bild langsam zu verzerren und sich zu krümmen, bis die Person wie ein Monster aussieht. Viele KI-Videomodelle leiden unter diesem Problem, wenn sie versuchen, lange Videos zu erstellen; je länger das Video läuft, desto mehr verzerrt sich das Gesicht des Charakters oder der Hintergrund. Vidu S1 nutzt ein cleveres Speichersystem namens „TwinCache“, um dies zu verhindern. Es ist wie ein Bibliothekar, der eine „grobe Skizze“ der letzten Sekunden bereithält, um die Bewegung flüssig zu halten, während er gleichzeitig eine „finale polierte Version“ bewahrt, um sicherzustellen, dass das Gesicht des Charakters scharf und erkennbar bleibt. Dies ermöglicht es dem Video, ewig weiterzulaufen, ohne dass der Charakter auseinanderfällt.

Das Paper weist auch darauf hin, dass zwar andere Modelle existieren, die meisten von ihnen aber entweder zu langsam für Interaktivität sind, Sprachbefehle nicht direkt verstehen können oder nach kurzer Zeit zusammenbrechen. Vidu S1 ist speziell darauf ausgelegt, das Gegenteil zu sein: Es nimmt Ihre Stimme als direkten Befehl entgegen, generiert das Video sofort und hält es so lange stabil, wie Sie möchten. In ihren Tests wurde das Modell mit anderen Top-Systemen verglichen und schnitt in der Befolgung von Anweisungen und der Natürlichkeit der Bewegungen am besten ab. Die Forscher sagen, dass wir mit dieser Technologie näher an eine Zukunft herankommen, in der man ein Live-Gespräch mit einem digitalen Charakter führen kann, der wie ein echter Mensch aussieht und sich bewegt – alles dynamisch direkt auf dem eigenen Computer generiert.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →