← Nieuwste papers
🤖 machine learning

Vidu S1: A Real-Time Interactive Video Generation Model

Vidu S1 is een realtime interactief videogeneratiemodel dat gebruikers in staat stelt digitale personages te besturen via stemcommando's om oneindig lange, hoogwaardige 540p-video's te produceren met maximaal 42 FPS op consumenten-GPU's zonder visuele degradatie.

Oorspronkelijke auteurs: Jintao Zhang, Kai Jiang, Jintao Chen, Xu Wang, Yang Luo, Yuji Wang, Dechuang Chen, Jungang Li, Chengyang Ye, Marco Chen, Hongzhou Zhu, Min Zhao, Yuxuan Jiang, Zhengkun Huang, Chendong Xiang, Kaiwen Zh
Gepubliceerd 2026-07-22
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jintao Zhang, Kai Jiang, Jintao Chen, Xu Wang, Yang Luo, Yuji Wang, Dechuang Chen, Jungang Li, Chengyang Ye, Marco Chen, Hongzhou Zhu, Min Zhao, Yuxuan Jiang, Zhengkun Huang, Chendong Xiang, Kaiwen Zheng, Haoxu Wang, Xiaohang Wang, Qi Jia, Xin Chen, Yimin Chen, Youhe Jiang, Fangcheng Fu, Zhijie Deng, Fan Bao, Jianfei Chen, Jun Zhu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je naar een film kijkt waarin de personages je niet kunnen horen, hoe hard je ook naar het scherm schreeuwt. Je kunt ze niet vertellen om te zwaaien, verbaasd te kijken of de scène te veranderen; je moet gewoon achterover leunen en wachten tot de regisseur de hele montage heeft afgerond voordat je het resultaat ziet. Dit is hoe de meeste video-genererende AI vandaag de dag werkt: je typt een verzoek, wacht een lange tijd en krijgt een voltooide clip. Maar wat als je met het personage zou kunnen praten terwijl ze worden gecreëerd? Wat als je zou kunnen zeggen: "Hé, geef eens een duim omhoog!" en ze dat direct doen, midden in het gesprek? Dit is de droom van real-time interactieve videogeneratie. Het is een veld dat probeert de kloof te overbruggen tussen statische, vooraf gemaakte films en de vloeiende, directe aard van een live gesprek. Om dit te doen, bouwen wetenschappers modellen die niet alleen een hele afbeelding in één keer "schilderen", maar de video in plaats daarvan frame voor frame "streamen", waarbij ze reageren op je stem terwijl deze gebeurt, net zoals een menselijke acteur een scène improviseert op basis van de directe aanwijzingen van de regisseur.

Maak kennis met Vidu S1, een nieuw model dat fungeert als een supersnelle, superreactieve digitale acteur die nooit een slag mist. De onderzoekers achter dit project wilden het probleem van "offline" videogeneratie oplossen, waarbij je minuten of zelfs uren moet wachten op een resultaat. In plaats daarvan bouwden ze een systeem waarmee je een digitaal personage met je stem in real-time kunt besturen. Denk aan een videogamepersonage dat niet alleen een vooraf geschreven script volgt, maar naar je stemcommando's luistert en direct reageert, of je nu vraagt om te zwaaien, te gaan zitten of een hartje met hun handen te maken. Het coole eraan is dat dit niet slechts voor een paar seconden werkt; het artikel suggereert dat Vidu S1 dit voor een "oneindige" tijd kan volhouden zonder dat het gezicht van het personage wazig wordt of hun bewegingen vreemd en schokkerig worden, een probleem dat meestal optreedt wanneer AI probeert lange video's te maken.

Het team achter Vidu S1 heeft niet alleen het brein gebouwd; ze hebben ook een superefficiënte motor gebouwd om het snel te laten draaien. Ze gebruikten speciale trucs (die ze "TurboDiffusion" en "TurboServe" noemen) om de videogeneratie samen te persen op gewone grafische kaarten die je misschien in een gamer-setup vindt. Het resultaat? Het model kan video uitspugen met een resolutie van 540p op een snelheid van 42 FPS (frames per seconde). Om dit in perspectief te plaatsen: standaard video speelt af met 30 FPS, dus dit is eigenlijk sneller dan real-time, wat betekent dat de AI een live gesprek kan bijhouden zonder te vertragen. De onderzoekers testten dit door gebruikers foto's van zichzelf, anime-personages of zelfs huisdieren te laten uploaden, en hen vervolgens steminstructies te geven. Het model genereerde succesvol video's waarin de personages de commando's opvolgden, zoals een been optillen of een duim omhoog geven, terwijl het gezicht exact hetzelfde bleef als op de foto die je hebt geüpload.

Een van de grootste hindernissen waar het artikel een oplossing voor biedt, is het "drift"-probleem. Stel je voor dat je een tekening probeert te maken van een persoon, maar elke keer dat je een nieuw detail toevoegt, de hele tekening langzaam begint te vervormen en te draaien totdat de persoon eruitziet als een monster. Veel AI-videomodellen lijden hieronder wanneer ze proberen lange video's te maken; hoe langer de video duurt, hoe meer het gezicht van het personage of de achtergrond vervormt. Vidu S1 gebruikt een slim geheugensysteem genaamd "TwinCache" om dit te voorkomen. Het is also kind van een bibliothecaris die een "ruwe schets" van de afgelopen paar seconden bewaart om de beweging vloeiend te houden, terwijl het ook een "gepolijste definitieve versie" bijhoudt om ervoor te zorgen dat het gezicht van het personage scherp en herkenbaar blijft. Hierdoor kan de video voor altijd doorgaan zonder dat het personage uit elkaar valt.

Het artikel wijst er ook op dat hoewel er andere modellen bestaan, de meeste ofwel te traag zijn om interactief te zijn, of geen directe stemcommando's begrijpen, of na een korte tijd instorten. Vidu S1 is specifiek ontworpen om het tegenovergestelde te zijn: het neemt je stem als een direct commando, genereert de video onmiddellijk en houdt het zo lang stabiel als je wilt praten. In hun tests werd het model vergeleken met andere top-systemen, en het kwam als winnaar uit in hoe goed het instructies opvolgde en hoe natuurlijk de bewegingen eruit zagen. De onderzoekers zeggen dat we met deze technologie dichter bij een toekomst komen waarin je een live, gepersonaliseerd gesprek kunt voeren met een digitaal personage dat er precies zo uitziet en beweegt als een echt persoon, allemaal on-the-fly gegenereerd op je eigen computer.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →