← Nieuwste papers
💻 computer science

Video = World + Event Stream

Het artikel introduceert Wan-Streamer v0.3, een real-time audio-visueel interactiemodel dat video frameert als een combinatie van een persistente "wereld" en een dynamische "event stream" om lage-latentie, algemene voorspelling van omgevingsveranderingen en agentgedrag mogelijk te maken.

Oorspronkelijke auteurs: Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Cheng Yu, Chen Liang, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chongyang Zhong, Jinwei Qi, Kai Zh
Gepubliceerd 2026-07-20
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Cheng Yu, Chen Liang, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zhiwei Lin, Zoubin Bi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een film kijkt, maar in plaats van alleen maar achterover te leunen en te kijken, zit je ín de scène, praat je met de personages, en praten zij direct terug tegen jou. Dit is de opwindende wereld van real-time kunstmatige intelligentie, waar computers proberen ons te begrijpen en te reageren zoals een menselijke vriend dat zou doen. Om dit te doen, moet AI drie dingen tegelijkertijd jongleren: wat het ziet (video), wat het hoort (audio), en wat het zegt of doet (tekst en acties). Voor een lange tijd was het laten doen van al deze taken door een AI zonder vertraging also$ een marathon lopen terwijl je een zware rugzak draagt; het was traag en onhandig. De grote vraag die onderzoekers zich hebben gesteld is: Hoe kunnen we een AI leren de "het toneel" waarop het zich bevindt en de "actie" die daar plaatsvindt te begrijpen, zodat het natuurlijk en direct kan reageren?

Maak kennis met Wan-Streamer v0.3, een nieuwe creatie van het Wan Team van Alibaba Group. Beschouw dit paper als een slim recept voor een supersnelle, superslimme digitale acteur. De auteurs realiseerden zich dat in plaats van een video te behandelen als één grote, verwarrende bende van veranderende pixels, we deze kunnen opdelen in twee eenvoudige delen: een Wereld en een Event Stream (gebeurtenisstroom). De "Wereld" is het stabiele deel—de kamer waarin je bent, de meubels, het gezicht van een persoon en het achtergrondgeluid. Dit verandert niet veel. De "Event Stream" is alles wat wel verandert—de persoon die loopt, praat, zwaait of de auto die voorbijrijdt. Door de AI te leren dat een video slechts een "Wereld" plus een "stroom van gebeurtenissen" is, vonden ze een manier om de AI veel slimmer en sneller te maken in het voorspellen van wat er hierna gebeurt.

Het Grote Idee: Het Toneel en het Toneelstuk

Het paper stelt een frisse manier voor om naar video te kijken. Stel je een theater voor. De Wereld is het decorontwerp: de geschilderde achtergrond, de verlichting, de attributen en het kostuum van de acteur. Zodra het toneelstuk begint, blijven deze dingen grotendeels hetzelfde. De Event Stream is het toneelstuk zelf: de acteur die over het podium loopt, een regel roept, een attribuut laat vallen of zich omdraait.

In het verleden probeerden AI-modellen het hele toneelstuk en het hele decorontwerp tegelijkertijd te leren, wat moeilijk was. Wan-Streamer v0.3 suggereert een simpelere truc: leer de AI het decorontwerp één keer, en focus je daarna alleen op het toneelstuk.

De onderzoekers trainden hun model op een enorme hoeveelheid real-world video's. Ze vroegen de AI niet alleen om het volgende frame te raden; ze leerden het om naar een "Wereld" te kijken (zoals een zonnige buitenwijk of een kippenhok) en vervolgens de "Event Stream" te voorspellen (zoals een robot die door de straat rent of een vrouw die kippen voert). Het model leerde dat als er een robot op een stoeprand staat, deze misschien richting een auto rent, de deur opent en wegrijdt. Als een vrouw in een kippenhok is, kan ze naar een emmer lopen en voer scheppen. Door deze patronen te leren, bouwt de AI een "wereldkennis" op van hoe dingen plausibel bewegen en veranderen.

De Magische Truk: Tegelijkertijd Praten en Handelen

Dus, wat doet dit eigenlijk? Het team testte dit idee op een real-time, full-duplex audio-visuele interactie. "Full-duplex" is een chique manier om te zeggen dat de AI tegelijkertijd kan praten en luisteren, net als een echt gesprek, zonder te wachten tot jij klaar bent met praten.

In deze nieuwe versie (v0.3) is de AI-agent niet alleen een pratend hoofd. Het kan nu vrije gedrag (free-form behavior) vertonen.

  • Oude manier: De AI knikt misschien alleen of kijkt naar je terwijl hij spreekt.
  • Nieuwe manier: De AI kan zeggen: "(pakt een koffiemok op en neemt een slok) Bedankt voor de herinnering," of "(frons lichtjes) Wat bedoelde je daarmee?"

Het paper legt uit dat de AI zijn reactie schrijft in een speciaal "rollenspel"-formaat. Het mengt gesproken woorden met acties geschreven tussen haakjes. Omdat de AI de "Wereld" (de omgeving en het personage) heeft geleerd, weet het dat als het zegt "(pakt een mok op)", de videogenerator daadwerkelijk het personage zal laten zien dat een mok oppakt die bij de scène past. Dit gebeurt in real-time, en de spraak, de actie en de video blijven perfect gesynchroniseerd.

De Snelheid: Snel Genoeg om Echt te Voelen

Een van de meest indrukwekkende delen van dit paper is dat ze niet hebben ingeleverd op snelheid voor deze nieuwe intelligentie. De auteurs laten zien dat Wan-Streamer v0.3 dezelfde razendsnelle prestaties behoudt als hun vorige versie (v0.2).

  • Videokwaliteit: Het genereert nog steeds video op een resolutie van 640×368.
  • Soepelheid: Het draait op 25 FPS (frames per seconde), wat vloeiend genoeg is om natuurlijk te ogen.
  • Snelheid: De AI doet er ongeveer 200 milliseconden over om na te denken en zelfstandig te reageren. Als je de tijd meerekent die het internet nodig heeft om de gegevens heen en weer te sturen (een budget van 350 milliseconden), is de totale wachttijd voor een antwoord ongeveer 550 milliseconden.

Om dit in perspectief te plaatsen: 550 milliseconden is minder dan een seconde. Het is snel genoeg zodat het gesprek voelt als een echt praatje met een vriend, en niet als een robot die wacht op een laadbalk.

Wat dit Betekent (en Wat het Niet Betekent)

Het paper suggereert dat we door het scheiden van de "Wereld" van de "Events", meer flexibele AI kunnen creëren. Het kan getraind worden op elk soort video en vervolgens gespecialiseerd worden voor verschillende taken, zoals een robot die door een kamer navigeert of een personage in een videogame. De auteurs laten zien dat deze aanpak werkt voor hun specifieke testgeval: een digitaal personage dat in real-time praat en handelt.

Echter, het paper merkt voorzichtig op dat dit een specifieke demonstratie is. Ze hebben aangetoond dat het model dit kan, en ze hebben de snelheid en kwaliteit gemeten. Ze beweren niet dat ze elk probleem in AI hebben opgelost, noch hebben ze elke mogelijke toekomstige toepassing opgesomd. Ze presenteren simpelweg een nieuwe manier van denken over videogeneratie die de AI slimmer maakt over hoe de wereld werkt, terwijl het snel genoeg blijft om nu al met je te chatten.

Kortom, Wan-Streamer v0.3 is als het geven van een script aan een digitale acteur dat zegt: "Hier is het decor, hier is je kostuum, en hier is het verhaal. Ga nu acteren, praten en bewegen, en doe dat allemaal voordat ik zelfs maar kan knipperen." En dankzij deze nieuwe "Wereld + Event"-truc, lijkt het precies dat te doen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →