← Nieuwste papers
🤖 AI

Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models

Wan-Streamer is een native-streaming, end-to-end interactief fundamenteel model dat taal-, audio- en videoverwerking verenigt binnen een enkele Transformer om sub-seconde, full-duplex multimodale communicatie te bereiken met een modelzijde-latentie van ongeveer 200 ms, waardoor de foutaccumulatie en vertragingen die inherent zijn aan traditionele gecascadeerde systemen worden geëlimineerd.

Oorspronkelijke auteurs: Lianghua Huang, Zhifan Wu, Wei Wang, Yupeng Shi, Mengyang Feng, Junjie He, Chenwei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chen Liang, Cheng Yu, Chongyang Zhong, Jinwei Qi, Kai Zhu
Gepubliceerd 2026-06-25
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Lianghua Huang, Zhifan Wu, Wei Wang, Yupeng Shi, Mengyang Feng, Junjie He, Chenwei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chen Liang, Cheng Yu, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Zoubin Bi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een gesprek voert met een vriend. Je wacht niet tot ze hun hele zin hebben afgemaakt, pauzeert om na te denken en begint dan pas te praten. In plaats daarvan luister je terwijl ze praten, je knikt, je maakt oogcontact, je onderbreekt ze misschien met een "Wacht, echt waar?" of een lach, en je begint alvast een antwoord te formuleren terwijl ze nog aan het praten zijn. Dit is full-duplex interactie: alles gebeurt tegelijkertijd, overlappend en op een natuurlijke manier.

Lange tijd waren computers hier erg slecht in. Ze werken meestal als een estafette met aparte hardlopers:

  1. Hardloper A luistert naar je stem en zet dit om in tekst (Spraak-naar-Tekst).
  2. Hardloper B leest de tekst en bedenkt een antwoord (Het Brein).
  3. Hardloper C zet dat antwoord weer om in spraak (Tekst-naar-Spraak).
  4. Hardloper D neemt die spraak en animeert een gezicht dat bij de woorden past (Videogeneratie).

Tegen de tijd dat het antwoord je oren bereikt, is er veel vertraging opgelopen, en de computer mist vaak je gezichtsuitdrukkingen of onderbreekt je onhandig omdat de "hardlopers" niet snel genoeg met elkaar kunnen communiceren.

Wan-Streamer is een nieuw soort AI dat probeert een enkele, supersnelle mens te zijn in plaats van een estafetteploeg. Zo werkt het, met eenvoudige analogieën:

1. De "Eénmansband" versus het "Orkest"

De meeste huidige systemen zijn als een orkest waarbij de violist, de drummer en de zanger in verschillende kamers zitten. Ze moeten wachten op een signaal om hun deel te beginnen te spelen. Als de drummer traag is, sleept het hele nummer zich voort.

Wan-Streamer is als een eénmansband die tegelijkertijd gitaar speelt, zingt en de maat houdt. Het heeft geen aparte modules voor luisteren, denken, spreken of het bewegen van het gezicht. Het is één enkel "brein" (een Transformer-model) dat jouw video ziet, jouw stem hoort en jouw tekst leest, en vervolgens onmiddellijk beslist wat het gaat zeggen, hoe het gaat klinken en hoe het zijn gezicht gaat bewegen gelijktijdig.

2. De "Denker" en de "Performer"

Om dit ongelooflijk snel te maken, splitsen de makers het werk op in twee rollen die in perfecte synchronisatie werken, zoals een dirigent en een muzikant:

  • De Denker: Dit deel luistert naar je, begrijpt wat je zegt en plant de reactie. Het is als een dirigent die de volgende noot bepaalt.
  • De Performer: Dit deel neemt het plan en creëert daadwerkelijk het geluid en de video. Het is als een muzikant die het instrument bespeelt.

Hier is de magische truc: Terwijl de Performer bezig is met het creëren van de video en audio voor jouw huidige reactie, is de Denker al aan het luisteren naar jouw volgende zin en het plannen van de volgende reactie. Ze geven het stokje zo snel aan elkaar door dat er geen wachttijd is. Dit stelt het systeem in staat om het tempo van een echt gesprek bij te houden zonder te bevriezen.

3. De "Live Stream" versus de "Gemonteerde Film"

Oudere AI-videosystemen zijn als het monteren van een film: ze wachten tot de hele scène is gefilmd, en monteren het dan in elkaar. Als je een regel wilt veranderen, moeten ze de hele film opnieuw monteren.

Wan-Streamer is als een live nieuwsbericht. Het genereert de video frame voor frame terwijl het gebeurt.

  • Als je stopt met praten, bevriest de AI niet; hij blijft "ademen", knipperen en kijkt naar je, net als een echt persoon die wacht tot je verdergaat.
  • Als je de AI onderbreekt, stopt hij onmiddellijk en luistert hij naar jou, in plaats van zijn zin af te maken omdat hij "vastzit" in een proces.
  • Hij reageert direct op jouw gezichtsuitdrukkingen. Als je verward kijkt, kan de AI vertragen of zichzelf uitleggen, allemaal binnen hetzelfde fractie van een seconde.

4. Hoe snel is het?

Het paper beweert dat dit systeem ongelooflijk snel is:

  • De "Breintijd" van de AI: Het duurt ongeveer 200 milliseconden (0,2 seconden) voordat de AI je hoort, nadenkt en begint met het genereren van een reactie. Dat is sneller dan een menselijke knipoog.
  • De Totale Gesprekstijd: Wanneer je de tijd toevoegt die het internet nodig heeft om het signaal heen en weer te sturen (ongeveer 350 ms), is de totale vertraging ongeveer 550 milliseconden (0,55 seconden).

Om dit in perspectief te plaatsen: Als je met een vriend zou praten via een videogesprek met een vertraging van 0,5 seconde, zou je het nauwelijks merken. Je zou hem kunnen onderbreken, en hij zou natuurlijk reageren.

Wat maakt het bijzonder?

Het paper benadrukt dat Wan-Streamer niet simpelweg verschillende tools aan elkaar "plakt". Het heeft geleerd om tegelijkertijd te luisteren, te spreken en het gezicht te bewegen vanaf het allereerste begin.

  • Geen "Tekst-tussenpersoon": Het hoeft je stem niet om te zetten in tekst en dan weer terug in stem. Het begrijpt geluid en video direct.
  • Natuurlijk Ritme: Omdat het leert van echte gesprekken waarbij mensen door elkaar praten, weet het wanneer het moet pauzeren, wanneer het moet knikken en wanneer het moet inspreken. Het klinkt niet robotachtig of stijf.

De Kernboodschap

Wan-Streamer is een prototype voor een digitale mens die een echt gesprek van man tot man (face-to-face) met je kan voeren. Het beantwoordt niet alleen vragen; het observeert je, luistert naar je en reageert op je met een gezicht en een stem die levend aanvoelen, terwijl het het gesprek vloeiend houdt zonder ongemakkelijke stiltes. Het is een stap richting AI die minder aanvoelt als een computerprogramma en meer als een persoon die tegenover je aan tafel zit.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →