← Nieuwste papers
💻 computer science

Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming

Vorch-Streamer is een post-training framework dat real-time, langdurige tekst-naar-audio-video streaming mogelijk maakt door een causale generator die getraind is met gemengde forcing-strategieën te combineren met DMD-distillatie voor lange-horizon stabiliteit en een extern taalmodel voor spraakplanning om een snelle, gesynchroniseerde en consistente avatar-generatie te bereiken.

Oorspronkelijke auteurs: Menglin Han, Yang Ding, Yulei Lu, Haoran Yu, Xin Ma, Junyi Chen, Zhangkai Ni, Lin Ma, Yaohui Wang

Gepubliceerd 2026-08-07
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Menglin Han, Yang Ding, Yulei Lu, Haoran Yu, Xin Ma, Junyi Chen, Zhangkai Ni, Lin Ma, Yaohui Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren om een verhaal te vertellen. Je wilt dat de robot spreekt, zijn lippen beweegt en zijn gezichtsuitdrukkingen verandert, allemaal tegelijkertijd, net als een echt persoon. Lange tijd konden de beste robots dit alleen voor zeer korte fragmenten doen, zoals een begroeting van 5 seconden. Ze werkten als een regisseur die het hele script bekijkt voordat een scène wordt gefilmd, om vooruit te kijken naar wat er volgt. Maar in de echte wereld hebben we geen tijd om te wachten tot het hele verhaal geschreven is voordat we beginnen met praten. We hebben nodig dat de robot nu spreekt, gebaseerd op alleen wat hij tot nu toe heeft gezegd, terwijl hij zijn gezicht en stem perfect synchroon houdt. Dit is de uitdaging van "real-time streaming". Het probleem is dat als een robot in de eerste seconde een kleine fout maakt, die fout zich in de loop van de tijd kan opstapelen, waardoor het gezicht van de robot er vreemd uit gaat zien of zijn stem uit de toon raakt tegen het einde van het gesprek. Wetenschappers proberen al een tijdje uit te zoeken hoe ze deze digitale avatars minutenlang kunnen laten praten zonder hun verstand of hun ritme te verliezen.

Maak kennis met Vorch-Streamer, een nieuw systeem dat werkt als een supergeorganiseerde, real-time verhalenverteller. In plaats van te proberen het hele script uit het hoofd te leren voordat het spreekt, gebruikt Vorch-Streamer een slimme tweeledige strategie om de show meer dan twee minuten lang door te laten gaan zonder te stoppen. Denk aan een band die een lange jamsessie speelt. Normaal gesproken, als een muzikant een verkeerde noot speelt, kan de rest van het nummer rommelig worden. Maar Vorch-Streamer heeft een speciale "repetitiemodus". Eerst oefent het het spelen van korte segmenten terwijl het zachtjes wordt gecorrigeerd door een leraar (een vooraf getraind model dat weet hoe het perfect moet). Daarna oefent het het spelen van het hele lied van begin tot eind, maar dit keer luistert het naar zijn eigen eerdere fouten en leert het hoe het die onderweg kan herstellen, terwijl een "dirigent" (een AI-planner) het precies vertelt welke woorden het als volgende moet zeggen.

Het resultaat is een digitale avatar die gelijktijdig video en audio kan genereren met 27,12 frames per seconde (FPS). Om dit in perspectief te plaatsen: standaardvideo speelt af met 24 FPS, wat betekent dat deze robot eigenlijk sneller is dan real-time! Het kan zijn gezicht er zo uit laten zien dat het steeds dezelfde persoon is, zijn lippen perfect laten bewegen op de maat van zijn woorden, en zijn stem helder en accuraat houden voor bijna twee minuten achter elkaar. De onderzoekers ontdekten dat zonder een specifieke "planning"-stap om te beslissen wat er als volgende gezegd moet worden, de robot in de war zou raken en onzin zou gaan praten of zichzelf zou gaan herhalen. Door deze planner toe te voegen, lost het systeem het puzzelstukje op van hoe je een lang gesprek vloeiend laat verlopen zonder de toekomst te hoeven zien. Het bewijst dat je een krachtige, trage robot die alles over een verhaal weet, kunt veranderen in een snelle, live performer die net genoeg weet om de show gaande te houden, seconde voor seconde.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →