← Nieuwste papers
💻 computer science

MOVA: Towards Scalable and Synchronized Video-Audio Generation

MOVA is een nieuw open-source model met een Mixture-of-Experts-architectuur dat hoogwaardige, gesynchroniseerde video en audio tegelijkertijd genereert op basis van afbeeldingen en tekst.

Oorspronkelijke auteurs: OpenMOSS Team, Donghua Yu, Mingshu Chen, Qi Chen, Qi Luo, Qianyi Wu, Qinyuan Cheng, Ruixiao Li, Tianyi Liang, Wenbo Zhang, Wenming Tu, Xiangyu Peng, Yang Gao, Yanru Huo, Ying Zhu, Yinze Luo, Yiyang Zh
Gepubliceerd 2026-02-11
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: OpenMOSS Team, Donghua Yu, Mingshu Chen, Qi Chen, Qi Luo, Qianyi Wu, Qinyuan Cheng, Ruixiao Li, Tianyi Liang, Wenbo Zhang, Wenming Tu, Xiangyu Peng, Yang Gao, Yanru Huo, Ying Zhu, Yinze Luo, Yiyang Zhang, Yuerong Song, Zhe Xu, Zhiyu Zhang, Chenchen Yang, Cheng Chang, Chushu Zhou, Hanfu Chen, Hongnan Ma, Jiaxi Li, Jingqi Tong, Junxi Liu, Ke Chen, Shimin Li, Shiqi Jiang, Songlin Wang, Wei Jiang, Zhaoye Fei, Zhiyuan Ning, Chunguo Li, Chenhui Li, Ziwei He, Zengfeng Huang, Xie Chen, Xipeng Qiu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een filmregisseur bent. Je hebt een prachtige scène gefilmd van een acteur die een emotionele speech houdt, maar... het is doodstil. Om het tot leven te wekken, moet je nu een geluidstechnicus inhuren die de stem eronder plakt. Maar de stem loopt net niet synchroon met de lippen, of het geluid van de wind in de boom op de achtergrond klinkt als een stofzuiger. Dat is precies het probleem waar huidige AI-modellen tegenaan lopen: ze maken óf een mooi plaatje, óf een mooi geluid, maar het combineren ervan is als een slecht gemonteerde film.

Het paper over MOVA (MOSS Video and Audio) presenteert de oplossing. Hier is de uitleg in begrijpelijke taal:

De Kern: De "Perfecte Orkestdirigent"

De meeste AI-systemen werken als een eenmansband: ze spelen eerst een melodie (video) en proberen daarna een ritme (audio) te vinden dat er een beetje bij past. Dat werkt nooit perfect.

MOVA werkt in plaats daarvan als een super-dirigent van een groot symfonieorkest. De dirigent kijkt niet alleen naar de violist (het beeld), maar hoort ook de trompet (het geluid) en zorgt dat ze tegelijkertijd precies de juiste noot raken. In technische termen noemen ze dit "joint multimodal modeling": beeld en geluid worden niet achteraf aan elkaar geplakt, maar worden vanaf de allereerste seconde samen "gedroomd" door de AI.

Hoe werkt het? (De Metaforen)

1. De Twee Torens en de Brug (Architectuur)
Stel je voor dat je twee enorme bibliotheken hebt. De ene bibliotheek bevat alle kennis over hoe de wereld eruitziet (de Video-toren), de andere over hoe de wereld klinkt (de Audio-toren). Om te voorkomen dat ze in hun eigen wereld blijven hangen, hebben de makers van MOVA een "magische brug" gebouwd tussen de twee. Via deze brug kunnen de beelden "fluisteren" naar het geluid ("Hé, ik ben een vallende kop koffie, maak een kletterend geluid!") en kan het geluid terugpraten naar het beeld ("Ik ben een diepe stem, zorg dat de lippen van de acteur goed meebewegen!").

2. De Tijdslijn-Match (Aligned RoPE)
Een groot probleem bij video en audio is dat ze een ander ritme hebben. Video is een reeks foto's (bijv. 24 per seconde), terwijl audio een constante stroom van trillingen is. Het is alsovergelijkbaar met een danspaar waarbij de één op de maat van de muziek danst, maar de ander op de maat van een klok. MOVA gebruikt een slimme wiskundige truc om de "tijd" van beide werelden perfect op elkaar af te stemmen, zodat de lippen van een spreker exact op de klanken vallen.

3. De Super-Curator (Data Engineering)
Om zo slim te worden, heeft MOVA miljoenen uren aan video's "bestudeerd". Maar niet zomaar video's. De onderzoekers hebben een gigantisch filter gebruikt. Ze hebben alle wazige video's, video's zonder geluid en video's waarbij het geluid niet bij het beeld paste, weggegooid. Het is alsof je een chef-kok traint: je geeft hem niet alleen alle ingrediënten, maar alleen de allerbeste, versste ingrediënten.

Waarom is dit bijzonder?

  • Lip-sync die klopt: Als een personage in de video "Hallo" zegt, zie je de mond ook echt de vorm van een "O" maken op het juiste moment.
  • Omgevingsgeluid: Als er een auto voorbijrijdt, hoor je niet alleen een auto, maar hoor je het geluid precies op het moment dat de auto door het beeld raast.
  • Open Source: In tegenstelling tot grote bedrijven zoals OpenAI (Sora), hebben de makers van MOVA de "recepten" en de "kennis" gedeeld met de wereld. Iedereen kan nu meebouwen aan deze technologie.

Samenvatting

MOVA is niet zomaar een machine die plaatjes maakt; het is een digitale maker die begrijpt dat in de echte wereld zien en horen onlosmakelijk met elkaar verbonden zijn. Het is de stap van een stomme film naar een meeslepende, levendige realiteit.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →