← नवीनतम पेपर
💻 computer science

MOVA: Towards Scalable and Synchronized Video-Audio Generation

MOVA एक ओपन-सोर्स, 32B-पैरामीटर वाला मिक्स्चर-ऑफ-एक्सपर्ट्स मॉडल है जिसे स्केलेबल और सिंक्रोनाइज्ड इमेज-टेक्स्ट-टू-वीडियो-ऑडियो जनरेशन के लिए डिज़ाइन किया गया है, जो लिप-सिंक्ड स्पीच और एनवायरनमेंट-अवेयर साउंड इफेक्ट्स सहित उच्च गुणवत्ता वाली, मल्टीमॉडल सामग्री प्रदान करता है।

मूल लेखक: OpenMOSS Team, Donghua Yu, Mingshu Chen, Qi Chen, Qi Luo, Qianyi Wu, Qinyuan Cheng, Ruixiao Li, Tianyi Liang, Wenbo Zhang, Wenming Tu, Xiangyu Peng, Yang Gao, Yanru Huo, Ying Zhu, Yinze Luo, Yiyang Zh
प्रकाशित 2026-02-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: OpenMOSS Team, Donghua Yu, Mingshu Chen, Qi Chen, Qi Luo, Qianyi Wu, Qinyuan Cheng, Ruixiao Li, Tianyi Liang, Wenbo Zhang, Wenming Tu, Xiangyu Peng, Yang Gao, Yanru Huo, Ying Zhu, Yinze Luo, Yiyang Zhang, Yuerong Song, Zhe Xu, Zhiyu Zhang, Chenchen Yang, Cheng Chang, Chushu Zhou, Hanfu Chen, Hongnan Ma, Jiaxi Li, Jingqi Tong, Junxi Liu, Ke Chen, Shimin Li, Shiqi Jiang, Songlin Wang, Wei Jiang, Zhaoye Fei, Zhiyuan Ning, Chunguo Li, Chenhui Li, Ziwei He, Zengfeng Huang, Xie Chen, Xipeng Qiu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक ऐसी फिल्म देख रहे हैं जहाँ अभिनेताओं के होंठ शब्दों के साथ पूरी तरह से हिल रहे हैं, कांच टूटने की आवाज़ ठीक उसी समय आती है जब वह ज़मीन पर गिरता है, और बैकग्राउंड म्यूजिक सीन के मूड के साथ बिल्कुल सही तरीके से उभरता है।

वर्तमान में, अधिकांश AI मॉडल इसमें संघर्ष करते हैं। वे एक ऐसे प्रतिभाशाली चित्रकार की तरह हैं जो एक सुंदर दृश्य तो बना सकता है लेकिन पूरी तरह से बहरा है, या एक ऐसे संगीतकार की तरह जो एक सुंदर गीत तो बजा सकता है लेकिन अंधा है। एक "फिल्म" बनाने के लिए, उन्हें आमतौर पर दो अलग-अलग उपकरणों का उपयोग करना पड़ता है: एक वीडियो बनाने के लिए और दूसरा बाद में ध्वनि को "चिपकाने" के लिए। यह अक्सर एक "खराब डबिंग" प्रभाव पैदा करता है जहाँ ध्वनि और चित्र थोड़े तालमेल से बाहर महसूस होते हैं।

MOVA एक ऐसे निर्माता की तरह है जिसने अंततः अपनी दोनों आँखों और कानों का एक ही समय में उपयोग करना सीख लिया है।

यहाँ बताया गया है कि उन्होंने इसे कैसे किया, कुछ सरल उपमाओं का उपयोग करते हुए:

1. "दो-मस्तिष्क" वास्तुकला (द ड्यूल-टावर)

एक विशाल, भ्रमित मस्तिष्क के बजाय जो सब कुछ करने की कोशिश करता है, शोधकर्ताओं ने MOVA को दो विशिष्ट "मस्तिष्क" (जिन्हें टावर्स कहा जाता है) के साथ बनाया है जो आपस में लगातार बात करते हैं:

  • वीडियो मस्तिष्क: आकृतियों, प्रकाश और गति को समझने में एक बड़ा विशेषज्ञ।
  • ऑडियो मस्तिष्क: एक विशेषज्ञ जो लय, पिच और स्वर को समझता है।
  • ब्रिज (पुल): यह सबसे महत्वपूर्ण हिस्सा है। कल्पना कीजिए कि दो नर्तक एक जुगलबंदी कर रहे हैं। यदि वे एक-दूसरे को नहीं देखते हैं, तो वे लड़खड़ा जाएंगे। "ब्रिज" निरंतर नेत्र संपर्क और शारीरिक स्पर्श की तरह कार्य करता है, यह सुनिश्चित करता है कि जब वीडियो मस्तिष्क किसी का मुँह हिलाने का निर्णय लेता है, तो ऑडियो मस्तिष्क तुरंत संबंधित ध्वनि चलाने के लिए तैयार हो।

2. "परफेक्ट स्क्रिप्ट" (डेटा इंजीनियरिंग)

इस मॉडल को सिखाने के लिए, आप इसे केवल रैंडम वीडियो नहीं दिखा सकते। आपको इसे एक "परफेक्ट स्क्रिप्ट" देनी होगी।
यदि आप एक बच्चे को कुत्ते के भौंकने का वीडियो दिखाते हैं, तो आप केवल "कुत्ता" नहीं कहते। आप कहते हैं, "एक सुनहरी रिट्रीवर एक धूप वाले पार्क में जोर से भौंक रही है जबकि पृष्ठभूमि में पक्षी चहचहा रहे हैं।"
MOVA टीम ने एक विशाल "स्वचालित शिक्षक" (एक पाइपलाइन) बनाया है जो हजारों घंटों के वीडियो को देखता है और दृश्यों और ध्वनियों दोनों के लिए अविश्वसनीय रूप से विस्तृत विवरण लिखता है। यह सुनिश्चित करता है कि मॉडल सीख सके कि कौन सी ध्वनि किस दृश्य हलचल से संबंधित है।

3. "स्मार्ट वॉल्यूम नॉब" (ड्यूल क्लासिफायर-फ्री गाइडेंस)

जब AI वीडियो जेनरेट कर रहा होता है, तो वह दो अलग-अलग बॉसों का पालन करने की कोशिश कर रहा होता है: टेक्स्ट प्रॉम्प्ट (जो आपने मांगा है) और क्रॉस-मोडल कनेक्शन (यह सुनिश्चित करना कि ध्वनि वीडियो से मेल खाती है)।
कभी-कभी, AI टेक्स्ट पर बहुत अधिक ध्यान दे सकता है और ध्वनि को सिंक करना भूल सकता है, या सिंक पर इतना अधिक ध्यान केंद्रित कर सकता है कि ऑडियो रोबोटिक सुनाई देने लगे।
MOVA एक "स्मार्ट नॉब" पेश करता है जो उपयोगकर्ताओं को इन दोनों के बीच संतुलन बनाने की अनुमति देता है। यदि आप बोलने वाले पात्र के लिए सटीक लिप-सिंक चाहते हैं, तो आप "सिंक नॉब" को बढ़ा सकते हैं, या यदि आप अधिक सिनेमाई, कलात्मक वीडियो चाहते हैं, तो आप "क्रिएटिविटी नॉब" को बढ़ा सकते हैं।

4. यह क्यों मायने रखता है?

MOVA से पहले, उच्च-गुणवत्ता वाला वीडियो-ऑडियो जेनरेशन बड़ी, बंद कंपनियों (जैसे OpenAI का Sora) के स्वामित्व वाली एक "गुप्त रेसिपी" थी। MOVA ओपन सोर्स है, जिसका अर्थ है कि वे इस रेसिपी को पूरी दुनिया को सौंप रहे हैं।

संक्षेप में: MOVA केवल एक वीडियो निर्माता या ध्वनि निर्माता नहीं है; यह एक मल्टीमीडिया स्टोरीटेलर है जो समझता है कि वास्तविक दुनिया में, देखना और सुनना एक ही सिक्के के दो पहलू हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →