← नवीनतम पेपर
💻 computer science

Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation

Omni-Customizer एक एंड-टू-एंड फ्रेमवर्क है जो Omni-Context Fusion, Masked TTS Cross-Attention और Semantic-Anchored Multimodal RoPE जैसे नवीन मॉड्यूल्स को पेश करके स्पीच लीकेज जैसी चुनौतियों को हल करता है और कई विषयों में सुसंगत विजुअल पहचान और वोकल टिम्बर्स के साथ सटीक जॉइंट ऑडियो-वीडियो जनरेशन को सक्षम बनाता है ताकि स्टेट-ऑफ-द-आर्ट मल्टीमॉडल कस्टमाइजेशन हासिल किया जा सके।

मूल लेखक: Yuheng Chen, Qingdong He, Teng Hu, Yuji Wang, Yabiao Wang, Lizhuang Ma, Jiangning Zhang

प्रकाशित 2026-05-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuheng Chen, Qingdong He, Teng Hu, Yuji Wang, Yabiao Wang, Lizhuang Ma, Jiangning Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप कई अभिनेताओं के साथ एक फिल्म का दृश्य फिल्माने की कोशिश कर रहे हैं एक निर्देशक के रूप में। आपके पास एक स्क्रिप्ट है, लेकिन आपको यह भी सुनिश्चित करना होगा कि अभिनेता A हमेशा उसी विशिष्ट व्यक्ति की तरह दिखे जिसे आपने काम पर रखा है और उनकी अनूठी आवाज़ की तरह ही सुनाई दे, और अभिनेता B भी अपने लिए ऐसा ही करे। यदि कैमरा भ्रमित हो जाता है, तो आप अभिनेता A का चेहरा चलते हुए और अभिनेता B की आवाज़ बोलते हुए देख सकते हैं, या इससे भी बुरा, अभिनेता स्क्रिप्ट में दी गई लाइनों के अलावा कुछ और बोलने लग सकते हैं क्योंकि आपने सीन नोट्स में उनका वर्णन किया है।

यह ठीक वही समस्या है जिसे Omni-Customizer हल करता है। यह एक नया AI सिस्टम है जिसे ऐसे वीडियो बनाने के लिए डिज़ाइन किया गया है जहाँ कई लोग बात कर सकें और एक-दूसरे के साथ संवाद कर सकें, जबकि उनके अनूठे रूप और आवाज़ को पूरी तरह से बरकरार रखा जा सके।

यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं के साथ तोड़कर:

1. समस्या: "भ्रमित निर्देशक" (The "Confused Director")

पिछले AI टूल्स वीडियो बनाने में अच्छे थे या ऑडियो बनाने में अच्छे थे, लेकिन जब उन्होंने एक साथ कई लोगों के साथ दोनों करने की कोशिश की, तो वे भ्रमित हो गए।

  • मिश्रण (The Mix-up): AI आवाज़ों को मिला सकता है। यह लाल शर्ट वाले आदमी को महिला की लाइनें बोलता हुआ बना सकता है।
  • "भूतिया" आवाज़ (The "Ghost" Voice): कभी-कभी, AI गलती से दृश्य के विवरण को भाषण में बदल देता है। यदि आपने लिखा, "आदमी लंबा है," तो AI वास्तव में उस चरित्र से कहलवा सकता है, "मैं लंबा हूँ," भले ही वह संवाद में न हो।
  • पहचान बदलना (The Drift): जैसे-जैसे वीडियो आगे बढ़ता है, पात्र धीरे-धीरे अपने चेहरे या आवाज़ बदल सकते हैं, जिससे उनकी पहचान खो जाती है।

2. समाधान: "Omni-Customizer" टूलकिट

शोधकर्ताओं ने इन समस्याओं को ठीक करने के लिए एक सिस्टम बनाया जिसमें तीन मुख्य "टूल्स" हैं:

A. "सुपर-कनेक्टर" (Omni-Context Fusion)

AI के मस्तिष्क को अलग-अलग विभागों के रूप में सोचें: एक टेक्स्ट के लिए, एक चित्रों के लिए, और एक ध्वनि के लिए। आमतौर पर, ये विभाग एक-दूसरे से बहुत धीरे और अप्रत्यक्ष रूप से बात करते हैं।

  • समाधान: Omni-Customizer एक "सुपर-कनेक्टर" बनाता है जो इन सभी विभागों को एक ही मेज पर बैठने और तुरंत बात करने के लिए मजबूर करता है। यह व्यक्ति के विवरण, उनके फोटो और उनके वॉयस सैंपल को लेता है, और वीडियो जनरेशन शुरू होने से पहले उन्हें एक सख्त पैकेज में जोड़ देता है। यह सुनिश्चित करता है कि AI जानता हो कि, "यह चेहरा, यह आवाज़, और यह नाम सभी एक ही व्यक्ति के हैं।"

B. "नेम टैग" सिस्टम (Semantic-Anchored RoPE)

कल्पना कीजिए कि आपके पास पहेली के टुकड़ों का एक ढेर है: कुछ चेहरे हैं, कुछ आवाज़ें हैं, और कुछ शब्द हैं। यदि आप उन्हें बस एक बॉक्स में फेंक देते हैं, तो वे आपस में मिल जाते हैं।

  • समाधान: सिस्टम एक विशेष "नेम टैग" (जिसे SA-MRoPE कहा जाता है) का उपयोग करता है। यह भौतिक रूप से "चेहरा A" और "आवाज़ A" के पहेली के टुकड़े को स्क्रिप्ट के टेक्स्ट शब्द "विषय 1" (Subject 1) से जोड़ देता है। यह एक चुंबकीय टैग लगाने जैसा है ताकि वे टुकड़े इधर-उधर न तैरें और गलत व्यक्ति से न जुड़ जाएं। यह AI को यह समझने में मदद करता है कि कौन कौन है, यहाँ तक कि तीन या चार लोगों वाले भीड़भाड़ वाले दृश्यों में भी।

C. "साइलेंस बटन" (Masked TTS Cross-Attention)

याद है वह समस्या जहाँ AI गलती से दृश्य के विवरण बोल देता था?

  • समाधान: शोधकर्ताओं ने एक "साइलेंस बटन" (MTP-CA) स्थापित किया है। वे AI को बताते हैं: "केवल <S> (शुरू) और <E> (अंत) टैग के अंदर के शब्दों को बोलें।" बाकी सब कुछ—जैसे मौसम या पात्रों के कपड़ों का विवरण—पूरी तरह से मौन रहता है। AI को स्पीच जनरेट करते समय वर्णनात्मक टेक्स्ट को अनदेखा करने के लिए मजबूर किया जाता है, ताकि वह गलती से स्टेज डायरेक्शंस को ज़ोर से न पढ़ दे।

3. प्रशिक्षण: "जिम रूटीन" (The "Gym Routine")

इस सिस्टम को सिखाने के लिए, शोधकर्ताओं ने सारा डेटा एक साथ नहीं डाला। उन्होंने एक स्मार्ट ट्रेनिंग शेड्यूल का उपयोग किया:

  • "केवल-ऑडियो" अभ्यास (The "Audio-Only" Drills): कभी-कभी, AI केवल ऑडियो के साथ अभ्यास करता है (आवाज़ों को सुनना और भाषाएँ सीखना) बिना वीडियो की चिंता किए। इससे इसे विभिन्न भाषाओं में बोलने में मदद मिलती है बिना भ्रमित हुए।
  • "वीडियो-ऑडियो" अभ्यास (The "Video-Audio" Drills): अन्य समय में, यह वीडियो और ऑडियो को पूरी तरह से मेल खाने (लिप-सिंक करने) के लिए अभ्यास करता है।
  • "आसान से कठिन" सीढ़ी (The "Easy to Hard" Ladder): उन्होंने AI को केवल एक व्यक्ति के बोलने को संभालने के लिए सिखाने से शुरुआत की। एक बार जब उसने इसमें महारत हासिल कर ली, तो वे दो लोगों की ओर बढ़े, और अंत में कई लोगों के आपस में बात करने वाले जटिल दृश्यों की ओर बढ़े। इस चरण-दर-चरण दृष्टिकोण ने AI को अभिभूत होने से बचाया।

4. परिणाम

परीक्षण के दौरान, Omni-Customizer ने साबित किया कि यह कर सकता है:

  • लंबे संवादों के दौरान भी चेहरों और आवाज़ों को सुसंगत रखना।
  • "भूतिया आवाज़" की समस्या (जहाँ विवरण बोले जाते हैं) को रोकना।
  • किसी भी पिछले ओपन-सोर्स मॉडल की तुलना में कई लोगों वाले जटिल दृश्यों को बेहतर ढंग से संभालना।

संक्षेप में: Omni-Customizer एक अत्यधिक संगठित फिल्म क्रू की तरह है जो कभी भी यह ट्रैक नहीं खोता कि कौन सा अभिनेता कौन है, यह सुनिश्चित करता है कि वे केवल अपनी वास्तविक लाइनें बोलें, और पहले सेकंड से लेकर आखिरी सेकंड तक उनकी आवाज़ और चेहरे को सुसंगत बनाए रखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →