← नवीनतम पेपर
💻 computer science

Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation

यूनिसन (Unison) एक एकीकृत ढांचा है जो सटीक टेम्पोरल संरेखण और ध्वनिक स्पष्टता सुनिश्चित करने के लिए सिमेंटिक-गाइडेड ऑडियो डिकपलिंग और द्विदिश क्रॉस-मोडल फोर्सिंग रणनीतियों के माध्यम से मोशन, स्पीच और साउंड इफेक्ट्स को स्पष्ट रूप से सामंजस्यपूर्ण बनाकर स्टेट-ऑफ-द-आर्ट मानव-केंद्रित ऑडियो-वीडियो जनरेशन प्राप्त करता है।

मूल लेखक: Shihao Cheng, Jiaxu Zhang, Quanyue Song, Shansong Liu, Zhizhi Guo, Xiaolei Zhang, Chi Zhang, Xuelong Li, Zhigang Tu

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shihao Cheng, Jiaxu Zhang, Quanyue Song, Shansong Liu, Zhizhi Guo, Xiaolei Zhang, Chi Zhang, Xuelong Li, Zhigang Tu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक फिल्म का दृश्य निर्देशित कर रहे हैं जहाँ एक अभिनेता बारिश में गिटार बजाते हुए गाना गा रहा है। एक आदर्श दुनिया में, गायन, गिटार की झंकार और बारिश की आवाज़, तीनों बिल्कुल सही क्षण पर एक साथ होंगे, जो एक सुंदर और स्वाभाविक अनुभव का निर्माण करेंगे।

हालाँकि, वर्तमान AI उपकरण जो ऐसे वीडियो बनाने की कोशिश करते हैं, अक्सर संघर्ष करते हैं। वे अभिनेता की आवाज़ को इतना तेज़ बना सकते हैं कि वह गिटार और बारिश की आवाज़ को दबा दे, या वे अभिनेता के होंठों को शब्दों के बजाय गिटार के सुरों के अनुसार हिला सकते हैं। यह एक ऐसे बैंड की तरह है जहाँ गायक वाद्य यंत्रों पर चिल्ला रहा है, और ड्रमर ताल से बाहर बज रहा है।

यह शोध पत्र Unison (जिसका अर्थ है "एक साथ अभिनय करना") नामक एक नया AI फ्रेमवर्क पेश करता है ताकि इन समस्याओं को ठीक किया जा सके। Unison को एक अत्यधिक कुशल ऑडियो-विजुअल कंडक्टर के रूप में समझें जो यह सुनिश्चित करता है कि वीडियो का हर तत्व पूर्ण सामंजस्य में काम करे।

यहाँ बताया गया है कि यह दो मुख्य समस्याओं को कैसे हल करता है, सरल उपमाओं का उपयोग करते हुए:

1. "वॉल्यूम नॉब" की समस्या (भाषण बनाम ध्वनि प्रभाव)

समस्या: पिछले AI मॉडलों में, "भाषण" (अभिनेता का बोलना या गाना) एक पार्टी में एक दबंग की तरह था। वह सारा स्थान घेर लेता था, जिससे "ध्वनि प्रभाव" (जैसे बारिश, हवा या गिटार की झंकार) पृष्ठभूमि में धकेल दिए जाते थे जब तक कि वे मुश्किल से सुनाई देने योग्य रह जाते थे। इसका परिणाम एक सपाट, उबाऊ ऑडियो था जहाँ वातावरण नकली महसूस होता था।

Unison का समाधान: Unison दो अलग-अलग मिक्सिंग बोर्डों वाले एक स्मार्ट साउंड इंजीनियर की तरह कार्य करता है।

  • पृथक्करण (Separation): आवाज़ और गिटार को एक ही अव्यवस्थित ढेर में मिलाने के बजाय, Unison उन्हें दो अलग-अलग ट्रैक्स पर बनाता है।
  • "स्मार्ट गेटिंग" (SCG): एक ट्रैफिक लाइट सिस्टम की कल्पना करें। यदि दृश्य मुख्य रूप से अभिनेता के बोलने के बारे में है, तो सिस्टम स्वचालित रूप से बैकग्राउंड शोर को बस इतना कम कर देता है कि आवाज़ स्पष्ट रहे। लेकिन यदि दृश्य कोई कॉन्सर्ट या तूफान है, तो सिस्टम बैकग्राउंड ध्वनियों को इतना बढ़ा देता है कि वे दब न जाएं।
  • "हैंडशेक" (Bi-ACA): वॉइस ट्रैक और साउंड ट्रैक लगातार एक-दूसरे से "बात" करते हैं। वे यह जांचने के लिए चेक-इन करते हैं कि कहीं आवाज़ गलती से गिटार की आवाज़ को निगल तो नहीं रही है, और इसके विपरीत भी। यह सुनिश्चित करता है कि अंतिम ऑडियो एक संतुलित और समृद्ध मिश्रण हो जहाँ आप गायक और बारिश दोनों को स्पष्ट रूप से सुन सकें।

2. "लिप-सिंक" की समस्या (गति बनाम ध्वनि)

समस्या: अक्सर, वीडियो और ऑडियो तालमेल में नहीं होते। अभिनेता का मुँह आवाज़ आने के एक सेकंड बाद खुल सकता है, या हाथ का हाथ गिटार के तार छूने से पहले ही झंकार हो सकती है। यह ऐसा लगता है जैसे वीडियो और ऑडियो दो अलग-अलग लोग हैं जिन्होंने एक साथ अभ्यास नहीं किया है।

Unison का समाधान: Unison "क्रॉस-मोडल फोर्सिंग" नामक एक प्रशिक्षण ड्रिल का उपयोग करता है।

  • उपमा: कल्पना कीजिए कि दो डांसर एक रूटीन सीख रहे हैं। आमतौर पर, वे पूरा डांस एक ही गति पर सीखने की कोशिश करते हैं। यदि एक लड़खड़ाता है, तो दूसरा भी लड़खड़ा जाता है, और वे भ्रमित हो जाते हैं।
  • Unison का ट्विस्ट: Unison एक डांसर (मान लीजिए, ऑडियो) को दूसरे (वीडियो) की तुलना में थोड़ा तेज़ और अधिक स्पष्ट रूप से कदम सीखने देता है। फिर वह "स्पष्ट" डांसर "शोर वाले" डांसर को मार्गदर्शन करने के लिए गाइड के रूप में कार्य करता है, जो उसे बताता है कि अगला कदम कहाँ रखना है।
  • परिणाम: एक स्पष्ट सिग्नल को दूसरे को निर्देशित करने की अनुमति देकर, AI वीडियो की गतिविधियों और ध्वनियों को पूरी तरह से लॉक करना सीख जाता है। समय के साथ, अभिनेता के होंठ ठीक उसी समय चलते हैं जब शब्द बोले जाते हैं, और गिटार की झंकार ठीक उसी क्षण होती है जब उंगलियां तारों को छूती हैं।

अंतिम परिणाम

जब आप इन दोनों समाधानों को एक साथ रखते हैं, तो Unison ऐसे वीडियो बनाता है जो वास्तविक लगते हैं।

  • अब कुछ भी दबेगा नहीं: आप गायक और बैकग्राउंड संगीत दोनों को सुन सकते हैं।
  • अब कोई अंतराल नहीं: क्रियाएं और ध्वनियां बिल्कुल एक ही समय पर होती हैं।

शोध पत्र दिखाता है कि Unison न केवल ऐसे वीडियो बनाता है जो दिखने में अच्छे हैं; बल्कि वे सुनने में भी अच्छे लगते हैं और तालमेल महसूस कराते हैं, जिससे पिछले AI मॉडलों की तुलना में बहुत अधिक इमर्सिव अनुभव मिलता है। यह बिना किसी विशाल कंप्यूटर के हासिल करता है, जो यह सिद्ध करता है कि स्मार्ट संगठन (जैसे ट्रैक्स को अलग करना और सीखने के लिए मार्गदर्शन करना) कच्ची शक्ति जितना ही महत्वपूर्ण है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →