UniVoice: A Unified Model for Speech and Singing Voice Generation
यूनिवॉयस (UniVoice) कंडीशनल फ्लो मैचिंग पर आधारित एक एकीकृत भाषण और गायन स्वर जनरेशन फ्रेमवर्क है जो कंडीशनिंग को कंटेंट, मेलोडी और टिम्ब्र में विभाजित करता है, और गायन के लिए स्पष्ट मेलोडी नियंत्रण सक्षम करने के लिए एक सीखे हुए 'नल मेलोडी टोकन' का उपयोग करता है, जबकि भाषण के लिए स्वाभाविक प्रोसोडी इन्फरेंस की अनुमति देता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक ही रोबोट को दो बहुत अलग काम करने के लिए सिखाने की कोशिश कर रहे हैं: कहानी सुनाना (बोलना) और ओपेरा करना (गाना)।
आमतौर पर, आप दो अलग-अलग रोबोट बनाएंगे। एक को स्वाभाविक और संवादात्मक सुनाई देने के लिए डिज़ाइन किया गया है, जो अपने शब्दों के आधार पर अपनी लय पकड़ता है। दूसरे को एक सख्त संगीत स्कोर का पालन करने के लिए डिज़ाइन किया गया है, जो हर नोट और बीट को बिल्कुल सटीक तरीके से हिट करता है।
समस्या यह है कि केवल एक ही रोबोट बनाने की कोशिश में, दोनों के निर्देश एक-दूसरे के विपरीत होते हैं।
- गाने के लिए, आपको रोबोट को एक विशिष्ट धुन का पालन करने के लिए मजबूर करना होगा (जैसे पटरी पर चलती ट्रेन)।
- बोलने के लिए, यदि आप रोबोट को एक पटरी का पालन करने के लिए मजबूर करते हैं, तो यह रोबोटिक और अप्राकृतिक लगता है। इसे कहानी के भाव के आधार पर स्वतंत्र रूप से घूमने की आवश्यकता होती है।
यदि आप केवल प्रशिक्षण डेटा (training data) को मिला देते हैं, तो रोबोट भ्रमित हो जाता है। वह तब भी ट्रैक का पालन करने की कोशिश करता है जब उसे स्वतंत्र होना चाहिए, और वह तब भी स्वतंत्र होने की कोशिश करता है जब उसे ट्रैक का पालन करना चाहिए। परिणाम आमतौर पर दोनों में ही खराब होता है।
समाधान: UniVoice
शोधकर्ताओं ने UniVoice बनाया, जो एक नया "रोबोट" (कंप्यूटर मॉडल) है जो फैक्टराइज्ड कंडीशनिंग (Factorized Conditioning) नामक एक चतुर तकनीक का उपयोग करके इस समस्या को हल करता है। इसे एक बड़े, उलझे हुए स्विच के बजाय तीन अलग-अलग कंट्रोल नॉब (control knobs) देने के रूप में समझें।
यहाँ वे तीन नॉब कैसे काम करते हैं:
- कंटेंट नॉब (क्या कहा जा रहा है): यह बोल या टेक्स्ट को पढ़ता है। यह बोलने और गाने दोनों के लिए एक समान है।
- टिम्बर नॉब (कौन बोल रहा है): यह किसी व्यक्ति की आवाज़ के एक छोटे से नमूने (जैसे 5 सेकंड का क्लिप) को सुनता है ताकि उसकी अनूठी ध्वनि की नकल की जा सके, चाहे वह फुसफुसा रहा हो या ऊंचे स्वर में गा रहा हो।
- मेलोडी नॉब (धुन): यही जादुई हिस्सा है।
- गाते समय: आप इसमें एक विशिष्ट म्यूजिकल स्कोर (MIDI नोट्स) लगाते हैं। रोबोट को इस ट्रैक का पालन करना ही होगा।
- बोलते समय: संगीत ट्रैक लगाने के बजाय, आप एक विशेष "नल टोकन" (Null Token) लगाते हैं। इसे मेलोडी के लिए एक विशेष "डू नॉट डिस्टर्ब" (Do Not Disturb) साइन के रूप में समझें। यह रोबोट को बताता है: "म्यूजिक ट्रैक को अनदेखा करें; बस शब्दों को सुनें और अपनी लय खुद तय करें।"
इंजन: एक साझा मस्तिष्क
अंदरूनी तौर से, UniVoice एक शक्तिशाली इंजन का उपयोग करता है जिसे डिफ्यूजन ट्रांसफॉर्मर (Diffusion Transformer - DiT) कहा जाता है। कल्पना कीजिए कि यह एक अत्यधिक कुशल कलाकार है जो कुछ भी पेंट कर सकता है।
- अतीत में, आपको दो अलग-अलग कलाकारों (स्पीच और सिंगिंग के लिए) की आवश्यकता हो सकती थी।
- UniVoice एक ही कलाकार का उपयोग करता है जो तीन कंट्रोल नॉब को सुनने में बहुत अच्छा है।
- जब "मेलोडी नॉब" को "नल टोकन" पर सेट किया जाता है, तो कलाकार जानता है कि उसे स्वाभाविक रूप से लय बनानी है। जब नॉब को एक विशिष्ट गाने पर सेट किया जाता है, तो कलाकार शीट म्यूजिक का पूरी तरह से पालन करता है।
यह क्यों महत्वपूर्ण है (परिणाम)
शोधकर्ताओं ने भारी मात्रा में डेटा (30,000 घंटे का भाषण और 35,000 घंटे का गायन) पर इसका परीक्षण किया। उन्हें यह पता चला:
- यह दोनों में माहिर है: UniVoice लगभग उतना ही अच्छा बोलता है जितना कि सर्वश्रेष्ठ स्पीच-ओनली रोबोट (जैसे F5-TTS), और यह पिछले "ऑल-इन-वन" रोबोट की तुलना में बहुत बेहतर गाता है।
- यह कुशल है: यह यह सब अपेक्षाकृत छोटे आकार (0.3 बिलियन पैरामीटर्स) के साथ करता है, जबकि पुराने यूनिफाइड मॉडल बहुत बड़े थे और फिर भी खराब प्रदर्शन करते थे।
- "नल टोकन" काम करता है: उन्होंने साबित किया कि भाषण के लिए उस विशेष "डू नॉट डिस्टर्ब" साइन का उपयोग करना गणितीय रूप से सही तरीका है ताकि मॉडल बाद में गाने की अपनी क्षमता को तोड़े बिना मेलोडी को अनदेखा कर सके।
नया टेस्ट: UNISINGING-EVAL
यह सुनिश्चित करने के लिए कि उनका रोबोट वास्तव में अच्छा था, टीम ने UNISINGING-EVAL नामक एक नया टेस्ट बनाया। कल्पना कीजिए कि यह 12 अलग-अलग संगीत शैलियों (पॉप से लेकर जैज़ और हिप-हॉप तक) के साथ एक टैलेंट शो है। उन्होंने रोबोट का परीक्षण यह देखने के लिए किया कि क्या वह एक ही आवाज़ बनाए रखते हुए और विभिन्न शैलियों को संभालते हुए बोलने और गाने के बीच स्विच कर सकता है।
मुख्य बात
UniVoice एक यूनिवर्सल वॉयस एक्टर की तरह है। इसे बोलने बनाम गाने के लिए पुन: प्रशिक्षित करने या अलग मस्तिष्क की आवश्यकता नहीं है। यह बस निर्देशों को देखता है:
- "यहाँ टेक्स्ट है, यहाँ आवाज़ है, और यहाँ एक गाना है" -> पूरी तरह से गाता है।
- "यहाँ टेक्स्ट है, यहाँ आवाज़ है, और यहाँ कोई गाना नहीं है" -> स्वाभाविक रूप से बोलता है।
निर्देशों को अलग करके, उन्होंने रोबोट को भ्रमित होने से रोका, जिससे वह एक साथ दोनों कामों में उत्कृष्ट बन सका।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।