← नवीनतम पेपर
⚡ electrical engineering

VoiceDesigner: Text-to-Voice Generation and Editing via Unified Diffusion Modeling and Data Augmentation

VoiceDesigner एक एकीकृत ढांचा है जो विविध वास्तविक और काल्पनिक आवाजों को उत्पन्न करने की मौजूदा सीमाओं को दूर करने के साथ-साथ सुदृढ़, नियंत्रणीय वॉयस एडिटिंग को सक्षम करने के लिए एक हाइब्रिड डेटा पाइपलाइन और एक उन्नत डिफ्यूजन ट्रांसफॉर्मर का लाभ उठाता है।

मूल लेखक: Jiarui Hai, Karan Thakkar, Ke Chen, Yunyun Wang, Jiaqi Su, Rithesh Kumar, Mounya Elhilali, Zeyu Jin

प्रकाशित 2026-08-17
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Jiarui Hai, Karan Thakkar, Ke Chen, Yunyun Wang, Jiaqi Su, Rithesh Kumar, Mounya Elhilali, Zeyu Jin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ आपकी आवाज़ केवल एक जैविक दुर्घटना नहीं है, बल्कि एक अनुकूलन योग्य वाद्य यंत्र है जिसे आप एक गिटार की तरह ट्यून कर सकते हैं। दशकों से, कंप्यूटर टेक्स्ट को ज़ोर से पढ़ने में बहुत अच्छे रहे हैं, लेकिन वे आमतौर पर एक एकल, कठोर रोबोट की तरह सुनाई देते हैं जब तक कि आप उन्हें नकल करने के लिए किसी वास्तविक व्यक्ति की रिकॉर्डिंग न दें। इस क्षेत्र को, जिसे टेक्स्ट-टू-वॉइस (TTV) कहा जाता है, इसे बदलने की कोशिश कर रही है। केवल एक विशिष्ट व्यक्ति की नकल करने के बजाय, वैज्ञानिक कंप्यूटर को "एक चिड़चिड़े बूढ़े जादूगर" या "एक उत्साहित एलियन" जैसे विवरणों को समझना सिखा रहे हैं और शून्य से एक आवाज़ बना रहे हैं। यह एक शेफ को व्यंजन की तस्वीर देने के बजाय शब्दों में लिखी गई रेसिपी देने जैसा है; लक्ष्य केवल निर्देशों को पढ़कर सटीक स्वाद, बनावट और गंध उत्पन्न करना है। लेकिन अब तक, इन डिजिटल शेफ को दो बड़ी समस्याओं का सामना करना पड़ा है: वे ज्यादातर केवल "मानवीय" व्यंजन ही बनाना जानते हैं, और यदि आप उनसे किसी स्वाद में बदलाव करने के लिए कहते हैं (जैसे किसी आवाज़ को अधिक खुशमिजाज बनाने के लिए), तो वे अक्सर पूरा भोजन खराब कर देते हैं।

पेश है VoiceDesigner, एक नया सिस्टम जो एक मास्टर वॉयस आर्किटेक्ट की तरह काम करता है। इस प्रोजेक्ट के पीछे के शोधकर्ताओं ने महसूस किया कि मौजूदा सिस्टम एक ढर्रे में फंस गए थे, जो ज्यादातर मानक मानवीय आवाज़ें उत्पन्न करते थे और काल्पनिक पात्रों जैसे कि ड्रैगन या दानव बनाने में विफल रहते थे, या किसी आवाज़ के मूड को बदलने की कोशिश करते समय उसे बिगाड़ देते थे। इसे ठीक करने के लिए, उन्होंने एक एकीकृत ढांचा बनाया जो आवाज़ बनाने और आवाज़ को संपादित करने को एक ही सिक्के के दो पहलुओं के रूप में मानता है। इसे एक एकल, सुपर-स्मार्ट स्टूडियो के रूप में सोचें जहाँ आप या तो एक टेक्स्ट विवरण का उपयोग करके ज़ीरो से एक आवाज़ बना सकते हैं, या एक मौजूदा आवाज़ को "इसे और अधिक रहस्यमय बनाओ" जैसे सरल निर्देश के साथ नया रूप दे सकते हैं।

VoiceDesigner के पीछे का असली राज दो चीजों का एक चतुर मिश्रण है। पहला, उन्होंने केवल वास्तविक लोगों की रिकॉर्डिंग पर भरोसा नहीं किया; उन्होंने एक "वॉयस फैक्ट्री" बनाई जो डिजिटल सिग्नल प्रोसेसिंग (जैसे साउंडबोर्ड पर नॉब्स घुमाना) और जनरेटिव एआई का उपयोग करके हजारों नकली लेकिन यथार्थवादी आवाज़ें बनाती है। इसने उन्हें मानव फुसफुसाहट से लेकर राक्षस की गहरी गूँज तक सब कुछ सिखाने में सक्षम बनाया, जिससे उन अंतरालों को भरा जा सका जिन्हें वास्तविक दुनिया की रिकॉर्डिंग खाली छोड़ देती थी। दूसरा, उन्होंने सिस्टम के मस्तिष्क को अपग्रेड किया—एक प्रकार का एआई जिसे डिफ्यूजन ट्रांसफॉर्मर कहा जाता है। उन्होंने इसे निर्देशों, ट्रांसक्रिप्ट्स और ऑडियो संदर्भों को एक साथ सुनने का एक नया तरीका दिया ताकि वह भ्रमित न हो, जिसमें एक विशेष 3D पोजिशनिंग सिस्टम का उपयोग किया गया है जो विभिन्न प्रकार की जानकारी को व्यवस्थित रखता है, जैसे कि एक लाइब्रेरियन जो कभी भी किताबों, फिल्मों और संगीत को आपस में नहीं मिलाता।

परिणाम बताते हैं कि यह दृष्टिकोण उल्लेखनीय रूप से अच्छा काम करता है। परीक्षणों में, VoiceDesigner अन्य ओपन-सोर्स मॉडल की तुलना में जटिल निर्देशों का पालन करने में बेहतर था, जिसने समुद्री डाकुओं और रोबोट जैसे पात्रों के लिए सफलतापूर्वक आवाजें उत्पन्न कीं जो बिल्कुल वर्णित विवरण के अनुसार थीं। इसने एक मास्टर एडिटर के रूप में भी खुद को साबित किया, जो किसी वक्ता की पहचान खोए बिना उसकी भावना या लहजे को बदलने में सक्षम था। हालांकि अभी भी शीर्ष-स्तरीय व्यावसायिक प्रणालियों के साथ एक छोटा सा अंतर बाकी है, यह पेपर दिखाता है कि रचनात्मक डेटा सिमुलेशन को एक स्मार्ट, एकीकृत मॉडल के साथ जोड़कर, हम एक ऐसे भविष्य के बहुत करीब पहुँच रहे हैं जहाँ आप अपने कीबोर्ड से ही किसी भी ऐसी आवाज़ को डिज़ाइन कर सकते हैं जिसकी आप कल्पना कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →