PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis
पायलटटीटीएस (PilotTTS) एक हल्का, ओपन-सोर्स ऑटोरेग्रेसिव टेक्स्ट-टू-स्पीच सिस्टम है जो एक न्यूनतम आर्किटेक्चर और केवल 200K घंटों के डेटा पर प्रशिक्षित एक पुनरुत्पादक डेटा पाइपलाइन का उपयोग करके वॉयस क्लोनिंग, इमोशन और डायलेक्ट सिंथेसिस में अत्याधुनिक प्रदर्शन प्राप्त करता है, जो काफी बड़े डेटासेट पर प्रशिक्षित मॉडलों से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विश्व स्तरीय वॉयस एक्टर (आवाज़ देने वाला कलाकार) बनाना चाहते हैं। आमतौर पर, ऐसा करने के लिए आपको एक विशाल, महंगे स्टूडियो, रिकॉर्ड किए गए स्क्रिप्ट के लाखों घंटों और एक जटिल मशीन बनाने के लिए इंजीनियरों की एक टीम की आवश्यकता होती है। यह एक औद्योगिक भट्टियों और दुर्लभ, विशेष सामग्रियों वाले कारखाने का उपयोग करके एक मिशलिन-स्टार केक बनाने की कोशिश करने जैसा है।
PilotTTS अलीबाबा की एमैप (Amap) टीम की एक नई रेसिपी है जो कहती है: "आपको कारखाने की आवश्यकता नहीं है। आपको बस एक बहुत अच्छे, अनुशासित किचन और आपके पास जो है उसका उपयोग करने के एक स्मार्ट तरीके की आवश्यकता है।"
इसे सरल भाषा में यहाँ समझाया गया है:
1. "साफ किचन" (डेटा प्रोसेसिंग)
अधिकांश AI वॉयस मॉडल इंटरनेट से स्क्रैप किए गए अव्यवस्थित डेटा पर प्रशिक्षित होते हैं—जैसे कि ऐसी सामग्री के साथ बेकिंग करना जिसमें कीड़े हों।
- पुराना तरीका: टीमें अक्सर अपने डेटा को साफ करने के लिए गुप्त, महंगे उपकरणों का उपयोग करती हैं, जो अन्य शोधकर्ताओं को इससे दूर रखता है।
- PilotTTS का तरीका: उन्होंने केवल मुफ्त, ओपन-सोर्स टूल्स का उपयोग करके एक "क्लीनिंग पाइपलाइन" बनाई। इसे एक कन्वेयर बेल्ट की तरह समझें जो हर एक ऑडियो क्लिप को धोती है, छाँटती है और निरीक्षण करती है।
- यह जाँचता है कि क्या ऑडियो स्पष्ट है (कोई शोर या बैकग्राउंड नॉइज़ नहीं)।
- यह उन हिस्सों को काट देता है जहाँ लोग एक-दूसरे के ऊपर बोल रहे होते हैं।
- यह सब कुछ पूरी तरह से लेबल करता है (कौन बोल रहा है, वे क्या कह रहे हैं, और वे कैसे कह रहे हैं)।
- परिणाम: उन्होंने इंटरनेट ऑडियो के एक विशाल ढेर को उच्च गुणवत्ता वाले डेटा की एक शुद्ध, 2,00,000 घंटे की लाइब्रेरी में बदल दिया। यह एक कबाड़खाने को एक पूरी तरह से व्यवस्थित लाइब्रेरी में बदलने जैसा है।
2. "स्मार्ट शेफ" (मॉडल आर्किटेक्चर)
हजारों चलते हुए पुर्जों वाले एक विशाल, जटिल रोबोट बनाने के बजाय, उन्होंने एक "मॉड्यूलर" दृष्टिकोण का उपयोग किया। उन्होंने मौजूदा, सिद्ध टूल्स को लिया और उन्हें एक चतुर नए तरीके से जोड़ा।
- दिमाग: उन्होंने टेक्स्ट को समझने के लिए एक शक्तिशाली लैंग्वेज मॉडल (Qwen3) का उपयोग किया।
- "डिकपलिंग" (Decoupling) ट्रिक: यह उनका सीक्रेट सॉस है। आमतौर पर, जब एक AI किसी की आवाज़ की नकल करने की कोशिश करता है, तो वह इस बात में भ्रमित हो जाता है कि व्यक्ति कौन है (उनकी अनूठी टोन/टिम्बर) और वे कैसे बोल रहे हैं (उनकी भावना या गति)।
- PilotTTS दो अलग-अलग "सेंसर्स" (एक Q-Former और एक CAMPPlus एनकोडर) का उपयोग करता है। एक सेंसर केवल पहचान (आवाज़ स्वयं) पर ध्यान केंद्रित करता है, और दूसरा शैली (भावना, गति और लहजा) पर ध्यान केंद्रित करता है।
- उपमा: एक चित्रकार की कल्पना करें। एक ब्रश व्यक्ति का चेहरा (पहचान) पेंट करता है, और दूसरा ब्रश दृश्य के मूड (शैली) को पेंट करता है। ब्रशों को अलग रखकर, चित्रकार मूड बदल सकता है (व्यक्ति को दुखी या खुश बना सकता है) बिना गलती से व्यक्ति का चेहरा बदले।
3. यह क्या कर सकता है?
चूंकि उन्होंने "आवाज़" को "शैली" से अलग कर दिया है, इसलिए यह सिस्टम अविश्वसनीय रूप से लचीला है:
- जीरो-शॉट क्लोनिंग: आप इसे किसी अजनबी की आवाज़ के 5 सेकंड दे सकते हैं, और यह उस आवाज़ में कोई भी टेक्स्ट बोल सकता है। इसने बहुत बड़े डेटासेट पर प्रशिक्षित अन्य सिस्टमों की तुलना में इसे बेहतर ढंग से किया।
- इमोशन कंट्रोल: आप इसे "दुखी", "गुस्से में", या "चिंता के भाव के साथ" बोलने के लिए कह सकते हैं। यह 11 विभिन्न भावनाओं के लिए यह कर सकता है।
- पैरालिंग्विस्टिक्स (Paralinguistics): यह हँसी, रोना, खाँसना या सांस लेने जैसी मानवीय ध्वनियाँ जोड़ सकता है। यह "रैप्ड लैफ्टर" (wrapped laughter) भी कर सकता है, जहाँ व्यक्ति बोलने के दौरान हँसता है, न कि केवल बोलने से पहले या बाद में।
- डायलैक्ट्स (बोलियाँ): यह 14 अलग-अलग चीनी बोलियाँ बोल सकता है। भले ही आप इसे मंदारिन (Mandarin) में प्रॉम्प्ट दें, यह मूल वॉयस आइडेंटिटी को रखते हुए एक विशिष्ट बोली में स्विच कर सकता है।
4. परिणाम
उन्होंने इस सिस्टम का परीक्षण अन्य शीर्ष-स्तरीय वॉयस मॉडलों के विरुद्ध किया।
- सटीकता: इसने जो कहा उसमें बहुत कम गलतियाँ कीं (कम एरर रेट)।
- वॉयस मैच: यह मूल वक्ता की तरह लगभग किसी भी अन्य परीक्षण किए गए सिस्टम की तुलना में अधिक सुनाई दिया, भले ही इसे बहुत कम डेटा (प्रतिद्वंद्वियों द्वारा उपयोग किए गए लाखों घंटों के मुकाबले 2,00,000 घंटे) पर प्रशिक्षित किया गया था।
- दक्षता: इसने इन परिणामों को बिना किसी मालिकाना डेटा या विशाल, जटिल आर्किटेक्चर की आवश्यकता के प्राप्त किया।
निचोड़
PilotTTS यह साबित करता है कि शीर्ष श्रेणी का AI वॉयस बनाने के लिए आपको अनंत संसाधनों वाली एक विशाल टेक कंपनी होने की आवश्यकता नहीं है। डेटा की गुणवत्ता के प्रति अनुशासित होकर और स्मार्ट, मॉड्यूलर डिज़ाइन (कि "कौन" है और "कैसे" बोल रहा है, को अलग करके) का उपयोग करके, उन्होंने एक ऐसा सिस्टम बनाया है जो इस क्षेत्र के सबसे बड़े खिलाड़ियों के साथ प्रतिस्पर्धा करने में सक्षम है।
उन्होंने अपनी "रेसिपी" (कोड और डेटा पाइपलाइन) को जनता के लिए जारी कर दिया है, ताकि कोई भी इस "साफ किचन" और "स्मार्ट शेफ" का अपना संस्करण बना सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।