JaiTTS: A Thai Voice Cloning Model
JaiTTS-v1.0 एक अत्याधुनिक थाई वॉयस क्लोनिंग टेक्स्ट-टू-स्पीच मॉडल है जो VoxCPM आर्किटेक्चर पर आधारित है, जो स्पष्ट टेक्स्ट नॉर्मलाइजेशन के बिना कोड-स्विचिंग और अंकगणित को प्रभावी ढंग से संभालकर बेहतर कैरेक्टर एरर रेट प्राप्त करता है और मानव मूल्यांकन में व्यावसायिक फ्लैगशिप मॉडल्स से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक मास्टर शेफ है जो कोई भी व्यंजन बना सकता है, लेकिन वह वास्तव में केवल अंग्रेजी भोजन बनाना ही अच्छी तरह जानता है। यदि आप उनसे थाई व्यंजन बनाने के लिए कहते हैं, तो वे मसालों में गलती कर सकते हैं, या यदि आप उन्हें ऐसा व्यंजन बनाने के लिए कहते हैं जिसमें थाई और अंग्रेजी सामग्री का मिश्रण हो, तो वे भ्रमित हो सकते हैं।
JaiTTS एक नए, विशिष्ट थाई शेफ की तरह है जिसे विशेष रूप से थाई आवाजों और कहानियों के एक विशाल पुस्तकालय पर प्रशिक्षित किया गया है। यहाँ एक सरल विवरण दिया गया है कि यह पेपर उनके नए निर्माण के बारे में क्या कहता है:
1. समस्या: "अंग्रेजी-मात्र" शेफ
मौजूदा बेहतरीन वॉयस-क्लोनिंग टूल्स में से अधिकांश उस अंग्रेजी-मात्र शेफ की तरह हैं। वे अंग्रेजी के लिए बहुत अच्छे से काम करते हैं लेकिन थाई के लिए संघर्ष करते हैं।
- लहजे (Accent) की समस्या: जब वे थाई बोलने की कोशिश करते हैं, तो वे कभी-कभी टोन (भाषा के संगीत संबंधी उतार-चढ़ाव) को गलत कर देते हैं।
- "कोड-स्विचिंग" का संघर्ष: वास्तविक जीवन में, थाई लोग अक्सर थाई वाक्यों में अंग्रेजी शब्दों को मिलाते हैं (जैसे कि कहना "I need to check my schedule")। मौजूदा थाई टूल्स अक्सर इस मिश्रण पर अटक जाते हैं या इसके लिए किसी इंसान द्वारा टेक्स्ट को पहले साफ करने की आवश्यकता होती है।
- लंबी कहानी की समस्या: कुछ थाई टूल्स छोटी वाक्यों के लिए बेहतरीन होते हैं, लेकिन जब उन्हें लंबी कहानी सुनाने के लिए कहा जाता है, तो वे रोबोटिक हो जाते हैं या टूट जाते हैं।
2. समाधान: JaiTTS-v1.0
टीम ने JaiTTS-v1.0 बनाया है, एक नया वॉयस मॉडल जो विशेष रूप से थाई के लिए डिज़ाइन किया गया है। इसे एक "सुपर-शेफ" के रूप में समझें जिसने सीधे 10,000 घंटों के थाई ऑडियो से सीखा है।
यह कैसे काम करता है (रसोई का रूपक):
एक पूर्व-निर्मित रेसिपी बुक का उपयोग करने के बजाय (जो एक "टोकेनाइज़र" की तरह है जो शब्दों को टुकड़ों में तोड़ देता है), JaiTTS सुनकर और सीधे नकल करके खाना बनाना सीखता है।
- द प्लानर (TSLM): यह टेक्स्ट को पढ़ता है और तय करता है कि क्या कहना है और कैसे कहना है (भावना और लय)।
- द स्केलेटन (FSQ): यह ध्वनि का एक मोटा खाका तैयार करता है, जैसे कि एक पेंटिंग का स्केच।
- द रिफाइनर (RALM): यह बारीक विवरण जोड़ता है, जैसे कि आवाज की विशिष्ट बनावट और वक्ता का अनूठा व्यक्तित्व।
- द पेंटर (LocDiT): अंत में, यह भाग स्केच और विवरणों को वास्तविक चिकनी, निरंतर ऑडियो तरंग (audio wave) में बदल देता है।
3. विशेष कौशल
- "प्री-क्लीनिंग" की आवश्यकता नहीं: यदि आप इसमें संख्याओं वाला एक अव्यवस्थित वाक्य (जैसे "I have 500 baht") या मिश्रित अंग्रेजी/थाई फीड करते हैं, तो इसे पहले लिखने के लिए किसी इंसान की आवश्यकता नहीं होती है। यह कच्चे टेक्स्ट को तुरंत समझ लेता है।
- छोटी और लंबी कहानियाँ: इसका परीक्षण छोटे वाक्यांशों (जैसे एक टेक्स्ट मैसेज) और लंबी कहानियों (जैसे पॉडकास्ट सेगमेंट) दोनों पर किया गया था। यह दोनों को अच्छी तरह से संभालता है, जबकि अन्य थाई टूल्स अक्सर लंबी कहानियों पर विफल हो जाते हैं।
4. टेस्ट रिजल्ट (परिणाम)
टीम ने अन्य प्रसिद्ध ओपन-सोर्स मॉडल्स और यहाँ तक कि शीर्ष-स्तरीय कमर्शियल वॉयस जनरेटरों (जैसे ElevenLabs और MiniMax) के खिलाफ JaiTTS का परीक्षण किया।
- सटीकता (Accuracy): एक "लिसनिंग टेस्ट" में जहाँ एक कंप्यूटर यह ट्रांसक्राइब करने की कोशिश करता है कि क्या कहा गया था, JaiTTS ने उन मानव वक्ताओं की तुलना में कम गलतियाँ कीं (1.94% त्रुटि दर) जिनकी उसने नकल की थी (1.98% त्रुटि दर)। यह उतना ही सटीक था!
- आवाज की समानता (Voice Likeness): जब किसी विशिष्ट व्यक्ति की तरह बोलने के लिए कहा गया, तो इसने बहुत अच्छा काम किया, मूल आवाज से बहुत करीब से मेल खाया।
- गति (Speed): यह अविश्वसनीय रूप से तेज़ है। यह वास्तविक समय से लगभग 9 गुना तेज़ गति से स्पीच जेनरेट कर सकता है। कल्पना कीजिए कि एक टाइपिस्ट एक पूरे पेज को पढ़ने के समय में पूरी किताब टाइप कर देता है।
- मानवीय निर्णय (Human Verdict): जब 20 वास्तविक थाई वक्ताओं ने JaiTTS बनाम बड़े कमर्शियल प्रतिस्पर्धियों को सुना, तो उन्होंने 70% बार JaiTTS को प्राथमिकता दी। 400 तुलनाओं के हेड-टू-हेड वोट में, JaiTTS 283 बार जीता और केवल 58 बार हारा।
सारांश
JaiTTS एक नया, अत्यधिक कुशल थाई वॉयस क्लोनिंग टूल है जिसे मिश्रित भाषाओं या संख्याओं को समझने के लिए किसी मदद की आवश्यकता नहीं है। यह अन्य ओपन-सोर्स विकल्पों की तुलना में अधिक प्राकृतिक और सटीक लगता है और यहाँ तक कि वास्तविक मानवीय आवाजों की नकल करने में कुछ महंगे कमर्शियल सिस्टम्स को भी पीछे छोड़ देता है, और यह सब बिजली जैसी तेज़ गति से काम करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।