FreyaTTS Technical Report
Freya-TTS एक संक्षिप्त, टोकनाइज़र-मुक्त, तुर्की-प्रथम टेक्स्ट-टू-स्पीच मॉडल है जो उच्च गुणवत्ता वाले, वास्तविक समय के संवादात्मक संश्लेषण के लिए एक निरंतर लेटेंट स्पेस में नॉन-ऑटोरिग्रेसिव कंडीशनल फ्लो-मैचिंग डिफ्यूजन ट्रांसफॉर्मर का लाभ उठाता है, जो बड़े ओपन-सोर्स सिस्टमों की तुलना में बेहतर दक्षता और सटीकता प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक ऐसा रोबोट बनाना चाहते हैं जो तुर्की (Turkish) बोल सके। अधिकांश लोग इस रोबोट को बनाने के लिए इसे ध्वनियों का एक विशाल शब्दकोश सिखाने की कोशिश करते हैं, हर शब्द को छोटे, पूर्व-निर्धारित टुकड़ों (जैसे लेगो ब्रिक्स) में तोड़ते हैं, और फिर उन ब्रिक्स को एक-एक करके बाएं से दाएं जोड़ते हैं। वर्तमान के कई "स्टेट-ऑफ-द-आर्ट" स्पीच रोबोट इसी तरह काम करते हैं। वे बहुत बड़े होते हैं, उन्हें बनाने में बहुत समय लगता है, और यदि वे किसी लंबे वाक्य पर लड़खड़ाते हैं, तो वे अक्सर अपने ही पैरों में उलझ जाते हैं, नंबरों को मिला देते हैं या क्रम गलत कर देते हैं।
FreyaTTS टीम ने एक पूरी तरह से अलग, बहुत छोटे और अधिक स्मार्ट दृष्टिकोण को अपनाने का निर्णय लिया। उन्होंने कोई विशाल शब्दकोश या ईंट-दर-ईंट जोड़ने वाला सिस्टम नहीं बनाया। इसके बजाय, उन्होंने एक 183.2-मिलियन-पैरामीटर वाला "कल्पना इंजन" (imagination engine) बनाया जो ऑडियो सुनकर और एक बार में पूरे वाक्य का अनुमान लगाकर तुर्की बोलना सीखता है, जैसे एक जैज़ संगीतकार नोट-दर-नोट शीट संगीत पढ़ने के बजाय एक पूरा सोलो बजाकर अपनी कला का प्रदर्शन करता है।
यहाँ उनका जादू कैसे काम करता है, इसे तीन सरल भागों में विभाजित किया गया है:
1. फ्रोजन ब्लूप्रिंट (The "AudioVAE2")
FreyaTTS टीम को ऐसे वास्तुकारों के रूप में सोचें जिन्होंने एक आदर्श, पूर्व-निर्मित घर (जिसे AudioVAE2 कहा जाता है) खोजा है जो पहले से ही जानता है कि एक स्केच को एक सुंदर 48 kHz साउंड वेव में कैसे बदलना है। यह घर इतना अच्छा है कि टीम ने इसे कभी न छूने का निर्णय लिया। उन्होंने इसे यथावत फ्रीज कर दिया।
क्योंकि उन्हें रोबोट को यह सिखाने में समय बर्बाद नहीं करना पड़ा कि साउंड वेव्स कैसे बनाई जाती हैं, इसलिए वे अपने दिमाग की 100% शक्ति का उपयोग यह सिखाने में कर सके कि रोबोट को क्या कहना है। उन्हें अक्षरों को ध्वनियों में बदलने के लिए किसी अनुवादक (फोनेमाइज़र) की आवश्यकता नहीं थी, और न ही उन्हें शब्दों को छोटे साउंड टोकन में तोड़ने की आवश्यकता थी। उन्होंने बस रोबोट को कच्चा तुर्की टेक्स्ट (92 प्रतीक, विशेष अक्षरों जैसे ç, ğ, ı, ö, ş, ü के साथ) खिलाया और उसे अपने आप उच्चारण सीखने दिया। यह एक बच्चे को ध्वन्यात्मकता (phonetics) पर पाठ्यपुस्तक देकर नहीं, बल्कि उससे बात करके बोलने सिखाने जैसा है।
2. "एक साथ सब कुछ" का जादू (Non-Autoregressive)
अधिकांश स्पीच रोबोट एक धीमे टाइपिस्ट की तरह होते हैं: वे एक अक्षर टाइप करते हैं, फिर अगला, फिर अगला। यदि वे शुरुआत में गलती करते हैं, तो पूरा वाक्य बिगड़ जाता है। इसे "ऑटोरिग्रेसिव" (autoregressive) जनरेशन कहा जाता है।
FreyaTTS अलग है। यह एक ऐसे चित्रकार की तरह है जो पूरे कैनवास को देखता है और एक ही बार में पूरा चित्र बना देता है। यह पूरे वाक्य के साउंड पैटर्न को समानांतर (in parallel) में अनुमान लगाने के लिए एक कंडीशनल फ्लो-मैचिंग डिफ्यूजन ट्रांसफॉर्मर का उपयोग करता है।
- उपमा: कल्पना कीजिए कि आप अपने दोस्त की आवाज़ का अनुमान लगा रहे हैं। एक-एक शब्द का अनुमान लगाने के बजाय (जिससे आप गलत शब्द का अनुमान लगा सकते हैं और वाक्य बिगड़ सकता है), Freyastdia एक ही बार में पूरे वाक्य की लय और टोन का अनुमान लगाता है।
- परिणाम: यह "बाएं-से-दाएं त्रुटि संचय" (left-to-right error accumulation) से बचता है। यदि आप इसे संख्याओं की एक लंबी सूची बोलने के लिए कहते हैं, तो यह बीच में भ्रमित नहीं होता है। यह पूरी अवधि और पूरे साउंड पैटर्न का एक साथ अनुमान लगाता है।
3. "वॉइस लॉक" (निरंतरता बनाए रखना)
जब उन्होंने पहली बार इस रोबोट को शुरू से प्रशिक्षित किया, तो यह एक गिरगिट की तरह था। हर बार जब आप इसे "Hello" कहने के लिए कहते, तो यह एक अलग व्यक्ति की तरह सुनाई देता। एक बार यह गहरी आवाज़ वाले पुरुष जैसा लग सकता था, अगली बार यह एक ऊँची पिच वाले बच्चे जैसा लग सकता था। ऐसा इसलिए था क्योंकि रोबोट कई आवाजों के मिश्रण से सीख रहा था और उसके पास कोई विशिष्ट पहचान नहीं थी।
इसे ठीक करने के लिए, टीम ने दो-चरणीय "वॉइस लॉक" किया:
- चरण 1: उन्होंने रोबोट को एक विशिष्ट व्यक्ति (एक पेशेवर वॉयस टैलेंट) की नकल करना सिखाया। इससे रोबोट के वॉइस पिच का उतार-चढ़ाव एक जंगली 74.9 Hz (एक विशाल रेंज) से घटकर एक स्थिर 5.0 Hz हो गया। अब, यह हर बार एक ही व्यक्ति जैसा लगता है।
- चरण 2: उन्हें एहसास हुआ कि रोबोट छोटे वाक्यांशों (जैसे "हाँ" या "नहीं") के लिए खराब है। इसलिए, उन्होंने इसे विशेष रूप से छोटे, एक-शब्द और दो-शब्द वाले वाक्यों पर अतिरिक्त अभ्यास कराया।
परिणाम: छोटा लेकिन शक्तिशाली
टीम ने अपने रोबोट का परीक्षण अन्य प्रसिद्ध ओपन-सोर्स स्पीच मॉडल्स के विरुद्ध किया। यहाँ उन्हें क्या मिला:
- आकार: XTTS-v2 (470M) या F5-TTS (336M) जैसे दिग्गजों की तुलना में FreyaTTS बहुत छोटा (183.2M पैरामीटर्स) है।
- सटीकता: 495 तुर्की वाक्यों के परीक्षण पर, FreyaTTS ने बड़े मॉडल्स की तुलना में कम गलतियाँ कीं। इसने 8.0% का वर्ड एरर रेट (WER) और 3.0% का कैरेक्टर एरर रेट (CER) प्राप्त किया।
- नोट: बड़े मॉडल्स ने क्रमशः 11.1% और 24.3% प्राप्त किया।
- गति: क्योंकि इसे अगले शब्द को शुरू करने से पहले एक शब्द के खत्म होने का इंतज़ार नहीं करना पड़ता, इसलिए यह अविश्वसनीय रूप से तेज़ है। एक मानक कंज्यूमर ग्राफिक्स कार्ड पर, यह 0.11 के रियल-टाइम फैक्टर पर चलता है। इसका मतलब है कि यह केवल 1.1 सेकंड में 10 सेकंड का ऑडियो बना सकता है।
- लैपटॉप पावर: यह इतना कुशल है कि यह लैपटॉप CPU (जैसे Apple M3) पर भी रियल-टाइम से तेज़ चल सकता है, जिससे यह फोन या छोटे उपकरणों के लिए एकदम सही बन जाता है।
वे स्पष्ट रूप से क्या नहीं कहते
पेपर इस बारे में बहुत स्पष्ट है कि FreyaTTS क्या नहीं है:
- यह एक "जीरो-शॉट" क्लोनर नहीं है जो आपके द्वारा दिए गए किसी भी क्लिप की आवाज़ की नकल कर सके। यह एक सिंगल-वॉयस मॉडल है। आपको वही एक आवाज़ मिलती है जिस पर इसे प्रशिक्षित किया गया है, और बस।
- यह एक विशाल बहुभाषी आधार (multilingual foundation) पर आधारित नहीं है जो एक साथ 50 भाषाएँ बोलने की कोशिश करता है। यह एक तुर्की-प्रथम (Turkish-first) मॉडल है, जो एक भाषा के लिए विशेष है।
- यह "फोनेमाइज़र" (ध्वनियों में बदलने के लिए नियम-आधारित प्रणाली) का उपयोग नहीं करता है। यह सीधे ऑडियो से ध्वनियों को सीखता है।
- यह लिखित रूप में संख्याओं को पढ़ने में पूर्ण नहीं है (जैसे "1999")। पेपर में उल्लेख है कि आपको मॉडल को देने से पहले संख्याओं को उनके बोले जाने वाले रूप (जैसे "एक हजार नौ सौ निन्यानवे") में विस्तारित करने की आवश्यकता है, क्योंकि रोबोट कभी-कभी लंबी अंकों की स्ट्रिंग्स की अवधि (duration) के साथ संघर्ष करता है।
वे कितने आश्वस्त हैं?
टीम इन आंकड़ों को लेकर बहुत आश्वस्त है क्योंकि उन्होंने केवल अनुमान नहीं लगाया; उन्होंने सब कुछ मापा है।
- उन्होंने 495 वाक्यों के साथ एक विशिष्ट बेंचमार्क बनाया जिसे Freya-TR-Eval कहा जाता है।
- उन्होंने परिणामों को केवल भाग्य नहीं बनाने के लिए "बूटस्ट्रैप" पद्धति का उपयोग करते हुए 10,000 बार परीक्षण चलाया।
- उन्होंने बिल्कुल उन्हीं वाक्यों का उपयोग करके और समान स्कोरिंग नियमों का उपयोग करके अपने मॉडल की तुलना की (सब कुछ 8 kHz तक डाउनसैंपल करके ताकि खेल का मैदान समान रहे)।
- उन्होंने "वॉइस लॉक" स्थिरता को भी मापा, जिससे दिखाया गया कि प्रशिक्षण चरणों के बाद पिच भिन्नता 74.9 Hz से घटकर 5.0 Hz हो गई।
संक्षेप में, FreyaTTS साबित करता है कि महान तुर्की भाषण बनाने के लिए आपको अरबों डॉलर के, बहुभाषी राक्षस की आवश्यकता नहीं है। आप एक छोटा, विशिष्ट, "एक साथ सब कुछ" करने वाला इंजन बना सकते हैं जो लैपटॉप पर चलता है, सुसंगत लगता है, और दिग्गजों से बेहतर तुर्की बोलता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।