ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis
यह शोध पत्र ParsVoice को प्रस्तुत करता है, जो ऑडियोबुक्स से एक स्केलेबल पाइपलाइन के माध्यम से निर्मित 2,200-घंटे का एक सार्वजनिक रूप से उपलब्ध बहु-वक्ता फारसी भाषण संग्रह (corpus) है, जो खुले फारसी TTS संसाधनों का महत्वपूर्ण विस्तार करता है और XTTS मॉडल को फाइन-ट्यून करने के लिए उपयोग किए जाने पर उच्च-गुणवत्ता वाले संश्लेषण प्रदर्शन को प्रदर्शित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को फारसी (Persian) बोलना सिखाना चाहते हैं। आप इसे केवल एक शब्दकोश नहीं दे सकते; आपको इसे वास्तविक मानवीय आवाजों के हजारों घंटों के ऑडियो खिलाने होंगे जिनमें कहानियाँ पढ़ी जा रही हों, ताकि यह भाषा की लय, भावना और अनूठी ध्वनियों को सीख सके।
लंबे समय से, फारसी भाषा उस विशाल पार्टी में एक ऐसे मेहमान की तरह रही है जिसे बैठने के लिए मेज पर जगह नहीं दी गई। जहाँ अंग्रेजी जैसी भाषाओं के पास रिकॉर्ड की गई स्पीच के विशाल पुस्तकालय हैं (इन्हें विशाल, सुव्यवस्थित गोदामों के रूप में सोचें), वहीं फारसी के पास बहुत कम था। इसने फारसी बोलने वालों के लिए अच्छे वॉयस असिस्टेंट या कहानी सुनाने वाले रोबोट बनाना कठिन बना दिया।
समाधान: पार्सवॉइस (ParsVoice)
इस शोध पत्र के लेखकों ने पार्सवॉइस बनाया है, जो अनिवार्य रूप से फारसी भाषण का एक विशाल, उच्च-गुणवत्ता वाला पुस्तकालय है। यह इस भाषा के लिए अब तक बनाया गया अपने प्रकार का सबसे बड़ा सार्वजनिक संग्रह है।
उन्होंने इसे कैसे किया, इसके सरल चरण यहाँ दिए गए हैं:
1. कच्चा माल: ऑडियोबुक्स (Audiobooks)
स्टूडियो में स्क्रिप्ट पढ़ने के लिए अभिनेताओं को काम पर रखने के बजाय (जो महंगा और धीमा है), टीम ने ईरानसेडा (IranSeda) नामक एक सार्वजनिक ऑडियोबुक लाइब्रेरी का रुख किया। इसे कच्चे, बिना कटे हुए फिल्म रील के एक पहाड़ के रूप में समझें। उनके पास 3,800 से अधिक पुस्तकें थीं, लेकिन एक समस्या थी: उनके पास वे लिखित स्क्रिप्ट (ट्रांसक्रिप्ट) नहीं थे जो ऑडियो के साथ पूरी तरह मेल खाते हों।
2. "स्मार्ट कटर" पाइपलाइन
आप बस एक 10 घंटे की ऑडियोबुक फ़ाइल को एक रोबोट को नहीं दे सकते; इसे छोटे, सटीक वाक्यों में काटना आवश्यक है। टीम ने एक स्वचालित "फैक्ट्री लाइन" बनाई:
- रफ कट (The Rough Cut): उन्होंने एक कंप्यूटर प्रोग्राम का उपयोग करके वाक्यों के बीच के सन्नाटे (silence) को ढूँढा और ऑडियो को वहीं से काटा।
- "क्या आपने समाप्त किया?" की जाँच: कभी-कभी, कंप्यूटर ऑडियो को वाक्य के बीच में ही काट देता है (जैसे किसी फिल्म को ठीक उसी समय रोक देना जब नायक कहता है "मैं तुमसे प्यार करता हूँ")। उन्होंने एक स्मार्ट AI (जो 'पार्सबर्ट' (ParsBERT) नामक मॉडल पर आधारित है) का उपयोग टेक्स्ट को पढ़ने और यह पूछने के लिए किया, "क्या यह एक पूर्ण विचार है?" यदि उत्तर "नहीं" था, तो सिस्टम ने स्वचालित रूप से कट को एक सेकंड के कुछ हिस्से के लिए बढ़ाया और तब तक दोबारा जांचा जब तक कि वाक्य पूरा नहीं हो गया।
- "फालतू चीज़ों को हटाना" (Trim the Fat): कटने के बाद भी, क्लिप की शुरुआत या अंत में थोड़ा सा सन्नाटा या खाँसी हो सकती है। सिस्टम ने "बाइनरी सर्च" (अनुमान लगाने और जांचने का एक चतुर तरीका) का उपयोग करके बिल्कुल सही मात्रा में सन्नाटा हटाया ताकि आवाज बिना किसी शब्द को काटे साफ तरीके से शुरू और समाप्त हो सके।
- गुणवत्ता निरीक्षक (The Quality Inspector): सभी ऑडियोबुक्स साउंडप्रूफ स्टूडियो में रिकॉर्ड नहीं की गई होती हैं। कुछ में बैकग्राउंड म्यूजिक या खराब माइक्रोफोन हो सकता है। सिस्टम एक सख्त संपादक की तरह काम करता था, जिसने ऑडियो स्पष्टता और टेक्स्ट की सटीकता पर प्रत्येक क्लिप को स्कोर दिया। यदि कोई क्लिप बहुत शोर वाली थी या टेक्स्ट निरर्थक था, तो उसे बाहर कर दिया गया।
- वॉयस डिटेक्टिव (The Voice Detective): चूंकि एक ही ऑडियोबुक में कई नैरेटर हो सकते हैं, इसलिए सिस्टम ने "वॉयस फिंगरप्रिंट" टूल का उपयोग करके सभी क्लिप्स को बोलने वाले के आधार पर समूहबद्ध किया। इससे उन्हें स्वचालित रूप से 1,815 अलग-अलग वक्ताओं की पहचान करने में मदद मिली।
3. परिणाम
अंतिम उत्पाद एक 2,200 घंटे का पुस्तकालय है जिसमें साफ, पूरी तरह से कटे हुए फारसी वाक्य हैं।
- यह पिछले सबसे बड़े फारसी स्पीच कलेक्शन से 25 गुना बड़ा है।
- इसमें 1.36 मिलियन व्यक्तिगत वाक्य क्लिप्स शामिल हैं।
- यह 1,815 अलग-अलग आवाजों को कवर करता है।
4. क्या यह काम आया?
यह परीक्षण करने के लिए कि क्या यह लाइब्रेरी वास्तव में उपयोगी है, टीम ने इस नए डेटा का उपयोग करके एक आधुनिक AI वॉयस मॉडल (जिसे XTTS कहा जाता है) को सिखाया। उन्होंने इसे पहले फारसी अक्षरों (फोनीम्स) की ध्वनियाँ नहीं सिखाईं; बल्कि उन्होंने इसे सीधे टेक्स्ट और ऑडियो से सीखने दिया।
परिणाम प्रभावशाली थे:
- स्वाभाविकता (Naturalness): मनुष्यों ने रोबोट की आवाज को बहुत स्वाभाविक (5 में से 3.6) बताया।
- आवाज मिलान (Voice Matching): जब उन्होंने रोबोट को ऐसी नई आवाज की नकल करने के लिए कहा जिसे उसने पहले कभी नहीं सुना था, तो इसने बहुत अच्छा काम किया (4.0 में से 4.0)।
- स्पष्टता (Intelligibility): रोबोट इतना स्पष्ट बोला कि अन्य कंप्यूटर प्रोग्राम भी इसे पूरी तरह से समझ सके।
यह क्या नहीं करता (सीमाएं)
लेखक ईमानदार हैं कि यह लाइब्रेरी क्या नहीं है:
- यह गपशप के लिए नहीं है: क्योंकि डेटा ऑडियोबुक्स से आता है, इसलिए आवाजें ऐसी लगती हैं जैसे वे कहानी पढ़ रही हों (औपचारिक और स्थिर)। यदि आप रोबोट से कॉफी शॉप में दो दोस्तों की तरह अनौपचारिक, तेज़ बातचीत करने के लिए कहते हैं, तो यह थोड़ा औपचारिक लग सकता है।
- यह पूर्ण नहीं है: चूंकि उन्हें टेक्स्ट का अनुमान लगाने के लिए कंप्यूटर का उपयोग करना पड़ा (क्योंकि उनके पास मूल पुस्तकें नहीं थीं), इसलिए टेक्स्ट में कुछ छोटी गलतियाँ हैं, हालांकि उन्होंने अधिकांश को छान दिया है।
- लिंग संतुलन (Gender Balance): लाइब्रेरी में महिला आवाजों की तुलना में पुरुष आवाजें अधिक हैं, क्योंकि उपयोग की गई ऑडियोबुक्स में अधिक पुरुष नैरेटर थे।
संक्षेप में:
टीम ने एक विशाल, स्वचालित फैक्ट्री बनाई जिसने हजारों घंटों की कच्ची फारसी ऑडियोबुक्स को एक साफ, व्यवस्थित और विशाल डेटासेट में बदल दिया। यह डेटासेट अब किसी के लिए भी बेहतर फारसी वॉयस टेक्नोलॉजी बनाने के लिए उपलब्ध है, जिससे अंततः इस भाषा को हाई-टेक स्पीच रिसर्च की मेज पर एक स्थान मिल गया है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।