Giving Voice to the Constitution: Low-Resource Text-to-Speech for Quechua and Spanish Using a Bilingual Legal Corpus
यह शोध पत्र पेरू के संविधान के लिए उच्च गुणवत्ता वाली द्विभाषी क्वेचुआ और स्पेनिश वाणी को संश्लेषित करने हेतु तीन अत्याधुनिक टीटीएस (TTS) आर्किटेक्चर का उपयोग करते हुए एक एकीकृत पाइपलाइन प्रस्तुत करता है, जो कम-संसाधन वाली क्वेचुआ भाषा में डेटा की कमी को दूर करने के लिए क्रॉस-लिंगुअल ट्रांसफर का लाभ उठाता है और समावेशी कानूनी स्पीच प्रौद्योगिकियों के लिए ओपन-सोर्स संसाधन प्रदान करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक देश के लिए एक बहुत ही महत्वपूर्ण नियम पुस्तिका है—संविधान। पेरू में, यह नियम पुस्तिका स्पेनिश में लिखी गई है, जिसे अधिकांश लोग समझते हैं। लेकिन लोगों का एक बहुत बड़ा समूह है जो केचुआ (Quechua) बोलता है, जो एक प्राचीन और सुंदर स्वदेशी भाषा है। उनके लिए कानून को पढ़ना ऐसा है जैसे किसी ऐसी भाषा में लिखी गई मानचित्र को पढ़ने की कोशिश करना जिसे आप नहीं जानते; जानकारी वहां मौजूद है, लेकिन वह एक दीवार के पीछे बंद है।
यह शोध पत्र एक पुल बनाने के बारे में है ताकि वह जानकारी स्वतंत्र रूप से बह सके। लेखकों ने एक विशेष "वॉयस मशीन" (टेक्स्ट-टू-स्पीच) बनाई है जो पेरू के संविधान को स्पेनिश और केचुआ दोनों में ज़ोर से पढ़ सकती है, जिससे कानून सभी के लिए सुलभ हो जाता है।
उन्होंने इसे कैसे किया, इसे रोज़मर्रा के उदाहरणों के साथ समझाया गया है:
1. समस्या: "खाली पुस्तकालय"
स्पेनिश भाषा को एक विशाल, पूरी तरह से स्टॉक किए गए पुस्तकालय के रूप में सोचें जिसमें लाखों किताबें, ऑडियोबुक्स और रिकॉर्डिंग हैं। अब, कल्पना करें कि केचुआ एक छोटा सा, आरामदायक शेड है जिसमें केवल कुछ ही किताबें और बहुत कम रिकॉर्डिंग हैं।
कंप्यूटर को अच्छी तरह से केचुआ बोलना सिखाने के लिए, आपको आमतौर पर रिकॉर्डिंग के एक विशाल पुस्तकालय (हज़ारों घंटों) की आवश्यकता होती है। लेकिन केचुआ के लिए, वह पुस्तकालय लगभग खाली है। यदि आप केवल कुछ घंटों की ऑडियो के साथ कंप्यूटर को सिखाने की कोशिश करते हैं, तो यह एक टूटी हुई आवाज़ वाले रोबोट की तरह सुनाई देता है।
2. समाधान: "द्विभाषी ट्यूटर"
लेखकों के पास एक चतुर विचार था: क्यों न कंप्यूटर को बड़ी लाइब्रेरी (स्पेनिश) का उपयोग करके छोटी भाषा (केचुआ) सीखने में मदद करने के लिए सिखाया जाए?
उन्होंने स्पेनिश को एक "द्विभाषी ट्यूटर" के रूप में माना। चूंकि स्पेनिश और केचुआ कुछ ध्वनियों और लय (जैसे कि कैसे एक गिटार और एक वायलिन संगीत के नोट्स साझा करते हैं) को साझा करते हैं, इसलिए कंप्यूटर भाषण की संगीतमयता को प्रचुर स्पेनिश डेटा से सीख सकता है और उन कौशलों को दुर्लभ केचुआ डेटा पर लागू कर सकता है।
उन्होंने इस परीक्षण के लिए तीन अलग-अलग प्रकार के "वॉयस इंजन" (AI मॉडल) का उपयोग किया:
- XTTS v2: एक शक्तिशाली, भारी-भरकम इंजन।
- F5-TTS: एक आधुनिक इंजन जो आवाज़ को सुचारू बनाने के लिए "फ्लो" का उपयोग करता है।
- DiFlow-TTS: एक संक्षिप्त, कुशल इंजन।
3. प्रशिक्षण: डेटा की सफाई
कंप्यूटर को सिखाने से पहले, उन्हें "पाठ्यपुस्तकों" को साफ करना था।
- फ़िल्टर: उनके पास केचुआ की घंटों की रिकॉर्डिंग थी, लेकिन उनमें से कई केवल 1-सेकंड के सन्नाटे या शोर के क्लिप थे। कल्पना करें कि आप एक गाने के 1-सेकंड के अंशों को सुनकर गाना सीखने की कोशिश कर रहे हैं; यह काम नहीं करता। उन्होंने छोटे, खराब क्लिप को फ़िल्टर कर दिया और केवल स्पष्ट, लंबे वाक्यों को रखा।
- अनुवादक: केचुआ एक "चिपकने वाली" (agglutinative) भाषा है, जिसका अर्थ है कि शब्द बहुत लंबे और जटिल हो सकते हैं। उन्होंने इन शब्दों को उनके मानक भागों में तोड़ने के लिए एक डिजिटल टूल का उपयोग किया, जिससे यह सुनिश्चित हुआ कि कंप्यूटर वर्तनी के विविध रूपों से भ्रमित न हो।
4. परिणाम: "छोटा इंजन" जीतता है
आमतौर पर, AI की दुनिया में, बड़ा बेहतर होता है। आप सोचेंगे कि सबसे बड़ा, सबसे महंगा कंप्यूटर मॉडल जीतेगा। लेकिन यहाँ, परिणाम आश्चर्यजनक थे:
- हेवीवेट (XTTS): यह बड़ा और शक्तिशाली था, लेकिन यह थोड़ा सख्त सुनाई देता था।
- मिडलवेट (F5-TTS): यह बहुत सुसंगत था, जैसे एक विश्वसनीय रेडियो होस्ट।
- लाइटवेट (DiFlow-TTS): यह आश्चर्यजनक विजेता था! भले ही यह सबसे छोटा मॉडल (एक "कॉम्पैक्ट इंजन") था, इसने सबसे स्वाभाविक लगने वाली केचुआ आवाज़ उत्पन्न की।
उपमा: इसे खाना पकाने के बारे में सोचें। आपके पास एक विशाल, औद्योगिक रसोई (बड़ा मॉडल) हो सकती है, लेकिन यदि आपके पास सही सामग्री (डेटा) नहीं है, तो भोजन बेस्वाद लगेगा। छोटे किचन (DiFlow) ने क्रॉस-लैंग्वेज लर्निंग के "सीक्रेट सॉस" का पूरी तरह से उपयोग किया, जिससे बहुत कम सामग्री के साथ एक स्वादिष्ट भोजन तैयार हुआ।
5. यह क्यों मायने रखता है
यह केवल एक कूल वॉयस ऐप बनाने के बारे में नहीं है। यह न्याय और समावेशिता के बारे में है।
- अभिगम्यता (Accessibility): अब, एक केचुआ बोलने वाला व्यक्ति रेडियो या फोन पर संविधान सुन सकता है, अपनी भाषा में अपने अधिकारों को समझ सकता है।
- पुन: प्रयोज्यता (Reusability): लेखकों ने केवल आवाज़ नहीं बनाई; उन्होंने "रेसिपी" (कोड और डेटा) को भी जारी किया। अन्य शोधकर्ता केचुआ के लिए बेहतर उपकरण, जैसे वॉयस असिस्टेंट या अनुवाद ऐप बनाने के लिए इसका उपयोग कर सकते हैं।
निष्कर्ष
लेखकों ने साबित किया कि कंप्यूटर को एक दुर्लभ भाषा सिखाने के लिए आपको डेटा की विशाल मात्रा की आवश्यकता नहीं है। यदि आप स्मार्ट तरीके से इसे एक संबंधित, अच्छी तरह से संसाधन वाली भाषा (जैसे स्पेनिश) से जोड़ते हैं, तो आप एक उच्च-गुणवत्ता वाली आवाज़ बना सकते है जो स्वदेशी संस्कृतियों का सम्मान करती है और उन्हें ऊपर उठाती है।
उन्होंने प्रभावी रूप से संविधान को एक आवाज़ दी, यह सुनिश्चित करते हुए कि कानून सभी के लिए बोले, न कि केवल उन लोगों के लिए जो प्रमुख भाषा बोलते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।