Building Community-Centred NLP Resources for Puno Quechua
यह शोध पत्र पुनो क्वेचुआ के लिए पहले समर्पित स्वचालित भाषण पहचान संसाधनों को प्रस्तुत करता है, जिसमें 66 घंटे का सहभागी भाषण संग्रह, अत्याधुनिक मॉडलों का एक व्यवस्थित बेंचमार्क, और समुदाय-केंद्रित भाषा संरक्षण को समर्थन देने के लिए सभी डेटासेट और फाइन-ट्यून किए गए मॉडल की खुली रिलीज़ शामिल है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
भाषा की कल्पना एक विशाल, प्राचीन पुस्तकालय के रूप में करें। सदियों से, इस पुस्तकालय के "पुनो क्वेचुआ" (Puno Quechua) अनुभाग की किताबें अंधेरे में छोड़ी गई हैं, जिससे लोगों को खोजने में मदद करने के लिए कोई डिजिटल कैटलॉग या सर्च इंजन उपलब्ध नहीं है। जबकि दुनिया अंग्रेजी, स्पेनिश या मंदारिन बोलने वाले AI टूल्स बनाने की दौड़ में लगी है, पेरू के उन 465,000 लोगों को डिजिटल बातचीत से बाहर रखा गया है जो पुनो क्वेचुआ बोलते हैं, क्योंकि वे अपनी भाषा में टाइप नहीं कर सकते।
यह शोध पत्र एक टीम के बारे में है जो उस अनुभाग को खोलने के लिए पहला डिजिटल ताला (digital key) बना रही है। उन्होंने केवल एक चाबी नहीं बनाई; उन्होंने एक पूरी नई प्रणाली बनाई जो विशेष रूप से वहां रहने वाले लोगों के लिए डिज़ाइन की गई है।
यहाँ उनकी कहानी है, जिसे सरल भागों में विभाजित किया गया है:
1. समस्या: डिजिटल दुनिया में बिना आवाज़ की एक भाषा
AI टूल्स जैसे ChatGPT को एक बहुत ही सख्त लाइब्रेरियन की तरह समझें जो केवल कुछ प्रमुख भाषाएं बोलता है। यदि आप उनसे पुनो क्वेचुआ में बात करने की कोशिश करते हैं, तो वे बस खाली नज़रें टिका देते हैं। क्यों? क्योंकि पुनो क्वेचुआ के लिए "प्रशिक्षण डेटा" (वह किताबें जो लाइब्रेरियन ने पढ़ी थीं) गायब था। क्वेचुआ सिखाने के पिछले प्रयास एक कुत्ते को बिल्ली, हैम्स्टर और कुत्ते के निर्देशों को मिलाकर सिखाने जैसा था। उन्होंने सभी क्वेचुआ बोलियों को एक बड़ा, समान समूह मान लिया, और पुनो क्वेचुआ की अनूठी ध्वनियों और नियमों की अनदेखी की।
2. समाधान: समुदाय के साथ मिलकर एक पुस्तकालय बनाना
इंटरनेट से डेटा उठाने के बजाय, शोधकर्ताओं ने पुनो क्षेत्र में जाकर एक सामुदायिक उद्यान (community garden) बनाया। उन्होंने "सहभागी डिजाइन" (participatory design) दृष्टिकोण का उपयोग किया, जो कि पहले से बने-बनाए बगीचे को देने के बजाय पड़ोसियों को बीज बोने में मदद करने के लिए आमंत्रित करने जैसा है।
- कटाई (The Harvest): उन्होंने 66 घंटे की वॉयस रिकॉर्डिंग एकत्र की। कल्पना कीजिए कि 66 घंटों तक लोग कहानियाँ पढ़ रहे हैं, अपने दिन के बारे में बातें कर रहे हैं, और खेती, स्वास्थ्य और तकनीक के बारे में चर्चा कर रहे हैं।
- गुणवत्ता नियंत्रण: इसमें से 36 घंटों को मूल भाषियों द्वारा हाथ से सावधानीपूर्वक जांचा और ट्रांसक्राइब किया गया (जिसे "गोल्ड स्टैंडर्ड" कहा जाता है)। बाकी हिस्सा सहज भाषण और "सिल्वर" डेटा का मिश्रण था (स्वचालित रूप से ट्रांसक्राइब किया गया लेकिन कम सटीक, जैसे एक कच्चा मसौदा)।
- परिणाम: यह अब भाषा की किसी भी एकल किस्म के लिए निर्मित पुनो क्वेचुआ स्पीच डेटा का सबसे बड़ा संग्रह है।
3. प्रयोग: AI को सुनना सिखाना
एक बार जब उनके पास "किताबें" (डेटा) आ गईं, तो उन्हें AI को उन्हें पढ़ना सिखाना था। उन्होंने तीन अलग-अलग "छात्रों" (AI मॉडल) का परीक्षण किया:
- Whisper: एक सामान्य छात्र जो कई भाषाएं जानता है।
- wav2vec2: एक छात्र जिसने मुख्य रूप से अंग्रेजी की किताबों से सीखा है।
- XLS-R: एक सुपर-छात्र जिसने 128 अलग-अलग भाषाओं की किताबें पढ़ी हैं।
उन्होंने इन छात्रों का दो तरीकों से परीक्षण किया:
- ज़ोर से पढ़ना: स्पष्ट, स्क्रिप्टेड वाक्यों पर परीक्षण।
- छिपकर सुनना (Eavesdropping): सहज, वास्तविक जीवन की बातचीत पर परीक्षण (जो अव्यवस्थित और तेज़ होती है)।
उन्होंने कंटीन्यूड प्री-ट्रेनिंग (CPT) नामक एक विशेष तरकीब भी आजमाई। कल्पना कीजिए कि "सुपर-स्टूडेंट" (XLS-R) को एक समर कैंप में ले जाया गया जहाँ उन्होंने शब्दों को पढ़ने की कठिन मेहनत शुरू करने से पहले, केवल पुनो क्वेचुआ रेडियो और बातचीत को सुना। इससे उनके कान भाषा की अनूठी ध्वनियों (जैसे कि तीखी "इजेक्टिव" ध्वनियाँ) को समझने के लिए अभ्यस्त हो गए।
4. परिणाम: क्या सबसे अच्छा काम कर गया?
टीम ने कुछ आश्चर्यजनक चीजें पाईं, जैसे एक कोच द्वारा यह पता लगाना कि कौन सी ट्रेनिंग ड्रिल वास्तव में टीम को जिताने में मदद करती है:
- "सिल्वर" का रहस्य: अव्यवस्थित, वास्तविक जीवन की बातचीत के लिए, "कच्चा मसौदा" डेटा (सिल्वर ट्रांसक्रिप्शन) एक गुप्त हथियार था। भले ही यह पूर्ण नहीं था, लेकिन इसे प्रशिक्षण डेटा में जोड़ने से त्रुटियां 77% कम हो गईं। यह एक छात्र को विचारों से भरी एक बिखरी हुई नोटबुक देने जैसा है; यह उन्हें केवल पूर्ण, साफ नोट्स की तुलना में बातचीत के प्रवाह को बेहतर ढंग से समझने में मदद करता है।
- समर कैंप प्रभाव: "कंटीन्यूड प्री-ट्रेनिंग" (CPT) ने AI को पुनो क्वेचुआ की अनूठी ध्वनियों को बहुत बेहतर तरीके से समझने में मदद की, विशेष रूप से स्पष्ट, स्क्रिप्टेड भाषण के लिए। इसने इस चरण को छोड़ने की तुलना में त्रुटियों को 42% कम कर दिया।
- समझौता (Trade-off): सबसे बड़े, सबसे शक्तिशाली AI मॉडल (जैसे 7-बिलियन पैरामीटर वाला "omniASR") अनजाने (out-of-domain) भाषण (जैसे रेडियो क्लिप जिन्हें उन्होंने नहीं देखा था) को समझने में सबसे अच्छे थे। हालाँकि, वे इतने भारी हैं कि उन्हें चलाने के लिए एक विशाल कंप्यूटर की आवश्यकता होती है। टीम द्वारा बनाए गए छोटे, कस्टम-प्रशिक्षित मॉडल बहुत हल्के हैं और एक साधारण लैपटॉप या फोन पर चल सकते हैं, लेकिन वे पूरी तरह से नए प्रकार के भाषण के साथ थोड़ा संघर्ष करते हैं।
5. उपहार: सब कुछ दान में देना
इस शोध पत्र का सबसे महत्वपूर्ण हिस्सा यह है कि टीम ने चाबियाँ अपने पास नहीं रखीं। उन्होंने दरवाजे खोल दिए और सब कुछ मुफ्त में दे दिया:
- 66 घंटे की रिकॉर्डिंग।
- ट्रांसक्राइब किया गया टेक्स्ट।
- प्रशिक्षित AI मॉडल (वे "छात्र" जिन्होंने पुनो क्वेचुआ बोलना सीखा है)।
यह क्यों मायने रखता है
यह केवल एक भाषा को समझने के बारे में नहीं है; यह गरिमा और पहुंच के बारे में है। वर्तमान में, यदि पुनो क्वेचुआ बोलने वाला व्यक्ति किसी वॉयस असिस्टेंट का उपयोग करना चाहता है, तो उसे स्पेनिश बोलने के लिए मजबूर होना पड़ता है, जो एक ऐसी भाषा है जिसमें वे पूरी तरह से साक्षर नहीं हो सकते। इन उपकरणों का निर्माण करके, शोधकर्ता समुदाय को एक ऐसा माइक्रोफ़ोन सौंप रहे हैं जो अंततः उनकी आवाज़ को समझता है, जिससे उन्हें अपनी अपनी भाषा में तकनीक के साथ संवाद करने की अनुमति मिलती है।
संक्षेप में: उन्होंने पुनो क्वेचुआ की आवाजों का पहला विशाल पुस्तकालय बनाया, तीन अलग-अलग AI छात्रों को उन्हें सुनना सिखाया, यह खोजा कि "कच्चे मसौदे" और "सुनने के कैंप" सबसे अच्छे शिक्षक हैं, और फिर पूरी लाइब्रेरी और प्रशिक्षित छात्रों को दुनिया को मुफ्त में दे दिया।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।