AfriVoices-KE: A Multilingual Speech Dataset for Kenyan Languages
AfriVoices-KE एक बड़े पैमाने का, उच्च गुणवत्ता वाला बहुभाषी स्पीच डेटासेट है जिसमें पांच केन्याई भाषाओं के लगभग 5,000 मूल वक्ताओं के लगभग 3,000 घंटों का स्क्रिप्टेड और सहज ऑडियो शामिल है, जिसे स्पीच तकनीक में अफ्रीकी भाषाओं के कम प्रतिनिधित्व को दूर करने और समावेशी ऑटोमैटिक स्पीच रिकग्निशन और टेक्स्ट-टू-स्पीच सिस्टम के विकास में सहायता करने के लिए डिज़ाइन किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
वॉयस टेक्नोलॉजी (जैसे सिरी, एलेक्सा, या गूगल असिस्टेंट) की दुनिया की कल्पना एक विशाल, हाई-टेक लाइब्रेरी के रूप में करें। वर्षों से, यह लाइब्रेरी लगभग पूरी तरह से अंग्रेजी और कुछ अन्य प्रमुख भाषाओं की किताबों से भरी हुई है। यदि आप ढोलुआ (Dholuo), किकुयू (Kikuyu), या मासाई (Maasai) में कोई प्रश्न पूछने का प्रयास करते, तो लाइब्रेरियन बस अपने कंधे उचकाकर कह देता, "क्षमा करें, हमारे पास वह किताब नहीं है।"
AfriVoices-KE एक विशाल प्रोजेक्ट है जिसने अभी-अभी इस लाइब्रेरी का एक नया विंग बनाया है, जो विशेष रूप से पांच प्रमुख केन्याई भाषाओं के लिए है। यह कहानी है कि उन्होंने इसे कैसे किया, जिसे सरल तरीके से समझाया गया है।
1. मिशन: खाली शेल्फ को भरना
लक्ष्य बोले गए शब्दों का एक विशाल संग्रह बनाना था—लगभग 3,000 घंटे का ऑडियो! यह लगातार 125 दिनों तक पॉडकास्ट सुनने के समान है। उन्होंने पांच भाषाओं पर ध्यान केंद्रित किया: ढोलुआ (Dholuo), किकुयू (Kikuyu), कलेंजिन (Kalenjin), मासाई (Maasai), और सोमाली (Somali)।
इस डेटासेट को आर्टिफिशियल इंटेलिजेंस के लिए एक "ट्रेनिंग जिम" के रूप में समझें। जिस तरह एक मानव एथलीट को मजबूत होने के लिए दौड़ने, कूदने और वजन उठाने का अभ्यास करने की आवश्यकता होती है, उसी तरह एक कंप्यूटर को विभिन्न लहजों, गति और बोलियों को समझने के लिए हजारों घंटों के वास्तविक मानव भाषण को सुनने की आवश्यकता होती है।
2. रेसिपी: दो प्रकार के "सामग्री"
एक अच्छा स्टू (stew) बनाने के लिए, आपको अलग-अलग सामग्रियों की आवश्यकता होती है। टीम ने दो प्रकार के भाषण एकत्र किए:
- "स्क्रिप्टेड" भाषण (25%): कल्पना कीजिए कि एक गायक संगीत की शीट से पढ़ रहा है। लोगों को जोर से पढ़ने के लिए विशिष्ट वाक्य दिए गए थे। यह पियानो पर स्केल का अभ्यास करने जैसा है—यह नियंत्रित, साफ है, और कंप्यूटर को भाषा की बुनियादी ध्वनियों को सीखने में मदद करता है।
- "अनस्क्रिप्टेड" भाषण (75%): यह असली जादू है। बोलने के बजाय, लोगों को स्वाभाविक रूप से बातचीत करने के लिए कहा गया। उन्हें चित्र दिखाए गए या विषय दिए गए (जैसे "आप ट्रैक्टर को कैसे ठीक करते हैं?" या "अपनी दादी के बारे में एक कहानी सुनाएं") और उन्हें स्वतंत्र रूप से बोलने के लिए कहा गया। यह मानवीय बातचीत की अव्यवस्थित लेकिन सुंदर वास्तविकता को पकड़ता है: ठहराव, व्यवधान, स्लैंग (slang), और विभिन्न बोलियाँ।
3. टूल: आपकी जेब में एक डिजिटल "वॉयस बूथ"
केन्या के ग्रामीण इलाकों में हजारों लोगों के लिए एक भौतिक रिकॉर्डिंग स्टूडियो बनाना असंभव होता। इसलिए, टीम ने एक कस्टम मोबाइल ऐप बनाया।
इस ऐप को अपनी जेब में फिट होने वाले एक डिजिटल वॉयस बूथ के रूप में समझें।
- यह कैसे काम करता था: आपने ऐप डाउनलोड किया, एक विषय या वाक्य चुना, और रिकॉर्ड बटन दबाया।
- सेफ्टी नेट: इससे पहले कि आप अपनी आवाज सबमिट कर पाते, ऐप एक सख्त बाउंसर की तरह काम करता। इसने जांचा कि क्या कमरा बहुत शोर वाला था या आपकी आवाज बहुत धीमी थी। यदि गुणवत्ता अच्छी नहीं थी, तो इसने आपको फिर से प्रयास करने के लिए वापस भेज दिया। इसने सुनिश्चित किया कि "लाइब्रेरी" में केवल उच्च-गुणवत्ता वाली किताबें ही आएं।
4. लोग: समुदाय ही नायक है
इस प्रोजेक्ट ने केवल अभिनेताओं को काम पर नहीं रखा; इसने समुदाय को लामबंद किया। उन्होंने पूरे केन्या से, नैरोबी की हलचल भरी सड़कों से लेकर दूरदराज के गांवों तक, लगभग 4,700 मूल भाषियों (native speakers) को जोड़ा।
- चुनौती: लोगों को अपनी आवाज (और भुगतान के लिए अपना आईडी नंबर) किसी अजनबी को देने के लिए विश्वास दिलाना कठिन था। कुछ लोग डरे हुए थे कि उनका डेटा चोरी हो जाएगा।
- समाधान: टीम ने "स्थानीय मोबिलाइजर्स" (Local Mobilizers) का उपयोग किया—सम्मानित सामुदायिक नेता जो विश्वसनीय राजदूतों के रूप में कार्य करते थे। वे घर-घर गए, स्थानीय बोलियों में प्रोजेक्ट को समझाया और विश्वास बनाया। यह एक पड़ोसी द्वारा नए व्यवसाय की गारंटी देने जैसा था; एक बार जब पड़ोसी ने इसे सुरक्षित बताया, तो सभी इसमें शामिल हो गए।
5. परिणाम: भविष्य के लिए एक खजाना मानचित्र
अंतिम परिणाम डेवलपर्स के लिए एक विशाल, व्यवस्थित खजाना मानचित्र है।
- डेटा: इसमें 11 अलग-अलग विषयों को कवर करते हुए 3,000 घंटों का ऑडियो शामिल है, जैसे खेती, स्वास्थ्य सेवा, सरकारी सेवाएं और कहानी सुनाना।
- गुणवत्ता: प्रत्येक रिकॉर्डिंग की मनुष्यों (ट्रांसक्राइबर्स) द्वारा जांच की गई थी जिन्होंने ठीक वही लिखा जो कहा गया था, जिसमें यह भी शामिल था कि लोग भाषाओं के बीच कब स्विच (code-switching) कर रहे थे।
- प्रभाव: अब, डेवलपर्स इस डेटा का उपयोग ऐसे वॉयस असिस्टेंट बनाने के लिए कर सकते हैं जो फसल की कीमतों के बारे में पूछने वाले एक मासाई किसान या अपने बच्चे के स्वास्थ्य की जांच करने वाली एक किकुयू माँ को समझ सकें।
यह क्यों महत्वपूर्ण है
इस प्रोजेक्ट से पहले, यदि आप केन्याई भाषा बोलते थे, तो आप तकनीकी रूप से अदृश्य थे। आप वॉयस कमांड का उपयोग करके ऋण प्राप्त करने, मौसम की जांच करने या सरकारी सेवाओं तक पहुंचने के लिए नहीं कर सकते थे।
AfriVoices-KE बेजुबानों को आवाज देने जैसा है। यह सुनिश्चित करता है कि जैसे-जैसे दुनिया डिजिटल हो रही है, कोई भी इसलिए पीछे न छूट जाए क्योंकि उसकी भाषा कंप्यूटर के समझने के लिए "पर्याप्त अच्छी" नहीं थी। यह केन्या की समृद्ध मौखिक विरासत का एक डिजिटल संरक्षण है, जो यह सुनिश्चित करता है कि ये भाषाएं न केवल जीवित रहें, बल्कि एआई (AI) के युग में फलें-फूलें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।