The Thiomi Dataset: A Large-Scale Multimodal Corpus for Low-Resource African Languages
यह शोध पत्र थिओमी डेटासेट (Thiomi Dataset) का परिचय देता है, जो दस अफ्रीकी भाषाओं में 6,01,000 से अधिक टेक्स्ट एनोटेशन और 3,85,000 ऑडियो रिकॉर्डिंग वाला एक बड़े पैमाने का मल्टीमॉडल कॉर्पस है, जो स्पीच और लैंग्वेज मॉडल्स के लिए नए स्टेट-ऑफ-द-आर्ट बेसलाइन स्थापित करता है और ऑटोमैटिक स्पीच रिकग्निशन प्रदर्शन में महत्वपूर्ण सुधार प्रदर्शित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि भाषा प्रौद्योगिकी की दुनिया एक विशाल, हलचल भरी लाइब्रेरी है। लंबे समय से, इस लाइब्रेरी में अंग्रेजी, फ्रेंच और मैंडरिन की किताबें ऊँची रखी हुई हैं, जबकि अफ्रीकी भाषाओं के लिए अलमारियाँ लगभग खाली हैं। यदि आप एक ऐसा रोबोट बनाना चाहते जो स्वाहिली बोल सके या सोमाली में संदेश का अनुवाद कर सके, तो आपको एक पूरी विश्वकोश के बजाय मुट्ठी भर टुकड़ों के साथ इसे करना होगा।
थियोमी डेटासेट (Thiomi Dataset) एक विशाल, समुदाय-निर्मित निर्माण परियोजना की तरह है जिसे उन खाली अलमारियों को भरने के लिए डिज़ाइन किया गया है। यह दस अलग-अलग अफ्रीकी भाषाओं के लिए बोले गए और लिखे गए शब्दों का एक बड़ा संग्रह है, जिसे किसी एक कॉर्पोरेशन द्वारा लैब में नहीं, बल्कि उन समुदायों के 100 से अधिक वास्तविक लोगों द्वारा बनाया गया है।
यहाँ उनका विवरण दिया गया है, कुछ रोजमर्रा के उपमाओं का उपयोग करते हुए:
1. समस्या: "खाली अलमारी"
वर्तमान AI की स्थिति को एक शेफ (रसोइया) के रूप में सोचें जो एक दावत पकाने की कोशिश कर रहा है। यूरोपीय भाषाओं के लिए, शेफ के पास ताजी सामग्री के साथ एक पूरी तरह से भरा हुआ पेंट्री (भंडार) है। कई अफ्रीकी भाषाओं के लिए, शेफ एक अकेले, बासी बिस्कुट के साथ खाना पकाने की कोशिश कर रहा है। इसका मतलब है कि वॉयस असिस्टेंट, ट्रांसलेशन ऐप्स और स्पीच-टू-टेक्स्ट टूल्स उन एक अरब से अधिक लोगों के लिए ठीक से काम नहीं करते जो इन भाषाओं में बोलते हैं।
2. समाधान: एक "कम्युनिटी पॉटलक" (सामुदायिक भोज)
एक बड़ी कंपनी द्वारा कुछ लोगों को डेटा रिकॉर्ड करने के लिए काम पर रखने के बजाय, थियोमी टीम ने एक मोबाइल ऐप (एक डिजिटल पॉटलक आमंत्रण की तरह) बनाया।
- प्लेटफॉर्म: उन्होंने एक "मोबाइल-फर्स्ट" ऐप बनाया। चूंकि पूर्वी अफ्रीका में अधिकांश लोग कंप्यूटर की तुलना में स्मार्टफोन का अधिक उपयोग करते हैं, इसलिए यह ऐप एक सरल सोशल मीडिया फीड की तरह काम करता है। आपको कुछ भी इंस्टॉल करने की आवश्यकता नहीं है; बस अपने ब्राउज़र में इसे खोलें।
- दो रेसिपी: उन्होंने दो तरीकों से डेटा एकत्र किया:
- "अनुवाद" विधि: उन्होंने लोगों को अंग्रेजी में एक वाक्य दिया (जैसे "The doctor told her to rest") और उनसे इसे अपनी स्थानीय भाषा में अनुवाद करने और इसे पढ़ने का रिकॉर्ड करने के लिए कहा। यह किसी को एक रेसिपी कार्ड देने और उन्हें अपनी शैली में खाना पकाने के लिए कहने जैसा है।
- "कहानी सुनाने" की विधि: उन्होंने लोगों से बस उनके दिन या किसी विषय के बारे में स्वाभाविक रूप से बोलने के लिए कहा, और फिर समुदाय के अन्य सदस्यों ने जो उन्होंने सुना उसे लिखा। यह लोगों के बात करने के वास्तविक, अनौपचारिक तरीके को पकड़ता है, जिसमें स्लैंग और बोलियाँ भी शामिल हैं।
3. गुणवत्ता नियंत्रण: "स्वाद परीक्षण"
आप केवल यादृच्छिक शब्द लाइब्रेरी में नहीं डाल सकते; उन्हें सटीक होना चाहिए। टीम ने एक चार-चरणीय गुणवत्ता फ़िल्टर स्थापित किया, जो एक कठोर खाद्य सुरक्षा निरीक्षण के समान है:
- चरण 1: एक कंप्यूटर जाँचता है कि क्या वाक्य पर्याप्त लंबा है और उसमें कोई टाइपो (वर्तनी की गलती) तो नहीं है।
- चरण 2: उसी भाषा समुदाय का एक साथी इसे पढ़ता है। यदि यह अजीब लगता है, तो वे इसे "दोबारा करने" के लिए वापस भेज देते हैं।
- चरण 3: एक भाषा विशेषज्ञ (जैसे एक मुख्य शेफ) व्याकरण और सांस्कृतिक बारीकियों को सुनिश्चित करने के लिए काम के 10% हिस्से की रैंडम जांच करता है।
- चरण 4: अंतिम अनुमोदन। यदि यह पास हो जाता है, तो इसे डेटासेट में जोड़ दिया जाता है।
इस सख्त प्रक्रिया के कारण, उन्होंने अपनी मुख्य भाषाओं के लिए 95-98% अनुमोदन दर प्राप्त की। यह सुनिश्चित करने जैसा है कि किसी को भी उधार देने से पहले शेल्फ पर मौजूद हर किताब वास्तव में पठनीय और सही हो।
4. परिणाम: यह साबित करना कि रेसिपी काम करती है
यह साबित करने के लिए कि यह नया "पेंट्री" उपयोगी है, टीम ने तीन प्रकार के AI रोबोट बनाए और उनका परीक्षण किया:
- कान (स्पीच रिकग्निशन): उन्होंने एक रोबोट बनाया जो भाषण सुनता है और उसे टेक्स्ट में बदल देता है।
- परिणाम: स्वाहिली के लिए, उनके नए रोबोट ने केवल 3.24% बार गलतियाँ कीं। पिछले सर्वश्रेष्ठ रोबोट ने 8.3% बार गलतियाँ की थीं। यह एक बहुत बड़ी छलांग है! यह ध्वनि को धीमा करने वाले हियरिंग एड से बदलकर स्पष्ट रूप से सुनने वाले हियरिंग एड में अपग्रेड करने जैसा है।
- अनुवादक (मशीन ट्रांसलेशन): उन्होंने अंग्रेजी और सोमाली एवं किकुयू जैसी भाषाओं के बीच अनुवाद करने के लिए एक रोबोट बनाया।
- परिणाम: अनुवाद उच्च गुणवत्ता के थे, जो मानक परीक्षणों पर बहुत अच्छा स्कोर करते हैं। यह एक ऐसे अनुवादक की तरह है जो केवल शब्दों को नहीं बदलता बल्कि अर्थ को भी समझता है।
- आवाज़ (टेक्स्ट-टू-स्पीच): उन्होंने एक रोबोट बनाया जो टेक्स्ट को ज़ोर से पढ़ता है।
- परिणाम: मूल भाषियों ने आवाजों को "प्राकृतिक" और समझने में आसान बताया। अब यह रोबोट की तरह नहीं लग रहा है; यह एक इंसान की तरह लगता है।
5. यह क्यों मायने रखता है
थियोमी डेटासेट केवल नंबरों के बारे में नहीं है; यह एक नींव है।
- यह निष्पक्ष है: यह उन भाषाओं को आवाज़ देता है जिन्हें अनदेखा किया गया था।
- यह खुला है: वे इस डेटा को HuggingFace (AI के लिए एक सार्वजनिक लाइब्रेरी) पर रख रहे हैं, ताकि कोई भी बेहतर ऐप्स बनाने के लिए इसका उपयोग कर सके।
- यह नैतिक है: योगदान देने वाले लोगों को उचित भुगतान किया गया, और उनके डेटा की सुरक्षा की गई।
संक्षेप में: थियोमी टीम ने केवल एक डेटासेट नहीं बनाया; उन्होंने एक सेतु (पुल) बनाया है। उन्होंने "लो-रिसोर्स" भाषाओं और आधुनिक तकनीक के बीच की खाई को पाटने के लिए सामुदायिक शक्ति का उपयोग किया, यह साबित करते हुए कि जब आप लोगों को सही उपकरण देते हैं, तो वे भाषा प्रौद्योगिकी के भविष्य का निर्माण स्वयं कर सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।