← नवीनतम पेपर
💬 NLP

The Thiomi Dataset: A Large-Scale Multimodal Corpus for Low-Resource African Languages

यह शोध पत्र थिओमी डेटासेट (Thiomi Dataset) का परिचय देता है, जो दस अफ्रीकी भाषाओं में 6,01,000 से अधिक टेक्स्ट एनोटेशन और 3,85,000 ऑडियो रिकॉर्डिंग वाला एक बड़े पैमाने का मल्टीमॉडल कॉर्पस है, जो स्पीच और लैंग्वेज मॉडल्स के लिए नए स्टेट-ऑफ-द-आर्ट बेसलाइन स्थापित करता है और ऑटोमैटिक स्पीच रिकग्निशन प्रदर्शन में महत्वपूर्ण सुधार प्रदर्शित करता है।

मूल लेखक: Hillary Mutisya, John Mugane, Gavin Nyamboga, Brian Chege, Maryruth Gathoni

प्रकाशित 2026-04-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hillary Mutisya, John Mugane, Gavin Nyamboga, Brian Chege, Maryruth Gathoni

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि भाषा प्रौद्योगिकी की दुनिया एक विशाल, हलचल भरी लाइब्रेरी है। लंबे समय से, इस लाइब्रेरी में अंग्रेजी, फ्रेंच और मैंडरिन की किताबें ऊँची रखी हुई हैं, जबकि अफ्रीकी भाषाओं के लिए अलमारियाँ लगभग खाली हैं। यदि आप एक ऐसा रोबोट बनाना चाहते जो स्वाहिली बोल सके या सोमाली में संदेश का अनुवाद कर सके, तो आपको एक पूरी विश्वकोश के बजाय मुट्ठी भर टुकड़ों के साथ इसे करना होगा।

थियोमी डेटासेट (Thiomi Dataset) एक विशाल, समुदाय-निर्मित निर्माण परियोजना की तरह है जिसे उन खाली अलमारियों को भरने के लिए डिज़ाइन किया गया है। यह दस अलग-अलग अफ्रीकी भाषाओं के लिए बोले गए और लिखे गए शब्दों का एक बड़ा संग्रह है, जिसे किसी एक कॉर्पोरेशन द्वारा लैब में नहीं, बल्कि उन समुदायों के 100 से अधिक वास्तविक लोगों द्वारा बनाया गया है।

यहाँ उनका विवरण दिया गया है, कुछ रोजमर्रा के उपमाओं का उपयोग करते हुए:

1. समस्या: "खाली अलमारी"

वर्तमान AI की स्थिति को एक शेफ (रसोइया) के रूप में सोचें जो एक दावत पकाने की कोशिश कर रहा है। यूरोपीय भाषाओं के लिए, शेफ के पास ताजी सामग्री के साथ एक पूरी तरह से भरा हुआ पेंट्री (भंडार) है। कई अफ्रीकी भाषाओं के लिए, शेफ एक अकेले, बासी बिस्कुट के साथ खाना पकाने की कोशिश कर रहा है। इसका मतलब है कि वॉयस असिस्टेंट, ट्रांसलेशन ऐप्स और स्पीच-टू-टेक्स्ट टूल्स उन एक अरब से अधिक लोगों के लिए ठीक से काम नहीं करते जो इन भाषाओं में बोलते हैं।

2. समाधान: एक "कम्युनिटी पॉटलक" (सामुदायिक भोज)

एक बड़ी कंपनी द्वारा कुछ लोगों को डेटा रिकॉर्ड करने के लिए काम पर रखने के बजाय, थियोमी टीम ने एक मोबाइल ऐप (एक डिजिटल पॉटलक आमंत्रण की तरह) बनाया।

  • प्लेटफॉर्म: उन्होंने एक "मोबाइल-फर्स्ट" ऐप बनाया। चूंकि पूर्वी अफ्रीका में अधिकांश लोग कंप्यूटर की तुलना में स्मार्टफोन का अधिक उपयोग करते हैं, इसलिए यह ऐप एक सरल सोशल मीडिया फीड की तरह काम करता है। आपको कुछ भी इंस्टॉल करने की आवश्यकता नहीं है; बस अपने ब्राउज़र में इसे खोलें।
  • दो रेसिपी: उन्होंने दो तरीकों से डेटा एकत्र किया:
    1. "अनुवाद" विधि: उन्होंने लोगों को अंग्रेजी में एक वाक्य दिया (जैसे "The doctor told her to rest") और उनसे इसे अपनी स्थानीय भाषा में अनुवाद करने और इसे पढ़ने का रिकॉर्ड करने के लिए कहा। यह किसी को एक रेसिपी कार्ड देने और उन्हें अपनी शैली में खाना पकाने के लिए कहने जैसा है।
    2. "कहानी सुनाने" की विधि: उन्होंने लोगों से बस उनके दिन या किसी विषय के बारे में स्वाभाविक रूप से बोलने के लिए कहा, और फिर समुदाय के अन्य सदस्यों ने जो उन्होंने सुना उसे लिखा। यह लोगों के बात करने के वास्तविक, अनौपचारिक तरीके को पकड़ता है, जिसमें स्लैंग और बोलियाँ भी शामिल हैं।

3. गुणवत्ता नियंत्रण: "स्वाद परीक्षण"

आप केवल यादृच्छिक शब्द लाइब्रेरी में नहीं डाल सकते; उन्हें सटीक होना चाहिए। टीम ने एक चार-चरणीय गुणवत्ता फ़िल्टर स्थापित किया, जो एक कठोर खाद्य सुरक्षा निरीक्षण के समान है:

  • चरण 1: एक कंप्यूटर जाँचता है कि क्या वाक्य पर्याप्त लंबा है और उसमें कोई टाइपो (वर्तनी की गलती) तो नहीं है।
  • चरण 2: उसी भाषा समुदाय का एक साथी इसे पढ़ता है। यदि यह अजीब लगता है, तो वे इसे "दोबारा करने" के लिए वापस भेज देते हैं।
  • चरण 3: एक भाषा विशेषज्ञ (जैसे एक मुख्य शेफ) व्याकरण और सांस्कृतिक बारीकियों को सुनिश्चित करने के लिए काम के 10% हिस्से की रैंडम जांच करता है।
  • चरण 4: अंतिम अनुमोदन। यदि यह पास हो जाता है, तो इसे डेटासेट में जोड़ दिया जाता है।

इस सख्त प्रक्रिया के कारण, उन्होंने अपनी मुख्य भाषाओं के लिए 95-98% अनुमोदन दर प्राप्त की। यह सुनिश्चित करने जैसा है कि किसी को भी उधार देने से पहले शेल्फ पर मौजूद हर किताब वास्तव में पठनीय और सही हो।

4. परिणाम: यह साबित करना कि रेसिपी काम करती है

यह साबित करने के लिए कि यह नया "पेंट्री" उपयोगी है, टीम ने तीन प्रकार के AI रोबोट बनाए और उनका परीक्षण किया:

  • कान (स्पीच रिकग्निशन): उन्होंने एक रोबोट बनाया जो भाषण सुनता है और उसे टेक्स्ट में बदल देता है।
    • परिणाम: स्वाहिली के लिए, उनके नए रोबोट ने केवल 3.24% बार गलतियाँ कीं। पिछले सर्वश्रेष्ठ रोबोट ने 8.3% बार गलतियाँ की थीं। यह एक बहुत बड़ी छलांग है! यह ध्वनि को धीमा करने वाले हियरिंग एड से बदलकर स्पष्ट रूप से सुनने वाले हियरिंग एड में अपग्रेड करने जैसा है।
  • अनुवादक (मशीन ट्रांसलेशन): उन्होंने अंग्रेजी और सोमाली एवं किकुयू जैसी भाषाओं के बीच अनुवाद करने के लिए एक रोबोट बनाया।
    • परिणाम: अनुवाद उच्च गुणवत्ता के थे, जो मानक परीक्षणों पर बहुत अच्छा स्कोर करते हैं। यह एक ऐसे अनुवादक की तरह है जो केवल शब्दों को नहीं बदलता बल्कि अर्थ को भी समझता है।
  • आवाज़ (टेक्स्ट-टू-स्पीच): उन्होंने एक रोबोट बनाया जो टेक्स्ट को ज़ोर से पढ़ता है।
    • परिणाम: मूल भाषियों ने आवाजों को "प्राकृतिक" और समझने में आसान बताया। अब यह रोबोट की तरह नहीं लग रहा है; यह एक इंसान की तरह लगता है।

5. यह क्यों मायने रखता है

थियोमी डेटासेट केवल नंबरों के बारे में नहीं है; यह एक नींव है।

  • यह निष्पक्ष है: यह उन भाषाओं को आवाज़ देता है जिन्हें अनदेखा किया गया था।
  • यह खुला है: वे इस डेटा को HuggingFace (AI के लिए एक सार्वजनिक लाइब्रेरी) पर रख रहे हैं, ताकि कोई भी बेहतर ऐप्स बनाने के लिए इसका उपयोग कर सके।
  • यह नैतिक है: योगदान देने वाले लोगों को उचित भुगतान किया गया, और उनके डेटा की सुरक्षा की गई।

संक्षेप में: थियोमी टीम ने केवल एक डेटासेट नहीं बनाया; उन्होंने एक सेतु (पुल) बनाया है। उन्होंने "लो-रिसोर्स" भाषाओं और आधुनिक तकनीक के बीच की खाई को पाटने के लिए सामुदायिक शक्ति का उपयोग किया, यह साबित करते हुए कि जब आप लोगों को सही उपकरण देते हैं, तो वे भाषा प्रौद्योगिकी के भविष्य का निर्माण स्वयं कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →