← नवीनतम पेपर
💬 NLP

GhanaNLP Parallel Corpora: Comprehensive Multilingual Resources for Low-Resource Ghanaian Languages

घानाएनएलपी (GhanaNLP) पहल पांच स्थानीय भाषाओं और अंग्रेजी के बीच पेशेवर रूप से अनुवादित 41,513 समानांतर वाक्य युग्मों का एक क्यूरेटेड संग्रह जारी करके कम-संसाधन वाली घानाई भाषाओं के लिए डिजिटल भाषाई डेटा की कमी को संबोधित करती है ताकि मशीन अनुवाद, भाषण प्रौद्योगिकियों और भाषा संरक्षण को आगे बढ़ाया जा सके।

मूल लेखक: Lawrence Adu Gyamfi, Paul Azunre, Stephen Edward Moore, Joel Budu, Akwasi Asare, Mich-Seth Owusu, Jonathan Ofori Asiamah

प्रकाशित 2026-03-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lawrence Adu Gyamfi, Paul Azunre, Stephen Edward Moore, Joel Budu, Akwasi Asare, Mich-Seth Owusu, Jonathan Ofori Asiamah

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप पूरी दुनिया के लिए एक विशाल, उच्च-तकनीकी पुस्तकालय बनाने की कोशिश कर रहे हैं। लंबे समय से, इस पुस्तकालय में अंग्रेजी, मंदारिन और स्पेनिश में लाखों किताबें रखी गई हैं। क्योंकि इन भाषाओं में बहुत सारी किताबें हैं, इसलिए पुस्तकालयाध्यक्षों (AI कंप्यूटरों) ने उन्हें पूरी तरह से पढ़ना, लिखना और अनुवाद करना सीख लिया है।

लेकिन फिर, जब आप ट्वी (Twi), फान्ते (Fante), एवे (Ewe), गा (Ga) और कुसाल (Kusaal) जैसी भाषाओं (जो घाना के लाखों लोगों द्वारा बोली जाती हैं) के लिए अलमारियों को देखते हैं, तो आप पाते हैं कि वे लगभग खाली हैं। इन भाषाओं के लिए बहुत कम "किताबें" (डिजिटल डेटा) मौजूद हैं। क्योंकि पुस्तकालय खाली है, इसलिए AI पुस्तकालयाध्यक्ष इन भाषाओं में बोलना नहीं जानते। वे इन स्थानीय भाषाओं में डॉक्टर की सलाह, शिक्षक का पाठ, या किसान के बाजार भाव का अनुवाद नहीं कर सकते।

यह शोध पत्र इस बारे में है कि कैसे 'घानाNLP' नामक एक टीम ने उन खाली अलमारियों को भरने का निर्णय लिया।

यहाँ इसका विवरण दिया गया है कि उन्होंने क्या किया, कुछ रोजमर्रा के उपमाओं का उपयोग करते हुए:

1. समस्या: "डिजिटल रेगिस्तान"

वर्षों से, AI एक ऐसे यात्री की तरह रहा है जो केवल अंग्रेजी बोलता है। यदि आप उससे ट्वी या एवे में बात करने की कोशिश करते हैं, तो वह बस शून्य भाव से देखता रहता है। ऐसा इसलिए है क्योंकि इन भाषाओं के लिए "प्रशिक्षण डेटा" (वे किताबें जिन्हें AI सीखने के लिए पढ़ता है) गायब है। डेटा के बिना, AI सीख नहीं सकता। यह लाखों घानावासियों को डिजिटल दुनिया से बाहर कर देता है, जिससे वे अपनी मातृभाषाओं में वॉयस असिस्टेंट, अनुवाद ऐप या ऑनलाइन शिक्षा का उपयोग करने में असमर्थ हो जाते हैं।

2. समाधान: एक "द्विभाषी पुल" बनाना

घानाNLP टीम ने केवल कंप्यूटर में रैंडम शब्द नहीं डाले। उन्होंने एक द्विभाषी पुल बनाया।

  • अवधारणा: उन्होंने 41,513 वाक्यों के जोड़े बनाए। इसे एक विशाल शब्दकोश के रूप में सोचें जहाँ स्थानीय घानाई भाषा का प्रत्येक वाक्य उसके अंग्रेजी समकक्ष के साथ पूरी तरह से मेल खाता है।
  • भाषाएँ: उन्होंने पाँच प्रमुख भाषाओं पर ध्यान केंद्रित किया: ट्वी (Twi), फान्ते (Fante), एवे (Ewe), गा (Ga) और कुसाल (Kusaal)
  • आकार: यह एक छोटे लेकिन बहुत मजबूत पुस्तकालय के निर्माण जैसा है। हालांकि यह अंग्रेजी पुस्तकालय जितना बड़ा नहीं है, लेकिन यह पहली बार है जब इन विशिष्ट भाषाओं के पास इस आकार का एक संरचित, उच्च-गुणवत्ता वाला संग्रह है।

3. उन्होंने इसे कैसे बनाया: "मास्टर क्राफ्ट्समेन" दृष्टिकोण

आप केवल एक रोबोट से ये किताबें लिखने के लिए नहीं कह सकते; वह गलतियाँ करेगा। टीम ने "ह्यूमन-इन-द-लूप" (मानव-केंद्रित) दृष्टिकोण का उपयोग किया, जो एक पुल बनाने के लिए मास्टर क्राफ्ट्समेन (कुशल कारीगरों) को काम पर रखने जैसा है।

  • ईंटें इकट्ठा करना: उन्होंने विकिपीडिया, स्थानीय कहानियों (जैसे स्थानीय भाषाओं में अनूदित ओलिवर ट्विस्ट) और सांस्कृतिक अभिलेखागारों जैसे स्थानों से वाक्य एकत्र किए।
  • अनुवाद टीम: उन्होंने सशुल्क, पेशेवर अनुवादकों को काम पर रखा जो अंग्रेजी और स्थानीय भाषाओं दोनों में निपुण थे। ये केवल वे लोग नहीं थे जो शब्द जानते थे; वे विशेषज्ञ थे जो भाव (vibe), संस्कृति और बोलियों को समझते थे।
    • उपमा: कल्पना कीजिए कि आप एक चुटकुले का अनुवाद करने की कोशिश कर रहे हैं। एक रोबोट शायद शब्दों का शाब्दिक अनुवाद करेगा और उसका हास्य खत्म कर देगा। एक मानव अनुवादक जानता है कि वह चुटकुला क्यों मजेदार है और दूसरे भाषा में उसे कैसे काम करने लायक बनाया जाए।
  • "बोली" का विवरण: यह महत्वपूर्ण है। घाना में, ट्वी जैसी भाषा के अलग-अलग "स्वाद" (बोलियाँ) होते हैं, जो इस बात पर निर्भर करते हैं कि आप कहाँ हैं (जैसे असांते, अकुआपम, आदि)। टीम ने यह सुनिश्चित किया कि इसमें सभी स्वाद शामिल हों, ताकि AI केवल एक संस्करण न सीखे बल्कि पूरे परिवार को समझ सके।

4. खेल के नियम: गुणवत्ता नियंत्रण

टीम इस बात को लेकर बहुत सख्त थी कि पुस्तकालय में क्या शामिल किया जाए।

  • छोटे वाक्य नहीं: उन्होंने उन सभी वाक्यों को हटा दिया जिनमें 4 से कम शब्द थे। क्यों? क्योंकि छोटे वाक्यांश अक्सर भ्रमित करने वाले होते हैं। वे पूर्ण, संपूर्ण विचार (कर्ता + क्रिया + कर्म) चाहते थे ताकि AI वास्तविक वाक्य बनाना सीख सके।
  • "सर्वनाम से शुरू होने वाले वाक्य" नहीं: उन्होंने उन वाक्यों से परहेज किया जो बिना संदर्भ के "वह" (He/She) या "यह" (It) से शुरू होते हैं, क्योंकि यह AI को भ्रमित करता है।
  • फ़िल्टर: उनके पास लगभग 90,000 संभावित वाक्य थे और उन्होंने उनमें से लगभग 32% को इसलिए हटा दिया क्योंकि वे पर्याप्त अच्छे नहीं थे। यह सुनिश्चित करता है कि जो शेष है वह उच्च-गुणवत्ता वाला सोना है, न कि केवल मिट्टी।

5. हम इससे क्या कर सकते हैं? ("वास्तविक दुनिया" का जादू)

एक बार जब AI इन नई किताबों से सीख लेता है, तो यह अद्भुत चीजें कर सकता है:

  • खया AI (Khaya AI): उन्होंने पहले से ही इस डेटा का उपयोग करके खया AI नामक एक अनुवाद इंजन बनाया है। यह एक डिजिटल दुभाषिए की तरह है जो अंग्रेजी और इन स्थानीय भाषाओं के बीच तुरंत अनुवाद कर सकता है।
  • वॉयस असिस्टेंट: कल्पना कीजिए कि आप अपने फोन से कुसाल भाषा में पूछते हैं, "मक्का की कीमत क्या है?" और वह कुसाल में ही उत्तर देता है। यह डेटा इसे संभव बनाता है।
  • शिक्षा और स्वास्थ्य: डॉक्टर एवे भाषा में स्वास्थ्य संबंधी सलाह दे सकते हैं, और शिक्षक गा भाषा में पाठ बना सकते हैं, जिससे ग्रामीण समुदायों के लिए भाषाई बाधाएं टूट सकती हैं।
  • सांस्कृतिक संरक्षण: उन्होंने कहावतों और लोक कथाओं को शामिल किया है। यह भाषा की "आत्मा" को बचाने जैसा है, यह सुनिश्चित करना कि डिजिटल युग में प्राचीन ज्ञान खो न जाए।

6. कमी: यह अभी भी पूर्ण नहीं है (अभी तक)

यह शोध पत्र अपनी सीमाओं के बारे में ईमानदार है:

  • यह अभी भी छोटा है: अंग्रेजी के अरबों वाक्यों की तुलना में, 41,000 एक बूंद के समान है। AI स्मार्ट है, लेकिन यह अपने अंग्रेजी बोलने वाले चचेरे भाई की तुलना में अभी भी एक बच्चा है।
  • केवल टेक्स्ट: अभी के लिए, पुस्तकालय में केवल लिखित पुस्तकें हैं। उनके पास अभी ऑडियो रिकॉर्डिंग नहीं है। इसलिए, AI टेक्स्ट का अनुवाद कर सकता है, लेकिन वह इन भाषाओं को "बोल" या "सुन" नहीं सकता है।
  • बोली अंतराल: हालांकि उन्होंने सभी बोलियों को कवर करने की कोशिश की, लेकिन कुछ दूरदराज के ग्रामीण संस्करण अभी भी गायब हैं।

बड़ी तस्वीर

यह शोध पत्र डिजिटल समावेशन का एक ब्लूप्रिंट है। यह कहता है: "तकनीक केवल उन कुछ लोगों के लिए नहीं होनी चाहिए जो अंग्रेजी बोलते हैं। यह सभी के लिए होनी चाहिए।"

इस "द्विभाषी पुल" का निर्माण करके, घानाNLP टीम उन लाखों लोगों को आवाज दे रही है जो पहले डिजिटल दुनिया में मौन थे। वे यह साबित कर रहे हैं कि पर्याप्त देखभाल, मानवीय प्रयास और सामुदायिक भावना के साथ, हम AI को दुनिया की भाषाओं को बोलना सिखा सकते हैं, न कि केवल शक्तिशाली लोगों की भाषाओं को।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →