← नवीनतम पेपर
💬 NLP

Nsanku: Evaluating Zero-Shot Translation Performance of LLMs for Ghanaian Languages

यह शोधपत्र नसांकु (Nsanku) प्रस्तुत करता है, जो 43 घाना भाषाओं में 19 बड़े भाषा मॉडलों के ज़ीरो-शॉट अनुवाद प्रदर्शन का मूल्यांकन करने वाला एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि हालांकि जेमिनी-2.5-फ्लैश (Gemini-2.5-flash) जैसे शीर्ष मॉडल मध्यम स्कोर प्राप्त करते हैं, लेकिन कोई भी वर्तमान मॉडल इन भाषाओं के लिए उच्च प्रदर्शन और निरंतरता को एक साथ प्रदर्शित नहीं करता है, जो यह संकेत देता है कि वे अभी तक इन भाषाओं में बड़े पैमाने पर अनुवाद के लिए विश्वसनीय रूप से उपयोग करने योग्य नहीं हैं।

मूल लेखक: Stephen E. Moore, Mich-Seth Owusu, Akwasi Asare, Lawrence Adu Gyamfi, Paul Azunre, Joel Budu, Jonathan Asiamah, Elias Dzobo, Kelvin Newman, Edmund O. Benefo, Gerhardt Datsomor, Onesimus Addo Appiah, A
प्रकाशित 2026-05-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Stephen E. Moore, Mich-Seth Owusu, Akwasi Asare, Lawrence Adu Gyamfi, Paul Azunre, Joel Budu, Jonathan Asiamah, Elias Dzobo, Kelvin Newman, Edmund O. Benefo, Gerhardt Datsomor, Onesimus Addo Appiah, Ama Branoa Banful, Lucas Woedem Kpatah, Saani Mustapha Deishini, John Ayernor

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

द नसांकु रिपोर्ट: घाना की भाषाओं पर AI अनुवादकों का परीक्षण

कल्पना कीजिए कि आपके पास 19 अलग-अलग "सुपर-ब्रेन" (AI मॉडल) का एक विशाल पुस्तकालय है। कुछ बड़े तकनीकी दिग्गजों के स्वामित्व में हैं, और अन्य समुदायों द्वारा बनाए गए ओपन-सोर्स प्रोजेक्ट्स हैं। आप जानना चाहते हैं: क्या इनमें से कोई भी मस्तिष्क बिना कभी इन विशिष्ट भाषाओं को सीखे, अंग्रेजी का घाना की 43 विभिन्न भाषाओं में अनुवाद कर सकता है?

यही वह काम है जो नसांकु (Nsanku) पेपर ने किया। "नसांकु" नाम अकां (Akan) भाषा से आया है और इसका अर्थ है "वाद्य यंत्र" (musical instruments)। जिस तरह एक बैंड को संगीत बनाने के लिए कई अलग-अलग वाद्य यंत्रों की आवश्यकता होती है, इस प्रोजेक्ट को यह देखने के लिए कि वे घाना की विविध "संगीत" को कितनी अच्छी तरह संभालते हैं, कई अलग-अलग AI मॉडलों की आवश्यकता थी।

यहाँ उनके द्वारा किए गए शोध का विवरण सरल भाषा में दिया गया है।


1. सेटअप: एक सख्त "ज़ीरो-शॉट" टेस्ट

इन AI मॉडलों को एक सरप्राइज़ परीक्षा देने वाले छात्रों के रूप में सोचें।

  • नियम: उन्हें पहले से पढ़ाई करने की अनुमति नहीं थी। उन्हें घाना के डेटा पर "फाइन-ट्यून" (पुनः प्रशिक्षित) नहीं किया जा सकता था। उन्हें पूरी तरह से अपने सामान्य प्रशिक्षण से मिली जानकारी पर निर्भर रहना था। इसे ज़ीरो-शॉट (zero-shot) टेस्ट कहा जाता है।
  • परीक्षण सामग्री: परीक्षा के प्रश्न बाइबल के 300 वाक्य थे, जिन्हें 43 अलग-अलग घाना की भाषाओं में अनुवादित किया गया था। शोधकर्ताओं ने बाइबल का उपयोग इसलिए किया क्योंकि यह उन कुछ स्थानों में से एक है जहाँ आप लगभग इन सभी भाषाओं के लिखित संस्करण एक ही स्थान पर पा सकते हैं।
  • ग्रेडिंग: उन्होंने दो अलग-अलग ग्रेडिंग सिस्टम का उपयोग किया:
    • BLEU: एक सख्त शिक्षक की तरह जो यह जाँचता है कि क्या छात्र ने बिल्कुल सही शब्दों का उपयोग किया है।
    • chrF: एक अधिक लचीले शिक्षक की तरह जो यह जाँचता है कि क्या छात्र ने वाक्य की सामान्य ध्वनि और संरचना को सही पकड़ा है, भले ही सटीक शब्द थोड़े अलग हों।

2. परिणाम: कौन पास हुआ? कौन फेल हुआ?

"स्टार छात्र" (प्रोप्रायटरी मॉडल)

तकनीकी दिग्गजों (Google, Anthine, और OpenAI) के तीन बड़े नाम वाले AI मॉडल शीर्ष पर रहे।

  • Gemini-2.5-flash सबसे अधिक स्कोर के साथ क्लास वैलेडिक्टोरियन (सर्वश्रेष्ठ छात्र) रहा।
  • Claude-sonnet-4-5 और GPT-4.1 इसके ठीक पीछे थे।
  • उपमा: ये उन छात्रों की तरह हैं जो सबसे महंगे निजी स्कूलों में गए हैं। उन्होंने बहुत सारा डेटा देखा है और वे दूसरों की तुलना में उत्तरों का बेहतर अनुमान लगा सकते हैं, लेकिन फिर भी वे पूर्ण नहीं हैं।

"कम्युनिटी छात्र" (ओपन-वेट मॉडल)

बाकी मॉडल ओपन-सोर्स (मुफ्त उपयोग और संशोधन के लिए) थे।

  • इस समूह में सबसे अच्छा kimi-k2-instruct था, लेकिन इसका स्कोर "स्टार छात्रों" की तुलना में काफी कम था।
  • अंतर: महंगे, निजी मॉडलों और मुफ्त, सामुदायिक मॉडलों के बीच एक स्पष्ट अंतर है। निजी मॉडल वर्तमान में इन भाषाओं को समझने में बहुत बेहतर हैं।

"भाषा की कठिनाई" का कारक

सभी भाषाओं का अनुवाद करना समान रूप से आसान नहीं था।

  • Siwu AI के लिए अनुवाद करने के लिए "सबसे आसान" भाषा थी (उच्चतम स्कोर)।
  • Nkonya "सबसे कठिन" (सबसे कम स्कोर) थी।
  • ट्विस्ट: आश्चर्यजनक रूप से, सबसे अधिक बोली जाने वाली भाषाओं (जैसे Twi) को हमेशा उच्चतम स्कोर नहीं मिला। कभी-कभी, कम बोलने वालों वाली भाषाओं को उच्च स्कोर मिला। क्यों? क्योंकि उन भाषाओं के लिए उपयोग किया गया विशिष्ट बाइबल अनुवाद लोकप्रिय भाषाओं की तुलना में अधिक स्पष्ट और पूर्ण था। यह एक बड़े शहर की तुलना में एक छोटे गाँव के लिए स्पष्ट मानचित्र होने जैसा है।

3. बड़ी समस्या: "अविश्वसनीय मित्र" का मुद्दा

यह इस पेपर का सबसे महत्वपूर्ण निष्कर्ष है। शोधकर्ताओं ने केवल औसत स्कोर नहीं देखा; उन्होंने निरंतरता (consistency) को देखा।

  • उपमा: कल्पना कीजिए कि आपका एक मित्र है जो इतालवी भोजन बनाने में बहुत अच्छा है लेकिन थाई भोजन बनाने में बहुत बुरा है। यदि आप उनसे कोई भी रैंडम भोजन बनाने के लिए कहते हैं, तो आपको कभी पता नहीं होता कि आपको स्वादिष्ट भोजन मिलेगा या जला हुआ कचरा।
  • निष्कर्ष: कोई भी एकल AI मॉडल "उच्च प्रदर्शन करने वाला" (High Performing) और "सुसंगत" (Consistent) दोनों नहीं था।
    • सर्वश्रेष्ठ मॉडल "उच्च प्रदर्शन करने वाले लेकिन असंगत" थे। वे Siwu का अनुवाद पूरी तरह से कर सकते हैं लेकिन Nkonya पर बुरी तरह विफल हो सकते हैं।
    • सुसंगत मॉडल "सुसंगत लेकिन औसत" थे। उन्होंने हर भाषा के लिए एक ही औसत परिणाम दिया, कभी बुरी तरह विफल नहीं हुए लेकिन कभी बहुत अच्छा भी नहीं किया।
    • "लीडर्स" चतुर्थांश (Quadrant): शोधकर्ताओं ने चार कोनों वाला एक चार्ट बनाया। ऊपरी-दाएं कोना "लीडर्स" ज़ोन है (उच्च गुणवत्ता + उच्च निरंतरता)। कोई भी मॉडल और कोई भी भाषा इस ज़ोन में नहीं आई।

4. इसका क्या अर्थ है (पेपर के अनुसार)

पेपर यह निष्कर्ष निकालता है कि हालांकि ये AI मॉडल प्रभावशाली हैं, फिर भी वे घाना की भाषाओं के लिए वास्तविक दुनिया के कार्यों (जैसे सरकारी दस्तावेज़, चिकित्सा सलाह या समाचार) के लिए उपयोग किए जाने के लिए अभी तक पर्याप्त विश्वसनीय नहीं हैं।

  • "शास्त्रीय" सीमा: यह परीक्षण बाइबल के छंदों का उपयोग करके किया गया था। लेखक चेतावनी देते हैं कि ये मॉडल रोज़मर्रा की बातचीत, समाचार या कानूनी पाठ पर और भी खराब प्रदर्शन कर सकते हैं क्योंकि उन्होंने अपने प्रशिक्षण में इस प्रकार के शब्दों को नहीं देखा है।
  • "डेटा" की समस्या: कम स्कोर इसलिए नहीं हैं क्योंकि भाषाएँ "कठिन" या "टूटी हुई" हैं। यह इसलिए है क्योंकि AI ने उनके पर्याप्त उदाहरण नहीं देखे हैं। यह एक भाषा को केवल एक किताब पढ़कर सीखने जैसा है; आप मूल बात समझ सकते हैं, लेकिन आप बारीकियों को मिस कर देंगे।

सारांश

नसांकु प्रोजेक्ट ने 43 घाना की भाषाओं पर 19 AI मॉडलों का परीक्षण करने के लिए एक विशाल स्कोरबोर्ड बनाया।

  1. बिग टेक मॉडल वर्तमान में सबसे अच्छे हैं, लेकिन मुफ्त मॉडल बराबरी कर रहे हैं।
  2. कैरेक्टर-आधारित ग्रेडिंग (chrF), शब्द-दर-शब्द ग्रेडिंग (BLEU) की तुलना में इन भाषाओं को आंकने का एक बेहतर तरीका है।
  3. सबसे महत्वपूर्ण बात: कोई भी AI वर्तमान में इन भाषाओं के लिए भरोसेमंद नहीं है। वे एक ऐसे छात्र की तरह हैं जो कभी A+ प्राप्त करता है और कभी F, यह इस पर निर्भर करता है कि विशिष्ट भाषा कौन सी है। जब तक हम एक ऐसा मॉडल नहीं देखते जो लगातार अच्छा हो, हम महत्वपूर्ण कार्यों के लिए उन पर पूरी तरह से भरोसा नहीं कर सकते।

इस पेपर ने अपना सारा डेटा और कोड सार्वजनिक कर दिया है ताकि शोधकर्ता इन मॉडलों का परीक्षण और सुधार करना जारी रख सकें, इस उम्मीद में कि अंततः उस "लीडर" चतुर्थांश को भरा जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →