← नवीनतम पेपर
💬 NLP

Evaluating Large Language Models for Hausa and Fongbe Machine Translation: Benchmarks, Failures, and Metric Reliability

यह अध्ययन अंग्रेजी-से-हौसा और अंग्रेजी-से-फोंगबे के लिए चार बड़े भाषा मॉडलों की अनुवाद क्षमताओं का मूल्यांकन करता है, जो दोनों भाषाओं के बीच प्रदर्शन में महत्वपूर्ण असमानताओं, मानव निर्णय के साथ सहसंबंध स्थापित करने में मानक स्वचालित मेट्रिक्स की अविश्वसनीयता, और कम संसाधन वाली अफ्रीकी भाषाओं के लिए बड़े पैमाने पर मूल्यांकन और बहु-मैट्रिक दृष्टिकोण की आवश्यकता को प्रकट करता है।

मूल लेखक: Mahounan Pericles Adjovi, Roald Eiselen, Prasenjit Mitra

प्रकाशित 2026-06-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mahounan Pericles Adjovi, Roald Eiselen, Prasenjit Mitra

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कहानी को अंग्रेजी से दो बहुत अलग अफ्रीकी भाषाओं में अनुवाद करने की कोशिश कर रहे हैं: हौसा (जो नाइजीरिया और नाइजर में लाखों लोग बोलते हैं) और फोंगबे (जो बेनिन के एक छोटे समूह द्वारा बोली जाती है)। आपके पास इन कामों को करने के लिए चार शक्तिशाली "रोबोट अनुवादक" (GPT-4, Claude और Gemini जैसे Large Language Models) तैयार हैं।

यह शोध पत्र यह देखने के लिए एक कठोर स्वाद परीक्षण (taste test) की तरह है कि कौन सा रोबोट सबसे अच्छा काम करता है और, अधिक महत्वपूर्ण बात यह है कि क्या वे "स्कोरकार्ड" जिनका उपयोग हम उन्हें ग्रेड देने के लिए करते हैं (स्वचालित मेट्रिक्स/automatic metrics), वास्तव में वास्तविक मानव वक्ताओं की सोच से मेल खाते हैं।

यहाँ उनके निष्कर्षों का विवरण दिया गया है, सरल उपमाओं का उपयोग करते हुए:

1. "रोबोट रेस": कौन जीता?

शोधकर्ताओं ने रोबोट से हजारों वाक्यों का अनुवाद करने के लिए कहा। परिणाम दो बहुत अलग दुनियाओं की कहानी थे:

  • हौसा (एक "ठीक-ठाक" धावक): रोबोटों ने यहाँ अच्छा काम किया। अनुवाद समझने योग्य थे और प्रवाह में अच्छे थे। यह एक दौड़ पूरी करने वाले धावक की तरह था जिसने एक सम्मानजनक समय प्राप्त किया हो।
    • विजेता: GPT-4o मानव न्यायाधीशों के बीच पसंदीदा था, भले ही कंप्यूटर स्कोरकार्ड ने जीत Claude को दी थी।
  • फोंगबे (एक "लड़खड़ाता" धावक): रोबोट यहाँ बुरी तरह संघर्ष कर रहे थे। अनुवाद अक्सर निरर्थक या टूटे हुए थे। यह अपने ही जूतों के फीतों में उलझकर गिरते हुए धावक की तरह था।
    • विजेता: Gemini सबसे कम खराब विकल्प था, लेकिन यहाँ तक कि इसने भी मनुष्यों से केवल "खराब" ग्रेड प्राप्त किया।
  • बड़ा अंतर: हौसा अनुवाद फोंगबे अनुवादों की तुलना में लगभग तीन गुना बेहतर थे। ऐसा इसलिए नहीं था क्योंकि फोंगबे एक "कठिन" भाषा है, बल्कि इसलिए था क्योंकि रोबोटों ने हौसा के लिए फोंगबे की तुलना में बहुत अधिक प्रशिक्षण डेटा (training data) देखा था।

मुख्य निष्कर्ष: सिर्फ इसलिए कि एक रोबोट एक अफ्रीकी भाषा में अच्छा है, इसका मतलब यह नहीं है कि वह दूसरी भाषा में भी अच्छा होगा। आप यह मान नहीं सकते कि एक "वन-साइज़-फिट्स-ऑल" (सबके लिए एक समान) AI हर जगह काम करेगा।

2. "स्कोरकार्ड" की समस्या: क्या कंप्यूटर झूठ बोलते हैं?

यह इस शोध पत्र का सबसे आश्चर्यजनक हिस्सा है। शोधकर्ताओं ने रोबलों के प्रदर्शन की तुलना दो चीजों के साथ की:

  1. मानव न्यायाधीश: वास्तविक मूल वक्ता जो अनुवादों को रेटिंग देते हैं।
  2. स्वचालित मेट्रिक्स (Automatic Metrics): कंप्यूटर एल्गोरिदम (जैसे BLEU, chrF++, BERTScore) जो बिना किसी इंसान के देखे अनुवाद को ग्रेड देने की कोशिश करते हैं।

बेमेल (The Mismatch):

  • फोंगबे के लिए: कंप्यूटर स्कोरकार्ड और मनुष्य सहमत थे। दोनों ने कहा: "Gemini सबसे अच्छा है।"
  • हौसा के लिए: कंप्यूटर स्कोरकार्ड और मनुष्य पूरी तरह से असहमत थे।
    • कंप्यूटरों (विशेष रूप से BLEU और chrF++) ने कहा: "Claude विजेता है!"
    • मनुष्यों ने कहा: "नहीं, GPT-4o विजेता है; Claude सुनने में रोबोटिक लगता है।"

"टूटे हुए पैमाने" की उपमा:
कल्पना कीजिए कि आप दो लोगों की ऊंचाई माप रहे हैं।

  • फोंगबे के लिए, आपका पैमाना (ruler) पूरी तरह से काम करता है।
  • हौसा के लिए, आपका पैमाना मुड़ा हुआ है। यह गलत बता रहा है कि छोटा व्यक्ति लंबा है क्योंकि यह गलत चीज़ माप रहा है (जैसे कि यह देखना कि वाक्य कैसा सुनाई देता है, बजाय इसके कि शब्द में कितने अक्षर हैं)।

3. "जादुई दर्पण" जो कुछ भी प्रतिबिंबित नहीं करता (न्यूरल मेट्रिक्स)

शोधकर्ताओं ने BERTScore नामक एक विशिष्ट प्रकार के कंप्यूटर मेट्रिक का परीक्षण किया, जो एक "जादुई दर्पण" (एक एम्बेडिंग मॉडल) का उपयोग करता है यह देखने के लिए कि क्या दो वाक्यों का अर्थ एक ही है।

  • खराबी (The Glitch): हौसा और फोंगबे दोनों के लिए, यह दर्पण टूटा हुआ था। इसने दो पूरी तरह से अलग वाक्यों को देखा और कहा, "ये 99% समान हैं!"
  • परिणाम: क्योंकि दर्पण यह अंतर नहीं कर सका कि एक अच्छा अनुवाद और एक बुरा अनुवाद क्या है, सभी स्कोर एक जैसे (उच्च अंक) थे। यह एक जज द्वारा हर प्रतियोगी को स्वर्ण पदक देने जैसा था क्योंकि वह यह नहीं पहचान सका कि कौन वास्तव में गा रहा है।
  • सबक: जब तक हम इस दर्पण को ठीक नहीं कर देते, तब तक आप इन "स्मार्ट" मेट्रिक्स पर भरोसा नहीं कर सकते।

4. "नमूना आकार" का जाल (Sample Size Trap)

शोधकर्ताओं ने छोटे समूहों के वाक्यों (500 या 1,000) और फिर एक बड़े समूह (10,000) के साथ रोबोटों का परीक्षण किया।

  • जाल: छोटे समूहों के साथ, परिणाम अराजक और भ्रामक थे। उदाहरण के लिए, 1,000 वाक्यों पर, डेटा ने सुझाव दिया कि Gemini हौसा में जीत रहा है। लेकिन जब उन्होंने 10,000 वाक्यों का परीक्षण किया, तो पता चला कि वास्तव में Claude जीत रहा था।
  • सबक: एक सच्ची तस्वीर पाने के लिए आपको एक बड़ी भीड़ (कम से कम 2,500 वाक्य) की आवश्यकता होती है। छोटे नमूने एक पूरी फिल्म को उसके 10 सेकंड के क्लिप के आधार पर आंकने जैसे हैं; आप गलत धारणा बना सकते हैं।

सिफारिशों का सारांश

इस "स्वाद परीक्षण" के आधार पर, लेखक निम्नलिखित सुझाव देते हैं:

  1. केवल कंप्यूटर स्कोरकार्ड पर भरोसा न करें। विशेष रूप से हौसा के लिए, कंप्यूटरों ने विजेता को गलत बताया। आपको काम की जांच के लिए वास्तविक मनुष्यों की आवश्यकता है।
  2. सही पैमाने का उपयोग करें। यदि आपको कंप्यूटर मेट्रिक का उपयोग करना ही है, तो chrF++ (जो वर्ण मिलान/character matches गिनता है) का उपयोग करें, बजाय "जादुई दर्पण" (BERTScore) के, जो वर्तमान में टूटा हुआ है।
  3. अपने रोबोट को सावधानी से चुनें। यदि आपको हौसा में अनुवाद करने की आवश्यकता है, तो GPT-4o या Claude का उपयोग करें। यदि आपको फोंगबे में अनुवाद करने की आवश्यकता है, तो Gemini का उपयोग करें, लेकिन खराब गुणवत्ता के लिए तैयार रहें।
  4. अभी फोंगबे अनुवादों का किसी भी गंभीर काम के लिए उपयोग न करें। गुणवत्ता बहुत कम है; यह गीली रेत से घर बनाने की कोशिश करने जैसा होगा।
  5. हौसा "डेटा ऑग्मेंटेशन" (data augmentation) के लिए तैयार है। हौसा के अनुवाद इतने अच्छे हैं कि उनका उपयोग अतिरिक्त प्रशिक्षण डेटा के रूप में किया जा सकता है, बशर्ते कि पहले खराब अनुवादों को फ़िल्टर कर दिया जाए।

संक्षेप में: AI अफ्रीकी भाषाओं का अनुवाद करने में बेहतर हो रहा है, लेकिन यह अभी वहां तक नहीं पहुंचा है। सफलता को मापने के लिए उपयोग किए जाने वाले उपकरण अक्सर टूटे हुए होते हैं, और रोबोटों को ईमानदार रखने के लिए हमें वास्तविक मनुष्यों की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →