← नवीनतम पेपर
💬 NLP

UrduMMLU: A Massive Multitask Benchmark for Urdu Language Understanding

यह शोध पत्र उर्दूएमएमएलयू (UrduMMLU) को प्रस्तुत करता है, जो 30 बड़े भाषा मॉडलों के प्रदर्शन का मूल्यांकन करने के लिए मूल शैक्षिक स्रोतों से प्राप्त 26,000 से अधिक उर्दू-भाषा के बहुविकल्पीय प्रश्नों का एक व्यापक बेंचमार्क है, जो STEM की तुलना में क्षेत्रीय रूप से आधारित सामग्री और मानविकी विषयों की उनकी समझ में महत्वपूर्ण अंतराल को प्रकट करता है।

मूल लेखक: Ahmer Tabassum, Sarfraz Ahmad, Hasan Iqbal, Owais Aijaz, Momina Ahsan, Preslav Nakov

प्रकाशित 2026-06-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ahmer Tabassum, Sarfraz Ahmad, Hasan Iqbal, Owais Aijaz, Momina Ahsan, Preslav Nakov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप छात्रों के एक समूह की बुद्धिमत्ता का परीक्षण करने की कोशिश कर रहे हैं। वर्षों से, आप केवल अंग्रेजी में लिखे गए परीक्षण ही उन्हें दे पाने में सक्षम थे। आप जानते हैं कि वे अंग्रेजी पढ़ सकते हैं, लेकिन आपको यह पता नहीं है कि वे वास्तव में अपनी संस्कृति के इतिहास, साहित्य और विज्ञान को समझते हैं, या उन्होंने केवल उन अवधारणाओं के अंग्रेजी अनुवादों को रट लिया है।

यह शोध पत्र URDUMMLU प्रस्तुत करता है, जो विशेष रूप से उर्दू भाषा के लिए डिज़ाइन किया गया एक विशाल नया "अभ्यास" (exam) है, जो 23 करोड़ से अधिक लोगों द्वारा बोली जाती है। यहाँ बताया गया है कि उन्होंने क्या किया और उन्हें क्या मिला, कुछ सरल उपमाओं का उपयोग करते हुए।

1. समस्या: "अनुवादित मेनू" का मुद्दा

अब तक, यदि शोधकर्ता उर्दू पर AI मॉडल का परीक्षण करना चाहते थे, तो वे मुख्य रूप से अंग्रेजी परीक्षणों को लेते थे और उनका अनुवाद करते थे।

  • उपमा: कल्पना कीजिए कि आप किसी शेफ की प्रामाणिक इतालवी भोजन बनाने की क्षमता का आकलन एक ऐसे मेनू से करने की कोशिश कर रहे हैं जिसे फ्रेंच से अनुवादित किया गया है। वे शब्दों को सही कर सकते हैं, लेकिन वे सांस्कृतिक बारीकियों, स्थानीय सामग्रियों, या किसी व्यंजन को पारंपरिक रूप से तैयार करने के विशिष्ट तरीके को मिस कर सकते हैं।
  • वास्तविकता: मौजूदा उर्दू बेंचमार्क इन अनुवादित मेनू की तरह थे। वे उर्दू शिक्षा, साहित्य या स्थानीय इतिहास (जैसे पाकिस्तान अध्ययन या इस्लामी अध्ययन) के अनूठे स्वाद को नहीं पकड़ पा रहे थे।

2. समाधान: एक मूल "उर्दू परीक्षा हॉल" का निर्माण

लेखकों ने URDUMMLU बनाया, जो 26,431 बहुविकल्पीय प्रश्नों वाला एक बेंचमार्क है।

  • प्रश्न कहाँ से आए? अंग्रेजी प्रश्नों का अनुवाद करने के बजाय, वे सीधे स्रोत पर गए: वास्तविक पाकिस्तानी स्कूली पाठ्यपुस्तकें, पिछले परीक्षा प्रश्न पत्र (SSC/HSSC), और स्थानीय उर्दू प्रश्न बैंक।
  • "डबल-चेक" प्रणाली: चूंकि इन पुराने परीक्षा पत्रों में से कुछ में उत्तर कुंजी (answer keys) नहीं थी, इसलिए टीम ने 17 मूल उर्दू वक्ताओं को नियुक्त किया (जो मुख्य रूप से विश्वविद्यालय की डिग्री प्राप्त थे) ताकि वे "प्रॉक्टर" (निरीक्षक) के रूप में कार्य कर सकें।
    • नियम: प्रत्येक प्रश्न को दो प्रॉक्टरों को देखना था और उत्तर पर सहमत होना था। यदि वे असहमत थे, या यदि प्रश्न त्रुटिपूर्ण था, तो उस प्रश्न को बाहर कर दिया जाता था। इसने सुनिश्चित किया कि "गोल्ड स्टैंडर्ड" उत्तर 100% विश्वसनीय थे।
  • दायरा: यह परीक्षा 26 विषयों को कवर करती है, जिसमें गणित और भौतिकी (STEM) से लेकर उर्दू साहित्य, इस्लामी अध्ययन और पाकिस्तान अध्ययन तक शामिल हैं।

3. परीक्षण: 30 AI मॉडलों को परीक्षा हॉल में रखना

शोधकर्ताओं ने 30 अलग-अलग AI मॉडलों (दोनों प्रसिद्ध "क्लोज्ड" जैसे गूगल का जेमिनी और ओपन-सोर्स मॉडल) को लिया और उन्हें यह उर्दू परीक्षा दी। उन्होंने उन्हें दो तरीकों से परखा:

  1. अंग्रेजी निर्देश: "यहाँ एक प्रश्न उर्दू में है, उत्तर चुनें।" (निर्देश अंग्रेजी में है)।
  2. उर्दू निर्देश: "یہاں ایک سوال ہے، جواب منتخب کریں۔" (निर्देश उर्दू में है)।

4. परिणाम: "STEM बनाम संस्कृति" का अंतर

परिणाम बहुत ही स्पष्ट थे, जैसे कि एक रिपोर्ट कार्ड जो दिखाता है कि एक छात्र गणित में तो बहुत अच्छा है लेकिन कविता पढ़ने में बहुत बुरा है।

  • शीर्ष प्रदर्शन करने वाला: मॉडल Gemini-3.5-Flash स्पष्ट विजेता था, जिसने 90% से अधिक स्कोर किया। यह एकमात्र मॉडल था जिसने 85% की बाधा को पार किया।
  • ओपन-सोर्स गैप: सबसे अच्छा ओपन-सोर्स मॉडल (DeepSeek-V4-Flash) लगभग 82% स्कोर कर गया। अच्छा होने के बावजूद, यह लीडर से लगभग 8 अंक पीछे था।
  • "मानविकी" का पतन: यह सबसे महत्वपूर्ण निष्कर्ष है।
    • उपमा: कल्पना कीजिए कि एक छात्र जो जटिल भौतिकी समीकरण (STEM) हल कर सकता है लेकिन जब उससे किसी कविता का विश्लेषण करने या धार्मिक पाठ को समझाने के लिए कहा जाता है, तो वह बुरी तरह विफल हो जाता है (Humanities)।
    • वास्तविकता: लगभग हर मॉडल ने विज्ञान और गणित के प्रश्नों पर बहुत बेहतर प्रदर्शन किया। जब प्रश्न उर्दू साहित्य, उर्दू भाषा और इस्लामी अध्ययन की ओर बढ़े, तो कई मॉडलों के स्कोर में 25 से 40 प्रतिशत अंक की गिरावट आई।
    • उदाहरण: एक मॉडल भौतिकी में 97% प्राप्त कर सकता है लेकिन उर्दू साहित्य में केवल 67%। यह बताता है कि मॉडल विज्ञान के तथ्यों (जो सार्वभौमिक हैं) को जानते हैं, लेकिन स्थानीय विषयों के लिए आवश्यक गहरी सांस्कृतिक और भाषाई समझ की कमी रखते हैं।

5. अन्य आश्चर्यजनक निष्कर्ष

  • निर्देश की भाषा से ज्यादा फर्क नहीं पड़ा: चाहे AI को अंग्रेजी में उत्तर देने के लिए कहा गया हो या उर्दू में, स्कोर में बहुत कम बदलाव आया। समस्या निर्देश की भाषा नहीं थी; समस्या मॉडल के "दिमाग" में उर्दू संस्कृति के बारे में ज्ञान की कमी थी।
  • फ्यू-शॉट लर्निंग (द "चीट शीट"): शोधकर्ताओं ने परीक्षण से पहले AI को कुछ उदाहरण प्रश्न देने की कोशिश की (एक चीट शीट की तरह)। इससे थोड़ा फायदा हुआ (स्कोर में 1-3 अंक की वृद्धि हुई), लेकिन यह सांस्कृतिक ज्ञान के बड़े अंतराल को ठीक करने के लिए पर्याप्त नहीं था।
  • "उर्दू-विशिष्ट" मॉडल: दिलचस्प बात यह है कि विशेष रूप से केवल उर्दू के लिए प्रशिक्षित मॉडल (जैसे क़ल्ब और अलिफ़) काफी खराब प्रदर्शन करते हैं (लग लगभग 35%), जो सामान्य मॉडलों से भी अक्सर बदतर होते हैं। यह सुझाव देता है कि केवल उर्दू टेक्स्ट पर प्रशिक्षण देना पर्याप्त नहीं है; मॉडलों को केवल चैट या समाचारों के बजाय शैक्षिक और तर्कसंगत सामग्री पर प्रशिक्षित करने की आवश्यकता है।

सारांश

URDUMMLU उर्दू में AI के लिए एक नए, सख्त "ड्राइविंग लाइसेंस टेस्ट" की तरह है। यह साबित करता है कि हालांकि AI उर्दू में विज्ञान के सवालों के जवाब देने में बहुत अच्छा हो रहा है, लेकिन वह अभी भी भाषा की आत्मा—इसके साहित्य, इतिहास और स्थानीय संस्कृति को समझने के लिए संघर्ष कर रहा है। वर्तमान "सर्वश्रेष्ठ" AI (जेमिनी) एक मजबूत ड्राइवर है, लेकिन ओपन-सोर्स मॉडल अभी भी सड़क के नियमों को सीख रहे हैं, विशेष रूप से उर्दू बोलने वाली दुनिया की सांस्कृतिक बारीकियों के मामले में।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →