UrduMMLU: A Massive Multitask Benchmark for Urdu Language Understanding
यह शोध पत्र उर्दूएमएमएलयू (UrduMMLU) को प्रस्तुत करता है, जो 30 बड़े भाषा मॉडलों के प्रदर्शन का मूल्यांकन करने के लिए मूल शैक्षिक स्रोतों से प्राप्त 26,000 से अधिक उर्दू-भाषा के बहुविकल्पीय प्रश्नों का एक व्यापक बेंचमार्क है, जो STEM की तुलना में क्षेत्रीय रूप से आधारित सामग्री और मानविकी विषयों की उनकी समझ में महत्वपूर्ण अंतराल को प्रकट करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप छात्रों के एक समूह की बुद्धिमत्ता का परीक्षण करने की कोशिश कर रहे हैं। वर्षों से, आप केवल अंग्रेजी में लिखे गए परीक्षण ही उन्हें दे पाने में सक्षम थे। आप जानते हैं कि वे अंग्रेजी पढ़ सकते हैं, लेकिन आपको यह पता नहीं है कि वे वास्तव में अपनी संस्कृति के इतिहास, साहित्य और विज्ञान को समझते हैं, या उन्होंने केवल उन अवधारणाओं के अंग्रेजी अनुवादों को रट लिया है।
यह शोध पत्र URDUMMLU प्रस्तुत करता है, जो विशेष रूप से उर्दू भाषा के लिए डिज़ाइन किया गया एक विशाल नया "अभ्यास" (exam) है, जो 23 करोड़ से अधिक लोगों द्वारा बोली जाती है। यहाँ बताया गया है कि उन्होंने क्या किया और उन्हें क्या मिला, कुछ सरल उपमाओं का उपयोग करते हुए।
1. समस्या: "अनुवादित मेनू" का मुद्दा
अब तक, यदि शोधकर्ता उर्दू पर AI मॉडल का परीक्षण करना चाहते थे, तो वे मुख्य रूप से अंग्रेजी परीक्षणों को लेते थे और उनका अनुवाद करते थे।
- उपमा: कल्पना कीजिए कि आप किसी शेफ की प्रामाणिक इतालवी भोजन बनाने की क्षमता का आकलन एक ऐसे मेनू से करने की कोशिश कर रहे हैं जिसे फ्रेंच से अनुवादित किया गया है। वे शब्दों को सही कर सकते हैं, लेकिन वे सांस्कृतिक बारीकियों, स्थानीय सामग्रियों, या किसी व्यंजन को पारंपरिक रूप से तैयार करने के विशिष्ट तरीके को मिस कर सकते हैं।
- वास्तविकता: मौजूदा उर्दू बेंचमार्क इन अनुवादित मेनू की तरह थे। वे उर्दू शिक्षा, साहित्य या स्थानीय इतिहास (जैसे पाकिस्तान अध्ययन या इस्लामी अध्ययन) के अनूठे स्वाद को नहीं पकड़ पा रहे थे।
2. समाधान: एक मूल "उर्दू परीक्षा हॉल" का निर्माण
लेखकों ने URDUMMLU बनाया, जो 26,431 बहुविकल्पीय प्रश्नों वाला एक बेंचमार्क है।
- प्रश्न कहाँ से आए? अंग्रेजी प्रश्नों का अनुवाद करने के बजाय, वे सीधे स्रोत पर गए: वास्तविक पाकिस्तानी स्कूली पाठ्यपुस्तकें, पिछले परीक्षा प्रश्न पत्र (SSC/HSSC), और स्थानीय उर्दू प्रश्न बैंक।
- "डबल-चेक" प्रणाली: चूंकि इन पुराने परीक्षा पत्रों में से कुछ में उत्तर कुंजी (answer keys) नहीं थी, इसलिए टीम ने 17 मूल उर्दू वक्ताओं को नियुक्त किया (जो मुख्य रूप से विश्वविद्यालय की डिग्री प्राप्त थे) ताकि वे "प्रॉक्टर" (निरीक्षक) के रूप में कार्य कर सकें।
- नियम: प्रत्येक प्रश्न को दो प्रॉक्टरों को देखना था और उत्तर पर सहमत होना था। यदि वे असहमत थे, या यदि प्रश्न त्रुटिपूर्ण था, तो उस प्रश्न को बाहर कर दिया जाता था। इसने सुनिश्चित किया कि "गोल्ड स्टैंडर्ड" उत्तर 100% विश्वसनीय थे।
- दायरा: यह परीक्षा 26 विषयों को कवर करती है, जिसमें गणित और भौतिकी (STEM) से लेकर उर्दू साहित्य, इस्लामी अध्ययन और पाकिस्तान अध्ययन तक शामिल हैं।
3. परीक्षण: 30 AI मॉडलों को परीक्षा हॉल में रखना
शोधकर्ताओं ने 30 अलग-अलग AI मॉडलों (दोनों प्रसिद्ध "क्लोज्ड" जैसे गूगल का जेमिनी और ओपन-सोर्स मॉडल) को लिया और उन्हें यह उर्दू परीक्षा दी। उन्होंने उन्हें दो तरीकों से परखा:
- अंग्रेजी निर्देश: "यहाँ एक प्रश्न उर्दू में है, उत्तर चुनें।" (निर्देश अंग्रेजी में है)।
- उर्दू निर्देश: "یہاں ایک سوال ہے، جواب منتخب کریں۔" (निर्देश उर्दू में है)।
4. परिणाम: "STEM बनाम संस्कृति" का अंतर
परिणाम बहुत ही स्पष्ट थे, जैसे कि एक रिपोर्ट कार्ड जो दिखाता है कि एक छात्र गणित में तो बहुत अच्छा है लेकिन कविता पढ़ने में बहुत बुरा है।
- शीर्ष प्रदर्शन करने वाला: मॉडल Gemini-3.5-Flash स्पष्ट विजेता था, जिसने 90% से अधिक स्कोर किया। यह एकमात्र मॉडल था जिसने 85% की बाधा को पार किया।
- ओपन-सोर्स गैप: सबसे अच्छा ओपन-सोर्स मॉडल (DeepSeek-V4-Flash) लगभग 82% स्कोर कर गया। अच्छा होने के बावजूद, यह लीडर से लगभग 8 अंक पीछे था।
- "मानविकी" का पतन: यह सबसे महत्वपूर्ण निष्कर्ष है।
- उपमा: कल्पना कीजिए कि एक छात्र जो जटिल भौतिकी समीकरण (STEM) हल कर सकता है लेकिन जब उससे किसी कविता का विश्लेषण करने या धार्मिक पाठ को समझाने के लिए कहा जाता है, तो वह बुरी तरह विफल हो जाता है (Humanities)।
- वास्तविकता: लगभग हर मॉडल ने विज्ञान और गणित के प्रश्नों पर बहुत बेहतर प्रदर्शन किया। जब प्रश्न उर्दू साहित्य, उर्दू भाषा और इस्लामी अध्ययन की ओर बढ़े, तो कई मॉडलों के स्कोर में 25 से 40 प्रतिशत अंक की गिरावट आई।
- उदाहरण: एक मॉडल भौतिकी में 97% प्राप्त कर सकता है लेकिन उर्दू साहित्य में केवल 67%। यह बताता है कि मॉडल विज्ञान के तथ्यों (जो सार्वभौमिक हैं) को जानते हैं, लेकिन स्थानीय विषयों के लिए आवश्यक गहरी सांस्कृतिक और भाषाई समझ की कमी रखते हैं।
5. अन्य आश्चर्यजनक निष्कर्ष
- निर्देश की भाषा से ज्यादा फर्क नहीं पड़ा: चाहे AI को अंग्रेजी में उत्तर देने के लिए कहा गया हो या उर्दू में, स्कोर में बहुत कम बदलाव आया। समस्या निर्देश की भाषा नहीं थी; समस्या मॉडल के "दिमाग" में उर्दू संस्कृति के बारे में ज्ञान की कमी थी।
- फ्यू-शॉट लर्निंग (द "चीट शीट"): शोधकर्ताओं ने परीक्षण से पहले AI को कुछ उदाहरण प्रश्न देने की कोशिश की (एक चीट शीट की तरह)। इससे थोड़ा फायदा हुआ (स्कोर में 1-3 अंक की वृद्धि हुई), लेकिन यह सांस्कृतिक ज्ञान के बड़े अंतराल को ठीक करने के लिए पर्याप्त नहीं था।
- "उर्दू-विशिष्ट" मॉडल: दिलचस्प बात यह है कि विशेष रूप से केवल उर्दू के लिए प्रशिक्षित मॉडल (जैसे क़ल्ब और अलिफ़) काफी खराब प्रदर्शन करते हैं (लग लगभग 35%), जो सामान्य मॉडलों से भी अक्सर बदतर होते हैं। यह सुझाव देता है कि केवल उर्दू टेक्स्ट पर प्रशिक्षण देना पर्याप्त नहीं है; मॉडलों को केवल चैट या समाचारों के बजाय शैक्षिक और तर्कसंगत सामग्री पर प्रशिक्षित करने की आवश्यकता है।
सारांश
URDUMMLU उर्दू में AI के लिए एक नए, सख्त "ड्राइविंग लाइसेंस टेस्ट" की तरह है। यह साबित करता है कि हालांकि AI उर्दू में विज्ञान के सवालों के जवाब देने में बहुत अच्छा हो रहा है, लेकिन वह अभी भी भाषा की आत्मा—इसके साहित्य, इतिहास और स्थानीय संस्कृति को समझने के लिए संघर्ष कर रहा है। वर्तमान "सर्वश्रेष्ठ" AI (जेमिनी) एक मजबूत ड्राइवर है, लेकिन ओपन-सोर्स मॉडल अभी भी सड़क के नियमों को सीख रहे हैं, विशेष रूप से उर्दू बोलने वाली दुनिया की सांस्कृतिक बारीकियों के मामले में।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।