← नवीनतम पेपर
💬 NLP

Evaluation of Small Language Models for Arabic Language Processing

यह शोध पत्र दस कौशलों वाले एक नए 240-आइटम वाले अरबी बेंचमार्क पर बारह लघु भाषा मॉडलों (Small Language Models) का मूल्यांकन करता है, जिससे यह पता चलता है कि जेम्मा 3 (Gemma 3 - 12B) अन्य मॉडलों से बेहतर प्रदर्शन करता है और यह प्रदर्शित करता है कि मॉडल के आकार के बजाय अरबी संरेखण (Arabic alignment) और निर्देश-अनुसरण (instruction-following) क्षमताएं प्रदर्शन के अधिक महत्वपूर्ण निर्धारक हैं।

मूल लेखक: Jumana Alsubhi, Ahmed Alhusayni, Abdulrahman Gharawi, Israa Hamdine, Alshaymaa Allahim, Lamees Alhumaid, Ahmad Shabana, Rafik Madani

प्रकाशित 2026-06-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jumana Alsubhi, Ahmed Alhusayni, Abdulrahman Gharawi, Israa Hamdine, Alshaymaa Allahim, Lamees Alhumaid, Ahmad Shabana, Rafik Madani

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप "मिनी-ब्रेन" (Mini-Brains) के एक नए स्कूल के प्रधानाचार्य हैं। ये वे विशाल, अत्यधिक महंगे सुपरकंप्यूटर नहीं हैं जो आमतौर पर सारा काम संभालते हैं; ये स्मॉल लैंग्वेज मॉडल्स (SLMs) हैं। ये छोटे, कुशल छात्रों की तरह हैं जिन्हें बिना किसी विशाल पुस्तकालय या पावर प्लांट की आवश्यकता के बड़े काम करने के लिए डिज़ाइन किया गया है।

इस शोध पत्र के लेखक, सऊदी अरब की 'नसीज इनोवेशन लैब' (Naseej Innovation Lab) की एक टीम ने यह देखने के लिए एक भव्य परीक्षा आयोजित करने का निर्णय लिया कि इनमें से कौन सा मिनी-ब्रेन वास्तव में अरबी बोलने और समझने में सबसे अच्छा है।

यहाँ उनके प्रयोग की कहानी सरल रूप में दी गई है:

1. सेटअप: "अरबी ओलंपिक"

शोधकर्ताओं ने मॉडल्स को केवल बातचीत करने के लिए नहीं कहा; उन्होंने एक कठोर टेस्ट ट्रैक बनाया जिसे बेंचमार्क कहा जाता है।

  • कोर्स: उन्होंने 240 अलग-अलग प्रश्न बनाए (जैसे 240 बाधाएं)।
  • क्षेत्र: ये प्रश्न 8 अलग-अलग दुनियाओं को कवर करते थे: सामाजिक विषय, अरबी व्याकरण, इतिहास, तकनीक, तर्क (Arguments), धर्म, गणित और रचनात्मक लेखन।
  • कौशल: मॉडल्स को 10 अलग-अलग कौशलों को सिद्ध करना था, जिसमें सरल कार्यों जैसे "तथ्य खोजें" (समझ/comprehension) से लेकर कठिन कार्यों जैसे "कहानी लिखें" या "इस वाक्य को फिर से लिखें" (जनरेशन/generation) तक शामिल थे।
  • नियम: इसे निष्पक्ष बनाने के लिए, प्रत्येक मॉडल को बिल्कुल एक ही निर्देश दिए गए जो केवल अरबी में लिखे गए थे। उन्हें केवल अरबी में ही उत्तर देना था। अंग्रेजी या फ्रेंच में स्विच करके नकल करने की कोई अनुमति नहीं थी।

2. निर्णायक: "तीन बुद्धिमान रोबोट"

एक रोबोट द्वारा लिखे गए निबंध को आप कैसे ग्रेड करेंगे? आप केवल एक इंसान को 2,880 उत्तर (12 मॉडल × 240 प्रश्न) पढ़ने के लिए नहीं कह सकते क्योंकि वे थक जाएंगे। इसलिए, शोधकर्ताओं ने एक चतुर तकनीक का उपयोग किया: LLM-as-a-Judge

उन्होंने तीन अन्य शक्तिशाली AI रोबोट्स (GPT-4.1 Mini, Claude Haiku 4.5, और DeepSeek-Chat) को शिक्षक के रूप में काम करने के लिए नियुक्त किया।

  • प्रत्येक रोबोट ने हर उत्तर को 0 से 5 के पैमाने पर ग्रेड किया।
  • उन्होंने देखा कि: क्या यह सही था? क्या यह स्पष्ट था? क्या इसने काम पूरा किया? क्या यह अरबी में रहा?
  • यदि तीनों निर्णायकों के बीच भारी असहमति थी (उदाहरण के लिए, एक ने 1 दिया और दूसरे ने 5 दिया), तो शोधकर्ताओं ने उसे बारीकी से देखने के लिए फ्लैग किया।

3. परिणाम: स्वर्ण पदक किसने जीता?

जब स्कोर की गणना की गई, तो एक स्पष्ट पदानुक्रम उभर कर आया। यह केवल इस बारे में नहीं था कि कौन सा छात्र "सबसे बड़ा" था; बल्कि यह इस बारे में था कि कौन सा सबसे अधिक सुशिक्षित था।

  • 🥇 विजेता: Gemma 3 (12B) ने 5 में से 4.55 के औसत स्कोर के साथ शीर्ष स्थान प्राप्त किया। यह सुसंगत था, निर्देशों का पूरी तरह से पालन करता था, और सभी विषयों पर धाराप्रवाह अरबी बोलता था।
  • 🥈 उपविजेता: Aya और C4AI Command Arabic दूसरे और तीसरे स्थान पर आए। ये मॉडल्स विशेष हैं क्योंकि इन्हें विशेष रूप से अरबी संस्कृति और भाषा की बारीकियों को समझने के लिए "ट्यून" किया गया था।
  • बाकी कक्षा: Fanar और Tiny Aya जैसे अन्य मॉडल्स ने अच्छा प्रदर्शन किया, लेकिन कुछ "डिस्टिल्ड" (distilled) मॉडल्स (वे मॉडल्स जिन्हें बड़े मॉडल्स से छोटा किया गया है) संघर्ष करते दिखे। वे अक्सर निर्देश भूल जाते थे, भाषा बदल देते थे, या अधूरे उत्तर देते थे।

बड़ा सबक: शोध पत्र ने पाया कि आकार का मतलब बुद्धिमत्ता नहीं है। एक मॉडल जिसके पास कम "मस्तिष्क कोशिकाएं" (पैरामीटर्स) हैं, वह बड़े मॉडल को हरा सकता है यदि उसे विशेष रूप से अरबी पर बेहतर तरीके से प्रशिक्षित किया गया हो और उसे नियमों का सख्ती से पालन करना सिखाया गया हो।

4. "शर्म की गैलरी" (Hall of Shame): सामान्य गलतियाँ

शोधकर्ताओं ने देखा कि निचले प्रदर्शन वाले मॉडल्स कहाँ विफल हुए, जिससे कुछ बार-बार होने वाली बुरी आदतें सामने आईं:

  • प्रॉम्प्ट लीकेज (Prompt Leakage): प्रश्न का उत्तर देने के बजाय, मॉडल ने शिक्षक के निर्देशों को उनके सामने दोहरा दिया (जैसे एक छात्र प्रश्न का उत्तर देने के बजाय टेस्ट प्रश्न को जोर से पढ़ रहा हो)।
  • भाषा का विचलन (Language Drift): मॉडल को केवल अरबी बोलने के लिए कहा गया था, फिर भी उसने अंग्रेजी या चीनी बोलना शुरू कर दिया।
  • भ्रम (Hallucinations): मॉडल ने ऐसे तथ्य बनाए जो आत्मविश्वास से भरे लग रहे थे लेकिन पूरी तरह से गलत थे।
  • "फेड आउट" (The Fade Out): मॉडल एक बेहतरीन उत्तर लिखना शुरू करता था लेकिन बीच में ही रुक जाता था।

5. "शिक्षक की असहमति"

अध्ययन में यह भी देखा गया कि तीनों रोबोट निर्णायक हमेशा सहमत नहीं थे।

  • कभी-कभी, एक निर्णायक बहुत सख्त था, जबकि दूसरा उदार था।
  • गणित और तर्क (Math and Logic) को ग्रेड करना सबसे कठिन था क्योंकि निर्णायक कभी-कभी इस बात पर असहमत होते थे कि गणित का उत्तर वास्तव में सही था या नहीं।
  • भाषा के नियम भी पेचीदा थे; कभी-कभी एक मॉडल ने सही उत्तर दिया लेकिन गलत भाषा में, और एक निर्णायक ने भाषा के उल्लंघन को अनदेखा करते हुए उसे "स्मार्ट" होने के लिए उच्च स्कोर दे दिया।

मुख्य निष्कर्ष

यह शोध पत्र नई पीढ़ी के छोटे अरबी AI मॉडल्स के लिए एक रिपोर्ट कार्ड की तरह है। यह हमें बताता है कि:

  1. विशेष प्रशिक्षण आकार से अधिक महत्वपूर्ण है। एक मॉडल जो विशेष रूप से अरबी के लिए बनाया गया है (जैसे Aya या Gemma 3), वह एक सामान्य विशाल मॉडल से बेहतर है।
  2. विश्वसनीयता महत्वपूर्ण है। एक मॉडल जो निर्देशों का पालन करता है और अरबी में रहता है, वह उस मॉडल से अधिक उपयोगी है जो "स्मार्ट" तो है लेकिन अराजक (chaotic) है।
  3. हमें विवरणों की जांच करनी चाहिए। आप केवल औसत स्कोर को नहीं देख सकते; आपको यह देखना होगा कि क्या मॉडल विशिष्ट कौशलों (जैसे गणित या लेखन) में विफल होता है, इससे पहले कि आप उसे किसी वास्तविक काम के लिए छोड़ें।

लेखक निष्कर्ष निकालते हैं कि यह बेंचमार्क उन सभी के लिए एक ठोस मानचित्र है जो आज एक विश्वसनीय, कुशल अरबी AI सिस्टम बनाना या चुनना चाहते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →