← नवीनतम पेपर
💬 NLP

Evaluating Modern Large Language Models on Low-Resource and Morphologically Rich Languages:A Cross-Lingual Benchmark Across Cantonese, Japanese, and Turkish

यह शोध पत्र कैंटोनीज़, जापानी और तुर्की में चार विविध कार्यों पर सात अत्याधुनिक लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करने वाला एक व्यापक क्रॉस-लिंगुअल बेंचमार्क प्रस्तुत करता है, जो यह प्रकट करता है कि जहाँ शीर्ष प्रोप्रायटरी मॉडल प्रदर्शन में आगे हैं, वहीं विशेष रूप से छोटे ओपन-सोर्स मॉडल्स के लिए रूपात्मक जटिलता और सांस्कृतिक बारीकियों को संभालने में महत्वपूर्ण चुनौतियाँ बनी हुई हैं।

मूल लेखक: Chengxuan Xia, Qianye Wu, Hongbin Guan, Sixuan Tian, Yilun Hao, Xiaoyu Wu

प्रकाशित 2026-02-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chengxuan Xia, Qianye Wu, Hongbin Guan, Sixuan Tian, Yilun Hao, Xiaoyu Wu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की दुनिया की कल्पना एक विशाल, अत्यंत बुद्धिमान पुस्तकालय के रूप में करें। लंबे समय तक, यह पुस्तकालय केवल अंग्रेजी में लिखी गई किताबों से भरा था। इसके लाइब्रेरियन (AI मॉडल) अंग्रेजी में अविश्वसनीय रूप से निपुण थे, जो किसी भी प्रश्न का उत्तर देने, किसी कहानी का सारांश लिखने या किसी पाठ का अनुवाद करने में सक्षम थे।

लेकिन क्या होता है जब आप इन लाइब्रेरियन से किसी ऐसे व्यक्ति की मदद करने के लिए कहते हैं जो कैंटोनीज़ (Cantonese), जापानी या तुर्की बोलता है? क्या वे केवल अनुमान लगाते हैं? क्या वे रोबोट की तरह सुनाई देते हैं? या उन्होंने अंततः इन भाषाओं को उसी प्रवाह और सांस्कृतिक समझ के साथ बोलना सीख लिया है?

यह शोध पत्र दुनिया के सात सबसे स्मार्ट AI "लाइब्रेरियन" को दिया गया एक रिपोर्ट कार्ड है। लेखकों ने उन्हें एक कठोर परीक्षा के माध्यम से परखा कि वे उन भाषाओं को कितनी अच्छी तरह संभालते हैं जो या तो:

  1. लो-रिसोर्स (Low-Resource): जैसे कैंटोनीज़, जहाँ AI के अध्ययन के लिए बहुत कम डिजिटल पुस्तकें उपलब्ध हैं।
  2. मॉर्फोलॉजिकल रूप से समृद्ध (Morphologically Rich): जैसे तुर्की, जहाँ शब्द लेगो ब्रिक्स (Lego bricks) की तरह होते हैं जो विशाल, नए शब्द बनाने के लिए जटिल तरीकों से आपस में जुड़ जाते हैं।

प्रतियोगी

इस शोध पत्र ने सात अलग-अलग AI मॉडल का परीक्षण किया, जिनमें "सुपर-एलीट" (जैसे GPT-4o और Claude 3.5) से लेकर "मिड-टियर" ओपन-सोर्स मॉडल (जैसे LLaMA 3.1) और "रूकियों" (छोटे मॉडल जैसे Mistral 7B) तक शामिल हैं।

चार चुनौतियाँ (परीक्षा)

लाइब्रेरियन को प्रत्येक भाषा में चार अलग-अलग प्रकार की परीक्षाओं में बैठना था:

  1. ट्रिविया क्विज़ (ओपन-डोमेन QA): "तुर्की की पहली महिला पायलट कौन थी?" या "गुआंगज़ौ में यह उत्सव किस महीने में होता है?"
    • लक्ष्य: क्या AI बिना मनगढ़ंत बातें किए सही तथ्य खोज सकता है?
  2. बुक रिपोर्ट (सारांश): एक लंबे समाचार लेख को पढ़ना और एक छोटा, स्पष्ट सारांश लिखना।
    • लक्ष्य: क्या AI भाषा के स्वाद को खोए बिना मुख्य बिंदुओं को बनाए रख सकता है?
  3. अनुवादक (English-to-X): एक अंग्रेजी वाक्य को लेना और उसे प्राकृतिक लगने वाली तुर्की, जापानी या कैंटोनीज़ में बदलना।
    • लक्ष्य: क्या यह ऐसा लगता है जैसे किसी इंसान ने इसे लिखा है, या यह शब्द-दर-शब्द अनुवाद करने वाली मशीन की तरह है?
  4. सांस्कृतिक चैट (संवाद): यह सबसे कठिन हिस्सा था। AI को स्थानीय स्लैंग (slang), विनम्र सम्मानजनक शब्दों (जैसे जापानी में) या मुहावरों का उपयोग करके एक उपयोगकर्ता के साथ चैट करना था।
    • लक्ष्य: यदि कोई उपयोगकर्ता कैंटोनीज़ में मजाक करता है, तो क्या AI पंचलाइन समझ पाता है? यदि कोई उपयोगकर्ता तुर्की में सलाह मांगता है, तो क्या AI सम्मानजनक लगता है?

परिणाम: कौन पास हुआ?

🏆 सुपर-एलीट्स (GPT-4o, GPT-4, Claude 3.5)
ये मॉडल बहुभाषी विद्वानों की तरह हैं। इन्होंने हर क्षेत्र में सर्वश्रेष्ठ प्रदर्शन किया।

  • GPT-4o इस शो का सितारा था, विशेष रूप से कैंटोनीज़ के साथ। इसने केवल अनुवाद नहीं किया; इसने 'वाइब' (vibe) को समझा। यह जानता था कि कब स्लैंग का उपयोग करना है और कब औपचारिक होना है।
  • Claude 3.5 इसके ठीक पीछे था, जिसने अविश्वसनीय तर्क कौशल दिखाया।
  • कमी: यहाँ तक कि ये दिग्गज भी थोड़ा लड़खड़ा गए। तुर्की में, वे कभी-कभी जटिल "लेगो" शब्द के अंत (endings) में गलती कर जाते थे। कैंटोनीज़ में, वे कभी-कभी चूक गए और स्थानीय बोली के बजाय मानक चीनी शब्दों का उपयोग करने लगे।

🥈 मिड-टियर (LLaMA 3.1, Mistral Large 2)
ये परिश्रमी छात्र हैं। इन्होंने जापानी और तुर्की में आश्चर्यजनक रूप से अच्छा प्रदर्शन किया, लगभग दिग्गजों के बराबर पहुँच गए। हालाँकि, जब बात कैंटोनीज़ की आई, तो वे संघर्ष करते दिखे। यह एक ऐसे छात्र की तरह है जिसने गणित की परीक्षा के लिए कड़ी मेहनत की लेकिन इतिहास की परीक्षा के लिए उसके पास पर्याप्त पाठ्यपुस्तकें नहीं थीं। क्योंकि उनके प्रशिक्षण में कैंटोनीज़ के लिए कम डेटा उपलब्ध था, इसलिए वे अक्सर ऐसा लगे जैसे वे स्थानीय बोली के बजाय "मानक चीनी" बोल रहे हों।

🥉 रूकीज़ (LLaMA-2 13B, Mistral 7B)
ये मॉडल नए स्नातकों की तरह हैं जिन्होंने अभी दुनिया बहुत कम देखी है। वे काफी संघर्ष करते दिखे।

  • उन्होंने अक्सर ट्रिविया के गलत उत्तर दिए।
  • उनके सारांश भ्रमित करने वाले थे।
  • सांस्कृतिक चैट में, वे सुर-ताल से बाहर (tone-deaf) थे। वे जापान में एक दादी के साथ अनौपचारिक, असभ्य लहजे का उपयोग कर सकते थे, या तुर्की के मुहावरे को पूरी तरह समझने में विफल रहे।

मुख्य निष्कर्ष

  1. आकार मायने रखता है (लेकिन डेटा अधिक महत्वपूर्ण है): सबसे बड़े मॉडल आमतौर पर जीतते हैं, लेकिन यदि कोई भाषा "लो-रिसोर्स" (जैसे कैंटोनीज़) है, तो वास्तव में चमकने के लिए बड़े मॉडलों को भी विशिष्ट प्रशिक्षण डेटा की आवश्यकता होती है।
  2. संस्कृति कठिन है: आप एक AI को व्याकरण सिखा सकते हैं, लेकिन उसे संस्कृति सिखाना मछली को साइकिल चलाने के लिए सिखाने जैसा है। शीर्ष मॉडल स्थानीय चुटकुलों और विनम्रता को समझने में बेहतर हो रहे हैं, लेकिन वे अभी भी ऐसी गलतियाँ करते हैं जो एक इंसान कभी नहीं करेगा।
  3. रोबोट बनाम इंसान: शोध पत्र में पाया गया कि इन परीक्षणों को ग्रेड करने के लिए उपयोग किए जाने वाले कंप्यूटर प्रोग्राम (जैसे BLEU स्कोर) अक्सर विफल रहे। वे एक आदर्श अनुवाद को कम स्कोर दे सकते हैं क्योंकि शब्द थोड़े अलग थे। सूक्ष्मता, हास्य और सांस्कृतिक सम्मान को पकड़ने के लिए मानवीय निर्णायक (Human judges) आवश्यक थे।

निचोड़

हम अद्भुत प्रगति कर रहे हैं। AI लाइब्रेरियन पहले से कहीं अधिक भाषाओं को बोलने में सक्षम हो रहे हैं। हालाँकि, अभी भी एक "डिजिटल विभाजन" है। जबकि अंग्रेजी बोलने वालों को सर्वोत्तम सेवा मिलती है, कैंटोनीज़, तुर्की और जापानी जैसी भाषाओं के बोलने वाले अभी भी अपने AI सहायकों के उनकी अनूठी संस्कृतियों और जटिल व्याकरण को वास्तव में समझने का इंतज़ार कर रहे हैं।

लेखकों ने अपना परीक्षण डेटा जारी किया है ताकि हर कोई केवल अंग्रेजी बोलने वाले आधे हिस्से के लिए ही नहीं, बल्कि पूरी दुनिया के लिए बेहतर, अधिक समावेशी AI बनाने में मदद कर सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →