← नवीनतम पेपर
💬 NLP

CulturALL: Benchmarking Multilingual and Multicultural Competence of LLMs on Grounded Tasks

यह शोधपत्र CulturALL को प्रस्तुत करता है, जो 14 भाषाओं और 51 क्षेत्रों में 2,610 ग्राउंडेड कार्यों से बना एक व्यापक बेंचमार्क है, जिसे वास्तविक, संदर्भ-युक्त परिदृश्यों में लार्ज लैंग्वेज मॉडल्स की बहुभाषी और बहुसांस्कृतिक क्षमता का कड़ाई से मूल्यांकन करने के लिए डिज़ाइन किया गया है जहाँ वर्तमान मॉडल्स में सुधार की काफी गुंजाइश है।

मूल लेखक: Peiqin Lin, Chenyang Lyu, Wenjiang Luo, Haotian Ye, Md Mehrab Hossain, Chunlan Ma, Shaoxiong Ji, Younes Samih, Bo Zeng, Fan Jiang, Yuanbin Cao, Dilda Duisenbek, Adrian Neo Sau Xun, Daria Pozdniakova
प्रकाशित 2026-04-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Peiqin Lin, Chenyang Lyu, Wenjiang Luo, Haotian Ye, Md Mehrab Hossain, Chunlan Ma, Shaoxiong Ji, Younes Samih, Bo Zeng, Fan Jiang, Yuanbin Cao, Dilda Duisenbek, Adrian Neo Sau Xun, Daria Pozdniakova, Liubou Misevich, Nevena Marinković, Ngoc Gia Linh Nguyen, Thi Khanh Linh Do, Sarakmatak Sophy, Baotian Hu, Guanhua Chen, Gongbo Tang, Alham Fikri Aji, Longyue Wang, Weihua Luo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक सुपर-स्मार्ट रोबोट असिस्टेंट बनाया है जो दुनिया की हर भाषा बोल सकता है। आपको इस पर गर्व है, है ना? लेकिन फिर आप उससे एक साधारण सवाल पूछते हैं: "मैं अगले महीने जापान की यात्रा की योजना बना रहा हूँ। मुझे क्या पैक करना चाहिए?"

यदि रोबोट सिर्फ इतना कहता है, "एक जैकेट साथ रखें," तो यह तकनीकी रूप से सही है लेकिन बेकार है। यदि वह कहता है, "एक हल्का रेनकोट और चलने के लिए आरामदायक जूते साथ रखें क्योंकि बारिश का मौसम खत्म हो रहा है और सड़कें पथरीली हैं," तो वह वास्तव में मददगार है।

"CulturALL" नामक शोध पत्र यह परीक्षण करने के बारे में है कि क्या हमारे सर्वश्रेष्ठ AI रोबोट वास्तव में दूसरा काम कर सकते हैं।

यहाँ सरल उपमाओं का उपयोग करके इस शोध पत्र का विवरण दिया गया है:

1. समस्या: "ट्रिविया क्विज़" का जाल

आजकल हम AI को जो अधिकांश परीक्षण देते हैं, वे ट्रिविया क्विज़ (सामान्य ज्ञान प्रश्नोत्तरी) की तरह होते हैं।

  • प्रश्न: "फ्रांस की राजधानी क्या है?"
  • उत्तर: "पेरिस।"

यह आसान है। यह केवल तथ्यों को याद रखना है। लेकिन वास्तविक जीवन कोई ट्रिविया क्विज़ नहीं है। वास्तविक जीवन जमीनी (grounded) होता है। यह जटिल, विशिष्ट और इस पर निर्भर है कि आप कहाँ हैं और आप कौन हैं।

  • वास्तविक जीवन का प्रश्न: "मैं शंघाई में एक फूलों की दुकान का मालिक हूँ। अगस्त के अंत में 2025 चल रहा है। पैसा कमाने के लिए मुझे कौन से फूल प्रमोट करने चाहिए?"

इसे उत्तर देने के लिए, AI को जानना होगा:

  1. भाषा: चीनी प्रश्न को पूरी तरह से समझना।
  2. संस्कृति: यह जानना कि चीन में अगस्त का अंत "घोस्ट फेस्टिवल" या विशिष्ट स्थानीय त्योहारों के आसपास होता है, और उस समय कुछ फूल भाग्यशाली (या अशुभ) होते हैं।
  3. तर्क (Reasoning): स्मार्ट उत्तर देने के लिए तारीख, स्थान और व्यावसायिक लक्ष्य को आपस में जोड़ना।

मौजूदा परीक्षण ज्यादातर यह जांचते हैं कि क्या AI को "ट्रिविया" पता है। CulturALL यह जांचता है कि क्या AI वास्तविक जीवन की स्थितियों को संभाल सकता है।

2. समाधान: "CulturALL" बेंचमार्क

लेखकों ने CulturALL नामक एक नया परीक्षण बनाया है। इसे AI के लिए एक विशाल, वैश्विक बाधा दौड़ (obstacle course) के रूप में सोचें।

  • कोर्स: इसमें 2,610 अलग-अलग "लेवल" (प्रश्न) हैं।
  • क्षेत्र (Terrain): ये लेवल 51 अलग-अलग क्षेत्रों (जैसे देश या राज्य) और 14 अलग-अलग भाषाओं को कवर करते हैं।
  • विषय: वे जीवन के 16 क्षेत्रों को कवर करते हैं, जैसे यात्रा और भोजन से लेकर सरकार और विश्वासों तक।

लक्ष्य: यह देखना कि क्या एक AI किसी विशिष्ट सांस्कृतिक स्थिति में बिना भटके नेविगेट कर सकता है।

3. उन्होंने इसे कैसे बनाया: "मानव-AI नृत्य"

इस परीक्षण को बनाना कठिन था। आप कंप्यूटर को सांस्कृतिक प्रश्न बनाने के लिए नहीं कह सकते क्योंकि कंप्यूटर अक्सर 'हैलुसिनेट' (मनगढ़ंत बातें बनाना) करते हैं।

इसलिए, उन्होंने एक मानव-AI सहयोगात्मक ढांचे (Human-AI Collaborative Framework) का उपयोग किया:

  • इंसान (विशेषज्ञ): कल्पना कीजिए कि दुनिया भर के स्थानीय विशेषज्ञों की एक टीम है। वे "निर्देशक" हैं। वे अपने वास्तविक जीवन के आधार पर परिदृश्य तैयार करते हैं (जैसे, "मुझे हांगकांग के लिए वीज़ा कैसे प्राप्त करें?")। वे सुनिश्चित करते हैं कि प्रश्न कठिन और सांस्कृतिक रूप से सटीक हों।
  • AI (सहायक): AI एक "संपादक" के रूप में कार्य करता है। यह प्रश्नों का अनुवाद करने, उन्हें फॉर्मेट करने और वर्तनी की गलतियों की जाँच करने में मदद करता है।
  • "कठिनाई अपग्रेड": यदि कोई प्रश्न बहुत आसान है (जैसे "राजधानी क्या है?"), तो इंसान उसे कठिन बनाने के लिए उसमें बदलाव करते हैं। वे "हांगकांग" को बदलकर हांगकांग के एक विशिष्ट ट्रेकिंग मार्ग के बारे में पूछ सकते हैं, जिससे AI को गहराई तक जाने के लिए मजबूर होना पड़ता है।

4. परिणाम: AI अभी भी एक छात्र है

जब उन्होंने सबसे अच्छे AI मॉडल्स (जैसे Gemini, GPT और Claude के सबसे स्मार्ट वर्ज़न) को इस बाधा दौड़ से गुज़ारा, तो परिणाम... आश्चर्यजनक रूप से कम थे।

  • स्कोर: सर्वश्रेष्ठ AI को केवल लगभग 44% उत्तर सही मिले।
  • उपमा: कल्पना कीजिए कि एक छात्र अपनी अंतिम परीक्षा दे रहा है। 44% प्राप्त करने का अर्थ है कि वह फेल हो रहा है। उसे परिभाषाएँ तो पता हैं, लेकिन वह ज्ञान को वास्तविक दुनिया की समस्याओं पर लागू नहीं कर सकता।

मुख्य निष्कर्ष:

  • प्रोपराइटरी बनाम ओपन सोर्स: "बिग टेक" मॉडल्स (जैसे गूगल का Gemini) ओपन-सोर्स मॉडल्स की तुलना में बेहतर प्रदर्शन करते हैं, लेकिन बेहतरीन मॉडल्स भी संघर्ष करते हैं।
  • "वेब सर्च" की जीवन रेखा: जब AI को टेस्ट के दौरान Google (वेब सर्च) का उपयोग करने की अनुमति दी गई, तो उसका स्कोर बढ़ गया। यह साबित करता है कि AI अभी तक इन सांस्कृतिक तथ्यों को जानता नहीं है; इसे इन्हें ढूँढना पड़ता है।
  • भाषा मायने रखती है: जब प्रश्न मूल भाषा (जैसे चीनी या अरबी) में पूछा गया, तो AI का प्रदर्शन अंग्रेजी की तुलना में खराब रहा। यह ऐसा है जैसे AI अंग्रेजी में टेक्स्टबुक पढ़ने में अधिक सहज है बजाय इसके कि वह स्पेनिश में किसी स्थानीय चुटकुले को समझे।

5. यह क्यों महत्वपूर्ण है

यह शोध पत्र एक चेतावनी है। हम हर जगह AI को तैनात कर रहे हैं, लेकिन हम उनका परीक्षण उन चीजों के लिए कर रहे हैं जो मायने नहीं रखतीं (ट्रिविया)।

CulturALL कहता है: "यह परीक्षण करना बंद करें कि क्या आपका रोबोट चंद्रमा लैंडिंग की तारीख जानता है। इसके बजाय यह परीक्षण करें कि क्या आपका रोबोट एक पर्यटक को वियतनाम के स्थानीय बाजार में बिना किसी को नाराज किए नेविगेट करने में मदद कर सकता है।"

यह इस बात पर जोर देता है कि AI को वास्तव में वैश्विक स्तर पर उपयोगी होने के लिए, इसे केवल एक लाइब्रेरी (केवल तथ्य संग्रहीत करना) बनना बंद करना होगा और एक स्थानीय गाइड (संदर्भ, संस्कृति और बारीकियों को समझना) बनना शुरू करना होगा। जब तक यह ऐसा नहीं कर पाता, तब तक यह केवल एक बहुत ही स्मार्ट तोता है, एक सहायक नहीं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →