CulturALL: Benchmarking Multilingual and Multicultural Competence of LLMs on Grounded Tasks
यह शोधपत्र CulturALL को प्रस्तुत करता है, जो 14 भाषाओं और 51 क्षेत्रों में 2,610 ग्राउंडेड कार्यों से बना एक व्यापक बेंचमार्क है, जिसे वास्तविक, संदर्भ-युक्त परिदृश्यों में लार्ज लैंग्वेज मॉडल्स की बहुभाषी और बहुसांस्कृतिक क्षमता का कड़ाई से मूल्यांकन करने के लिए डिज़ाइन किया गया है जहाँ वर्तमान मॉडल्स में सुधार की काफी गुंजाइश है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने एक सुपर-स्मार्ट रोबोट असिस्टेंट बनाया है जो दुनिया की हर भाषा बोल सकता है। आपको इस पर गर्व है, है ना? लेकिन फिर आप उससे एक साधारण सवाल पूछते हैं: "मैं अगले महीने जापान की यात्रा की योजना बना रहा हूँ। मुझे क्या पैक करना चाहिए?"
यदि रोबोट सिर्फ इतना कहता है, "एक जैकेट साथ रखें," तो यह तकनीकी रूप से सही है लेकिन बेकार है। यदि वह कहता है, "एक हल्का रेनकोट और चलने के लिए आरामदायक जूते साथ रखें क्योंकि बारिश का मौसम खत्म हो रहा है और सड़कें पथरीली हैं," तो वह वास्तव में मददगार है।
"CulturALL" नामक शोध पत्र यह परीक्षण करने के बारे में है कि क्या हमारे सर्वश्रेष्ठ AI रोबोट वास्तव में दूसरा काम कर सकते हैं।
यहाँ सरल उपमाओं का उपयोग करके इस शोध पत्र का विवरण दिया गया है:
1. समस्या: "ट्रिविया क्विज़" का जाल
आजकल हम AI को जो अधिकांश परीक्षण देते हैं, वे ट्रिविया क्विज़ (सामान्य ज्ञान प्रश्नोत्तरी) की तरह होते हैं।
- प्रश्न: "फ्रांस की राजधानी क्या है?"
- उत्तर: "पेरिस।"
यह आसान है। यह केवल तथ्यों को याद रखना है। लेकिन वास्तविक जीवन कोई ट्रिविया क्विज़ नहीं है। वास्तविक जीवन जमीनी (grounded) होता है। यह जटिल, विशिष्ट और इस पर निर्भर है कि आप कहाँ हैं और आप कौन हैं।
- वास्तविक जीवन का प्रश्न: "मैं शंघाई में एक फूलों की दुकान का मालिक हूँ। अगस्त के अंत में 2025 चल रहा है। पैसा कमाने के लिए मुझे कौन से फूल प्रमोट करने चाहिए?"
इसे उत्तर देने के लिए, AI को जानना होगा:
- भाषा: चीनी प्रश्न को पूरी तरह से समझना।
- संस्कृति: यह जानना कि चीन में अगस्त का अंत "घोस्ट फेस्टिवल" या विशिष्ट स्थानीय त्योहारों के आसपास होता है, और उस समय कुछ फूल भाग्यशाली (या अशुभ) होते हैं।
- तर्क (Reasoning): स्मार्ट उत्तर देने के लिए तारीख, स्थान और व्यावसायिक लक्ष्य को आपस में जोड़ना।
मौजूदा परीक्षण ज्यादातर यह जांचते हैं कि क्या AI को "ट्रिविया" पता है। CulturALL यह जांचता है कि क्या AI वास्तविक जीवन की स्थितियों को संभाल सकता है।
2. समाधान: "CulturALL" बेंचमार्क
लेखकों ने CulturALL नामक एक नया परीक्षण बनाया है। इसे AI के लिए एक विशाल, वैश्विक बाधा दौड़ (obstacle course) के रूप में सोचें।
- कोर्स: इसमें 2,610 अलग-अलग "लेवल" (प्रश्न) हैं।
- क्षेत्र (Terrain): ये लेवल 51 अलग-अलग क्षेत्रों (जैसे देश या राज्य) और 14 अलग-अलग भाषाओं को कवर करते हैं।
- विषय: वे जीवन के 16 क्षेत्रों को कवर करते हैं, जैसे यात्रा और भोजन से लेकर सरकार और विश्वासों तक।
लक्ष्य: यह देखना कि क्या एक AI किसी विशिष्ट सांस्कृतिक स्थिति में बिना भटके नेविगेट कर सकता है।
3. उन्होंने इसे कैसे बनाया: "मानव-AI नृत्य"
इस परीक्षण को बनाना कठिन था। आप कंप्यूटर को सांस्कृतिक प्रश्न बनाने के लिए नहीं कह सकते क्योंकि कंप्यूटर अक्सर 'हैलुसिनेट' (मनगढ़ंत बातें बनाना) करते हैं।
इसलिए, उन्होंने एक मानव-AI सहयोगात्मक ढांचे (Human-AI Collaborative Framework) का उपयोग किया:
- इंसान (विशेषज्ञ): कल्पना कीजिए कि दुनिया भर के स्थानीय विशेषज्ञों की एक टीम है। वे "निर्देशक" हैं। वे अपने वास्तविक जीवन के आधार पर परिदृश्य तैयार करते हैं (जैसे, "मुझे हांगकांग के लिए वीज़ा कैसे प्राप्त करें?")। वे सुनिश्चित करते हैं कि प्रश्न कठिन और सांस्कृतिक रूप से सटीक हों।
- AI (सहायक): AI एक "संपादक" के रूप में कार्य करता है। यह प्रश्नों का अनुवाद करने, उन्हें फॉर्मेट करने और वर्तनी की गलतियों की जाँच करने में मदद करता है।
- "कठिनाई अपग्रेड": यदि कोई प्रश्न बहुत आसान है (जैसे "राजधानी क्या है?"), तो इंसान उसे कठिन बनाने के लिए उसमें बदलाव करते हैं। वे "हांगकांग" को बदलकर हांगकांग के एक विशिष्ट ट्रेकिंग मार्ग के बारे में पूछ सकते हैं, जिससे AI को गहराई तक जाने के लिए मजबूर होना पड़ता है।
4. परिणाम: AI अभी भी एक छात्र है
जब उन्होंने सबसे अच्छे AI मॉडल्स (जैसे Gemini, GPT और Claude के सबसे स्मार्ट वर्ज़न) को इस बाधा दौड़ से गुज़ारा, तो परिणाम... आश्चर्यजनक रूप से कम थे।
- स्कोर: सर्वश्रेष्ठ AI को केवल लगभग 44% उत्तर सही मिले।
- उपमा: कल्पना कीजिए कि एक छात्र अपनी अंतिम परीक्षा दे रहा है। 44% प्राप्त करने का अर्थ है कि वह फेल हो रहा है। उसे परिभाषाएँ तो पता हैं, लेकिन वह ज्ञान को वास्तविक दुनिया की समस्याओं पर लागू नहीं कर सकता।
मुख्य निष्कर्ष:
- प्रोपराइटरी बनाम ओपन सोर्स: "बिग टेक" मॉडल्स (जैसे गूगल का Gemini) ओपन-सोर्स मॉडल्स की तुलना में बेहतर प्रदर्शन करते हैं, लेकिन बेहतरीन मॉडल्स भी संघर्ष करते हैं।
- "वेब सर्च" की जीवन रेखा: जब AI को टेस्ट के दौरान Google (वेब सर्च) का उपयोग करने की अनुमति दी गई, तो उसका स्कोर बढ़ गया। यह साबित करता है कि AI अभी तक इन सांस्कृतिक तथ्यों को जानता नहीं है; इसे इन्हें ढूँढना पड़ता है।
- भाषा मायने रखती है: जब प्रश्न मूल भाषा (जैसे चीनी या अरबी) में पूछा गया, तो AI का प्रदर्शन अंग्रेजी की तुलना में खराब रहा। यह ऐसा है जैसे AI अंग्रेजी में टेक्स्टबुक पढ़ने में अधिक सहज है बजाय इसके कि वह स्पेनिश में किसी स्थानीय चुटकुले को समझे।
5. यह क्यों महत्वपूर्ण है
यह शोध पत्र एक चेतावनी है। हम हर जगह AI को तैनात कर रहे हैं, लेकिन हम उनका परीक्षण उन चीजों के लिए कर रहे हैं जो मायने नहीं रखतीं (ट्रिविया)।
CulturALL कहता है: "यह परीक्षण करना बंद करें कि क्या आपका रोबोट चंद्रमा लैंडिंग की तारीख जानता है। इसके बजाय यह परीक्षण करें कि क्या आपका रोबोट एक पर्यटक को वियतनाम के स्थानीय बाजार में बिना किसी को नाराज किए नेविगेट करने में मदद कर सकता है।"
यह इस बात पर जोर देता है कि AI को वास्तव में वैश्विक स्तर पर उपयोगी होने के लिए, इसे केवल एक लाइब्रेरी (केवल तथ्य संग्रहीत करना) बनना बंद करना होगा और एक स्थानीय गाइड (संदर्भ, संस्कृति और बारीकियों को समझना) बनना शुरू करना होगा। जब तक यह ऐसा नहीं कर पाता, तब तक यह केवल एक बहुत ही स्मार्ट तोता है, एक सहायक नहीं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।