← नवीनतम पेपर
💬 NLP

ChiKhaPo: A Large-Scale Multilingual Benchmark for Evaluating Lexical Comprehension and Generation in Large Language Models

यह शोध पत्र ChiKhaPo को प्रस्तुत करता है, जो 2700 से अधिक भाषाओं को कवर करने वाला एक बड़े पैमाने का बहुभाषी बेंचमार्क है, जिसमें बड़े भाषा मॉडलों (large language models) की शाब्दिक समझ और सृजन क्षमताओं का मूल्यांकन करने के लिए आठ उप-कार्य दिए गए हैं, जो यह प्रकट करता है कि अत्याधुनिक मॉडल भी दुनिया की अधिकांश लिखित भाषाओं में बुनियादी भाषाई सक्षमता के लिए संघर्ष करते हैं।

मूल लेखक: Emily Chang, Niyati Bafna

प्रकाशित 2026-06-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Emily Chang, Niyati Bafna

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास हज़ारों अलग-अलग भाषाओं में लिखी गई किताबों का एक विशाल, अत्यंत बुद्धिमान पुस्तकालय है। आपने एक नया, प्रतिभाशाली लाइब्रेरियन (एक लार्ज लैंग्वेज मॉडल, या LLM) काम पर रखा है ताकि वह आपको विशिष्ट शब्द खोजने और उनका अनुवाद करने में मदद कर सके। आप जानना चाहते हैं: क्या यह लाइब्रेरियन वास्तव में शब्दों को समझता है, या यह केवल उन कुछ भाषाओं के आधार पर अनुमान लगा रहा है जिनका इसने सबसे अधिक अध्ययन किया है?

यह शोध पत्र एक नया परीक्षण पेश करता है जिसे ChiKhaPo (उच्चारण: चि-खा-पो) कहा जाता है, ताकि ठीक इसी प्रश्न का उत्तर दिया जा सके। इसका नाम एक कहावत से आया है जिसका अर्थ है "कदम दर कदम," क्योंकि लेखकों का मानना है कि हमें यह समझने के लिए छोटे, सावधानीपूर्ण कदम उठाने की आवश्यकता है कि ये AI मॉडल दुनिया की विभिन्न भाषाओं में वास्तव में कैसे काम करते हैं।

यहाँ इसका विवरण दिया गया है, कुछ रोज़मर्रा के उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: भाषाओं का "वीआईपी लाउंज" (VIP Lounge)

वर्तमान में, AI के लिए अधिकांश परीक्षण वीआईपी लाउंज की तरह हैं। वे केवल कुछ दर्जन "उच्च-संसाधन वाली भाषाओं" (High-Resource Languages) को ही प्रवेश देते हैं (जैसे अंग्रेजी, स्पेनिश या फ्रेंच)। ये वे भाषाएँ हैं जिनके लिए इंटरनेट पर भारी मात्रा में डेटा उपलब्ध है।

  • वास्तविकता: दुनिया में 3,800 से अधिक लिखित भाषाएँ हैं। इनमें से अधिकांश इन वीआईपी लाउंजों से बाहर हैं।
  • अंतराल (Gap): हमें नहीं पता कि क्या AI अन्य 3,700+ भाषाओं को संभाल सकता है। हो सकता है कि वह अंग्रेजी में जीनियस हो, लेकिन किसी कम-संसाधन वाली भाषा में शब्द का अनुवाद करने के लिए पूछा जाने पर पूरी तरह से खो जाए।

2. समाधान: "विशाल बहुभाषी परीक्षा" (ChiKhaPo)

लेखकों ने एक विशाल परीक्षा बनाई है जो 2,700+ भाषाओं को कवर करती है। AI से जटिल निबंध लिखने या गणित की समस्या हल करने के बजाय (जो कठिन कार्य हैं), उन्होंने बुनियादी चीज़ों पर ध्यान केंद्रित किया: लेक्सिकल कॉम्पिटेंस (शब्द ज्ञान/Lexical Competence)

  • उपमा: इसे एक छात्र के शब्दावली परीक्षण की तरह समझें, इससे पहले कि उससे उपन्यास लिखने के लिए कहा जाए। क्या वह एक शब्द को पहचान सकता है? क्या वह उसका अर्थ बता सकता है? क्या वह उसे एक वाक्य में उपयोग कर सकता है?

इस परीक्षा में इन कौशलों का विभिन्न कोणों से परीक्षण करने के लिए 8 अलग-अलग खंड (उप-कार्य) हैं:

  • शब्द अनुवाद (Word Translation): "मलय में 'बारिश' के लिए कौन सा शब्द है?" (प्रत्यक्ष अनुवाद)।
  • संदर्भ के साथ शब्द अनुवाद (Word Translation with Context): "तूफान के बारे में इस कहानी में, 'ujan' शब्द का क्या अर्थ है?" (संदर्भ के संकेतों का उपयोग करना)।
  • ट्रांसलेशन-कंडीशन्ड मॉडलिंग (Translation-Conditioned Modeling): AI को एक भाषा में एक वाक्य दिया जाता है और उसे अनुवाद में अगला शब्द अनुमानित करना होता है। (जैसे कि "रिक्त स्थान भरें" वाला खेल)।
  • बैग-ऑफ-वर्ड्स अनुवाद (Bag-of-Words Translation): AI एक पूरा वाक्य अनुवाद करता है, और परीक्षण यह जाँचता है कि क्या उसने व्यक्तिगत शब्दों को सही पकड़ा है, भले ही वाक्य की संरचना थोड़ी अव्यवस्थित हो।

3. परिणाम: AI बुनियादी बातों में संघर्ष करता है

लेखकों ने आज के सबसे स्मार्ट 6 AI मॉडलों का इस परीक्षा पर परीक्षण किया।

  • निष्कर्ष: सबसे अच्छे मॉडल भी काफी संघर्ष करते हैं, विशेष रूप से कम-संसाधन वाली भाषाओं के साथ।
  • "समझ बनाम सृजन" का अंतर (The "Comprehension vs. Generation" Gap): मॉडल एक शब्द को समझने (उसे पढ़ने और उसका अर्थ जानने) में सृजन करने (उस शब्द को बोलने या लिखने) की तुलना में बेहतर थे।
    • उपमा: यह एक ऐसे व्यक्ति की तरह है जो किसी विदेशी भाषा के मेनू को पढ़ सकता है और जान सकता है कि "सूप" क्या है, लेकिन जब उसे इसे ऑर्डर करने के लिए कहा जाता है, तो वह ठिठक जाता है और शब्द नहीं बोल पाता।
  • "समृद्ध बनाम निर्धन" का अंतर (The "Rich vs. Poor" Gap): मॉडल उन भाषाओं पर बेहतर प्रदर्शन करते हैं जिनमें बहुत अधिक डेटा है (High-Resource), तुलना में उन भाषाओं के जो बहुत कम डेटा वाली हैं (Low-Resource)। प्रदर्शन का अंतर बहुत बड़ा था।

4. यह क्यों महत्वपूर्ण है (शोध पत्र के अनुसार)

शोध पत्र का तर्क है कि हम केवल इसलिए यह मानकर नहीं चल सकते कि AI "बहुभाषी" है क्योंकि वह अंग्रेजी में अच्छा काम करता है।

  • "प्रॉक्सी" की खोज: उन्होंने पाया कि यदि कोई AI एकल शब्दों का अनुवाद करने में अच्छा है (सरल परीक्षण), तो वह आमतौर पर पूर्ण वाक्यों का अनुवाद करने में भी अच्छा होता है (जटिल परीक्षण)। इसका अर्थ है कि सरल शब्द परीक्षण एक सस्ता और आसान तरीका है यह जाँचने का कि क्या कोई AI कठिन काम के लिए तैयार है।
  • लक्ष्य: लेखकों का लक्ष्य भाषाई असमानता पर प्रकाश डालना है। वर्तमान में, एनएलपी (NLP - नेचुरल लैंग्वेज प्रोसेसिंग) अनुचित है क्योंकि यह हज़ारों भाषाओं की अनदेखी करता है। ChiKhaPo एक ऐसा उपकरण है जो शोधकर्ताओं को इन उपेक्षित भाषाओं पर ध्यान देने और बेहतर, निष्पक्ष AI बनाने के लिए मजबूर करने के लिए बनाया गया है।

सारांश

ChiKhaPo 2,700+ भाषाओं में AI के लिए एक विशाल, चरण-दर-चरण शब्दावली परीक्षण है। यह प्रकट करता है कि सबसे स्मार्ट AI मॉडल भी वर्तमान में दुनिया की अधिकांश भाषाओं के लिए "शब्द-अंधे" (word-blind) हैं। वे अक्सर एक शब्द को समझ सकते हैं लेकिन उसे उत्पन्न करने में संघर्ष करते हैं, और वे उन भाषाओं के लिए बहुत खराब प्रदर्शन करते हैं जिनके पास ऑनलाइन बहुत कम डेटा है। लेखक आशा करते हैं कि यह परीक्षण AI समुदाय को केवल "वीआईपी" भाषाओं पर ध्यान केंद्रित करने के बजाय ऐसी मॉडल बनाने के लिए प्रेरित करेगा जो वास्तव में पूरी दुनिया को समझ सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →