LLM Probe: Evaluating LLMs for Low-Resource Languages
यह शोध पत्र LLM Probe को प्रस्तुत करता है, जो कम-संसाधन वाली भाषाओं के लिए एक लेक्सिकॉन-आधारित मूल्यांकन ढांचा और साथ में एक बेंचमार्क डेटासेट है, जो लेक्सिकल अलाइनमेंट, मॉर्फोसिंटैक्टिक विश्लेषण और अनुवाद जैसे कार्यों में कॉज़ल (causal) और सीक्वेंस-टू-सीक्वेंस (sequence-to-sequence) मॉडलों के बीच स्पष्ट प्रदर्शन अंतर को प्रकट करता है ताकि बहुभाषी एआई विकास में भाषाई रूप से आधारित मूल्यांकन की वकालत की जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट है जो हजारों भाषाएं बोल सकता है। यह एक बहुभाषी जीनियस की तरह है जो अंग्रेजी, स्पेनिश और मंदारिन में कविता लिख सकता है, गणित की समस्याएं हल कर सकता है और चुटकुले सुना सकता है। लेकिन, एक पेंच है: इस रोबोट ने मुख्य रूप से उन भाषाओं में लिखी गई किताबों से सीखा है जो लोकप्रिय हैं। यदि आप इससे किसी ऐसी भाषा के बारे में पूछते हैं जो एक विशिष्ट क्षेत्र में कुछ मिलियन लोगों द्वारा बोली जाती है—जैसे कि तिग्रीन्या (Tigrinya) (जो इरिट्रिया और इथियोपिया में बोली जाती है)—तो यह लड़खड़ा सकता है, अनुमान लगा सकता है, या बस मनगढ़ंत बातें बना सकता है।
यह शोध पत्र एक विशेषज्ञ "रिपोर्ट कार्ड" बनाने के बारे में है जो ठीक से परीक्षण कर सके कि ये रोबोट उन भाषाओं को कितनी अच्छी तरह संभालते हैं जिन्हें उन्होंने पर्याप्त अध्ययन नहीं किया है। लेखक इस परीक्षण को "LLM Probe" कहते हैं।
इस शोध पत्र का विवरण सरल उपमाओं (analogies) का उपयोग करके यहाँ दिया गया है:
1. समस्या: "अमीर बनाम गरीब" भाषा अंतराल
दुनिया की भाषाओं को विभिन्न मोहल्लों की तरह समझें।
- उच्च-संसाधन वाली भाषाएं (जैसे अंग्रेजी): ये विशाल पुस्तकालयों, लाखों शिक्षकों और अंतहीन पाठ्यपुस्तकों वाले हलचल भरे शहरों की तरह हैं। एआई रोबोटों ने यहाँ वर्षों तक अध्ययन किया है, इसलिए वे विशेषज्ञ हैं।
- निम्न-संसाधन वाली भाषाएं (जैसे तिग्रीन्या): ये छोटे, जीवंत गांवों की तरह हैं जिनका मौखिक इतिहास तो समृद्ध है लेकिन लिखित पुस्तकें बहुत कम हैं। एआई रोबोट इन गांवों में शायद ही कभी गए हैं।
क्योंकि तिग्रीन्या एक "रूपात्मक रूप से समृद्ध" (morphologically rich) भाषा है, यह एक जटिल, आपस में जुड़े हुए टुकड़ों वाले लेगो (Lego) सेट की तरह है। अंग्रेजी में, आप बहुवचन बनाने के लिए बस एक "s" जोड़ सकते हैं। तिग्रीन्या में, आपको यह दिखाने के लिए कि क्रिया कौन कर रहा है, कब और किसे, शब्द के आंतरिक स्वरों को घुमाना, मोड़ना और बदलना पड़ता है। रोबट इन जटिल लेगो संरचनाओं से भ्रमित हो जाते हैं क्योंकि उन्होंने पर्याप्त उदाहरण नहीं देखे हैं।
2. समाधान: "LLM Probe" टूलकिट
रोबोट से केवल "इस वाक्य का अनुवाद करें" कहकर और बेहतर परिणाम की उम्मीद करने के बजाय, लेखकों ने एक चार-भाग वाला नैदानिक टूलकिट (LLM Probe) बनाया है ताकि रोबोट के मस्तिष्क की विशिष्ट तरीकों से जांच की जा सके:
- लेक्सिकल अलाइनमेंट (शब्द मिलान का खेल - Lexical Alignment):
- उपमा: "मेमोरी" के खेल की कल्पना करें जहाँ आपको एक अंग्रेजी शब्द कार्ड को उसके तिग्रीन्या जुड़वां से मिलाना होता है।
- परीक्षण: क्या रोबोट बिना भ्रमित हुए "cat" को बिल्ली के लिए तिग्रीन्या शब्द के साथ सही ढंग से जोड़ सकता है?
- पार्ट-ऑफ-स्पीच टैगिंग (पद-व्याख्या/पद-भेद की जांच - Part-of-Speech Tagging):
- उपमा: आप रोबोट को शब्दों की एक सूची देते हैं और पूछते हैं, "क्या यह शब्द संज्ञा (एक वस्तु) है, क्रिया (एक कार्य) है, या विशेषण (एक विवरण) है?"
- परीक्षण: क्या रोबोट यह समझ सकता है कि वाक्य में एक शब्द की भूमिका क्या है, भले ही वाक्य की संरचना अजीब क्यों न हो?
- मॉर्फोसिंटैक्टिक प्रोबिंग (व्याकरण पहेली - Morphosyntactic Probing):
- उपमा: यह इस बात की जांच करने जैसा है कि क्या रोबोट एक जटिल बोर्ड गेम के नियमों को जानता है। क्या उसे पता है कि यदि कर्ता "वह" (he) है, तो क्रिया का रूप बदलना चाहिए?
- परीक्षण: क्या रोबोट लिंग (पुरुष/स्त्री) और वचन (एकवचन/बहुवचन) के परिवर्तनों को संभाल सकता है जो तिग्रीन्या के लिए आवश्यक हैं?
- अनुवाद निष्ठा (सटीकता की जांच - Translation Fidelity):
- उपमा: रोबोट एक वाक्य का अनुवाद करता है, और एक मानव विशेषज्ञ इसकी आदर्श अनुवाद से तुलना करता है।
- परीक्षण: क्या रोबोट ने अर्थ सही पकड़ा, या यह केवल सुनने में प्रवाहपूर्ण लगा लेकिन गलत बात कही?
3. डेटा: "स्वर्ण मानक" (Gold Standard) का निर्माण
इन परीक्षणों को चलाने के लिए, लेखक केवल गूगल ट्रांसलेट का उपयोग नहीं कर सकते थे। उन्हें अपना स्वयं का मैनुअल बेंचमार्क डेटासेट बनाना पड़ा।
- उन्होंने अंग्रेजी और तिग्रीन्या के 7,234 वाक्यांशों के जोड़े एकत्र किए।
- उन्होंने भाषाविदों (linguists) को काम पर रखा ताकि वे हर एक शब्द को उसके व्याकरण के नियमों, लिंग और अर्थ के साथ मैन्युअल रूप से लेबल कर सकें।
- क्यों? यह सुनिश्चित करने के लिए कि "उत्तर कुंजी" (answer key) 100% सही है। यदि उत्तर कुंजी गलत है, तो आप यह नहीं बता सकते कि रोबोट बुद्धिमान है या मूर्ख।
4. परिणाम: रोबोटों ने क्या सही (और गलत) किया
लेखकों ने कई अलग-अलग रोबोट मॉडल का परीक्षण किया (कुछ "कॉज़ल" मॉडल हैं, जो टेक्स्ट मैसेज की तरह अगले शब्द की भविष्यवाणी करते हैं; अन्य "सीक्वेंस-टू-सीक्वेंस" मॉडल हैं, जो पूरे वाक्यों का अनुवाद करने में बेहतर होते हैं)।
- विजेता: सीक्वेंस-टू-सीक्वेंस मॉडल (जैसे mT5 और ByT5) जटिल व्याकरण पहेलियों और अनुवाद में सबसे अच्छे थे। वे विशेष अनुवादकों की तरह हैं जो पूरे वाक्य की संरचना को समझते हैं।
- हारने वाले (कुछ क्षेत्रों में): कॉज़ल मॉडल (जैसे Gemma या Falcon) व्यक्तिगत शब्दों को मिलाने में बहुत अच्छे थे लेकिन पूरे वाक्यों का सटीक अनुवाद करने में संघर्ष करते थे। वे शब्द-मिलान विशेषज्ञों की तरह हैं जो कभी-कभी कहानी का सार खो देते हैं।
- आश्चर्य: सबसे अच्छे रोबोट भी अभी भी तिग्रीन्या के जटिल "लेगो" व्याकरण के साथ गलतियाँ करते हैं। वे अक्सर संज्ञाओं को क्रियाओं के साथ भ्रमित कर देते हैं या लिंग (gender) को गलत समझ लेते हैं।
5. यह क्यों महत्वपूर्ण है
शोध पत्र निष्कर्ष निकालता है कि हम केवल यह मानकर नहीं चल सकते कि AI हर चीज़ में अच्छा है। यदि हम चाहते हैं कि AI इथियोपिया या इरिट्रिया के लोगों की मदद करे, तो हमें निम्नलिखित की आवश्यकता है:
- अनुमान लगाना बंद करें: हमें LLM Probe जैसे परीक्षणों की आवश्यकता है ताकि यह देखा जा सके कि रोबोट वास्तव में कहाँ विफल होते हैं।
- बेहतर उपकरण बनाएं: हमें निम्न-संसाधन वाली भाषाओं के लिए अधिक "लेगो निर्देश मैनुअल" (शब्दकोश और व्याकरण उपकरण) की आवश्यकता है।
- स्थानीय लोगों की सुनें: इन उपकरणों को बनाने का सबसे अच्छा तरीका स्थानीय मूल निवासियों के साथ मिलकर काम करना है, न कि केवल कंप्यूटर वैज्ञानिकों के साथ।
संक्षेप में: यह शोध पत्र एक आह्वान है। यह कहता है, "आइए हम सभी भाषाओं के साथ एक जैसा व्यवहार करना बंद करें। आइए हम बेहतर, निष्पक्ष परीक्षण बनाएं ताकि हमारे AI रोबोट दुनिया की उन जटिल, सुंदर भाषाओं को सीख सकें जिन्हें पीछे छोड़ दिया गया है।"
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।