UA-Legal-Bench: A Benchmark for Evaluating Large Language Models on Ukrainian Legal Reasoning
यह शोध पत्र UA-Legal-Bench प्रस्तुत करता है, जो यूक्रेन के विशाल यूनिफाइड स्टेट रजिस्टर ऑफ कोर्ट डिसीजन्स से प्राप्त एक व्यापक पांच-कार्य वाला बेंचमार्क है, जिसका उद्देश्य यूक्रेनी कानूनी तर्क पर लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करना है, जो कार्य-निर्भर फ्यू-शॉट प्रभावों, असंतुलित डेटा पर सटीकता की कमियों और विभिन्न मॉडल परिवारों में अलग-अलग स्केलिंग व्यवहारों के बारे में महत्वपूर्ण अंतर्दृष्टि प्रकट करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास कानूनी किताबों का एक विशाल पुस्तकालय है, लेकिन वे एक ऐसी भाषा (यूक्रेनी) में लिखी गई हैं जिसे दुनिया के अधिकांश सबसे स्मार्ट AI रोबोट अभी तक पूरी तरह से नहीं बोल पाते। जो परीक्षण हम यह जांचने के लिए उपयोग करते हैं कि ये रोबोट कितने "स्मार्ट" हैं, वे ज्यादातर अंग्रेजी में लिखे गए हैं। यह एक शेफ की इतालवी खाना बनाने की क्षमता को केवल सुशी बनाने के परीक्षण के माध्यम से जांचने जैसा है। आप इस तथ्य को नजरअंदाज कर सकते हैं कि वह प्याज काटने में असमर्थ है, या वह क्षेत्र के विशिष्ट मसालों के कारण भ्रमित हो जाता है।
यह शोध पत्र UA-Legal-Bench पेश करता है, जो एक नया "ड्राइवर लाइसेंस टेस्ट" है जिसे विशेष रूप से AI रोबॉट्स को यह साबित करने के लिए डिज़ाइन किया गया है कि वे यूक्रेनी कानून को समझ सकते हैं।
यहाँ एक सरल उपमाओं का उपयोग करके बताया गया है कि शोधकर्ताओं ने क्या किया और क्या पाया:
1. टेस्ट ड्राइव (द बेंचमार्क)
शोधकर्ताओं ने यूक्रेन के 99.5 मिलियन वास्तविक अदालती फैसलों का उपयोग करके एक परीक्षण बनाया। उन्होंने पांच अलग-अलग चुनौतियों को बनाने के लिए 2,000 मामलों के एक छोटे, प्रबंधनीय नमूने को चुना, जो आसान से लेकर बहुत कठिन तक हैं:
- "यह क्या है?" परीक्षण (केस-टाइप): क्या AI बता सकता है कि कोई दस्तावेज़ नागरिक विवाद, अपराध, व्यापार सौदे या प्रशासनिक मुद्दे के बारे में है? (जैसे मेल को अलग-अलग डिब्बों में छाँटना)।
- "यह किस तरह का कागज है?" परीक्षण (जजमेंट फॉर्म): क्या AI अंतिम निर्णय, अस्थायी आदेश या प्रस्ताव के बीच अंतर कर सकता है? (जैसे कि यह पहचानना कि "फाइनल एग्जाम" और "क्विज़" में क्या अंतर है, भले ही वे समान दिखते हों)।
- "क्या हुआ?" परीक्षण (केस-आउटकम): यह सबसे कठिन वाला है। AI मामले के तथ्यों को पढ़ता है (उत्तर छिपाकर) और अनुमान लगाता है कि व्यक्ति जीता, हारा या दोषी पाया गया। इसके लिए वास्तविक तर्क की आवश्यकता होती है, न कि केवल पैटर्न पहचानने की।
- "नियम खोजें" परीक्षण (नॉर्म एक्सट्रैक्शन): क्या AI पाठ में उद्धृत विशिष्ट कानूनों को ढूंढ सकता है? (जैसे कि एक अव्यवस्थित निर्देश पुस्तिका में विशिष्ट नियम पुस्तिका का पृष्ठ ढूंढना)।
- "यह किस बारे में है?" परीक्षण (कॉज़ कैटेगरी): क्या AI मामले को "चोरी", "परिवार" या "अनुबंध" जैसे 22 व्यापक विषयों में वर्गीकृत कर सकता है?
2. प्रतियोगी (AI मॉडल)
उन्होंने पांच अलग-अलग परिवारों (जैसे मिस्ट्रल, लामा और क्वेन) से 11 अलग-अलग AI मॉडल (छोटे, कुशल मॉडलों से लेकर विशाल, सुपर-स्मार्ट मॉडलों तक) का परीक्षण किया। उन्होंने इन परीक्षणों को दो तरीकों से चलाया:
- जीरो-शॉट (Zero-Shot): AI को बिना किसी मदद के प्रश्न दिया जाता है।
- फ्यू-शॉट (Few-Shot): AI को प्रश्न के साथ कुछ उदाहरण दिए जाते हैं कि समान प्रश्नों के उत्तर कैसे दिए जाएं (जैसे कि एक छात्र को वास्तविक परीक्षा से पहले अभ्यास प्रश्न पत्र देना)।
3. आश्चर्यजनक परिणाम
"ट्रिक क्वेश्चन" की सटीकता
शोधपत्र में एक बड़ी चेतावनी मिली: सटीकता (Accuracy) एक धोखेबाज हो सकती है।
- उपमा: कल्पना कीजिए कि एक बहुविकल्पीय परीक्षा है जहाँ 60% उत्तर "A" हैं। एक रोबोट जो हर बार केवल "A" का अनुमान लगाता है, वह 60% सही होगा। यह अच्छा लगता है! लेकिन यह वास्तव में मूर्खतापूर्ण है क्योंकि उसने प्रश्नों को पढ़ा ही नहीं।
- निष्कर्ष: एक बड़े AI मॉडल ने सबसे कठिन कार्य पर उच्चतम "सटीकता" प्राप्त की, लेकिन वह मुख्य रूप से सबसे आम परिणाम का अनुमान लगा रहा था। जब शोधकर्ताओं ने एक स्मार्ट मेट्रिक (मैक्रो-F1) का उपयोग किया जो यह जांचता है कि क्या AI ने दुर्लभ उत्तरों को भी सही पकड़ा, तो वही रोबोट बहुत खराब प्रदर्शन करता दिखा। "वास्तव में सर्वश्रेष्ठ" रोबोट ने कच्ची सटीकता (raw accuracy) पर कम स्कोर किया लेकिन वास्तव में मामलों को समझा।
"जादुई चीट शीट" (फ्यू-शॉट लर्निंग)
परीक्षण से पहले AI को उदाहरण देने से कुछ कार्यों के लिए चमत्कार हुआ लेकिन दूसरों के लिए नहीं।
- उपमा: "यह किस तरह का कागज है?" परीक्षण के लिए, AI को कुछ उदाहरण दिखाने से ऐसा लगा जैसे उसे चीट शीट थमा दी गई हो। एक छोटा मॉडल केवल कुछ उदाहरण देखकर फेल होने से सीधे ए+ (A+) पर पहुँच गया।
- ट्विस्ट: "क्या हुआ?" (तर्क/रीजनिंग) परीक्षण के लिए, चीट शीट ने ज्यादा मदद नहीं की। कभी-कभी इसने AI को भ्रमित भी कर दिया। यह साबित करता है कि आप यह मानकर नहीं चल सकते कि "अधिक उदाहरण = बेहतर परिणाम" हर कानूनी कार्य के लिए सही है।
आकार हमेशा मायने नहीं रखता
आमतौर पर, बड़े AI मॉडल अधिक स्मार्ट होते हैं। लेकिन यहाँ ऐसा नहीं है।
- उपमा: एक छोटी, फुर्तीली रेस कार बनाम एक विशाल ट्रक के बारे में सोचें। एक सीधी हाईवे (मेल छाँटने जैसे सरल कार्यों) पर, छोटी कार ट्रक जितनी ही तेज थी। लेकिन एक ऊबड़-खाबड़, जटिल ऑफ-रोड ट्रैक (जटिल तर्क) पर, ट्रक को संभालने के लिए बहुत बड़ा होना पड़ा।
- निष्कर्ष: एक छोटा 8-बिलियन पैरामीटर वाला मॉडल सरल कार्यों के लिए 675-बिलियन पैरामीटर वाले विशाल मॉडल के समान ही अच्छा था। हालांकि, कठिन तर्क कार्यों के लिए, बड़े मॉडलों ने आमतौर पर जीत हासिल की—लेकिन केवल तभी जब वे AI के सही "परिवार" से थे। कुछ परिवारों को काम करने के लिए बहुत बड़ा होना पड़ता था, जबकि अन्य छोटे होने पर भी स्मार्ट थे।
4. यूक्रेनी भाषा AI के लिए कठिन क्यों है?
शोधपत्र बताता है कि यूक्रेनी तीन मुख्य कारणों से कठिन है:
- वर्णमाला: यह सिरिलिक (Cyrillic) का उपयोग करती है, जिस पर कई AI अंग्रेजी की तुलना में उतना अच्छा प्रशिक्षण प्राप्त नहीं कर पाते हैं।
- व्याकरण: यूक्रेनी शब्दों के अंत बहुत बदलते हैं (जैसे "मैं जाता हूँ," "वह जाता है," "हम गए")। यह AI के आंतरिक "शब्द काउंटर" को भ्रमित कर देता है, जिससे इसे वाक्य पढ़ने के लिए अधिक कंप्यूटिंग शक्ति का उपयोग करना पड़ता है।
- प्रणाली: यूक्रेन एक "सिविल लॉ" प्रणाली (लिखित कोड पर आधारित) का उपयोग करता है, जबकि अधिकांश AI "कॉमन लॉ" (पिछले अदालती मामलों पर आधारित) पर प्रशिक्षित थे। यह एक ऐसे वकील को सिखाने जैसा है जो केवल पिछले उदाहरणों के आधार पर बहस करना जानता है, अचानक एक सख्त नियम पुस्तिका का पालन करना।
निचोड़
लेखकों ने यूक्रेनी कानून पर AI का परीक्षण करने का एक नया, अधिक निष्पक्ष तरीका बनाया। उन्होंने पाया कि:
- साधारण स्कोर पर भरोसा न करें: एक उच्च सटीकता स्कोर का मतलब केवल यह हो सकता है कि AI सबसे आम उत्तर का अनुमान लगा रहा है।
- उदाहरण मदद करते हैं, लेकिन हमेशा नहीं: उदाहरण दिखाना AI को दस्तावेज़ों के प्रकार पहचानने में मदद करता है, लेकिन यह जरूरी नहीं कि उसे एक बेहतर कानूनी विचारक बना दे।
- छोटा हमेशा कमजोर नहीं होता: कुछ कानूनी कार्यों के लिए, एक छोटा, सस्ता AI एक विशाल, महंगे AI के समान ही अच्छा है।
शोधकर्ताओं ने अपना सारा डेटा, परीक्षण और परिणाम सार्वजनिक कर दिए हैं ताकि अन्य लोग बेहतर, निष्पक्ष कानूनी AI उपकरण बना सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।