← नवीनतम पेपर
💻 computer science

UA-Legal-Bench: A Benchmark for Evaluating Large Language Models on Ukrainian Legal Reasoning

यह शोध पत्र UA-Legal-Bench प्रस्तुत करता है, जो यूक्रेन के विशाल यूनिफाइड स्टेट रजिस्टर ऑफ कोर्ट डिसीजन्स से प्राप्त एक व्यापक पांच-कार्य वाला बेंचमार्क है, जिसका उद्देश्य यूक्रेनी कानूनी तर्क पर लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करना है, जो कार्य-निर्भर फ्यू-शॉट प्रभावों, असंतुलित डेटा पर सटीकता की कमियों और विभिन्न मॉडल परिवारों में अलग-अलग स्केलिंग व्यवहारों के बारे में महत्वपूर्ण अंतर्दृष्टि प्रकट करता है।

मूल लेखक: Volodymyr Ovcharov

प्रकाशित 2026-05-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Volodymyr Ovcharov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास कानूनी किताबों का एक विशाल पुस्तकालय है, लेकिन वे एक ऐसी भाषा (यूक्रेनी) में लिखी गई हैं जिसे दुनिया के अधिकांश सबसे स्मार्ट AI रोबोट अभी तक पूरी तरह से नहीं बोल पाते। जो परीक्षण हम यह जांचने के लिए उपयोग करते हैं कि ये रोबोट कितने "स्मार्ट" हैं, वे ज्यादातर अंग्रेजी में लिखे गए हैं। यह एक शेफ की इतालवी खाना बनाने की क्षमता को केवल सुशी बनाने के परीक्षण के माध्यम से जांचने जैसा है। आप इस तथ्य को नजरअंदाज कर सकते हैं कि वह प्याज काटने में असमर्थ है, या वह क्षेत्र के विशिष्ट मसालों के कारण भ्रमित हो जाता है।

यह शोध पत्र UA-Legal-Bench पेश करता है, जो एक नया "ड्राइवर लाइसेंस टेस्ट" है जिसे विशेष रूप से AI रोबॉट्स को यह साबित करने के लिए डिज़ाइन किया गया है कि वे यूक्रेनी कानून को समझ सकते हैं।

यहाँ एक सरल उपमाओं का उपयोग करके बताया गया है कि शोधकर्ताओं ने क्या किया और क्या पाया:

1. टेस्ट ड्राइव (द बेंचमार्क)

शोधकर्ताओं ने यूक्रेन के 99.5 मिलियन वास्तविक अदालती फैसलों का उपयोग करके एक परीक्षण बनाया। उन्होंने पांच अलग-अलग चुनौतियों को बनाने के लिए 2,000 मामलों के एक छोटे, प्रबंधनीय नमूने को चुना, जो आसान से लेकर बहुत कठिन तक हैं:

  • "यह क्या है?" परीक्षण (केस-टाइप): क्या AI बता सकता है कि कोई दस्तावेज़ नागरिक विवाद, अपराध, व्यापार सौदे या प्रशासनिक मुद्दे के बारे में है? (जैसे मेल को अलग-अलग डिब्बों में छाँटना)।
  • "यह किस तरह का कागज है?" परीक्षण (जजमेंट फॉर्म): क्या AI अंतिम निर्णय, अस्थायी आदेश या प्रस्ताव के बीच अंतर कर सकता है? (जैसे कि यह पहचानना कि "फाइनल एग्जाम" और "क्विज़" में क्या अंतर है, भले ही वे समान दिखते हों)।
  • "क्या हुआ?" परीक्षण (केस-आउटकम): यह सबसे कठिन वाला है। AI मामले के तथ्यों को पढ़ता है (उत्तर छिपाकर) और अनुमान लगाता है कि व्यक्ति जीता, हारा या दोषी पाया गया। इसके लिए वास्तविक तर्क की आवश्यकता होती है, न कि केवल पैटर्न पहचानने की।
  • "नियम खोजें" परीक्षण (नॉर्म एक्सट्रैक्शन): क्या AI पाठ में उद्धृत विशिष्ट कानूनों को ढूंढ सकता है? (जैसे कि एक अव्यवस्थित निर्देश पुस्तिका में विशिष्ट नियम पुस्तिका का पृष्ठ ढूंढना)।
  • "यह किस बारे में है?" परीक्षण (कॉज़ कैटेगरी): क्या AI मामले को "चोरी", "परिवार" या "अनुबंध" जैसे 22 व्यापक विषयों में वर्गीकृत कर सकता है?

2. प्रतियोगी (AI मॉडल)

उन्होंने पांच अलग-अलग परिवारों (जैसे मिस्ट्रल, लामा और क्वेन) से 11 अलग-अलग AI मॉडल (छोटे, कुशल मॉडलों से लेकर विशाल, सुपर-स्मार्ट मॉडलों तक) का परीक्षण किया। उन्होंने इन परीक्षणों को दो तरीकों से चलाया:

  • जीरो-शॉट (Zero-Shot): AI को बिना किसी मदद के प्रश्न दिया जाता है।
  • फ्यू-शॉट (Few-Shot): AI को प्रश्न के साथ कुछ उदाहरण दिए जाते हैं कि समान प्रश्नों के उत्तर कैसे दिए जाएं (जैसे कि एक छात्र को वास्तविक परीक्षा से पहले अभ्यास प्रश्न पत्र देना)।

3. आश्चर्यजनक परिणाम

"ट्रिक क्वेश्चन" की सटीकता
शोधपत्र में एक बड़ी चेतावनी मिली: सटीकता (Accuracy) एक धोखेबाज हो सकती है।

  • उपमा: कल्पना कीजिए कि एक बहुविकल्पीय परीक्षा है जहाँ 60% उत्तर "A" हैं। एक रोबोट जो हर बार केवल "A" का अनुमान लगाता है, वह 60% सही होगा। यह अच्छा लगता है! लेकिन यह वास्तव में मूर्खतापूर्ण है क्योंकि उसने प्रश्नों को पढ़ा ही नहीं।
  • निष्कर्ष: एक बड़े AI मॉडल ने सबसे कठिन कार्य पर उच्चतम "सटीकता" प्राप्त की, लेकिन वह मुख्य रूप से सबसे आम परिणाम का अनुमान लगा रहा था। जब शोधकर्ताओं ने एक स्मार्ट मेट्रिक (मैक्रो-F1) का उपयोग किया जो यह जांचता है कि क्या AI ने दुर्लभ उत्तरों को भी सही पकड़ा, तो वही रोबोट बहुत खराब प्रदर्शन करता दिखा। "वास्तव में सर्वश्रेष्ठ" रोबोट ने कच्ची सटीकता (raw accuracy) पर कम स्कोर किया लेकिन वास्तव में मामलों को समझा।

"जादुई चीट शीट" (फ्यू-शॉट लर्निंग)
परीक्षण से पहले AI को उदाहरण देने से कुछ कार्यों के लिए चमत्कार हुआ लेकिन दूसरों के लिए नहीं।

  • उपमा: "यह किस तरह का कागज है?" परीक्षण के लिए, AI को कुछ उदाहरण दिखाने से ऐसा लगा जैसे उसे चीट शीट थमा दी गई हो। एक छोटा मॉडल केवल कुछ उदाहरण देखकर फेल होने से सीधे ए+ (A+) पर पहुँच गया।
  • ट्विस्ट: "क्या हुआ?" (तर्क/रीजनिंग) परीक्षण के लिए, चीट शीट ने ज्यादा मदद नहीं की। कभी-कभी इसने AI को भ्रमित भी कर दिया। यह साबित करता है कि आप यह मानकर नहीं चल सकते कि "अधिक उदाहरण = बेहतर परिणाम" हर कानूनी कार्य के लिए सही है।

आकार हमेशा मायने नहीं रखता
आमतौर पर, बड़े AI मॉडल अधिक स्मार्ट होते हैं। लेकिन यहाँ ऐसा नहीं है।

  • उपमा: एक छोटी, फुर्तीली रेस कार बनाम एक विशाल ट्रक के बारे में सोचें। एक सीधी हाईवे (मेल छाँटने जैसे सरल कार्यों) पर, छोटी कार ट्रक जितनी ही तेज थी। लेकिन एक ऊबड़-खाबड़, जटिल ऑफ-रोड ट्रैक (जटिल तर्क) पर, ट्रक को संभालने के लिए बहुत बड़ा होना पड़ा।
  • निष्कर्ष: एक छोटा 8-बिलियन पैरामीटर वाला मॉडल सरल कार्यों के लिए 675-बिलियन पैरामीटर वाले विशाल मॉडल के समान ही अच्छा था। हालांकि, कठिन तर्क कार्यों के लिए, बड़े मॉडलों ने आमतौर पर जीत हासिल की—लेकिन केवल तभी जब वे AI के सही "परिवार" से थे। कुछ परिवारों को काम करने के लिए बहुत बड़ा होना पड़ता था, जबकि अन्य छोटे होने पर भी स्मार्ट थे।

4. यूक्रेनी भाषा AI के लिए कठिन क्यों है?

शोधपत्र बताता है कि यूक्रेनी तीन मुख्य कारणों से कठिन है:

  1. वर्णमाला: यह सिरिलिक (Cyrillic) का उपयोग करती है, जिस पर कई AI अंग्रेजी की तुलना में उतना अच्छा प्रशिक्षण प्राप्त नहीं कर पाते हैं।
  2. व्याकरण: यूक्रेनी शब्दों के अंत बहुत बदलते हैं (जैसे "मैं जाता हूँ," "वह जाता है," "हम गए")। यह AI के आंतरिक "शब्द काउंटर" को भ्रमित कर देता है, जिससे इसे वाक्य पढ़ने के लिए अधिक कंप्यूटिंग शक्ति का उपयोग करना पड़ता है।
  3. प्रणाली: यूक्रेन एक "सिविल लॉ" प्रणाली (लिखित कोड पर आधारित) का उपयोग करता है, जबकि अधिकांश AI "कॉमन लॉ" (पिछले अदालती मामलों पर आधारित) पर प्रशिक्षित थे। यह एक ऐसे वकील को सिखाने जैसा है जो केवल पिछले उदाहरणों के आधार पर बहस करना जानता है, अचानक एक सख्त नियम पुस्तिका का पालन करना।

निचोड़

लेखकों ने यूक्रेनी कानून पर AI का परीक्षण करने का एक नया, अधिक निष्पक्ष तरीका बनाया। उन्होंने पाया कि:

  1. साधारण स्कोर पर भरोसा न करें: एक उच्च सटीकता स्कोर का मतलब केवल यह हो सकता है कि AI सबसे आम उत्तर का अनुमान लगा रहा है।
  2. उदाहरण मदद करते हैं, लेकिन हमेशा नहीं: उदाहरण दिखाना AI को दस्तावेज़ों के प्रकार पहचानने में मदद करता है, लेकिन यह जरूरी नहीं कि उसे एक बेहतर कानूनी विचारक बना दे।
  3. छोटा हमेशा कमजोर नहीं होता: कुछ कानूनी कार्यों के लिए, एक छोटा, सस्ता AI एक विशाल, महंगे AI के समान ही अच्छा है।

शोधकर्ताओं ने अपना सारा डेटा, परीक्षण और परिणाम सार्वजनिक कर दिए हैं ताकि अन्य लोग बेहतर, निष्पक्ष कानूनी AI उपकरण बना सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →