Multi-Legal-Bench: Evaluating LLMs on Legal Reasoning Across Jurisdictions, Languages, and Legal Traditions
यह शोध पत्र मल्टी-लीगल-बेंच (Multi-Legal-Bench) का परिचय देता है, जो छह देशों और चार भाषा परिवारों में कानूनी तर्क का मूल्यांकन करने वाला पहला क्रॉस-ज्यूरिसडिक्शनल (विभिन्न क्षेत्राधिकारों वाला) बेंचमार्क है, जो यह प्रकट करता है कि कार्य प्रदर्शन क्षेत्राधिकार के अनुसार काफी भिन्न होता है और लेबल-सेट संरेखण (label-set alignment), भाषा की निकटता या टोकेनाइज़र दक्षता के बजाय, क्रॉस-लिंगुअल फ्यू-शॉट ट्रांसफर की सफलता का प्राथमिक भविष्यवक्ता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप यह परीक्षण करने की कोशिश कर रहे हैं कि नए, अत्यंत बुद्धिमान छात्रों (लार्ज लैंग्वेज मॉडल्स या LLMs) का कानून की समझ कितनी अच्छी है।
अतीत में, शोधकर्ताओं ने केवल एक देश (आमतौर पर अमेरिका या यूके) और एक भाषा (अंग्रेजी) में इन छात्रों का परीक्षण किया था। यह न्यूयॉर्क में छात्रों को गणित का टेस्ट देने और यह मान लेने जैसा था कि उनके परिणाम टोक्यो में गणित के टेस्ट में कैसे होंगे। लेकिन कानून हर जगह अलग होते हैं, और भाषाएँ भी अलग होती हैं, इसलिए यह धारणा त्रुटिपूर्ण थी।
यह शोध पत्र Multi-Legal-Bench पेश करता है, जो एक नया "ग्लोबल रिपोर्ट कार्ड" है जिसे इस समस्या को ठीक करने के लिए डिज़ाइन किया गया है। यह कैसे काम करता है, इसके लिए सरल उपमाओं (analogies) का उपयोग किया गया है:
1. "वही टेस्ट, अलग क्लासरूम" का विचार
शोधकर्ताओं ने एक ऐसा बेंचमार्क बनाया जहाँ प्रश्न बिल्कुल वही हैं, लेकिन क्लासरूम अलग हैं।
- छात्र: उन्होंने 11 अलग-अलग AI मॉडल्स का परीक्षण किया (कुछ बहुत बड़े, कुछ छोटे)।
- क्लासरूम: उन्होंने 6 देश चुने: यूक्रेन, फ्रांस, नीदरलैंड, पोलैंड, चेक गणराज्य और लिथुआनिया।
- विषय: उन्होंने AI को निबंध लिखने के लिए नहीं कहा। उन्होंने उन्हें वास्तविक अदालती दस्तावेजों पर आधारित 5 विशिष्ट, तार्किक कार्य दिए:
- कोर्ट-टाइप क्लासिफिकेशन (न्यायालय प्रकार वर्गीकरण): "क्या यह एक आपराधिक मामला है या नागरिक मामला?" (जैसे मेल को "जंक" बनाम "बिल" में छाँटना)।
- जजमेंट फॉर्म क्लासिफिकेशन (निर्णय रूप वर्गीकरण): "क्या यह अंतिम फैसला है या केवल एक अस्थायी आदेश?" (जैसे "फाइनल एग्जाम" और "पॉप क्विज़" के बीच अंतर करना)।
- केस-आउटकम प्रेडिक्शन (मामले के परिणाम का पूर्वानुमान): "तथ्यों के आधार पर, कौन जीतता है?" (सबसे कठिन हिस्सा, जैसे शतरंज का खेल खत्म होने से पहले विजेता का अनुमान लगाना)।
- लीगल नॉर्म एक्सट्रैक्शन (कानूनी मानदंड निष्कर्षण): "इस पाठ में उद्धृत विशिष्ट कानूनों को खोजें।" (जैसे एक पैराग्राफ में सभी लाल शब्दों को खोजना)।
- कॉज़ कैटेगरी प्रेडिक्शन (कारण श्रेणी पूर्वानुमान): "यह मामला किस बारे में है? टैक्स? परिवार? अनुबंध?" (जैसे किताबों को उनकी शैली/genre के आधार पर छाँटना)।
2. "स्पार्स मैप" (Sparse Map) की वास्तविकता
शोधकर्ताओं ने यह अनिवार्य नहीं किया कि हर देश के पास हर कार्य के लिए डेटा हो। वे वास्तविक दुनिया की अव्यवस्था के प्रति ईमानदार थे।
- उपमा: एक शहर के मानचित्र की कल्पना करें जहाँ कुछ सड़कों पर ट्रैफिक लाइटें हैं और कुछ पर नहीं। उन्होंने उन सड़कों के लिए नकली ट्रैफिक लाइटें नहीं बनाईं जहाँ वे मौजूद नहीं थीं। उन्होंने बस यह मैप किया कि डेटा वास्तव में कहाँ मौजूद है। इसके परिणामस्वरूप एक "स्पार्स" ग्रिड (कुछ बॉक्स भरे हुए, कुछ खाली) प्राप्त हुआ, जो वास्तव में अधिक ईमानदारी से बताता है कि विभिन्न देशों में कानूनी डेटा कैसे संग्रहीत किया जाता है।
3. बड़ी सरप्राइज (जो उन्हें मिला)
A. "एक आकार सबके लिए उपयुक्त नहीं होता" (One Size Does Not Fit All)
कानून के लिए कोई "सर्वश्रेष्ठ AI" नहीं है।
- उपमा: AI मॉडल्स को अलग-अलग प्रकार की कारों के रूप में सोचें। एक कार रेस ट्रैक (फ्रांसीसी कानून) पर सबसे तेज़ हो सकती है, लेकिन कीचड़ भरे मैदान (पोलिश कानून) में बहुत खराब हो सकती है। दूसरी कार कीचड़ में अच्छी हो सकती है लेकिन ट्रैक पर धीमी हो सकती है।
- परिणाम: एक मॉडल जो फ्रांस में नंबर 1 है, वह पोलैंड में आखिरी हो सकता है। आप केवल "सबसे स्मार्ट" मॉडल नहीं चुन सकते; आपको विशिष्ट देश और कार्य के लिए सही मॉडल चुनना होगा।
B. "भाषा परिवार" का मिथक (The Language Family Myth)
शोधकर्ताओं को लगा था कि जो भाषाएँ "रिश्तेदार" हैं (जैसे यूक्रेनी और पोलिश, दोनों स्लाविक हैं), उनके बीच AI ज्ञान को आसानी से ट्रांसफर कर पाएगा।
- उपमा: उन्हें उम्मीद थी कि यदि आपने एक छात्र को यूक्रेनी में सिखाया, तो वह पोलिश में समान टेस्ट को आसानी से समझ लेगा।
- परिणाम: वे गलत थे। AI वास्तव में पोलिश की तुलना में यूक्रेनी से फ्रेंच (एक दूर के रिश्तेदार) में ज्ञान ट्रांसफर करने में बेहतर प्रदर्शन करता था।
- क्यों? यह भाषा के बारे में नहीं था; यह लेबल (labels) के बारे में था। यदि "उत्तर कुंजी" (वे श्रेणियां जिन्हें AI को चुनना है) समान दिखती थी, तो AI अच्छा प्रदर्शन करता था, भले ही भाषाएं पूरी तरह से अलग हों। यदि उत्तर कुंजियाँ अस्त-व्यस्त और अलग थीं, तो AI संघर्ष करता था, भले ही भाषाएं समान हों।
C. "हिंट" का प्रभाव (Few-Shot Learning)
उन्होंने परीक्षण किया कि टेस्ट से पहले AI को कुछ उदाहरण (हिंट) देने से मदद मिलती है या नहीं।
- परिणाम: यह कार्य पर निर्भर करता है।
- दस्तावेजों को छाँटने के लिए (जजमेंट फॉर्म), उदाहरण देना एक छात्र को चीट शीट देने जैसा था—इससे हर जगह मदद मिली।
- मामले में कौन जीतता है, इसका पूर्वानुमान लगाने के लिए, उदाहरण देना एक सिक्के के उछाल (coin toss) जैसा था। कभी मदद मिली, कभी AI भ्रमित हो गया।
- सरल छँटाई (कोर्ट टाइप) के लिए, AI पहले से ही इतना अच्छा था कि उसे हिंट की आवश्यकता नहीं थी।
D. "वर्ड काउंट" का जाल (The Word Count Trap)
उन्होंने "टोकनाइज़र फर्टिलिटी" (Tokenizer Fertility) का अध्ययन किया, जो मूल रूप से यह है कि एक मॉडल को एक शब्द को कितने छोटे टुकड़ों (टोकन) में तोड़ने की आवश्यकता होती है।
- उपमा: कल्पना करें कि एक छात्र एक शब्द को 2 अक्षरों में लिखता है और दूसरा 10 अक्षरों में। आप सोच सकते हैं कि 10 अक्षरों में लिखने वाला छात्र अक्षम है।
- परिणाम: उन्होंने पाया कि एक मॉडल शब्द को तोड़ने में कितना "कुशल" है, यह पूर्वानुमान नहीं लगाता कि वह वास्तविक कानूनी कार्यों में कितना स्मार्ट है। एक मॉडल जो शब्द लिखने के लिए अधिक "अक्षरों" का उपयोग करता है, वह अभी भी उतने ही सटीक कार्य कर सकता है जितना कि कम अक्षरों वाला मॉडल। "दक्षता" (efficiency) मीट्रिक यह अनुमान लगाने के लिए अच्छा है कि टेस्ट की लागत कितनी होगी, लेकिन यह इस बात का बुरा अनुमान है कि मॉडल वास्तव में कैसा प्रदर्शन करेगा।
4. निचोड़ (The Bottom Line)
यह शोध पत्र कानून के लिए AI का उपयोग करने वाले किसी भी व्यक्ति के लिए एक चेतावनी है: यह न मानें कि जो एक देश में काम करता है वह दूसरे में भी काम करेगा।
- यदि आप फ्रांस के लिए कानूनी AI बना रहे हैं, तो यह न मानें कि यह पोलैंड में भी काम करेगा क्योंकि वे दोनों यूरोप में हैं।
- यदि आप देखते हैं कि कोई मॉडल शब्दों के साथ "कुशल" है, तो यह न मानें कि वह कानूनी समस्याओं को हल करने में सर्वश्रेष्ठ है।
- यह जानने का एकमात्र तरीका कि क्या कोई AI आपके विशिष्ट कानूनी तंत्र के लिए अच्छा है, उसे आपके विशिष्ट डेटा और आपके विशिष्ट नियमों के साथ टेस्ट करना है।
शोधकर्ताओं ने अपना सारा डेटा, प्रश्न और परिणाम सार्वजनिक कर दिए हैं, ताकि कोई भी यह देख सके कि कौन सा AI उनके विशिष्ट कानूनी क्षेत्र के लिए सबसे अच्छा काम करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।