LegalBench-BR: A Benchmark for Evaluating Large Language Models on Brazilian Legal Decision Classification
यह शोध पत्र लीगलबेंच-बीआर (LegalBench-BR) को प्रस्तुत करता है, जो 3,105 एनोटेटेड अपीलीय कार्यवाहियों का उपयोग करके ब्राज़ीलियाई कानूनी निर्णय वर्गीकरण के लिए पहला सार्वजनिक बेंचमार्क है, जो यह प्रदर्शित करता है कि एक LoRA-फाइन-ट्यून किया गया BERT मॉडल सटीकता और डोमेन-विशिष्ट भेदभाव में अग्रणी वाणिज्यिक लार्ज लैंग्वेज मॉडल्स की तुलना में काफी बेहतर प्रदर्शन करता है और साथ ही सिविल लॉ के प्रति व्यवस्थित पूर्वाग्रहों को समाप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास ब्राजील के कानूनी दस्तावेजों का एक विशाल पुस्तकालय है, लेकिन वे सब एक विशाल, अराजक ढेर में मिले हुए हैं। वकीलों और न्यायाधीशों को इन दस्तावेजों को पांच विशिष्ट श्रेणियों में छांटना है: सिविल (Civil), कंज्यूमर (Consumer), टैक्स (Tax), एडमिनिस्ट्रेटिव (Administrative), और क्रिमिनल (Criminal)। इसे मैन्युअल रूप से करना धीमा और महंगा है। तो, सवाल यह है: क्या हम बस एक सुपर-स्मार्ट, सामान्य-उद्देश्य वाले AI (जैसे एक हाई-टेक लाइब्रेरियन) से इन्हें हमारे लिए छांटने के लिए कह सकते हैं?
यह शोध पत्र, LegalBench-BR, कहता है: "बिल्कुल नहीं। अभी नहीं।"
यहाँ बताया गया है कि उन्हें यह कैसे पता चला, इसे सरल भाषा में समझाया गया है।
1. समस्या: "जनरलिस्ट" बनाम "स्पेशलिस्ट"
शोधकर्ताओं ने परीक्षण करना चाहा कि क्या बड़े, प्रसिद्ध AI मॉडल (जैसे GPT-4o mini और Claude 3.5) ब्राजील के कानूनी मामलों को छांटने के लिए पर्याप्त अच्छे हैं। ये मॉडल जनरलिस्ट लाइब्रेरियन की तरह हैं: वे खाना बनाने की रेसिपी से लेकर क्वांटम फिजिक्स तक, हर चीज़ के बारे में थोड़ा-बहुत जानते हैं।
लेकिन ब्राजीलियाई कानून पेचीदा है। इसकी अपनी शब्दावली, विशिष्ट नियम और चीजों को व्यवस्थित करने का एक बहुत ही खास तरीका है। शोधकर्ताओं ने एक नया "टेस्ट" (बेंचमार्क) बनाया जिसमें सांता कैटरीना, ब्राजील के 3,105 वास्तविक अदालती मामले शामिल थे। उन्होंने सुनिश्चित किया कि टेस्ट निष्पक्ष हो, जिसके लिए उन्होंने AI को प्रत्येक पांच कानूनी श्रेणियों से समान संख्या में मामले दिए, ताकि AI केवल सबसे आम श्रेणी का अनुमान लगाकर उच्च स्कोर न प्राप्त कर सके।
2. दौड़: कौन जीता?
उन्होंने तीन प्रतियोगियों के बीच एक दौड़ आयोजित की:
- GPT-4o mini (महंगा, प्रसिद्ध क्लाउड AI)।
- Claude 3.5 Haiku (एक अन्य महंगा, प्रसिद्ध क्लाउड AI)।
- BERTimbau-LoRA (एक छोटा, कस्टम-ट्रेन्ड मॉडल जो एक मानक कंप्यूटर पर चलता है)।
परिणाम: कस्टम मॉडल ने एक बड़े अंतर से जीत हासिल की।
- कस्टम मॉडल: 87.6% सही रहा।
- प्रसिद्ध AI: केवल 60–65% सही रहे।
3. बड़ा आश्चर्य: "सिविल लॉ" का जाल
इस कहानी का सबसे दिलचस्प हिस्सा यह है कि प्रसिद्ध AI कैसे विफल हुए। उन्होंने केवल यादृच्छिक गलतियाँ नहीं कीं; वे एक विशिष्ट जाल में फंस गए जिसे "सिविल डिफॉल्ट बायस" (Civil Default Bias) कहा जाता है।
उपमा: कल्पना कीजिए कि एक मौसम विज्ञानी जो बारिश देखने का इतना आदी है कि, जब भी वह कोई बादल देखता है, तो बिना आसमान देखे ही चिल्लाने लगता है, "बारिश!"। भले ही वास्तव में बर्फबारी या धूप हो, वह जोर देकर कहता है कि यह बारिश है।
- क्या हुआ: जब प्रसिद्ध AI किसी मामले के बारे में अनिश्चित होते थे, तो वे "सिविल लॉ" (ब्राजील में सबसे आम प्रकार का मामला) का अनुमान लगाने लगते थे।
- तबाही: एडमिनिस्ट्रेटिव लॉ (सरकारी नौकरशाही से संबंधित) के मामलों के लिए, प्रसिद्ध AI 0% सही रहे। वे एक सरकारी टैक्स विवाद और एक नियमित सिविल मुकदमे के बीच अंतर नहीं कर सके।
- विजेता: कस्टम मॉडल, जिसने विशेष रूप से ब्राजीलियाई कानूनी ग्रंथों पर "अध्ययन" किया था, ने सूक्ष्म संकेतों (जैसे विशिष्ट न्यायालय के नाम या कानूनी शब्दावली) को सीख लिया था जो इन श्रेणियों को अलग करते हैं। इसने एडमिनिस्ट्रेटिव लॉ पर 91% सही परिणाम दिया।
4. कस्टम मॉडल क्यों जीता (द "LoRA" सीक्रेट)
आप सोच सकते हैं कि कस्टम मॉडल एक विशाल सुपर-कंप्यूटर है। ऐसा नहीं है। यह वास्तव में काफी छोटा और सस्ता है।
- उपमा: प्रसिद्ध AI को एक स्विस आर्मी नाइफ की तरह समझें। इसमें एक ब्लेड, एक स्क्रूड्राइवर और एक कॉर्कस्क्रू है। यह कई चीजों के लिए बेहतरीन है, लेकिन यदि आपको लकड़ी का एक विशिष्ट प्रकार काटना है, तो यह सबसे तेज उपकरण नहीं है।
- कस्टम मॉडल: यह उस स्विस आर्मी नाइफ को लेने और केवल एक विशिष्ट ब्लेड को तेज करने जैसा है (LoRA नामक तकनीक का उपयोग करके)।
- जादू: उन्होंने मॉडल के मस्तिष्क के केवल 0.3% हिस्से को बदला। यह एक सामान्य लाइब्रेरियन को केवल 30 मिनट के लिए ब्राजीलियाई कानूनी कोड पढ़ने के लिए सिखाने जैसा है। अचानक, वे एक कानूनी विशेषज्ञ बन जाते हैं।
- लागत: कस्टम मॉडल एक साधारण लैपटॉप (या यहाँ तक कि मुफ्त Google Colab GPU) पर चलता है और इसे चलाने की लागत $0 है। बड़े AI हर सवाल के लिए पैसे लेते हैं और जवाब देने में अधिक समय लेते हैं।
5. वास्तविक दुनिया के लिए यह क्यों मायने रखता है
यह केवल एक विज्ञान प्रयोग नहीं है; इसके वास्तविक परिणाम हैं।
- गोपनीयता: बड़े AI आपका डेटा क्लाउड (अमेरिका या अन्य देशों) में भेज देते हैं। ब्राजील में, कानून (LGPD) कहते हैं कि आप निजी कानूनी डेटा को तीसरे पक्ष को नहीं भेज सकते। कस्टम मॉडल आपके अपने कंप्यूटर पर डेटा को सुरक्षित रखता है।
- दक्षता: यदि कोई लॉ फर्म "सिविल डिफॉल्ट" AI का उपयोग करती है, तो वे एक सरकारी टैक्स मामले को गलत विभाग में भेज सकते हैं, जिससे देरी और भ्रम पैदा हो सकता है।
- सबक: आप विशेष कार्यों के लिए "एक ही आकार के सभी के लिए उपयुक्त" (one-size-fits-all) AI को केवल खरीद नहीं सकते। यदि आप ब्राजील में कानूनी दस्तावेजों को छांटना चाहते हैं, तो आपको एक ऐसा मॉडल चाहिए जिसने वास्तव में ब्राजीलियाई कानून का अध्ययन किया हो, न कि केवल एक ऐसा मॉडल जो अंग्रेजी और पुर्तकी भाषा के शब्दों को जानता हो।
सारांश
यह शोध पत्र सिद्ध करता है कि ब्राजीलियाई कानूनी मामलों को छांटने जैसे विशिष्ट कार्यों के लिए, एक छोटा, सस्ता, कस्टम-ट्रेन्ड मॉडल महंगे, सामान्य-उद्देश्य वाले दिग्गजों को हरा देता है। दिग्गज विवरणों को करीब से देखने के बजाय बहुत आलसी (या पक्षपाती) होते हैं, जबकि कस्टम मॉडल, जिसे विशेष रूप से काम के लिए प्रशिक्षित किया गया है, उन सुरागों को देख लेता है जिन्हें दूसरे मिस कर देते हैं।
निष्कर्ष: काम के लिए सबसे प्रसिद्ध उपकरण का उपयोग न करें; कभी-कभी, आपको विशिष्ट कार्य के लिए एक विशिष्ट उपकरण को तेज करने की आवश्यकता होती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।