LegalOne: A Family of Foundation Models for Reliable Legal Reasoning
यह शोध पत्र LegalOne को प्रस्तुत करता है, जो चीनी कानूनी फाउंडेशन मॉडलों का एक परिवार है, जो विश्वसनीय और व्याख्या योग्य न्यायिक तर्क को सक्षम करने के लिए प्लास्टिसिटी-एडजस्टेड सैंपलिंग (Plasticity-Adjusted Sampling), लीगल एजेंटिक CoT डिस्टिलेशन (Legal Agentic CoT Distillation), और करिकुलम रीइन्फोर्समेंट लर्निंग (Curriculum Reinforcement Learning) से युक्त एक तीन-चरणीय प्रशिक्षण पाइपलाइन के माध्यम से अत्याधुनिक प्रदर्शन प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ LegalOne पेपर का स्पष्टीकरण दिया गया है, जिसे जटिल तकनीकी अवधारणाओं को समझने में आसान बनाने के लिए रोजमर्रा की भाषा और उपमाओं (analogies) का उपयोग करके अनुवादित किया गया है।
बड़ी तस्वीर: हमें LegalOne की आवश्यकता क्यों है?
कल्पना कीजिए कि आपने एक प्रतिभाशाली, विद्वान सामान्यज्ञ (generalist) को वकील के रूप में काम पर रखा है। यह व्यक्ति (एक मानक लार्ज लैंग्वेज मॉडल) पुस्तकालय की लगभग हर किताब पढ़ चुका है। वह कविता लिख सकता है, गणित की समस्या हल कर सकता है और मौसम के बारे में बात कर सकता है। लेकिन जब आप उससे किसी विशिष्ट अदालती मामले पर बहस करने के लिए कहते हैं, तो वह अक्सर लड़खड़ा जाता है। वह ऐसे कानून बना सकता है जो अस्तित्व में ही नहीं हैं (hallucinate) या न्यायाधीश द्वारा आवश्यक सख्त, चरण-दर-चरण तर्क को भूल सकता है।
LegalOne एआई मॉडलों का एक नया परिवार है जिसे विशेष रूप से इसे ठीक करने के लिए डिज़ाइन किया गया है। इसे एक ऐसे "सामान्यज्ञ" के रूप में न देखें जो सब कुछ थोड़ा-थोड़ा जानता है, बल्कि एक विशेष कानून स्नातक (law school graduate) के रूप में देखें जिसे एक वकील की तरह सोचने के लिए कड़ाई से प्रशिक्षित किया गया है। पेपर का दावा है कि इन मॉडलों को अलग तरह से प्रशिक्षित करके, वे कानूनी कार्यों में विशाल, सामान्य एआई मॉडलों से बेहतर प्रदर्शन कर सकते हैं, भले ही वे बहुत छोटे और अधिक कुशल हों।
तीन-चरणीय प्रशिक्षण पाइपलाइन (Three-Step Training Pipeline)
शोधकर्ताओं ने केवल एआई को अधिक कानूनी किताबें नहीं खिलाईं। उन्होंने एक तीन-चरणीय प्रशिक्षण पाइपलाइन बनाई, जो एक रोबोट वकील के लिए एक विशेष शिक्षा कार्यक्रम की तरह है।
चरण 1: "मिड-ट्रेनिंग" चरण (नींव बनाना)
समस्या: यदि आप एक सामान्य एआई को लेते हैं और अचानक उसे केवल कानूनी दस्तावेज़ पढ़ने के लिए मजबूर करते हैं, तो वह सामान्य भाषा बोलने का तरीका भूल सकता है या वास्तविक दुनिया के बारें तर्क करने की अपनी क्षमता खो सकता है। इसे "कैटास्ट्रोफिक फॉरगेटिंग" (catastrophic forgetting) कहा जाता है।
समाधान: प्लास्टिसिटी-एडजस्टेड सैंपलिंग (PAS)
- उपमा: कल्पना कीजिए कि एक छात्र गणित में अच्छा है लेकिन उसे उन्नत भौतिकी (physics) सीखने की आवश्यकता है। यदि आप उसे सीधे जटिल समीकरणों से भरी किताब में डाल देंगे, तो वह घबरा सकता है और अपने गणित के मूल सिद्धांतों को भूल सकता है।
- LegalOne इसे कैसे करता है: शोधकर्ता PAS नामक एक स्मार्ट शेड्यूलर का उपयोग करते हैं। इसे एक ऐसे ट्यूटर के रूप में समझें जो छात्र के वर्तमान मूड और ऊर्जा के आधार पर होमवर्क की कठिनाई को समायोजित करता है।
- जब एआई "पुनः गर्म" (re-warming up) हो रहा होता है (नया प्रशिक्षण शुरू करता है), तो ट्यूटर उसे स्थिर रखने के लिए ज्यादातर परिचित, आसान कानूनी पाठ (कम "perplexity") देता है।
- जैसे-जैसे एआई मजबूत होता जाता है, ट्यूटर धीरे-धीरे कठिन, अधिक जटिल कानूनी पाठ पेश करता है।
- महत्वपूर्ण बात यह है कि ट्यूटर यह सुनिश्चित करने के लिए कि एआई अपने मूल कौशल को न भूले, हमेशा मिश्रण में थोड़ी मात्रा में "आसान" सामग्री रखता है।
- परिणाम: एआई अपनी सामान्य बुद्धिमत्ता को खोए बिना कानूनी ज्ञान की एक मजबूत, स्थिर नींव बनाता है।
चरण 2: सुपरवाइज्ड फाइन-ट्यूनिंग (वकील की तरह सोचना सीखना)
समस्या: वास्तविक कानूनी दस्तावेज़ (जैसे अदालती निर्णय) अक्सर सारांश के रूप में लिखे जाते हैं। वे बताते हैं कि न्यायाधीश ने क्या निर्णय लिया, लेकिन वे अक्सर उस प्रक्रिया को छोड़ देते हैं जिसका उपयोग न्यायाधीश वहां तक पहुँचने के लिए करते हैं। यदि आप केवल एआई को ये सारांश दिखाते हैं, तो वह तर्क को समझे बिना उत्तर का अनुमान लगाना सीख जाता है।
समाधान: लीगल एजेंटिक CoT डिस्टिलेशन (LEAD)
- उपमा: कल्पना कीजिए कि आप केवल अंतिम रेसिपी कार्ड पढ़कर खाना बनाना सीखने की कोशिश कर रहे हैं। आप जानते हैं कि सामग्री क्या है और व्यंजन क्या है, लेकिन आपको यह नहीं पता कि प्याज को कैसे काटना है या स्टेक को कब पलटना है।
- LegalOne इसे कैसे करता है: उन्होंने LEAD नामक एक प्रणाली बनाई है जो एक साथ काम करने वाली विशेषज्ञ शेफ (agents) की एक टीम की तरह कार्य करती है।
- केवल रेसिपी पढ़ने के बजाय, एआई एक "कुकिंग शो" देखता है जहाँ शेफ प्रक्रिया को तोड़ते हैं: "पहले, तथ्य खोजें। दूसरा, नियम खोजें। तीसरा, नियम लागू करें। अंत में, परिणाम तय करें।"
- एआई इन चरण-दर-चरण तर्क पथों (Chain-of-Thought) को खुद से उत्पन्न करना सीखता है, न कि केवल अंतिम उत्तर को याद करता है।
- उनके पास एक "गुणवत्ता नियंत्रण" चरण भी है जहाँ एक वरिष्ठ न्यायाधीश (एक अन्य एआई) यह जांचता है कि काम सटीक है या नहीं और तर्क सही है या नहीं, इससे पहले कि छात्र एआई इससे सीखे।
- परिणाम: एआई केवल उत्तरों को नहीं, बल्कि कानूनी तर्क की प्रक्रिया को सीखता है।
चरण 3: सुदृढीकरण लर्निंग (Reinforcement Learning - "कानूनी मानसिकता" का बूट कैंप)
समस्या: अच्छे तर्क के साथ भी, एक एआई बहुत अधिक शब्दों वाला, बहुत अस्पष्ट, या छोटे तार्किक अंतराल वाला हो सकता है। इसे अनुशासित होने की आवश्यकता है।
समाधान: मल्टी-स्टेज करिकुलम RL
- उपमा: इसे एआई के मस्तिष्क के लिए एक सैन्य बूट कैंप के रूप में सोचें। प्रशिक्षण आसान से शुरू होता है और कठिन होता जाता है, जिससे एआई को सटीक और कुशल होने की शिक्षा मिलती है।
- स्तर 1 (याद करना): एआई को कानूनों को पूरी तरह से कंठस्थ करना होगा। कोई अनुमान नहीं।
- स्तर 2 (अनुप्रयोग): एआई को उन कानूनों को विशिष्ट तथ्यों पर लागू करना होगा।
- स्तर 3 (जटिल तर्क): एआई को कठिन, बहु-चरणीय मामलों को हल करना होगा।
- पुरस्कार प्रणाली (Reward System): एआई को सटीक और तार्किक होने के लिए "अंक" (पुरस्कार) मिलते हैं। यदि वह भ्रमित (hallucinate) होता है या विषय से भटक जाता है, तो उसके अंक कट जाते हैं।
- परिणाम: एआई एक "पैटर्न मैचर" (समान शब्दों के आधार पर अनुमान लगाने वाला) से विकसित होकर एक स्वायत्त तर्ककर्ता (autonomous reasoner) बन जाता है जो संक्षिप्त, पेशेवर और विश्वसनीय कानूनी तर्क प्रस्तुत करता है।
परिणाम: छोटा लेकिन शक्तिशाली
पेपर एक आश्चर्यजनक निष्कर्ष प्रस्तुत करता है: आकार ही सब कुछ नहीं है।
- उपमा: आमतौर पर, एआई में, बड़ा होना बेहतर होता है (जैसे एक विशाल पुस्तकालय बनाम एक छोटी बुकशेल्फ़)। लेकिन LegalOne एक अत्यधिक विशिष्ट, संक्षिप्त कानूनी विश्वकोश की तरह है।
- दावा: LegalOne-8B मॉडल (जिसमें 8 बिलियन पैरामीटर हैं) कानूनी परीक्षणों पर विशाल सामान्य-उद्देश्य वाले मॉडलों (जैसे GPT-4o या सैकड़ों अरबों पैरामीटर वाले मॉडल) के बराबर या उनसे बेहतर प्रदर्शन करता है।
- दक्षता: यह इस "श्रेष्ठता" को विशाल होने से नहीं, बल्कि उच्च "ज्ञान घनत्व" (knowledge density) के माध्यम से प्राप्त करता है। यह जानता है कि कानून के लिए उसे बिल्कुल क्या जानने की आवश्यकता है, बिना किसी फालतू जानकारी के।
उन्होंने क्या जारी किया
दूसरों की मदद करने के लिए, टीम ने केवल रहस्य को गुप्त नहीं रखा। उन्होंने जारी किया:
- LegalOne Weights: वास्तविक प्रशिक्षित मॉडल ताकि अन्य लोग उनका उपयोग कर सकें।
- LegalKit: एक टूलकिट (एक मानकीकृत परीक्षण की तरह) यह मापने के लिए कि अन्य एआई मॉडल कानूनी क्षेत्र में कैसा प्रदर्शन करते हैं।
सारांश
LegalOne एआई मॉडलों का एक परिवार है जो साबित करता है कि एक महान वकील बनने के लिए आपको "विशाल" मस्तिष्क की आवश्यकता नहीं है। एक स्मार्ट तीन-चरणीय प्रशिक्षण प्रक्रिया (नींव को स्थिर करना, चरण-दर-चरण तर्क सिखाना और सटीकता के लिए अभ्यास कराना) का उपयोग करके, उन्होंने एक ऐसा मॉडल बनाया है जो एक कानूनी पेशेवर की तरह सोचता है, तर्क करता है और बहस करता है, और अदालत में बहुत बड़े सामान्य एआई मॉडलों से बेहतर प्रदर्शन करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।