← नवीनतम पेपर
💬 NLP

LegalOne: A Family of Foundation Models for Reliable Legal Reasoning

यह शोध पत्र LegalOne को प्रस्तुत करता है, जो चीनी कानूनी फाउंडेशन मॉडलों का एक परिवार है, जो विश्वसनीय और व्याख्या योग्य न्यायिक तर्क को सक्षम करने के लिए प्लास्टिसिटी-एडजस्टेड सैंपलिंग (Plasticity-Adjusted Sampling), लीगल एजेंटिक CoT डिस्टिलेशन (Legal Agentic CoT Distillation), और करिकुलम रीइन्फोर्समेंट लर्निंग (Curriculum Reinforcement Learning) से युक्त एक तीन-चरणीय प्रशिक्षण पाइपलाइन के माध्यम से अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Haitao Li, Yifan Chen, Shuo Miao, Qian Dong, Jia Chen, Yiran Hu, Junjie Chen, Minghao Qin, Yueyue Wu, Yujia Zhou, Qingyao Ai, Yiqun Liu, Cheng Luo, Quan Zhou, Ya Zhang, Jikun Hu

प्रकाशित 2026-02-04
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haitao Li, Yifan Chen, Shuo Miao, Qian Dong, Jia Chen, Yiran Hu, Junjie Chen, Minghao Qin, Yueyue Wu, Yujia Zhou, Qingyao Ai, Yiqun Liu, Cheng Luo, Quan Zhou, Ya Zhang, Jikun Hu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ LegalOne पेपर का स्पष्टीकरण दिया गया है, जिसे जटिल तकनीकी अवधारणाओं को समझने में आसान बनाने के लिए रोजमर्रा की भाषा और उपमाओं (analogies) का उपयोग करके अनुवादित किया गया है।

बड़ी तस्वीर: हमें LegalOne की आवश्यकता क्यों है?

कल्पना कीजिए कि आपने एक प्रतिभाशाली, विद्वान सामान्यज्ञ (generalist) को वकील के रूप में काम पर रखा है। यह व्यक्ति (एक मानक लार्ज लैंग्वेज मॉडल) पुस्तकालय की लगभग हर किताब पढ़ चुका है। वह कविता लिख सकता है, गणित की समस्या हल कर सकता है और मौसम के बारे में बात कर सकता है। लेकिन जब आप उससे किसी विशिष्ट अदालती मामले पर बहस करने के लिए कहते हैं, तो वह अक्सर लड़खड़ा जाता है। वह ऐसे कानून बना सकता है जो अस्तित्व में ही नहीं हैं (hallucinate) या न्यायाधीश द्वारा आवश्यक सख्त, चरण-दर-चरण तर्क को भूल सकता है।

LegalOne एआई मॉडलों का एक नया परिवार है जिसे विशेष रूप से इसे ठीक करने के लिए डिज़ाइन किया गया है। इसे एक ऐसे "सामान्यज्ञ" के रूप में न देखें जो सब कुछ थोड़ा-थोड़ा जानता है, बल्कि एक विशेष कानून स्नातक (law school graduate) के रूप में देखें जिसे एक वकील की तरह सोचने के लिए कड़ाई से प्रशिक्षित किया गया है। पेपर का दावा है कि इन मॉडलों को अलग तरह से प्रशिक्षित करके, वे कानूनी कार्यों में विशाल, सामान्य एआई मॉडलों से बेहतर प्रदर्शन कर सकते हैं, भले ही वे बहुत छोटे और अधिक कुशल हों।


तीन-चरणीय प्रशिक्षण पाइपलाइन (Three-Step Training Pipeline)

शोधकर्ताओं ने केवल एआई को अधिक कानूनी किताबें नहीं खिलाईं। उन्होंने एक तीन-चरणीय प्रशिक्षण पाइपलाइन बनाई, जो एक रोबोट वकील के लिए एक विशेष शिक्षा कार्यक्रम की तरह है।

चरण 1: "मिड-ट्रेनिंग" चरण (नींव बनाना)

समस्या: यदि आप एक सामान्य एआई को लेते हैं और अचानक उसे केवल कानूनी दस्तावेज़ पढ़ने के लिए मजबूर करते हैं, तो वह सामान्य भाषा बोलने का तरीका भूल सकता है या वास्तविक दुनिया के बारें तर्क करने की अपनी क्षमता खो सकता है। इसे "कैटास्ट्रोफिक फॉरगेटिंग" (catastrophic forgetting) कहा जाता है।

समाधान: प्लास्टिसिटी-एडजस्टेड सैंपलिंग (PAS)

  • उपमा: कल्पना कीजिए कि एक छात्र गणित में अच्छा है लेकिन उसे उन्नत भौतिकी (physics) सीखने की आवश्यकता है। यदि आप उसे सीधे जटिल समीकरणों से भरी किताब में डाल देंगे, तो वह घबरा सकता है और अपने गणित के मूल सिद्धांतों को भूल सकता है।
  • LegalOne इसे कैसे करता है: शोधकर्ता PAS नामक एक स्मार्ट शेड्यूलर का उपयोग करते हैं। इसे एक ऐसे ट्यूटर के रूप में समझें जो छात्र के वर्तमान मूड और ऊर्जा के आधार पर होमवर्क की कठिनाई को समायोजित करता है
    • जब एआई "पुनः गर्म" (re-warming up) हो रहा होता है (नया प्रशिक्षण शुरू करता है), तो ट्यूटर उसे स्थिर रखने के लिए ज्यादातर परिचित, आसान कानूनी पाठ (कम "perplexity") देता है।
    • जैसे-जैसे एआई मजबूत होता जाता है, ट्यूटर धीरे-धीरे कठिन, अधिक जटिल कानूनी पाठ पेश करता है।
    • महत्वपूर्ण बात यह है कि ट्यूटर यह सुनिश्चित करने के लिए कि एआई अपने मूल कौशल को न भूले, हमेशा मिश्रण में थोड़ी मात्रा में "आसान" सामग्री रखता है।
  • परिणाम: एआई अपनी सामान्य बुद्धिमत्ता को खोए बिना कानूनी ज्ञान की एक मजबूत, स्थिर नींव बनाता है।

चरण 2: सुपरवाइज्ड फाइन-ट्यूनिंग (वकील की तरह सोचना सीखना)

समस्या: वास्तविक कानूनी दस्तावेज़ (जैसे अदालती निर्णय) अक्सर सारांश के रूप में लिखे जाते हैं। वे बताते हैं कि न्यायाधीश ने क्या निर्णय लिया, लेकिन वे अक्सर उस प्रक्रिया को छोड़ देते हैं जिसका उपयोग न्यायाधीश वहां तक पहुँचने के लिए करते हैं। यदि आप केवल एआई को ये सारांश दिखाते हैं, तो वह तर्क को समझे बिना उत्तर का अनुमान लगाना सीख जाता है।

समाधान: लीगल एजेंटिक CoT डिस्टिलेशन (LEAD)

  • उपमा: कल्पना कीजिए कि आप केवल अंतिम रेसिपी कार्ड पढ़कर खाना बनाना सीखने की कोशिश कर रहे हैं। आप जानते हैं कि सामग्री क्या है और व्यंजन क्या है, लेकिन आपको यह नहीं पता कि प्याज को कैसे काटना है या स्टेक को कब पलटना है।
  • LegalOne इसे कैसे करता है: उन्होंने LEAD नामक एक प्रणाली बनाई है जो एक साथ काम करने वाली विशेषज्ञ शेफ (agents) की एक टीम की तरह कार्य करती है।
    • केवल रेसिपी पढ़ने के बजाय, एआई एक "कुकिंग शो" देखता है जहाँ शेफ प्रक्रिया को तोड़ते हैं: "पहले, तथ्य खोजें। दूसरा, नियम खोजें। तीसरा, नियम लागू करें। अंत में, परिणाम तय करें।"
    • एआई इन चरण-दर-चरण तर्क पथों (Chain-of-Thought) को खुद से उत्पन्न करना सीखता है, न कि केवल अंतिम उत्तर को याद करता है।
    • उनके पास एक "गुणवत्ता नियंत्रण" चरण भी है जहाँ एक वरिष्ठ न्यायाधीश (एक अन्य एआई) यह जांचता है कि काम सटीक है या नहीं और तर्क सही है या नहीं, इससे पहले कि छात्र एआई इससे सीखे।
  • परिणाम: एआई केवल उत्तरों को नहीं, बल्कि कानूनी तर्क की प्रक्रिया को सीखता है।

चरण 3: सुदृढीकरण लर्निंग (Reinforcement Learning - "कानूनी मानसिकता" का बूट कैंप)

समस्या: अच्छे तर्क के साथ भी, एक एआई बहुत अधिक शब्दों वाला, बहुत अस्पष्ट, या छोटे तार्किक अंतराल वाला हो सकता है। इसे अनुशासित होने की आवश्यकता है।

समाधान: मल्टी-स्टेज करिकुलम RL

  • उपमा: इसे एआई के मस्तिष्क के लिए एक सैन्य बूट कैंप के रूप में सोचें। प्रशिक्षण आसान से शुरू होता है और कठिन होता जाता है, जिससे एआई को सटीक और कुशल होने की शिक्षा मिलती है।
    • स्तर 1 (याद करना): एआई को कानूनों को पूरी तरह से कंठस्थ करना होगा। कोई अनुमान नहीं।
    • स्तर 2 (अनुप्रयोग): एआई को उन कानूनों को विशिष्ट तथ्यों पर लागू करना होगा।
    • स्तर 3 (जटिल तर्क): एआई को कठिन, बहु-चरणीय मामलों को हल करना होगा।
  • पुरस्कार प्रणाली (Reward System): एआई को सटीक और तार्किक होने के लिए "अंक" (पुरस्कार) मिलते हैं। यदि वह भ्रमित (hallucinate) होता है या विषय से भटक जाता है, तो उसके अंक कट जाते हैं।
  • परिणाम: एआई एक "पैटर्न मैचर" (समान शब्दों के आधार पर अनुमान लगाने वाला) से विकसित होकर एक स्वायत्त तर्ककर्ता (autonomous reasoner) बन जाता है जो संक्षिप्त, पेशेवर और विश्वसनीय कानूनी तर्क प्रस्तुत करता है।

परिणाम: छोटा लेकिन शक्तिशाली

पेपर एक आश्चर्यजनक निष्कर्ष प्रस्तुत करता है: आकार ही सब कुछ नहीं है।

  • उपमा: आमतौर पर, एआई में, बड़ा होना बेहतर होता है (जैसे एक विशाल पुस्तकालय बनाम एक छोटी बुकशेल्फ़)। लेकिन LegalOne एक अत्यधिक विशिष्ट, संक्षिप्त कानूनी विश्वकोश की तरह है।
  • दावा: LegalOne-8B मॉडल (जिसमें 8 बिलियन पैरामीटर हैं) कानूनी परीक्षणों पर विशाल सामान्य-उद्देश्य वाले मॉडलों (जैसे GPT-4o या सैकड़ों अरबों पैरामीटर वाले मॉडल) के बराबर या उनसे बेहतर प्रदर्शन करता है।
  • दक्षता: यह इस "श्रेष्ठता" को विशाल होने से नहीं, बल्कि उच्च "ज्ञान घनत्व" (knowledge density) के माध्यम से प्राप्त करता है। यह जानता है कि कानून के लिए उसे बिल्कुल क्या जानने की आवश्यकता है, बिना किसी फालतू जानकारी के।

उन्होंने क्या जारी किया

दूसरों की मदद करने के लिए, टीम ने केवल रहस्य को गुप्त नहीं रखा। उन्होंने जारी किया:

  1. LegalOne Weights: वास्तविक प्रशिक्षित मॉडल ताकि अन्य लोग उनका उपयोग कर सकें।
  2. LegalKit: एक टूलकिट (एक मानकीकृत परीक्षण की तरह) यह मापने के लिए कि अन्य एआई मॉडल कानूनी क्षेत्र में कैसा प्रदर्शन करते हैं।

सारांश

LegalOne एआई मॉडलों का एक परिवार है जो साबित करता है कि एक महान वकील बनने के लिए आपको "विशाल" मस्तिष्क की आवश्यकता नहीं है। एक स्मार्ट तीन-चरणीय प्रशिक्षण प्रक्रिया (नींव को स्थिर करना, चरण-दर-चरण तर्क सिखाना और सटीकता के लिए अभ्यास कराना) का उपयोग करके, उन्होंने एक ऐसा मॉडल बनाया है जो एक कानूनी पेशेवर की तरह सोचता है, तर्क करता है और बहस करता है, और अदालत में बहुत बड़े सामान्य एआई मॉडलों से बेहतर प्रदर्शन करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →