Legal: Enhancing Legal Reasoning in LLMs via Reinforcement Learning with Chain-of-Thought Guided Information Gain
Legal एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो DeepSeek-R1 से ज्ञान आसवन (knowledge distillation) और एक बहुआयामी पुरस्कार तंत्र का उपयोग करके, प्रत्यक्ष उत्तरों और चेन-ऑफ-थॉट तर्क के बीच सूचना लाभ को अधिकतम करके, LLMs में कानूनी तर्क की सटीकता और व्याख्यात्मकता को बढ़ाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
समस्या: "तेज़-सोचने वाला" वकील
कल्पना कीजिए कि आप एक अदालत में हैं। एक न्यायाधीश एक नए कानून के बारे में एक जटिल प्रश्न पूछता है। तर्क समझाने के बजाय, वकील बस चिल्लाकर कहता है, "दोषी!" या "निर्दोष!"
हालाँकि उत्तर सही हो सकता है, लेकिन न्यायाधीश नाखुश है। क्यों? क्योंकि वहाँ कोई तर्क नहीं दिया गया था। वहाँ कोई "क्यों" या "कैसे" नहीं था। AI की दुनिया में, इसे "फास्ट-थिंकिंग" (तेज़-सोचना) कहा जाता है। लार्ज लैंग्वेज मॉडल्स (LLMs) अक्सर कुशल होने के लिए सीधे उत्तर पर कूद जाते हैं, लेकिन कानून की दुनिया में, तर्क की प्रक्रिया अंतिम निर्णय जितनी ही महत्वपूर्ण है। यदि एक AI अपना काम (तर्क) दिखा नहीं सकता, तो हम उस पर भरोसा नहीं कर सकते।
समाधान: Legal∆ (एक "गहन-सोचने वाला" कोच)
शोधकर्ताओं ने Legal∆ बनाया है, जो AI को प्रशिक्षित करने का एक नया तरीका है ताकि वह जल्दबाजी करना बंद करे और गहराई से सोचना शुरू करे।
Legal∆ को एक पाठ्यपुस्तक के रूप में नहीं, बल्कि एक अत्यधिक विशिष्ट डिबेट कोच (वाद-विवाद प्रशिक्षक) के रूप में समझें। AI को केवल यह बताने के बजाय कि "यह उत्तर सही है," कोच एक विशेष विधि का उपयोग करता है ताकि AI को उसके तर्क की गुणवत्ता के लिए पुरस्कृत किया जा सके।
यह कैसे काम करता है: "आहा!" क्षण (सूचना लाभ/Information Gain)
यही इस शोध पत्र का गुप्त सूत्र है। शोधकर्ता इन्फॉर्मेशन गेन (सूचना लाभ) की अवधारणा का उपयोग करते हैं।
कल्पना कीजिए कि आप एक रहस्य सुलझाने की कोशिश कर रहे हैं।
- परिदृश्य A: आप तुरंत अनुमान लगाते हैं कि हत्यारा बटलर है। आपके पास कोई सुराग नहीं है। आपका "आत्मविश्वास" केवल एक भाग्यशाली अनुमान है।
- परिदृश्य B: आपको एक खून से सना दस्ताना, एक टूटी हुई खिड़की और एक संदिग्ध नोट मिलता है। जैसे-जैसे आप इन सबको जोड़ते हैं, आपकी निश्चितता बढ़ती जाती है। आपने केवल उत्तर प्राप्त नहीं किया; सुरागों ने स्वयं उत्तर को अकाट्य बना दिया।
Legal∆ AI को उस "आहा!" क्षण की तलाश करने के लिए प्रशिक्षित करता है।
शोधकर्ता AI के दो संस्करणों की तुलना करते हैं:
- AI जो सीधे उत्तर देने की कोशिश करता है ("अंतर्ज्ञान/Gut Feeling")।
- AI जो चेन-ऑफ-थॉट (Chain-of-Thought) का उपयोग करता है ("चरण-दर-चरण तर्क")।
"कोच" (पुरस्कार प्रणाली) इन दोनों के बीच के अंतर को देखता है। यदि चरण-दर-चरण तर्क AI को उत्तर के बारे में काफी अधिक आत्मविश्वासी और सटीक बनाता है, तो कोच AI को एक बड़ा "गोल्ड स्टार" (उच्च पुरस्कार) देता है।
यदि तर्क केवल "बनावटी" है—यानी AI बिना किसी नई स्पष्टता के केवल खुद को दोहरा रहा है—तो कोच उसे कम पुरस्कार देता है। यह AI को नकली तर्क "हैलुसिनेट" करने से रोकने और कानूनी नियमों एवं तथ्यों के बीच वास्तविक, सार्थक संबंध बनाने के लिए मजबूर करता है।
परिणाम: एक स्मार्ट कानूनी मस्तिष्क
जब उन्होंने विभिन्न AI मॉडलों पर इस "कोच" का परीक्षण किया, तो परिणाम प्रभावशाली थे:
- बेहतर सटीकता: AI ने न केवल अधिक उत्तर सही दिए; इसने कठिन उत्तर भी सही दिए (जैसे सजा का अनुमान लगाना या जटिल मामलों का विश्लेषण करना)।
- बेहतर फोकस: AI ने "लीगल टोकन्स"—उन विशिष्ट, प्रभावशाली कानूनी शब्दों पर अधिक ध्यान देना शुरू किया जो वास्तव में एक मामले में मायने रखते हैं।
- बेहतर सामान्यीकरण (Generalization): यहाँ तक कि जब AI को ऐसी कानूनी समस्याएँ दी गईं जो उसने पहले नहीं देखी थीं, तब भी वह घबराया नहीं। क्योंकि उसने केवल उत्तर याद रखना नहीं, बल्कि तर्क करना सीखा था, इसलिए वह नई चुनौतियों को संभाल सका।
संक्षेप में
Legal∆ एक AI को उस छात्र से बदल देता है जो उत्तर रटता है, एक ऐसे छात्र में जो तर्क को समझता है। यह यह सुनिश्चित करने के लिए एक गणितीय "पुरस्कार" का उपयोग करता है कि AI के तर्क का प्रत्येक चरण वास्तव में मूल्य जोड़ता है, जिससे AI एक अधिक विश्वसनीय, भरोसेमंद और "गहन-सोचने वाला" कानूनी सहायक बनता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।