A Two-Stage Architecture for NDA Analysis: LLM-based Segmentation and Transformer-based Clause Classification
यह शोधपत्र एक दो-चरणीय आर्किटेक्चर का प्रस्ताव करता है जो NDA विभाजन के लिए LLaMA-3.1-8B-Instruct और क्लॉज वर्गीकरण के लिए एक फाइन-ट्यून्ड Legal-Roberta-Large को जोड़ता है, जिससे जटिल गैर-प्रकटीकरण समझौतों (Non-Disclosure Agreements) के विश्लेषण को स्वचालित करने के लिए उच्च सटीकता (ROUGE F1 0.95 और भारित F1 0.85) प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक वकील हैं, लेकिन एक दिन में केवल एक अनुबंध (contract) की समीक्षा करने के बजाय, आप नॉन-डिस्क्लोजर एग्रीमेंट्स (NDAs) के समुद्र में डूब रहे हैं। ये वे कानूनी "हाथ मिलाने" (handshakes) हैं जो कंपनियाँ एक-दूसरे को यह वादा करने के लिए करती हैं कि वे एक-दूसरे के रहस्य उजागर नहीं करेंगी।
समस्या क्या है? हर कंपनी इन समझौतों को अलग तरह से लिखती है। कुछ छोटे और सरल होते हैं; अन्य बिना किसी स्पष्ट संरचना के, घने और भ्रमित करने वाले कानूनी शब्दों से भरे 50 पन्नों के होते हैं। इन्हें मैन्युअल रूप से पढ़ना धीमा, उबाऊ और गलतियों की संभावना वाला काम है। आप एक छोटा सा क्लॉज (clause) भी मिस कर सकते हैं जिसमें लिखा हो, "ओह, वैसे, अब आपके विचार हमारे हैं," जो पैराग्राफ 42 में कहीं दबा हुआ है।
यह शोध पत्र आपके लिए भारी काम करने के लिए एक दो-चरणीय रोबोट टीम का प्रस्ताव देता है। इसे एक उच्च-तकनीकी असेंबली लाइन की तरह समझें।
🏗️ दो-चरणीय असेंबली लाइन
यह प्रणाली एक रिले रेस की तरह बनाई गई है जिसमें दो धावक हैं: द सेगमेंटर (The Segmenter) और द क्लासिफायर (The Classifier)।
चरण 1: द सेगमेंटर (द "बुक बाइंडर")
समस्या: एक NDA संगमरमर के एक विशाल, बिना कटे ब्लॉक की तरह है। यह टेक्स्ट का एक बड़ा हिस्सा है। आप इसका विश्लेषण तब तक नहीं कर सकते जब तक आप इसे प्रबंधनीय टुकड़ों (clauses) में न काट लें। लेकिन कानूनी टेक्स्ट अव्यवस्थित होता है; कभी कोई क्लॉज एक वाक्य होता है, कभी तीन पैराग्राफ, और कभी फॉर्मेटिंग एक दुःस्वप्न होती है।
समाधान: टीम एक बहुत ही स्मार्ट AI का उपयोग करती है जिसे LLaMA कहा जाता है (इसे एक बहुत ही विद्वान, तेज़ पढ़ने वाले लाइब्रेरियन के रूप में सोचें)।
- यह कैसे काम करता है: आप पूरे NDA को लाइब्रेरियन को देते हैं। लाइब्रेरियन पूरी चीज़ पढ़ता है और कहता है, "ठीक है, यह क्लॉज 1 है, यह क्लॉज 2 है, यह क्लॉज 3 है..."
- जादुई ट्रिक: शोधकर्ताओं ने इस लाइब्रेरियन को अजीब फॉर्मेटिंग (जैसे अजीब कॉलम या टेबल) को अनदेखा करने और शुद्ध अर्थ पर ध्यान केंद्रित करने के लिए प्रशिक्षित किया ताकि यह पता चल सके कि एक विचार कहाँ समाप्त होता है और अगला कहाँ शुरू होता है।
- परिणाम: यह अविश्वसनीय रूप से सटीक है। यदि मूल दस्तावेज़ में 100 क्लॉज थे, तो रोबोट ने उनमें से 95 को पूरी तरह से खोज लिया और महत्वपूर्ण विवरणों को मिस नहीं किया। यह एक मास्टर शेफ द्वारा ब्रेड के लोफ को इतनी सटीकता से काटने जैसा है कि हर स्लाइस बिल्कुल सही आकार की है, भले ही लोफ का आकार अजीब रहा हो।
चरण 2: द क्लासिफायर (द "लेबलिंग एक्सपर्ट")
समस्या: अब जब आपके पास व्यक्तिगत क्लॉज हैं, तो आपको यह जानने की आवश्यकता है कि वे किस प्रकार के क्लॉज हैं। क्या यह "गोपनीयता" (Confidentiality) का क्लॉज है? "शासी कानून" (Governing Law) का क्लॉज है? "नियम तोड़ने पर किसे निकाला जाएगा" वाला क्लॉज है?
समाधान: टीम एक विशेष AI का उपयोग करती है जिसे Legal-Roberta कहा जाता है (इसे एक कानूनी विद्वान के रूप में सोचें जिसने हजारों अनुबंध पढ़े हैं और उनके पैटर्न को याद कर लिया है)।
- यह कैसे काम करता है: सेगमेंटर कटे हुए क्लॉज को स्कॉलर (Scholar) को सौंप देता है। स्कॉलर एक क्लॉज को पढ़ता है और चिल्लाकर कहता है, "यह एक गोपनीयता क्लॉज है!" या "यह एक समाप्ति (Termination) क्लॉज है!"
- चुनौती: कुछ क्लॉज पेचीदा होते हैं। एक पैराग्राफ में "गोपनीयता" और "दायित्व" (Liability) दोनों के बारे में हो सकता है। यह एक मल्टी-लेबल समस्या है (जैसे एक गाना जो "रॉक" और "जैज़" दोनों है)। साथ ही, कुछ प्रकार के क्लॉज दुर्लभ होते हैं (जैसे "प्रतिस्पर्धा अधिकार"), जिससे रोबोट के लिए सीखना कठिन हो जाता है।
- परिणाम: स्कॉलर सामान्य क्लॉज को पहचानने में बहुत अच्छा है (कुल मिलाकर लगभग 85% सटीकता के साथ)। यह एक अनुभवी जासूस की तरह है जो तुरंत सबसे आम प्रकार के सुरागों को पहचान सकता है, भले ही वह कभी-कभी दुर्लभ, अस्पष्ट क्लॉज को मिस कर दे।
🧪 उन्होंने इसका परीक्षण कैसे किया?
शोधकर्ताओं ने केवल अनुमान नहीं लगाया; उन्होंने इस प्रणाली को एक कठोर परीक्षा से गुजाराया।
- डेटासेट: उन्होंने वास्तविक दुनिया के 322 NDAs का उपयोग किया जो एक सार्वजनिक डेटाबेस से लिए गए थे। ये विभिन्न कंपनियों के वास्तविक, अव्यवस्थित दस्तावेज़ थे, न कि केवल साफ-सुथरे, आदर्श उदाहरण।
- "हे स्टैक में सुई" (Needle in a Haystack) की जांच: यह सुनिश्चित करने के लिए कि सेगमेंटर ने केवल सही संख्या में क्लॉज का अनुमान नहीं लगाया बल्कि वास्तव में सही टेक्स्ट प्राप्त किया, उन्होंने एक विशेष गणितीय एल्गोरिदम (Needleman-Wunsch) का उपयोग किया। कल्पना कीजिए कि आप कहानी के दो थोड़े अलग संस्करणों को मिलाने की कोशिश कर रहे हैं; यह एल्गोरिदम उन्हें शब्द-दर-शब्द संरेखित करता है ताकि देखा जा सके कि वे कितने मेल खाते हैं।
- स्कोर:
- सेगमेंटेशन: रोबोट ने 95% स्कोर प्राप्त किया। इसने दस्तावेज़ों को लगभग पूरी तरह से काटा।
- वर्गीकरण (Classification): इसने सबसे सामान्य क्लॉज पर 85% स्कोर प्राप्त किया। यह अभी भी पूर्ण नहीं है (क्योंकि कानूनी भाषा पेचीदा है और कुछ क्लॉज दुर्लभ हैं), लेकिन यह वकीलों के घंटों के काम को बचाने के लिए पर्याप्त है।
🚀 यह क्यों मायने रखता है?
वर्तमान में, वकील इन दस्तावेजों को पढ़ने में घंटों बिताते हैं, स्क्रीन को घूरते हुए, इस उम्मीद में कि वे किसी छिपे हुए जाल को मिस न कर दें।
- पहले: एक वकील 30 पन्नों का NDA पढ़ता है, स्क्रीन को सिकोड़कर देखता है, और उम्मीद करता है कि वह किसी छिपे हुए खतरे को न छोड़ दे।
- बाद में: रोबोट सेकंडों में 30 पन्ने पढ़ लेता है, उन्हें काट देता है, और वकील को एक व्यवस्थित सूची सौंप देता है: "यहाँ 14 क्लॉज हैं। क्लॉज 3 पैसे के बारे में है, क्लॉज 7 गोपनीयता के बारे में है, और क्लॉज 12 आईपी (IP) के स्वामित्व के बारे में है। आपको बस इन तीन की दोबारा जाँच करनी है।"
🔮 आगे क्या है?
लेखक स्वीकार करते हैं कि यह प्रणाली अभी पूर्ण नहीं है। यह दुर्लभ, अजीब क्लॉज के साथ थोड़ा संघर्ष करती है क्योंकि उन्हें सिखाने के लिए पर्याप्त उदाहरण नहीं थे।
- भविष्य की योजना: वे चाहते हैं कि रोबोट न केवल क्लॉज को खोजे और लेबल करे, बल्कि उन्हें पुनर्लेखन (rewrite) भी करे। एक ऐसे रोबोट की कल्पना करें जो कहता है, "हे, यह क्लॉज बहुत अस्पष्ट है। यहाँ एक बेहतर, सुरक्षित संस्करण है।"
संक्षेप में: यह शोध पत्र एक स्मार्ट सहायक बनाता है जो कानूनी कागजी कार्रवाई के अराजक ढेर को एक साफ, व्यवस्थित और लेबल की गई फाइल में बदल देता है, जिससे मानव वकील उबाऊ पढ़ने के बजाय बड़े निर्णयों पर ध्यान केंद्रित कर पाते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।