Retrieval Augmented Generation Framework for the Nepali Legal Domain Question Answering
यह अध्ययन नेपाली कानूनी प्रश्नोत्तर के लिए पहले रिट्रीवल ऑगमेंटेड जनरेशन (Retrieval Augmented Generation) फ्रेमवर्क को प्रस्तुत करता है, जो उच्च परिशुद्धता और सत्यता स्कोर प्राप्त करने के लिए नेपाल कानून पत्रिका संग्रह का लाभ उठाता है, जिससे कम-संसाधन वाले कानूनी डोमेन में डेटा की कमी की चुनौतियों का समाधान होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि नेपाल की कानूनी प्रणाली एक विशाल, प्राचीन पुस्तकालय है। इस पुस्तकालय में हजारों अदालती निर्णय (केस लॉ) हैं जो नेपाली भाषा में लिखे गए हैं। हालाँकि, यहाँ दो बड़ी समस्याएँ हैं:
- किताबें अस्त-व्यस्त हैं: वे पुराने ढंग की भाषा में लिखी गई हैं, अलग-अलग जगहों पर बिखरी हुई हैं, और उनमें से सभी को ठीक से डिजिटल नहीं किया गया है।
- लाइब्रेरियन नया है: आर्टिफिशियल इंटेलिजेंस (AI) मॉडल आमतौर पर अंग्रेजी की किताबों पर प्रशिक्षित होते हैं। जब आप उनसे नेपाली कानून के बारे में पूछते हैं, तो वे अक्सर भ्रमित हो जाते हैं या अपनी ओर से बातें बनाने लगते हैं क्योंकि उन्होंने नेपाली कानूनी ग्रंथों को सीखने के लिए पर्याप्त रूप से "पढ़ा" नहीं है।
यह शोध पत्र RAG (रिट्रीवल-ऑगमेंटेड जनरेशन) नामक एक प्रणाली का उपयोग करके इसे ठीक करने का एक नया तरीका पेश करता है। RAG को एक ऐसे छात्र के रूप में न देखें जो पाठ्यपुस्तक को याद करने की कोशिश कर रहा है, बल्कि एक स्मार्ट रिसर्च असिस्टेंट के रूप में देखें जिसे बोलने से पहले लाइब्रेरी में उत्तर खोजने की अनुमति है।
यहाँ बताया गया है कि शोधकर्ताओं ने इस सहायक को कैसे बनाया और परीक्षण किया:
1. पुस्तकालय (डेटा)
टीम ने नेपाल सर्वोच्च न्यायालय के आधिकारिक डिजिटल आर्काइव (नेपाल कानून पत्रिका) का रुख किया। उन्होंने 10,320 कानूनी दस्तावेजों को स्क्रैप और साफ किया।
- चुनौती: वे इन विशाल दस्तावेजों को सीधे AI को नहीं दे सकते थे। यह एक 500 पन्नों की किताब को एक बार में पूरा पढ़ने के बजाय उसमें एक विशिष्ट वाक्य खोजने जैसा है।
- समाधान: उन्होंने दस्तावेजों को छोटे "चंक्स" (जैसे एक लंबी कहानी को छोटे अनुच्छेदों में काटना) में विभाजित किया ताकि AI उन्हें बेहतर तरीके से संभाल सके।
2. सर्च इंजन (सही पन्ना ढूँढना)
AI के उत्तर देने से पहले, उसे पुस्तकालय में सही पन्ना ढूँढना होगा। शोधकर्ताओं ने खोजने के दो अलग-अलग तरीकों का परीक्षण किया:
विधि A: "कीवर्ड हंटर" (BM25)
- यह कैसे काम करता है: यह एक पारंपरिक लाइब्रेरियन की तरह है जो सटीक शब्दों की तलाश करता है। यदि आप पूछते हैं, "चोरी के लिए दंड क्या है?", तो लाइब्रेरियन "दंड", "चोरी" और "कानून" जैसे सटीक शब्दों को स्कैन करता है।
- परिणाम: यह विधि विजेता रही। इसने छोटे चंक्स देखते समय 91% बार और पूरे दस्तावेज़ देखते समय 88% बार सही दस्तावेज़ खोजा। यह बहुत सटीक था क्योंकि कानूनी भाषा अक्सर बहुत विशिष्ट और दोहराव वाली होती है।
विधि B: "मीनिंग मैचर" (डेंस रिट्रीवल)
- यह कैसे काम करता है: यह एक ऐसे लाइब्रेरियन की तरह है जो प्रश्न के 'वाइब' या 'अर्थ' को समझता है, भले ही शब्द अलग हों। यह उन्नत गणित (एम्बेडिंग्स) का उपयोग करता है यह अनुमान लगाने के लिए कि "चोरी करना" और "चोरी" एक ही बात है।
- परिणाम: यह विधि अच्छी थी, लेकिन इस विशिष्ट कार्य के लिए बहुत अच्छी नहीं थी। इसने केवल 75% बार सही दस्तावेज़ खोजा। शोधकर्ताओं ने पाया कि नेपाली कानून के लिए, अर्थ का अनुमान लगाने के बजाय सटीक शब्द मिलान (exact word matching) बेहतर काम करता है, क्योंकि कानूनी शब्द बहुत कठोर होते हैं।
स्पीड ट्रैप (गति का जाल):
"कीवर्ड हंटर" (BM25) की एक कमी थी। जब उन्होंने सटीकता बढ़ाने के लिए दस्तावेजों को बहुत छोटे टुकड़ों में बांटा, तो खोज प्रक्रिया बहुत धीमी हो गई (जैसे 10,000 किताबों के बजाय 1,10,000 छोटी इंडेक्स कार्ड्स के माध्यम से खोजना)। सिस्टम को उपयोगी रूप से तेज़ बनाए रखने के लिए, उन्होंने कीवर्ड हंटर का "पूरा दस्तावेज़" (Whole Document) संस्करण चुना। यह थोड़ा कम सटीक था लेकिन बहुत तेज़ था।
3. उत्तर लेखक (रिस्पॉन्स जेनरेट करना)
एक बार जब सिस्टम ने सही दस्तावेज़ ढूँढ लिया, तो उसे उत्तर लिखना था।
- नियम: AI को कड़ाई से निर्देश दिया गया था: "अपनी ओर से कुछ भी न बनाएं।"
- रणनीति: शोधकर्ताओं ने दो-चरणीय प्रक्रिया का उपयोग किया। पहले, AI को उस सटीक वाक्य की ओर इशारा करना था जो उत्तर को सिद्ध करता है। दूसरा, उसे केवल उसी वाक्य के आधार पर उत्तर लिखना था। यदि उसे कोई प्रमाण नहीं मिलता, तो उसे अनुमान लगाने के बजाय यह कहने के लिए कहा गया था कि, "मुझे नहीं पता।"
4. परिणाम (क्या यह काम आया?)
टीम ने इस सिस्टम का परीक्षण कानूनी विशेषज्ञों द्वारा लिखे गए 100 प्रश्नों के साथ किया। यहाँ सबसे अच्छा संस्करण (कीवर्ड हंटर + पूरे दस्तावेज़) कैसा रहा:
- सफलता दर: इसने 92% प्रश्नों के लिए सफलतापूर्वक उत्तर तैयार किया।
- सत्यता: जब दूसरे AI और मानव वकीलों द्वारा जांचा गया, तो उत्तर 85% सत्यनिष्ठ (यानी उन्होंने तथ्य नहीं गढ़े) थे।
- ग्राउंडेडनेस (आधारितता): 74% उत्तर सीधे पुस्तकालय में मिले टेक्स्ट द्वारा समर्थित थे।
निष्कर्ष
यह शोध पत्र यह सिद्ध करता है कि नेपाली जैसी कम संसाधन वाली भाषा के लिए, आपको सब कुछ याद रखने वाले सुपर-स्मार्ट AI की आवश्यकता नहीं है। इसके बजाय, आपको एक विश्वसनीय खोज उपकरण की आवश्यकता है जो सटीक कानूनी पाठ खोज सके और एक कठोर AI की आवश्यकता है जो तब तक बोलने से इनकार कर दे जब तक कि उसके सामने टेक्स्ट मौजूद न हो।
एक सरल, तेज़ खोज पद्धति (BM25) को एक सावधानीपूर्ण लेखन प्रक्रिया के साथ जोड़कर, उन्होंने पहला ऐसा सिस्टम बनाया है जो बिना तथ्य गढ़े नेपाली में कानूनी प्रश्नों के उत्तर विश्वसनीय रूप से दे सकता है। यह एक ऐसी नींव है जो अंततः आम लोगों को बिना कानून की डिग्री के अपने कानूनी अधिकारों को समझने में मदद कर सकती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।