GreekBarRetrieval: A Benchmark for Greek Statutory Retrieval
यह शोधपत्र GreekBarRetrieval प्रस्तुत करता है, जो बार-परीक्षा के प्रश्नों से व्युत्पन्न ग्रीक वैधानिक पुनर्प्राप्ति (statutory retrieval) के लिए एक नया बेंचमार्क है, और यह प्रदर्शित करता है कि दस-चरणों वाला LLM-आधारित क्वेरी पुनर्गठन लूप (query reformulation loop) BM25 के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है, जिससे यह वैनिला डेंस रिट्रीवर्स और अन्य उन्नत पुनर्प्राप्ति रणनीतियों दोनों को पछाड़ने में सक्षम हो जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कानून की दुनिया में, किसी विशिष्ट स्थिति पर लागू होने वाले सही नियम को खोजना न्याय की नींव है। जब किसी वकील या न्यायाधीश को किसी अपराध या अनुबंध के बारे में जटिल प्रश्न का उत्तर देने की आवश्यकता होती है, तो वे केवल स्मृति पर भरोसा नहीं कर सकते; उन्हें कानून के उस सटीक पाठ (टेक्स्ट) को खोजना होगा जो उस स्थिति को नियंत्रित करता है। यह प्रक्रिया, जिसे वैधानिक पुनर्प्राप्ति (statutory retrieval) कहा जाता है, इसमें हजारों कानूनी लेखों में से उन कुछ को खोजने के लिए खोज की जाती है जो वास्तव में प्रासंगिक हैं। चुनौती यह है कि लोग वास्तविक जीवन की घटनाओं को साधारण, रोजमर्रा की भाषा में वर्णित करते हैं, जबकि उन्हें नियंत्रित करने वाले कानून एक विशेष, अमूर्त कोड के रूप में लिखे जाते हैं। एक व्यक्ति कह सकता है, "उसने दवा देने से मना कर दिया," लेकिन कानून उसी अवधारणा को "कर्तव्य निभाने में चूक" (omission of a duty to act) के रूप में प्रस्तुत कर सकता है। मानवों के बोलने के तरीके और कानूनों के लिखे जाने के तरीके के बीच इस अंतर को पाटना कठिन है, विशेष रूप से ग्रीक जैसी भाषाओं के लिए, जिनमें जटिल शब्द संरचनाएं होती हैं जो सरल शब्द-मिलान (word-matching) को अविश्वसनीय बना देती हैं। इन कानूनी ग्रंथों को सटीक रूप से पुनर्प्राप्त करने की क्षमता के बिना, आर्टिफिशियल इंटेलिजेंस सिस्टम भरोसेमंद उत्तर प्रदान नहीं कर सकते या अपने तर्क की व्याख्या नहीं कर सकते, जो कानूनी परिवेश में एक महत्वपूर्ण आवश्यकता है।
ग्रीस के शोधकर्ताओं ने एक नया परीक्षण आधार बनाकर इस समस्या का समाधान किया है जिसे 'GreekBarRetrieval' कहा गया है। उन्होंने इस बेंचमार्क का निर्माण वास्तविक ग्रीक बार परीक्षाओं के प्रश्नों का उपयोग करके किया है, जो वे कठोर परीक्षाएं हैं जिन्हें वकील अभ्यास करने के लिए पास करने चाहिए। इन परीक्षाओं में, उम्मीदवारों को एक कानूनी मामले की विस्तृत कहानी प्रस्तुत की जाती है और उनसे पूछा जाता है कि दंड संहिता या अन्य कानूनों के कौन से विशिष्ट अनुच्छेद लागू होते हैं। शोधकर्ताओं ने इन परीक्षा प्रश्नों में से 283 प्रश्न, उनके पीछे की पूरी कहानियों के साथ, और 6,308 उम्मीदवार कानूनी लेखों के एक विशाल पुस्तकालय के साथ जोड़े। लक्ष्य यह देखना था कि क्या कंप्यूटर सिस्टम एक प्रश्न और उसकी कहानी को देख सकता है, और फिर उस बड़े पुस्तकालय के भीतर छिपे सही कानूनी अनुच्छेदों को सफलतापूर्वक खोज सकता है। यह सेटअप अद्वितीय है क्योंकि यह सिस्टम की क्षमता का परीक्षण करता है कि वह उत्तर लिखने का प्रयास करने से पहले ही स्रोत सामग्री को खोजने में कितना सक्षम है, जिससे खोजने के कौशल को तर्क करने के कौशल से अलग किया जा सके।
जब शोधकर्ताओं ने पहली बार मानक कंप्यूटर खोज विधियों का परीक्षण किया, तो परिणामों ने दो अलग-अलग दृष्टिकोणों के बीच एक स्पष्ट विभाजन दिखाया। एक दृष्टिकोण, जिसे 'स्पार्स रिट्रीवल' (sparse retrieval) कहा जाता है, प्रश्न और कानूनी पाठ के बीच सटीक शब्द मिलान खोजने का काम करता है। दूसरा, जिसे 'डेंस रिट्रीवल' (dense retrieval) कहा जाता है, शब्दों के पीछे के अर्थ को समझने के लिए उन्नत एआई का उपयोग करता है, भले ही शब्दावली अलग हो। अपने प्रारंभिक परीक्षणों में, अर्थ-आधारित प्रणालियों ने बहुत बेहतर प्रदर्शन किया, और लगभग 77 प्रतिशत समय शीर्ष सौ परिणामों में प्रासंगिक लेखों को सफलतापूर्वक खोज लिया। इसके विपरीत, शब्द-मिलान करने वाली प्रणालियाँ केवल लगभग 36 प्रतिशत समय सफल हुईं। इसने पुष्टि की कि जब प्रश्न की भाषा और कानून की भाषा इतनी भिन्न हो, तो केवल शब्दों का मिलान करना अक्सर पर्याप्त नहीं होता है।
हालाँकि, शोधकर्ताओं ने पाया कि कंप्यूटर द्वारा उत्तरों की खोज करने से पहले एक लार्ज लैंग्वेज मॉडल का उपयोग करके खोज प्रश्नों को फिर से लिखने से शब्द-मिलान प्रणालियों के प्रदर्शन में नाटकीय रूप से सुधार किया जा सकता है। मूल, अव्यवस्थित कहानी के साथ खोजने के बजाय, जिसमें अप्रासंगिक विवरण भरे होते हैं, एआई को प्रश्न को कानून की सटीक, औपचारिक भाषा में अनुवाद करने के लिए कहा गया, जिससे कथात्मक अनावश्यकता (narrative fluff) को हटा दिया गया। प्रश्न को पुनर्गठित करने के इस सरल कदम ने शब्द-मिलान प्रणाली की सफलता दर को 36 प्रतिशत से बढ़ाकर 60 प्रतिशत कर दिया, जिससे जटिल अर्थ-आधारित प्रणालियों के साथ का अंतर काफी हद तक कम हो गया। अध्ययन में पाया गया कि प्रश्न को फिर से लिखने की यह विधि, अन्य सामान्य युक्तियों, जैसे कि ग्रीक पाठ को पहले अंग्रेजी में अनुवाद करने या खोज इंजन की आंतरिक सेटिंग्स को बदलने की तुलना में कहीं अधिक प्रभावी थी।
प्रदर्शन को और आगे बढ़ाने के लिए, टीम ने एक ऐसी विधि पेश की जहाँ कंप्यूटर खोज करता है, जो उसने पाया उसकी समीक्षा करता है, और फिर उन परिणामों के आधार पर फिर से खोज करता है। यह पुनरावृत्ति प्रक्रिया (iterative process), जो इस तरह नकल करती है जैसे एक मानव वकील कुछ प्रारंभिक दस्तावेजों को पढ़ने के बाद अपनी खोज रणनीति को परिष्कृत करता है, शब्द-मिलान प्रणाली को 67 प्रतिशत की सफलता दर तक पहुँचने की अनुमति देती है। हालाँकि यह सर्वश्रेष्ठ अर्थ-आधारित प्रणाली को पार नहीं कर सका, जिसने 73 प्रतिशत तक पहुँच प्राप्त की थी, लेकिन इसने परिणामों की एक बहुत अधिक व्यवस्थित सूची बनाई, जिससे सबसे महत्वपूर्ण लेख सूची में सबसे ऊपर आ गए। यह विशेष रूप से मूल्यवान है क्योंकि कानूनी प्रणालियों को अक्सर सीमित संख्या में दस्तावेजों के साथ काम करने की आवश्यकता होती है। शोधकर्ताओं ने यह भी नोट किया कि इस पुनरावृत्ति दृष्टिकोण के साथ एक भारी कीमत आती है: इसके लिए कंप्यूटर को बहुत अधिक गणनाएँ करनी पड़ती हैं और एकल, प्रत्यक्ष खोज की तुलना में इसे पूरा करने में काफी अधिक समय लगता है।
अध्ययन निष्कर्ष निकालता है कि जबकि अर्थ समझने वाली उन्नत एआई प्रणालियाँ शक्तिशाली हैं, वे एकमात्र मार्ग नहीं हैं। लार्ज लैंग्वेज मॉडल का उपयोग करके रोजमर्रा के प्रश्नों को कानून की औपचारिक भाषा में अनुवाद करके, सरल और तेज़ खोज उपकरण भी अत्यधिक प्रभावी हो सकते हैं। यह सुझाव देता है कि बेहतर कानूनी एआई की कुंजी केवल बड़े मॉडल बनाना नहीं है, बल्कि यह सुनिश्चित करना है कि पूछे गए प्रश्न स्पष्ट हों और उनमें सही शब्दावली का उपयोग किया गया हो। शोधकर्ताओं ने अपने डेटा और कोड को सार्वजनिक कर दिया है, जो इस बात का एक नया मानक प्रदान करता है कि कंप्यूटर ग्रीक कानून के जटिल परिदृश्य को कितनी अच्छी तरह नेविगेट कर सकते हैं, और अन्य भाषाओं में भी कानूनी खोज उपकरणों को सुधारने के लिए एक ब्लूप्रिंट प्रदान करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।