← नवीनतम पेपर
💬 NLP

Annotated Surrogate Retrieval for Polish Statutory Law

यह शोध पत्र पोलिश वैधानिक कानून के लिए तीन पुनर्प्राप्ति विधियों को प्रस्तुत और मूल्यांकित करता है जो भाषा-मॉडल-जनित दस्तावेज़ सरोगेट्स का उपयोग करते हैं, यह प्रदर्शित करते हुए कि ASCR-H कैस्केड पुनर्रैंकिंग (reranking) के साथ कानूनी परीक्षा प्रश्नों में शीर्ष-रैंक सटीकता में मौजूदा बेसलाइन से काफी बेहतर प्रदर्शन करता है, जबकि एक अधिक लागत-कुशल विकल्प (DTF) काफी कम विलंबता और लागत के साथ रैंकिंग के शीर्ष पर तुलनीय प्रदर्शन प्राप्त करता है।

मूल लेखक: Orkun Yiğit Cengiz

प्रकाशित 2026-09-01✓ Author reviewed
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Orkun Yiğit Cengiz

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

किसी राष्ट्र के कानूनों की विशाल लाइब्रेरी में, एक विशिष्ट कानूनी प्रश्न का उत्तर देने वाले एकल अनुच्छेद को खोजना अत्यधिक सटीकता का कार्य है। कल्पना कीजिए कि एक ऐसी लाइब्रेरी है जिसमें अस्सी हजार से अधिक अलग-अलग अनुच्छेद हैं, जिनमें से प्रत्येक एक विशाल कानूनी पहेली का एक छोटा सा हिस्सा है। जब कोई वकील या छात्र कोई प्रश्न पूछता है, तो उत्तर कोई सामान्य सारांश या संबंधित विचारों का संग्रह नहीं होता; यह कानून का एक विशिष्ट वाक्य होता है जो उस टेक्स्ट के ढेर में कहीं छिपा होता है। यदि एक कंप्यूटर सिस्टम सही अनुच्छेद को खोज लेता है लेकिन उसे सुझावों की सूची में दसवें स्थान पर रखता है, तो शीर्ष परिणामों को स्कैन करने वाला मानव पाठक उसे पूरी तरह से मिस कर सकता है, जिससे वह खोज बेकार हो जाती है। यह वैधानिक खोज (statutory retrieval) की मुख्य चुनौती है: सिस्टम को न केवल सही दस्तावेज़ खोजना चाहिए, बल्कि उसे सूची में सबसे ऊपर भी रखना चाहिए। यह समस्या भाषा की प्रकृति के कारण और भी कठिन हो जाती है। पोलिश भाषा में, शब्द वाक्य में अपनी भूमिका के आधार पर अपना रूप बदलते हैं, जिसका अर्थ है कि एक प्रश्न और उसका कानूनी उत्तर एक ही अर्थ साझा कर सकते हैं लेकिन सतह पर पूरी तरह से अलग दिख सकते हैं।

शोधकर्ताओं ने पोलिश कानून के लिए इस विशिष्ट समस्या को हल करने के लिए तीन अलग-अलग रणनीतियों का परीक्षण किया ताकि कंप्यूटर को सही कानूनी अनुच्छेद खोजने में मदद मिल सके। उन्होंने अपना परीक्षण पोलिश कानूनी प्रशिक्षुओं की 2024 और 2025 की प्रवेश परीक्षाओं के वास्तविक प्रश्नों पर आधारित किया। ये उच्च-दांव वाले प्रश्न हैं जहाँ सही उत्तर कानून का एक एकल अनुच्छेद होता है। टीम ने एक ऐसा सिस्टम बनाया जो न केवल कानूनों के कच्चे टेक्स्ट (raw text) को पढ़ता है बल्कि प्रत्येक अनुच्छेद के साथ एक "सरोगेट" (surrogate) भी जोड़ता है। इस सरोगेट को हर एक कानून अनुच्छेद के लिए एक स्मार्ट सहायक द्वारा लिखे गए सहायक नोट्स के एक सेट के रूप में समझें। इन नोट्स में एक सारांश, विषयों की एक सूची और उन काल्पनिक प्रश्नों का एक सेट शामिल है जिनका उत्तर वह अनुच्छेद दे सकता है। जब कोई उपयोगकर्ता प्रश्न पूछता है, तो कंप्यूटर इन पूर्व-लिखित नोट्स के विरुद्ध मिलान कर सकता है, जो अक्सर उस अंतर को पाट देते हैं जो एक व्यक्ति के पूछने के तरीके और कानून के लिखे जाने के तरीके के बीच होता है।

अध्ययन ने इन नोट्स का उपयोग करने के तीन अलग-अलग दृष्टिकोणों का परीक्षण किया। पहला दृष्टिकोण, जिसे शोधकर्ता ASCR-H कहते हैं, एक सावधान संपादक की तरह कार्य करता है। यह पहले नोट्स का उपयोग करके सबसे आशाजनक कानूनों तक खोज को सीमित करता है, फिर अन्य संभावनाओं को खोजने के लिए एक 'डेंस सर्च' विधि का उपयोग करता है, और अंत में, शीर्ष उम्मीदवारों को फिर से रैंक करने के लिए एक शक्तिशाली भाषा मॉडल का उपयोग करता है। यह विधि धीमी और महंगी है क्योंकि यह कंप्यूटर को कई बार गहराई से सोचने के लिए कहती है। दूसरा दृष्टिकोण, DTF, बहुत तेज़ और सस्ता है। यह गहरी सोच और पुन: रैंकिंग को पूरी तरह से छोड़ देता है। इसके बजाय, यह तीन अलग-अलग खोज विधियों के परिणामों को जोड़ता है—एक जो नोट्स को देखता है, एक जो कच्चे टेक्स्ट को देखता है, और एक जो कानून की संरचना को देखता है—और उन्हें एक निश्चित, गणितीय नियम का उपयोग करके एक एकल सूची में मिला देता है। तीसरा दृष्टिकोण एक मध्य मार्ग है जो पुन: रैंकिंग चरण को हटा देता है लेकिन प्रारंभिक फ़िल्टरिंग को बनाए रखता है।

परिणामों ने सूची के बिल्कुल शीर्ष पर गति और सटीकता के बीच एक स्पष्ट समझौता (trade-off) प्रकट किया। सावधान संपादक वाला दृष्टिकोण, ASCR-H, सही अनुच्छेद को नंबर एक स्थान पर रखने में सबसे सफल रहा। यह 72.3% बार सफल रहा, जो उन सभी तरीकों से काफी बेहतर था जो पहले से ही उत्तर नहीं जानते थे। तेज़ दृष्टिकोण, DTF, सही अनुच्छेद को शीर्ष पर केवल 51.9% बार रख पाया, जो बीस अंकों से अधिक का अंतर है। हालाँकि, कहानी बदल जाती है यदि आप सूची में थोड़ा नीचे देखते हैं। जबकि सावधान संपादक शीर्ष पर बेहतर था, तेज़ दृष्टिकोण जल्दी ही बराबरी कर लेता है। जब तक आप शीर्ष बीस परिणामों को देखते हैं, दोनों विधियाँ सांख्यिकीय रूप से अविभेद्य हैं, और तेज़ विधि वास्तव में गहरे स्तरों पर थोड़ा बेहतर प्रदर्शन करने लगती है। यह सुझाव देता है कि यदि कोई मानव एक लंबी सूची को स्कैन करने के लिए तैयार है, तो सस्ता, तेज़ सिस्टम उतना ही प्रभावी है।

शोधकर्ताओं ने यह भी पता लगाया कि क्या काम नहीं करता है। उन्होंने अन्य खोज प्रणालियों में उपयोग किए जाने वाले कई सामान्य तरीकों का परीक्षण किया, जैसे कि उपयोगकर्ता के प्रश्न को अधिक स्पष्ट बनाने के लिए उसे फिर से लिखना या 'स्यूडो-रेलिवेंस फीडबैक' नामक तकनीक का उपयोग करना, जो शीर्ष परिणामों को सही मानकर और उनका उपयोग क्वेरी को परिष्कृत करने के लिए करके खोज को बेहतर बनाने की कोशिश करती है। इनमें से किसी भी ट्रिक ने मदद नहीं की; वास्तव में, कुछ ने परिणामों को और खराब कर दिया। उन्होंने यह भी पाया कि केवल एक शब्दकोश का उपयोग करके शब्दों के अंत (word endings) को हटाना, जो जटिल व्याकरण वाली भाषाओं के लिए एक सामान्य समाधान है, कोई लाभ प्रदान नहीं करता क्योंकि परीक्षा के प्रश्न पहले से ही उन कानूनों के बहुत करीब की भाषा में लिखे गए थे।

शायद सबसे आश्चर्यजनक खोज यह थी कि सही अनुच्छेद को सूची के शीर्ष पर लाना आवश्यक रूप से अंतिम उत्तर को बेहतर नहीं बनाता है। शोधकर्ताओं ने परीक्षण किया कि क्या एक कंप्यूटर प्रोग्राम, एक न्यायाधीश के रूप में कार्य करते हुए, प्राप्त अनुच्छेदों के आधार पर सही बहुविकल्पीय उत्तर चुन सकता है। उन्होंने पाया कि कंप्यूटर अपने आंतरिक ज्ञान से इन प्रश्नों का उत्तर देने में पहले से ही इतना अच्छा था कि इससे बहुत अधिक फर्क नहीं पड़ता था कि सही अनुच्छेद पहले स्थान पर है या पाँचवें। सिस्टम संतृप्त (saturated) था; वह टेक्स्ट की आवश्यकता के बिना ही उत्तर जानता था। इसका अर्थ है कि इस विशिष्ट प्रकार की परीक्षा के लिए, बिल्कुल शीर्ष पर सटीक रैंकिंग प्राप्त करने के लिए आवश्यक भारी प्रयास सार्थक नहीं हो सकता है, क्योंकि अंतिम परिणाम समान ही रहता है। अध्ययन निष्कर्ष निकालता है कि कानूनी खोज के लिए, सबसे अच्छा उपकरण पूरी तरह से लक्ष्य पर निर्भर करता है: यदि आपको तुरंत सही कानून देखने की पूर्ण संभावना चाहिए, तो महंगा, सावधान तरीका श्रेष्ठ है। लेकिन, यदि आपको तेजी से और सस्ते में संभावनाओं की एक विस्तृत श्रृंखला को कवर करने की आवश्यकता है, तो तेज़, सरल तरीका उतना ही अच्छा है, बशर्ते आप परिणामों में थोड़ा और गहराई तक देखने के लिए तैयार हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →