← नवीनतम पेपर
💬 NLP

Generative Chinese Statute Retrieval

यह शोध पत्र GCSR को प्रस्तुत करता है, जो एक जनरेटिव फ्रेमवर्क है जो बहु-स्तरीय संरचित दस्तावेज़ आईडी और बहु-कार्य प्रशिक्षण का उपयोग करके चीनी वैधानिक पुनर्प्राप्ति (statute retrieval) को एक अनुक्रम निर्माण कार्य (sequence generation task) के रूप में पुनर्गठित करता है ताकि बोलचाल की क्वेरी और औपचारिक वैधानिक भाषा के बीच के अंतर को प्रभावी ढंग से पाटा जा सके, जो मौजूदा पुनर्प्राप्ति बेसलाइनों से बेहतर प्रदर्शन करता है।

मूल लेखक: Yiteng Tu, Zitao Su, Weihang Su, Xuanyi Chen, Yueyue Wu, Yiqun Liu, Min Zhang, Qingyao Ai

प्रकाशित 2026-07-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yiteng Tu, Zitao Su, Weihang Su, Xuanyi Chen, Yueyue Wu, Yiqun Liu, Min Zhang, Qingyao Ai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, धूल भरी लाइब्रेरी में एक विशिष्ट नियम खोजने की कोशिश कर रहे हैं जहाँ किताबें एक अत्यंत सख्त, औपचारिक भाषा में लिखी गई हैं, लेकिन आप अपना प्रश्न अनौपचारिक, रोज़मर्रा की बोलचाल की भाषा में पूछ रहे हैं। यही स्टैच्यूट रिट्रीवल (Statute Retrieval) का दैनिक संघर्ष है: एक आम व्यक्ति की अव्यवस्थित, वास्तविक जीवन की समस्या (जैसे, "मेरे बॉस ने देर तक काम करने के लिए मुझे पैसे नहीं दिए!") को उस सटीक, कठोर कानूनी पैराग्राफ से जोड़ना जो उसे हल करता है।

लंबे समय तक, सर्च इंजन ने इसे एक लाइब्रेरियन द्वारा कार्ड कैटलॉग को स्कैन करने की तरह हल करने की कोशिश की। वे मिलान वाले शब्दों को देखते थे। यदि आपने सटीक फैंसी कानूनी शब्द का उपयोग नहीं किया, तो वे आपका उत्तर मिस कर देते थे। यह पेपर तर्क देता है कि यह पुराना "कीवर्ड्स खोजने वाला" तरीका एक घास के ढेर में सुई खोजने जैसा है, जहाँ आप केवल सोने के रंग को ही देख रहे हैं, भले ही सुई चांदी की हो।

बड़ा विचार: "जेनेरेटिव" लाइब्रेरियन
लेखकों, जोмिंगुआ विश्वविद्यालय और क्वानचेंग प्रयोगशाला की एक टीम ने GCSR नामक एक नया तरीका प्रस्तावित किया है। केवल लिस्ट में खोजने के बजाय, एक सुपर-स्मार्ट लाइब्रेरियन की कल्पना करें जो न केवल किताबें ढूँढता है बल्कि वास्तव में उस किताब का सटीक पता भी "सपनों में देख लेता है" (dream up) जिसकी आपको आवश्यकता है।

इस सिस्टम में, एक कानून का "पता" केवल एक रैंडम नंबर नहीं है। टीम ने एक मल्टी-ग्रैनुलैरिटी स्ट्रक्चर्ड डॉक-आईडी (Multi-granularity Structured DocID) का आविष्कार किया है। इसे एक कानून के लिए अत्यंत विस्तृत GPS निर्देशांक (coordinate) के रूप में समझें। केवल "किताब 42" कहने के बजाय, यह पता कहता है: "सिविल लॉ, लायबिलिटी पर अध्याय, उत्पाद दोषों पर अनुभाग, विशेष रूप से निर्माता के बारे में।" यह पता कानून के प्रकार, यह किसे प्रभावित करता है, और यह क्या करता है, इसके जैसे टुकड़ों से बनाया गया है। यह एक उबाऊ कानूनी पाठ को एक संरचित मानचित्र (map) में बदल देता है जिसे कंप्यूटर नेविगेट कर सकता है।

उन्होंने मस्तिष्क को कैसे प्रशिक्षित किया
इस AI लाइब्रेरियन को सिखाने के लिए, उन्होंने केवल कानून नहीं दिखाए। उन्होंने एक मल्टी-टास्क ट्रेनिंग स्ट्रैटेजी का उपयोग किया, जो एक लाइब्रेरियन को तीन अलग-अलग काम मास्टर करने के लिए देने जैसा है:

  1. द इंडेक्सर (The Indexer): उन्होंने कानून दिखाया और AI को अपना स्वयं का GPS पता लिखने के लिए कहा। इसने AI को लाइब्रेरी की संरचना सिखाई।
  2. द ट्रांसलेटर (The Translator): उन्होंने एक अन्य AI का उपयोग करके प्रत्येक कानून के लिए 10 अलग-अलग "नकली" प्रश्न बनाए, जो अनौपचारिक, अव्यवस्थित भाषा (जैसे "मेरा बॉस बुरा है और उसने मुझे पैसे नहीं दिए") में लिखे गए थे। इसने AI को यह सीखने में मदद की कि कैसे साधारण बोलचाल को गंभीर कानूनी शब्दों से जोड़ा जाए।
  3. द रियलिस्ट (The Realist): अंत में, उन्होंने वास्तविक लोगों के वास्तविक प्रश्नों के साथ इसका परीक्षण किया ताकि यह सुनिश्चित किया जा सके कि यह वास्तविक जीवन के शोर और भ्रम को संभाल सके।

परिणाम: क्या यह काम करता है?
टीम ने इसका परीक्षण STARD नामक एक डेटासेट पर किया, जिसमें आम लोगों के 1,543 वास्तविक प्रश्न और 55,348 चीनी कानूनों की एक लाइब्रेरी शामिल है। उन्होंने सफलता को इस बात से मापा कि सही कानून शीर्ष परिणामों में कितनी बार दिखाई देता है (Hits@K)।

परिणाम स्पष्ट थे: GCSR ने अन्य तरीकों को लगातार मात दी।

  • पुराना कीवर्ड सर्च (Sparse): इसने Hits@3 का स्कोर 0.305 से 0.319 प्राप्त किया।
  • स्टैंडर्ड AI सर्च (Dense): इसने Hits@3 का स्कोर 0.468 प्राप्त किया।
  • GCSR (नया तरीका): इसने Hits@3 पर 0.522, Hits@5 पर 0.536, Hits@10 पर 0.544, और Hits@20 पर 0.547 का स्कोर प्राप्त किया।

पेपर सुझाव देता है कि यह जेनेरेटिव दृष्टिकोण कानूनी खोज के भविष्य के लिए एक मजबूत दावेदार है क्योंकि यह इस अंतर को पाटता है कि लोग कैसे बात करते हैं और कानून कैसे लिखे जाते हैं।

उन्होंने किन चीजों को खारिज कर दिया
यह पेपर स्पष्ट रूप से कुछ चीजों के विरुद्ध तर्क देता है:

  • केवल कीवर्ड का उपयोग करना पर्याप्त नहीं है: उन्होंने पाया कि सरल कीवर्ड मिलान (जैसे BM25) अक्सर चूक जाता है क्योंकि लोग वकीलों की तरह नहीं बोलते।
  • मानक "कानूनी" AI मॉडल आदर्श नहीं हैं: कोर्ट केस के लिए विशेष रूप से प्रशिक्षित मॉडल (जैसे SAILER या Lawformer) वास्तव में खराब प्रदर्शन करते हैं। लेखकों का सुझाव है कि ऐसा इसलिए है क्योंकि वे मॉडल लंबी, कहानी जैसी अदालती कहानियों के लिए उपयोग किए जाते हैं, न कि संक्षिप्त, अमूर्त और कठोर कानूनी भाषा के लिए।
  • साधारण पते काम नहीं करते: यदि आप AI को एक रैंडम नंबर या एक साधारण शीर्षक के रूप में "पता" देते हैं, तो वह भ्रमित हो जाता है। AI को कानून के पदानुक्रम (hierarchy) को समझने के लिए विस्तृत, संरचित GPS निर्देशांकों की आवश्यकता होती है।

वे कितने आश्वस्त हैं?
लेखक अपने प्रयोगों के आधार पर इन आंकड़ों को लेकर काफी आश्वस्त हैं। उन्होंने इन परीक्षणों को एक विशिष्ट डेटासेट पर चलाया और पाया कि उनके तरीके ने अन्य तरीकों से काफी बेहतर प्रदर्शन किया (सांख्यिकीय महत्व p < 0.05 पर नोट किया गया)। हालांकि, वे सावधानी बरतते हुए कहते हैं कि यह एक "उभरता हुआ प्रतिमान" (promising paradigm) और चीनी कानूनों के लिए एक "नया स्टेट-ऑफ-द-आर्ट" है। वे यह दावा नहीं करते कि यह दुनिया की हर कानूनी प्रणाली के लिए एक जादुई समाधान है, लेकिन परिणाम बताते हैं कि यह विशेष रूप से साधारण प्रश्नों को औपचारिक कानूनी उत्तरों में बदलने की समस्या के लिए बहुत अच्छी तरह से काम करता है।

संक्षेप में, GCSR सुझाव देता है कि यदि आप कोई कानून खोजना चाहते हैं, तो आपको केवल शब्दों को नहीं खोजना चाहिए; बल्कि आपको AI से उस नियम का सटीक "पता" उत्पन्न करने के लिए कहना चाहिए जिसकी आपको आवश्यकता है, एक ऐसे मानचित्र का उपयोग करते हुए जो आपकी साधारण बोलचाल और कानून की संरचना दोनों को समझता हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →