← नवीनतम पेपर
💬 NLP

JurisTCU: A Brazilian Portuguese Information Retrieval Dataset with Query Relevance Judgments

यह शोध पत्र JurisTCU को प्रस्तुत करता है, जो 16,045 दस्तावेज़ों और 150 एनोटेटेड क्वेरीज़ वाला एक नवीन ब्राज़ीलियाई पुर्तगाली कानूनी सूचना पुनर्प्राप्ति डेटासेट है, जो यह प्रदर्शित करता है कि दस्तावेज़ विस्तार (document expansion) लेक्सिकल खोज प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है और OpenAI एम्बेडिंग्स कानूनी क्वेरीज़ के लिए सिमेंटिक संबंधों को पकड़ने में अन्य मॉडलों की तुलना में बेहतर प्रदर्शन करते हैं।

मूल लेखक: Leandro Carísio Fernandes, Leandro dos Santos Ribeiro, Marcos Vinícius Borela de Castro, Leonardo Augusto da Silva Pacheco, Edans Flávius de Oliveira Sandes

प्रकाशित 2026-06-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Leandro Carísio Fernandes, Leandro dos Santos Ribeiro, Marcos Vinícius Borela de Castro, Leonardo Augusto da Silva Pacheco, Edans Flávius de Oliveira Sandes

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप घास के एक विशाल ढेर में एक विशिष्ट सुई खोजने की कोशिश कर रहे हैं। लेकिन यह केवल घास का ढेर नहीं है; यह ब्राजील के फेडरल कोर्ट ऑफ अकाउंट्स (TCU) द्वारा लिखित 16,000 कानूनी दस्तावेजों का एक पुस्तकालय है। ये दस्तावेज़ बताते हैं कि सार्वजनिक धन को कैसे खर्च किया जाना चाहिए और विभिन्न स्थितियों में कौन से नियम लागू होते हैं।

वर्षों से, इस घास के ढेर में सही "सुई" (सही कानूनी मिसाल) को खोजना कठिन रहा है क्योंकि खोज उपकरण एक ऐसे लाइब्रेरियन की तरह थे जो केवल सटीक शब्दों के मिलान पर ध्यान देते हैं। यदि आप "पैसे के नियम" (money rules) पूछते, तो वे उस दस्तावेज़ को अनदेखा कर देते जिसमें "वित्तीय विनियम" (financial regulations) लिखा होता, भले ही उन दोनों का अर्थ एक ही हो।

यह शोध पत्र JurisTCU पेश करता है, जो इस समस्या को ठीक करने के लिए डिज़ाइन किया गया एक नया टूल है। JurisTCU को एक स्मार्ट लाइब्रेरियन बनाने के लिए प्रशिक्षण नियमावली (training manual) और एक परीक्षण किट (test kit) के रूप में समझें।

यहाँ यह शोध पत्र इसे विस्तार से समझाता है:

1. समस्या: "सटीक मिलान" का जाल (The "Exact Match" Trap)

TCU में वर्तमान खोज प्रणाली एक ऐसे रोबोट की तरह है जो केवल सटीक वर्तनी (spelling) को समझता है। यदि आप "tax" टाइप करते हैं, तो यह उस दस्तावेज़ को नहीं खोज पाएगा जिसमें "levy" लिखा है, भले ही वे समानार्थी हों। इसे "शब्दावली बेमेल" (vocabulary mismatch) कहा जाता है। शोधकर्ताओं ने यह देखना चाहा कि क्या वे रोबोट को शब्दों के पीछे के अर्थ को समझने के लिए प्रशिक्षित कर सकते हैं, न कि केवल अक्षरों को।

2. समाधान: एक नया टेस्ट किचन (A New Test Kitchen)

नई खोज विधियों का परीक्षण करने के लिए, शोधकर्ताओं ने JurisTCU नामक एक डेटासेट बनाया।

  • पुस्तकालय: उन्होंने TCU से 16,045 वास्तविक कानूनी दस्तावेज़ एकत्र किए।
  • प्रश्न: उन्होंने 150 अलग-अलग खोज प्रश्न बनाए। कुछ छोटे और सरल थे (जैसे "tax rules"), जबकि अन्य पूर्ण वाक्य थे (जैसे "कर नियमों के लिए क्या नियम हैं?")।
  • उत्तर कुंजी (The Answer Key): यह सबसे महत्वपूर्ण हिस्सा है। उन्होंने विशेषज्ञों को काम पर लगाया और उन्नत AI का उपयोग करके एक "उत्तर कुंजी" बनाई। प्रत्येक प्रश्न के लिए, उन्होंने ठीक से चिह्नित किया कि कौन से दस्तावेज़ सही उत्तर थे। यह उन्हें यह मापने की अनुमति देता है कि एक खोज इंजन वास्तव में कितना अच्छा है।

3. प्रयोग: रोबोट को नई तरकीबें सिखाना (Teaching the Robot New Tricks)

शोधकर्ताओं ने यह देखने के लिए 14 अलग-अलग प्रयोग चलाए कि खोज इंजन को और स्मार्ट कैसे बनाया जाए। उन्होंने दो मुख्य रणनीतियों का परीक्षण किया:

रणनीति A: "दस्तावेज़ अनुवादक" (लेक्सिकल सर्च - Lexical Search)
कल्पना कीजिए कि आपके पास "वित्तीय विनियमों" (financial regulations) के बारे में एक दस्तावेज़ है। रोबॉट इसे तब नहीं खोज सकता जब आप "tax" खोजते हैं। इसलिए, शोधकर्ताओं ने दस्तावेज़ को बचाने से पहले उसे AI का उपयोग करके फिर से लिखा।

  • उन्होंने समानार्थी शब्द जोड़े (जैसे "वित्तीय विनियमों" वाले दस्तावेज़ में "tax" और "levy" जोड़ना)।
  • उन्होंने AI का उपयोग यह अनुमान लगाने के लिए किया कि कोई व्यक्ति इस दस्तावेज़ के बारे में क्या प्रश्न पूछ सकता है और उन प्रश्नों को दस्तावेज़ की फ़ाइल में जोड़ दिया।
  • परिणाम: यह रोबोट को एक शब्दकोश देने जैसा था। यह बहुत अच्छा रहा, विशेष रूप से छोटे, कीवर्ड-आधारित खोजों के लिए। इसने खोज परिणामों में 45% से अधिक सुधार किया।

रणनीति B: "अर्थ पाठक" (सिमेंटिक सर्च - Semantic Search)
केवल शब्दों को मिलाने के बजाय, यह रणनीति पाठ के भाव या अवधारणा को समझने की कोशिश करती है। यह हर दस्तावेज़ और हर प्रश्न को उसके अर्थ के आधार पर एक अद्वितीय "फिंगरप्रिंट" (गणितीय वेक्टर) में बदल देती है।

  • उन्होंने इन फिंगरप्रिंट्स को बनाने के लिए कई AI मॉडल का परीक्षण किया।
  • परिणाम: अधिकांश ओपन-सोर्स मॉडल (जैसे BERT) संघर्ष करते रहे, जो एक ऐसे छात्र की तरह व्यवहार करते रहे जिसने शब्दकोश तो रट लिया लेकिन कहानी को समझ नहीं पाया। हालाँकि, OpenAI मॉडल एक प्रतिभाशाली छात्र की तरह थे जो संदर्भ को वास्तव में समझते थे। उन्होंने पुराने सिस्टम की तुलना में 70% बेहतर तरीके से सही दस्तावेज़ खोजे, भले ही खोज शब्द बहुत छोटे हों।

4. मुख्य निष्कर्ष (The Big Takeaway)

शोध पत्र निष्कर्ष निकालता है कि:

  1. हमें एक नए मानक की आवश्यकता है: JurisTCU इस प्रकार का पहला प्रमुख डेटासेट है जो वास्तविक खोज प्रश्नों और विशेषज्ञ उत्तरों के साथ पुर्तगाली भाषा में उपलब्ध है। यह समुदाय के लिए भविष्य के खोज इंजनों का परीक्षण करने के लिए एक बेंचमार्क है।
  2. AI मदद कर सकता है, लेकिन सावधानी से चुनें: केवल दस्तावेज़ों में समानार्थी शब्द जोड़ना बहुत मदद करता है। लेकिन पाठ के अर्थ को समझने के लिए उन्नत AI का उपयोग करना (विशेष रूप से OpenAI के मॉडल्स का उपयोग करना) सबसे शक्तिशाली उपकरण है जो उन्होंने पाया।
  3. वास्तविक दुनिया पर प्रभाव: यह केवल सिद्धांत नहीं है। TCU की खोज प्रणाली का उपयोग नागरिकों और अधिकारियों द्वारा साल में 15 लाख से अधिक बार किया जाता है। इन निष्कर्षों का उपयोग करके, TCU एक ऐसा खोज इंजन बना सकता है जो वास्तव में लोगों को वह कानूनी जानकारी खोजने में मदद करे जिसकी उन्हें आवश्यकता है, न कि केवल कीवर्ड मिलाता रहे।

संक्षेप में, शोध पत्र कहता है: "हमने ब्राजील के लिए कानूनी खोज इंजन के लिए एक टेस्ट कोर्स बनाया है। हमने पाया कि जबकि रोबोट को समानार्थी शब्द सिखाना मदद करता है, कानून के अर्थ को समझना असली गेम-चेंजर है।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →