← नवीनतम पेपर
🤖 machine learning

Train, Retrieve, or Both? A Four-Arm Head-to-Head for Correct Statutory Citation on the Ontario Residential Tenancies Act

यह शोध पत्र एक चार-आर्म मूल्यांकन प्रस्तुत करता है जो यह प्रदर्शित करता है कि रिट्रीवल के साथ फाइन-ट्यून्ड Qwen2.5-7B मॉडल (SFT+RAG) का संयोजन, विशेषीकृत रिट्रीवल मॉडलों या बड़े डेटासेट की आवश्यकता के बिना, स्टैंडअलोन फाइन-ट्यूनिंग और केवल रिट्रीवल दृष्टिकोण दोनों से बेहतर प्रदर्शन करते हुए, ओंटारियो रेजिडेंशियल टेनेंसीज़ एक्ट को उद्धृत करने में उच्चतम सटीकता प्राप्त करता है और मतिभ्रम (hallucinations) को समाप्त करता है।

मूल लेखक: Ali Asaria, Tony Salomone, Deep Gandhi

प्रकाशित 2026-06-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ali Asaria, Tony Salomone, Deep Gandhi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, 300 पन्नों की नियम पुस्तिका (ओंटारियो रेजिडेंशियल टेनेंसी एक्ट) में उस सटीक नियम को खोजने की कोशिश कर रहे हैं जो एक विशिष्ट प्रश्न का उत्तर देता है, जैसे कि "मेरे अपार्टमेंट में प्रवेश करने से पहले मकान मालिक को कितना नोटिस देना चाहिए?"

लक्ष्य एक सुंदर निबंध लिखना नहीं है; बल्कि लक्ष्य एक उंगली रखना है जो सटीक पेज और पैराग्राफ नंबर (साइटेशन) की ओर इशारा करे ताकि एक आम व्यक्ति इसे खुद देख सके।

यह पेपर एक "टेस्ट टेस्ट" है यह पता लगाने के लिए कि कंप्यूटर को यह काम सिखाने का सबसे अच्छा तरीका क्या है। शोधकर्ताओं ने एक स्मार्ट AI मॉडल (एक डिजिटल मस्तिष्क) का उपयोग करके चार अलग-अलग रणनीतियों के बीच एक दौड़ आयोजित की, ताकि यह देखा जा सके कि कौन सा मॉडल बिना मनगढ़ंत बातें किए सही नियम खोज पाता है।

यहाँ दौड़ में भाग लेने वाले चार धावक कैसे प्रदर्शन करते हैं:

चार धावक

  1. "रॉ ब्रेन" (बेस मॉडल):

    • उपमा: यह एक बहुत ही बुद्धिमान छात्र की तरह है जिसने नियम पुस्तिका को एक बार पढ़ा है लेकिन उसे याद नहीं किया है। वे याददाश्त से पेज नंबर का अनुमान लगाने की कोशिश करते हैं।
    • परिणाम: वे पूरी तरह से विफल रहे। वे सही पेज नहीं ढूंढ सके, और 81% बार, उन्होंने एक फर्जी पेज नंबर बना दिया जो अस्तित्व में ही नहीं था। वे इस काम के लिए बहुत अविश्वसनीय हैं।
  2. "मेमोराइज़र" (केवल फाइन-ट्यूनिंग):

    • उपमा: यह वही छात्र है, लेकिन उन्होंने "प्रश्न → पेज नंबर" के फ्लैशकार्ड्स का अभ्यास करने में हफ्तों बिताए हैं। वे प्रारूप को जानते हैं और उत्तरों को याद करने की कोशिश करते हैं।
    • परिणाम: उन्होंने फर्जी पेज बनाना तो बंद कर दिया, लेकिन वे अभी भी विशिष्ट नंबरों को गलत बताते थे। उन्हें नियम का विचार तो याद था लेकिन वे सटीक सेक्शन नंबरों को मिला देते थे। यह ऐसा है जैसे यह जानना कि नियम "शोर" के बारे में है, लेकिन यह अनुमान लगाना कि यह पेज 52 के बजाय पेज 50 पर है।
  3. "लाइब्रेरियन" (केवल रिट्रीवल):

    • उपमा: यह छात्र कुछ भी याद करने की कोशिश नहीं करता है। इसके बजाय, उसके पास एक सुपर-फास्ट लाइब्रेरियन है जो उसके लिए किताब खोजता है। छात्र को केवल उन्हीं पेजों का उपयोग करके उत्तर देने की अनुमति है जो लाइब्रेरियन उसे थमाता है।
    • परिणाम: यह एक बहुत बड़ा सुधार था। क्योंकि छात्र को वास्तविक टेक्स्ट देखने के लिए मजबूर किया जाता है, इसलिए वे कभी भी फर्जी पेज नंबर नहीं बनाते (0% मतिभ्रम/hallucinations)। हालाँकि, कभी-कभी लाइब्रेरियन उन्हें 10 पेजों का ढेर थमा देता है, और छात्र इस बात को लेकर भ्रमित हो जाता है कि वास्तव में सही वाला कौन सा है।
  4. "सुपर टीम" (हाइब्रिड: मेमोराइज़र + लाइब्रेरियन):

    • उपमा: यह वह छात्र है जिसने फ्लैशकार्ड ड्रिल भी की है और जिसके पास लाइब्रेरियन भी है। ड्रिल्स ने उन्हें बेहतर जज बनने में मदद की जब लाइब्रेरियन उन्हें पेजों का एक अस्त-व्यस्त ढेर थमाता है।
    • परिणाम: इस टीम ने दौड़ जीत ली। उन्होंने किसी भी अन्य की तुलना में अधिक बार सटीक पेज नंबर खोजा। "ड्रिल्स" ने उन्हें लाइब्रेरियन के पेजों के ढेर में से सही पेज चुनने में मदद की, भले ही वह ढेर बड़ा क्यों न हो।

बड़ी आश्चर्यजनक बातें

  • बड़ा होना हमेशा बेहतर नहीं होता: शोधकर्ताओं ने छात्रों की मदद करने के लिए एक "सुपर-लाइब्रेरियन" (एक अधिक जटिल, महंगा सर्च टूल) का उपयोग करने की कोशिश की। इससे कोई मदद नहीं मिली। साधारण, सस्ता लाइब्रेरियन भी उतना ही अच्छा काम कर रहा था। यह एक अच्छी खबर है क्योंकि इसका मतलब है कि आपको इस समस्या को हल करने के लिए महंगी, भारी मशीनरी की आवश्यकता नहीं है।
  • अधिक अध्ययन करने से मदद नहीं मिली: उन्होंने "मेमोराइज़र" को अधिक फ्लैशकार्ड अध्ययन करने के लिए दिए। इससे वे बेहतर नहीं हुए। बाधा यह नहीं थी कि उन्होंने कितना अध्ययन किया; बाधा यह थी कि उन्हें टेक्स्ट खोजने के लिए लाइब्रेरियन की आवश्यकता थी।
  • "जीरो हॉलुसिनेशन" (शून्य मतिभ्रम) ट्रिक: "लाइब्रेरियन" और "सुपर टीम" ने कभी भी फर्जी नियम क्यों नहीं बनाए, इसका कारण डिज़ाइन में ही है। सिस्टम में एक सुरक्षा द्वार है: यदि पेज नंबर लाइब्रेरियन के पास मौजूद किताब में नहीं है, तो सिस्टम उसे कहने से इनकार कर देता है। यह एक सख्त नियम है, कोई सीखी हुई कुशलता नहीं।

अंतिम स्कोरकार्ड

"सुपर टीम" (हाइब्रिड) ने सबसे अच्छा स्कोर प्राप्त किया, लेकिन वे अभी स्वर्ण पदक भी नहीं जीत पाए।

  • लक्ष्य: शोधकर्ता 0.70 का स्कोर चाहते थे (सही उत्तर 70% बार देना)।
  • वास्तविकता: उन्हें 0.48 मिला (लगभग आधी बार सही होना)।

वे 100% क्यों नहीं पा सके?

  1. लाइब्रेरियन ने किताब मिस कर दी: कभी-कभी लाइब्रेरियन सही पेज बिल्कुल नहीं ढूंढ पाता था (लगभग 11% बार)। यदि सही पेज ढेर में नहीं है, तो छात्र उसे चुन नहीं सकता।
  2. "फाइन प्रिंट" की समस्या: छात्र अक्सर सही सेक्शन (अध्याय) तो ढूंढ लेता था लेकिन विशिष्ट सब-सेक्शन (पैराग्राफ) को मिस कर देता था। यह सही अध्याय खोजने लेकिन गलत पैराग्राफ खोजने जैसा है। यह एक "आधा-सही" उत्तर माना जाता है।
  3. छोटा टेस्ट ग्रुप: अंतिम परीक्षण में केवल 27 प्रश्न थे। यह एक पूरे सीजन के आधार पर एक स्पोर्ट्स टीम का आकलन करने जैसा है। परिणाम आशाजनक हैं, लेकिन सैंपल साइज इतना छोटा है कि हम 100% निश्चित नहीं हो सकते।

मुख्य निष्कर्ष (द बॉटम लाइन)

यदि आप चाहते हैं कि कंप्यूटर लोगों को सही कानून की ओर इशारा करे:

  • केवल इसे कानून याद करने के लिए न कहें (यह गलत अनुमान लगाएगा)।
  • केवल इसे कानून पढ़ने के लिए न कहें (यह बहुत अधिक टेक्स्ट से भ्रमित हो जाएगा)।
  • करें एक ऐसा मॉडल जो प्रारूप को समझने के लिए प्रशिक्षित किया गया हो और एक ऐसे टूल को मिलाएँ जो आपके लिए कानून को खोज सके।

यह दृष्टिकोण सबसे सटीक है, यह कभी भी झूठ नहीं बोलता कि कोई नियम कहाँ है, और यह बिना किसी महंगी, भारी तकनीक के अच्छा काम करता है। हालाँकि, "अच्छा" (48% सटीकता) से "शानदार" (70% सटीकता) तक पहुँचने के लिए अभी भी काम करने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →