Train, Retrieve, or Both? A Four-Arm Head-to-Head for Correct Statutory Citation on the Ontario Residential Tenancies Act
यह शोध पत्र एक चार-आर्म मूल्यांकन प्रस्तुत करता है जो यह प्रदर्शित करता है कि रिट्रीवल के साथ फाइन-ट्यून्ड Qwen2.5-7B मॉडल (SFT+RAG) का संयोजन, विशेषीकृत रिट्रीवल मॉडलों या बड़े डेटासेट की आवश्यकता के बिना, स्टैंडअलोन फाइन-ट्यूनिंग और केवल रिट्रीवल दृष्टिकोण दोनों से बेहतर प्रदर्शन करते हुए, ओंटारियो रेजिडेंशियल टेनेंसीज़ एक्ट को उद्धृत करने में उच्चतम सटीकता प्राप्त करता है और मतिभ्रम (hallucinations) को समाप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, 300 पन्नों की नियम पुस्तिका (ओंटारियो रेजिडेंशियल टेनेंसी एक्ट) में उस सटीक नियम को खोजने की कोशिश कर रहे हैं जो एक विशिष्ट प्रश्न का उत्तर देता है, जैसे कि "मेरे अपार्टमेंट में प्रवेश करने से पहले मकान मालिक को कितना नोटिस देना चाहिए?"
लक्ष्य एक सुंदर निबंध लिखना नहीं है; बल्कि लक्ष्य एक उंगली रखना है जो सटीक पेज और पैराग्राफ नंबर (साइटेशन) की ओर इशारा करे ताकि एक आम व्यक्ति इसे खुद देख सके।
यह पेपर एक "टेस्ट टेस्ट" है यह पता लगाने के लिए कि कंप्यूटर को यह काम सिखाने का सबसे अच्छा तरीका क्या है। शोधकर्ताओं ने एक स्मार्ट AI मॉडल (एक डिजिटल मस्तिष्क) का उपयोग करके चार अलग-अलग रणनीतियों के बीच एक दौड़ आयोजित की, ताकि यह देखा जा सके कि कौन सा मॉडल बिना मनगढ़ंत बातें किए सही नियम खोज पाता है।
यहाँ दौड़ में भाग लेने वाले चार धावक कैसे प्रदर्शन करते हैं:
चार धावक
"रॉ ब्रेन" (बेस मॉडल):
- उपमा: यह एक बहुत ही बुद्धिमान छात्र की तरह है जिसने नियम पुस्तिका को एक बार पढ़ा है लेकिन उसे याद नहीं किया है। वे याददाश्त से पेज नंबर का अनुमान लगाने की कोशिश करते हैं।
- परिणाम: वे पूरी तरह से विफल रहे। वे सही पेज नहीं ढूंढ सके, और 81% बार, उन्होंने एक फर्जी पेज नंबर बना दिया जो अस्तित्व में ही नहीं था। वे इस काम के लिए बहुत अविश्वसनीय हैं।
"मेमोराइज़र" (केवल फाइन-ट्यूनिंग):
- उपमा: यह वही छात्र है, लेकिन उन्होंने "प्रश्न → पेज नंबर" के फ्लैशकार्ड्स का अभ्यास करने में हफ्तों बिताए हैं। वे प्रारूप को जानते हैं और उत्तरों को याद करने की कोशिश करते हैं।
- परिणाम: उन्होंने फर्जी पेज बनाना तो बंद कर दिया, लेकिन वे अभी भी विशिष्ट नंबरों को गलत बताते थे। उन्हें नियम का विचार तो याद था लेकिन वे सटीक सेक्शन नंबरों को मिला देते थे। यह ऐसा है जैसे यह जानना कि नियम "शोर" के बारे में है, लेकिन यह अनुमान लगाना कि यह पेज 52 के बजाय पेज 50 पर है।
"लाइब्रेरियन" (केवल रिट्रीवल):
- उपमा: यह छात्र कुछ भी याद करने की कोशिश नहीं करता है। इसके बजाय, उसके पास एक सुपर-फास्ट लाइब्रेरियन है जो उसके लिए किताब खोजता है। छात्र को केवल उन्हीं पेजों का उपयोग करके उत्तर देने की अनुमति है जो लाइब्रेरियन उसे थमाता है।
- परिणाम: यह एक बहुत बड़ा सुधार था। क्योंकि छात्र को वास्तविक टेक्स्ट देखने के लिए मजबूर किया जाता है, इसलिए वे कभी भी फर्जी पेज नंबर नहीं बनाते (0% मतिभ्रम/hallucinations)। हालाँकि, कभी-कभी लाइब्रेरियन उन्हें 10 पेजों का ढेर थमा देता है, और छात्र इस बात को लेकर भ्रमित हो जाता है कि वास्तव में सही वाला कौन सा है।
"सुपर टीम" (हाइब्रिड: मेमोराइज़र + लाइब्रेरियन):
- उपमा: यह वह छात्र है जिसने फ्लैशकार्ड ड्रिल भी की है और जिसके पास लाइब्रेरियन भी है। ड्रिल्स ने उन्हें बेहतर जज बनने में मदद की जब लाइब्रेरियन उन्हें पेजों का एक अस्त-व्यस्त ढेर थमाता है।
- परिणाम: इस टीम ने दौड़ जीत ली। उन्होंने किसी भी अन्य की तुलना में अधिक बार सटीक पेज नंबर खोजा। "ड्रिल्स" ने उन्हें लाइब्रेरियन के पेजों के ढेर में से सही पेज चुनने में मदद की, भले ही वह ढेर बड़ा क्यों न हो।
बड़ी आश्चर्यजनक बातें
- बड़ा होना हमेशा बेहतर नहीं होता: शोधकर्ताओं ने छात्रों की मदद करने के लिए एक "सुपर-लाइब्रेरियन" (एक अधिक जटिल, महंगा सर्च टूल) का उपयोग करने की कोशिश की। इससे कोई मदद नहीं मिली। साधारण, सस्ता लाइब्रेरियन भी उतना ही अच्छा काम कर रहा था। यह एक अच्छी खबर है क्योंकि इसका मतलब है कि आपको इस समस्या को हल करने के लिए महंगी, भारी मशीनरी की आवश्यकता नहीं है।
- अधिक अध्ययन करने से मदद नहीं मिली: उन्होंने "मेमोराइज़र" को अधिक फ्लैशकार्ड अध्ययन करने के लिए दिए। इससे वे बेहतर नहीं हुए। बाधा यह नहीं थी कि उन्होंने कितना अध्ययन किया; बाधा यह थी कि उन्हें टेक्स्ट खोजने के लिए लाइब्रेरियन की आवश्यकता थी।
- "जीरो हॉलुसिनेशन" (शून्य मतिभ्रम) ट्रिक: "लाइब्रेरियन" और "सुपर टीम" ने कभी भी फर्जी नियम क्यों नहीं बनाए, इसका कारण डिज़ाइन में ही है। सिस्टम में एक सुरक्षा द्वार है: यदि पेज नंबर लाइब्रेरियन के पास मौजूद किताब में नहीं है, तो सिस्टम उसे कहने से इनकार कर देता है। यह एक सख्त नियम है, कोई सीखी हुई कुशलता नहीं।
अंतिम स्कोरकार्ड
"सुपर टीम" (हाइब्रिड) ने सबसे अच्छा स्कोर प्राप्त किया, लेकिन वे अभी स्वर्ण पदक भी नहीं जीत पाए।
- लक्ष्य: शोधकर्ता 0.70 का स्कोर चाहते थे (सही उत्तर 70% बार देना)।
- वास्तविकता: उन्हें 0.48 मिला (लगभग आधी बार सही होना)।
वे 100% क्यों नहीं पा सके?
- लाइब्रेरियन ने किताब मिस कर दी: कभी-कभी लाइब्रेरियन सही पेज बिल्कुल नहीं ढूंढ पाता था (लगभग 11% बार)। यदि सही पेज ढेर में नहीं है, तो छात्र उसे चुन नहीं सकता।
- "फाइन प्रिंट" की समस्या: छात्र अक्सर सही सेक्शन (अध्याय) तो ढूंढ लेता था लेकिन विशिष्ट सब-सेक्शन (पैराग्राफ) को मिस कर देता था। यह सही अध्याय खोजने लेकिन गलत पैराग्राफ खोजने जैसा है। यह एक "आधा-सही" उत्तर माना जाता है।
- छोटा टेस्ट ग्रुप: अंतिम परीक्षण में केवल 27 प्रश्न थे। यह एक पूरे सीजन के आधार पर एक स्पोर्ट्स टीम का आकलन करने जैसा है। परिणाम आशाजनक हैं, लेकिन सैंपल साइज इतना छोटा है कि हम 100% निश्चित नहीं हो सकते।
मुख्य निष्कर्ष (द बॉटम लाइन)
यदि आप चाहते हैं कि कंप्यूटर लोगों को सही कानून की ओर इशारा करे:
- केवल इसे कानून याद करने के लिए न कहें (यह गलत अनुमान लगाएगा)।
- केवल इसे कानून पढ़ने के लिए न कहें (यह बहुत अधिक टेक्स्ट से भ्रमित हो जाएगा)।
- करें एक ऐसा मॉडल जो प्रारूप को समझने के लिए प्रशिक्षित किया गया हो और एक ऐसे टूल को मिलाएँ जो आपके लिए कानून को खोज सके।
यह दृष्टिकोण सबसे सटीक है, यह कभी भी झूठ नहीं बोलता कि कोई नियम कहाँ है, और यह बिना किसी महंगी, भारी तकनीक के अच्छा काम करता है। हालाँकि, "अच्छा" (48% सटीकता) से "शानदार" (70% सटीकता) तक पहुँचने के लिए अभी भी काम करने की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।