Dissecting Agentic RAG: A Component Ablation for Multi-Hop QA with a Local 7B Model
यह शोध पत्र HotpotQA पर एक स्थानीय 7B मॉडल का उपयोग करते हुए एक एजेंटिक RAG सिस्टम के घटक एब्लेशन अध्ययन को प्रस्तुत करता है, जो यह प्रकट करता है कि फिक्स्ड हाइब्रिड रिट्रीवल और सीमित रिट्रीवल इटरेशन, जटिल एडेप्टिव रूटिंग और गहरे लूप्स से बेहतर प्रदर्शन करते हैं, जो यह दर्शाता है कि संसाधन संबंधी बाधाओं के तहत मल्टी-हॉप QA के लिए सरल, गैर-अनुकूलनशील डिज़ाइन अधिक प्रभावी होते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जटिल रहस्य को सुलझाने की कोशिश कर रहे हैं, जैसे कि यह पता लगाना कि कुकी जार किसने चुराया और क्यों। आपके पास एक बहुत ही स्मार्ट लेकिन छोटा जासूस (एक स्थानीय 7B AI मॉडल) है और दस्तावेजों का एक निश्चित, बंद सेट है जो विशेष रूप से इस मामले के लिए प्रदान किया गया है (सहायक और भटकाने वाले अंशों का एक स्थानीय संग्रह)।
यह शोध पत्र एक सरल प्रश्न पूछता है: हम अपने छोटे जासूस को इन बहु-चरणीय रहस्यों को सबसे प्रभावी ढंग से कैसे हल करने के लिए तैयार करें बिना समय या कंप्यूट बर्बाद किए?
शोधकर्ताओं ने एजेंटिक RAG (Agentic RAG) नामक एक "सुपर-डिटेक्टिव" सिस्टम बनाया। केवल दस्तावेजों के ढेर से एक पन्ना खोजने और उत्तर का अनुमान लगाने के बजाय, यह सिस्टम बड़े रहस्य को छोटे सुरागों में तोड़ता है, दिए गए टेक्स्ट के भीतर सबूतों की तलाश करता है, जांच करता है कि क्या सुराग समझ में आते हैं, और फिर टुकड़ों को जोड़ता है।
इस सिस्टम को चलाने का सबसे अच्छा तरीका खोजने के लिए, शोधकर्ताओं ने केवल अनुमान नहीं लगाया; उन्होंने एक "कंपोनेंट एब्लेशन" (component ablation) किया। इसे एक उच्च श्रेणी की कार के इंजन को बोल्ट-दर-बोल्ट अलग करने जैसा समझें ताकि यह देखा जा सके कि कौन से हिस्से वास्तव में कार को तेज चलाते हैं, और कौन से हिस्से केवल भारी, महंगे सजावटी सामान हैं।
यहाँ उन्होंने क्या खोजा, सरल उपमाओं का उपयोग करते हुए:
1. "स्मार्ट राउटर" बनाम "फिक्स्ड हाइब्रिड"
सेटअप: सिस्टम में एक "ट्रैफिक पुलिस" (एक अडैप्टिव राउटर) था जिसे यह तय करने के लिए डिज़ाइन किया गया था कि प्रत्येक सुराग के लिए किस खोज उपकरण का उपयोग किया जाए।
- यदि सुराग में कोई नाम या तारीख थी, तो पुलिस उसे कीवर्ड सर्च (BM25) के पास भेज देती थी, जो सटीक शब्द मिलान देखता है।
- यदि सुराग अस्पष्ट था, तो वह सिमेंटिक सर्च (Dense) के पास जाता था, जो शब्दों के अर्थ को समझता है।
- अन्यथा, यह दोनों का एक मिश्रण (Mix) उपयोग करता था।
आश्चर्य: शोधकर्ताओं को लगा कि "स्मार्ट ट्रैफिक पुलिस" सबसे अच्छी होगी। लेकिन यह पता चला कि पुलिस थोड़ी अनाड़ी थी। क्योंकि बहु-चरणीय रहस्यों में लगभग हमेशा नाम और तारीखें शामिल होती हैं, इसलिए पुलिस ने 79% सभी सुरागों को कीवर्ड सर्च के पास भेज दिया। इसने सिमेंटिक सर्च को बहुत अधिक बार अनदेखा कर दिया।
परिणाम: जब उन्होंने ट्रैफिक पुलिस को हटा दिया और केवल एक फिक्स्ड मिक्स (हर सुराग के लिए कीवर्ड और सिमेंटिक दोनों खोजों का उपयोग करना) का उपयोग किया, तो सिस्टम अधिक स्मार्ट हो गया।
- उपमा: यह एक ऐसे शेफ की तरह है जो हर चीज़ के लिए चाकू का उपयोग करने का निर्णय लेता है क्योंकि वे काउंटर पर एक सब्जी देखते हैं। लेकिन कभी-कभी आपको चम्मच की भी आवश्यकता होती है! हर व्यंजन के लिए दोनों उपकरणों का उपयोग करके, भोजन उस तुलना में बेहतर निकला जब शेफ ने यह तय करने की कोशिश की कि कौन सा उपकरण चुनना है।
2. "अनंत लूप" बनाम "दो चरण"
सेटअप: सिस्टम को लूप में सुराग खोजने के लिए डिज़ाइन किया गया था। यह सैद्धांतिक रूप से खोज सकता था, एक सुराग पा सकता था, उस सुराग के आधार पर फिर से खोज सकता था, फिर से खोज सकता था, और इसी तरह, अधिकतम 5 बार तक।
आश्चर्य: शोधकर्ताओं ने पाया कि दो खोजों के बाद, जासूस ने लगभग वह सब कुछ ढूंढ लिया था जिसकी उसे आवश्यकता थी। तीसरी, चौथी या पांचवीं खोज करने से वास्तव में कोई मदद नहीं मिली।
- उपमा: अपनी चाबियों को खोजने की कल्पना करें। आप रसोई की जांच करते हैं (चरण 1)। आपको वे नहीं मिलतीं, इसलिए आप लिविंग रूम की जांच करते हैं (चरण 2)। आपको वे मिल जाती हैं! गैरेज, कार और पिछवाड़े (चरण 3, 4, 5) की जांच करना समय की बर्बादी है। आपके पास पहले से ही उत्तर है। शोध पत्र ने पाया कि 95% सफलता केवल पहले दो चरणों में ही मिल गई।
3. "क्वेश्चन ब्रेकर" और "एडिटर"
सेटअप:
- क्वेश्चन ब्रेकर (Question Breaker): खोजने से पहले, AI एक बड़े कठिन प्रश्न को तीन या चार छोटे, आसान प्रश्नों में तोड़ देता है।
- एडिटर (Editor): 20 संभावित उत्तरों को खोजने के बाद, AI सबसे अच्छे 5 को चुनने के लिए एक विशेष "एडिटर" का उपयोग करता है।
परिणाम: इन दोनों ने मदद की, लेकिन पहले दो कारकों जितने प्रभावी नहीं थे।
- ब्रेकर: इसने सटीकता में मदद की, लेकिन इसने प्रक्रिया में दोगुना समय लगा दिया (क्योंकि AI को अतिरिक्त सोच करनी पड़ी)।
- एडिटर: इसने सटीकता में मदद की और लगभग कोई अतिरिक्त समय नहीं लिया।
- उपमा: "ब्रेकर" एक अनुवादक को नियुक्त करने जैसा है जो किसी कठिन प्रश्न को पूछने से पहले उसे फिर से लिखता है। यह अच्छा काम करता है, लेकिन इसमें समय लगता है। "एडिटर" एक लाइब्रेरियन की तरह है जो सबसे अच्छी किताब चुनने के लिए किताबों के ढेर को जल्दी से स्कैन करता है। यह तेज़ और प्रभावी है, इसलिए आपको एडिटर को हमेशा रखना चाहिए, लेकिन शायद अगर आप बहुत जल्दी में हैं तो ट्रांसलेटर को छोड़ सकते हैं।
निष्कर्ष
शोध पत्र यह निष्कर्ष निकालता है कि एक छोटे, स्थानीय AI मॉडल (जो आपके अपने कंप्यूटर पर चल रहा है, न कि किसी विशाल क्लाउड सर्वर पर) के लिए, सादगी की जीत होती है।
- रूटिंग पर बहुत अधिक विचार न करें: बस हर चीज़ के लिए खोज उपकरणों का मिश्रण उपयोग करें।
- बहुत अधिक खोज न करें: खोजने के दो राउंड पर्याप्त हैं।
- एडिटर को रखें: यह सस्ता और प्रभावी है।
जटिल, "अडैप्टिव" फीचर्स को हटाकर, जिन्हें लोगों ने आवश्यक माना था, शोधकर्ताओं ने एक ऐसा सिस्टम बनाया जो वास्तव में जटिल संस्करण की तुलना में बेहतर, तेज़ और अधिक विश्वसनीय था। उन्होंने साबित किया कि स्थानीय AI के लिए, आपको फेरारी इंजन की आवश्यकता नहीं है; एक अच्छी तरह से ट्यून की गई साइकिल अक्सर आपको गंतव्य तक पहले पहुँचा देती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।