A New Role for Relevance: Guiding Corpus Interaction in Agentic Search
यह शोध पत्र RARG को प्रस्तुत करता है, जो एक प्रासंगिकता-जागरूक (relevance-aware) खोज एजेंट है जो क्रमिक दस्तावेज़ अन्वेषण और मिलान पुनर्रैंकिंग (match reranking) के माध्यम से मोटे-से-सूक्ष्म (coarse-to-fine) कॉर्पस इंटरैक्शन को निर्देशित करने के लिए प्रासंगिकता स्कोर का लाभ उठाता है, जिससे मौजूदा रिट्रीवल और डायरेक्ट-इंटरेक्शन विधियों की तुलना में जटिल प्रश्न उत्तर देने की सटीकता और दक्षता दोनों में सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रहस्य सुलझाने की कोशिश कर रहे एक जासूस हैं, लेकिन आपके पास कुछ सुरागों से भरी नोटबुक के बजाय लाखों किताबों वाला एक पुस्तकालय है। आपका लक्ष्य वह एक विशिष्ट वाक्य ढूंढना है जिसमें उत्तर छिपा हो। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इसे "रिट्रीवल" (retrieval) कहा जाता है। लंबे समय तक, एआई असिस्टेंट एक ऐसे लाइब्रेरियन की तरह काम करते थे जो शीर्ष दस किताबों के शीर्षकों को जल्दी से स्कैन करता था और आपको उन्हें थमा देता था, इस उम्मीद में कि उत्तर शायद पहले ही पन्ने पर मिल जाए। लेकिन क्या होगा अगर उत्तर किसी ऐसी किताब के पेज नंबर 400 के बीच में छिपे एक पैराग्राफ में हो जो शीर्ष दस में भी नहीं थी? या क्या होगा अगर सुराग एक छोटा, विशिष्ट वाक्यांश हो जो केवल तभी दिखाई दे जब आप किसी बहुत विशिष्ट पैटर्न के लिए खोज करें?
यहीं "एजेंटिक सर्च" (Agentic Search) काम आता है। सिर्फ एक लाइब्रेरियन से सूची मांगने के बजाय, एक एआई "एजेंट" को पुस्तकालय के भीतर जाने के लिए उपकरणों का एक सेट दिया जाता है। यह किसी भी किताब को खोल सकता है, विशिष्ट पृष्ठ पढ़ सकता है, और कीवर्ड्स की तलाश करने के लिए एक सर्च टूल (जैसे कि डिजिटल "grep" या "find" कमांड) का उपयोग कर सकता है। हालांकि, एक पेच है: यदि एजेंट बिना सोचे-समझे लाखों किताबों में रैंडमली खोजना शुरू कर देता है, तो वह सही सुराग खोजने से पहले गलत गलियारों में घंटों बर्बाद कर सकता है। बड़ा सवाल जो शोधकर्ता पूछ रहे हैं वह यह है: हम एआई को यह कैसे सिखाएं कि उसे कौन सी किताबें पहले खोलनी चाहिए, और किन वाक्यों को पढ़ना चाहिए, ताकि वह कम प्रयास और तेज़ी से रहस्य सुलझा सके?
आप जो पेपर पढ़ने जा रहे हैं, वह इस कहानी में एक नया पात्र पेश करता है: RARG (Relevance-Aware RipGrep Search Agent)। RARG को एक सुपर-स्मार्ट जासूस के रूप में समझें जो केवल रैंडमली खोज नहीं करता है। इससे पहले कि जासूस आवर्धक लेंस (magnifying glass) उठाता है, उसे एक "रेलेवेंस मैप" (relevance map) मिलता है। यह मैप उसे उत्तर नहीं देता; इसके बजाय, यह उसे बताता है कि किन किताबों में सुराग होने की सबसे अधिक संभावना है। RARG इस मैप का उपयोग यह तय करने के लिए करता है कि किताबों को किस क्रम में खोला जाए। यह सबसे आशाजनक किताबों के साथ शुरुआत करता है, यह सुनिश्चित करते हुए कि यदि उत्तर वहां है, तो जासूस उसे तुरंत ढूंढ ले।
लेकिन RARG यहीं नहीं रुकता। इसके पास दो विशेष तरकीबें हैं। पहला, यह शुरुआत में ही जासूस को कुछ अत्यधिक प्रासंगिक पैराग्राफों का एक "स्टार्टर पैक" देता है, ताकि उसे यह अनुमान लगाने में समय बर्बाद न करना पड़े कि शुरुआत कहाँ से करनी है। दूसरा, जब जासूस को कई किताबों में से बहुत सारे मिलान वाले वाक्य (hits) मिलते हैं, तो RARG एक सख्त संपादक की तरह काम करता है। यह उन सभी मिलानों को देखता है और उन्हें फिर से रैंक करता है, सबसे अधिक सूचनात्मक वाक्यों को ऊपर धकेलता है और उबाऊ, अप्रासंगिक वाक्यों को छिपा देता है। यह सुनिश्चित करता है कि जासूस केवल सर्वोत्तम सुराग ही देखे, भले ही वे सुराग ऐसी किताब से आए हों जो मूल रूप से सूची में सबसे ऊपर नहीं थी।
शोधकर्ताओं ने पुराने तरीकों के मुकाबले इस नए जासूस का परीक्षण किया। उन्होंने पाया कि खोज के दौरान—न कि केवल किताबों की सूची चुनने के लिए—खोज को निर्देशित करने के लिए 'रेलेवेंस' का उपयोग करने से, एआई जटिल प्रश्नों को बहुत तेज़ी से हल करता है। 1,00,000 दस्तावेजों के पुस्तकालय के परीक्षणों में, नया तरीका (RARG++) 84% सटीकता तक पहुँचा, जिसने पिछले सर्वश्रेष्ठ तरीकों को पीछे छोड़ दिया जो लगभग 78% के आसपास थे। जब उन्होंने पुस्तकालय को 10 लाख दस्तावेजों तक बढ़ाया, तो नए तरीके की सटीकता गिरकर 79% हो गई, लेकिन यह अभी भी पुराने तरीकों पर महत्वपूर्ण बढ़त बनाए हुए था, जो गिरकर 69% रह गए थे। इस गिरावट के बावजूद, नए तरीके ने काफी कम "टूल कॉल्स" (खोज प्रक्रिया में उठाए गए कदम) का उपयोग किया, जिससे यह बहुत सस्ता और तेज़ बन गया।
यह पेपर सुझाव देता है कि बेहतर एआई सर्च की कुंजी केवल एक बड़ा पुस्तकालय या एक स्मार्ट सर्च टूल होना नहीं है, बल्कि एजेंट को दिशा का बेहतर बोध कराना है। "रेलेवेंस" को केवल एक साधारण फिल्टर से बदलकर खोज के तरीके के लिए एक मार्गदर्शक बनाकर, एआई पूरे ढेर को हिलाए बिना घास के ढेर में सुई ढूंढ सकता है। लेखक दिखाते हैं कि यह दृष्टिकोण विशिष्ट उत्तर खोजने (जैसे कि गणित की समस्या) और सूचनाओं की सूची को रैंक करने, दोनों के लिए अच्छी तरह काम करता है, जो यह सिद्ध करता है कि यह जानना कि कहाँ देखना है, यह जानने जितना ही महत्वपूर्ण है कि कैसे खोजना है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।