Search, Inspect, Fetch: Exploiting Boolean Retrieval for Deep-Research Agents
यह शोधपत्र SIEVE को पेश करता है, जो एक डीप-रिसर्च एजेंट इंटरफ़ेस है जो केवल प्रासंगिक दस्तावेज़ अनुभागों को फ़िल्टर, रैंक और प्राप्त करने के लिए फील्डेड बूलियन रिट्रीवल (fielded Boolean retrieval) का लाभ उठाता है, जिससे पारंपरिक सर्च-विज़िट वर्कफ़्लो की तुलना में काफी कम टोकन के साथ उच्च सटीकता प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रहस्य सुलझाने की कोशिश कर रहे हैं एक जासूस के रूप में, लेकिन आपके पास किसी धूल भरी लाइब्रेरी के बजाय, पूरी इंटरनेट तक पहुँच है। आर्टिफिशियल इंटेलिजेंस की दुनिया में, "डीप-रिसर्च एजेंट्स" (deep-research agents) इन जासूसों की तरह होते हैं: ये कंप्यूटर प्रोग्राम हैं जिन्हें वेब पर खोज करने, जो वे पाते हैं उसे पढ़ने और उत्तर को जोड़ने के लिए डिज़ाइन किया गया है। ऐसा करने के लिए, वे आमतौर पर एक सरल दिनचर्या का पालन करते हैं: वे एक सर्च क्वेरी टाइप करते हैं, वेब पेजों के संक्षिप्त सारांशों (snippets) की एक सूची देखते हैं, सबसे आशाजनक एक को चुनते हैं, और फिर शुरू से अंत तक पूरे पेज को पढ़ते हैं। इसे "सर्च-विज़िट" (Search–Visit) वर्कफ़्लो कहा जाता है। यह एक ऐसी किताब में एक विशिष्ट वाक्य खोजने जैसा है जहाँ आपको लाइब्रेरी के हर एक पन्ने को पढ़ना पड़ता है, भले ही आपको केवल एक किताब के बीच के एक पैराग्राफ की आवश्यकता हो। समस्या यह है कि वेब पेज वास्तव में शीर्षक, हेडिंग और सेक्शन के साथ व्यवस्थित होते हैं, लेकिन अधिकांश AI जासूस इस संरचना को अनदेखा कर देते हैं। वे हर पेज को टेक्स्ट के एक विशाल, असंगठित ढेर की तरह मानते हैं, जिससे समय बर्बाद होता है और कंप्यूटर भ्रमित हो जाता है।
यह शोध पत्र SIEVE नामक एक स्मार्ट तरीके से जासूसी करने का परिचय देता है। शोधकर्ताओं ने एक ऐसा सिस्टम बनाया है जो वेब पेजों को कागजों के अव्यवस्थित ढेरों के बजाय अच्छी तरह से व्यवस्थित फाइलिंग कैबिनेट की तरह मानता है। पूरे पेजों को पढ़ने के बजाय, SIEVE एक विशेष "बुलियन क्वेरी लैंग्वेज" (Boolean Query Language - जिसे आप एक अत्यंत सटीक सर्च फ़िल्टर मान सकते हैं) का उपयोग करता है ताकि बहुत विशिष्ट प्रश्न पूछे जा सकें, जैसे "मुझे केवल वे सेक्शन दिखाएं जिनमें 'History' हेडिंग है और '1995' का उल्लेख है।" इसके बाद यह परिणामों की सूची का निरीक्षण करता है कि कौन सी हेडिंग्स और संक्षिप्त स्निपेट्स हैं, सटीक सेक्शन चुनता है जिसकी उसे आवश्यकता है, और केवल उस छोटे से हिस्से को प्राप्त (fetch) करता है। यह दृष्टिकोण, जिसे "सर्च-इन्स्पेक्ट-फ़ैच" (search–inspect–fetch) कहा जाता है, एजेंट को दस्तावेज़ के अप्रासंगिक हिस्सों को पूरी तरह से अनदेखा करने की अनुमति देता है। लेखकों ने इसे तीन अलग-अलग कठिन प्रश्नों के सेट पर परखा और पाया कि SIEVE न केवल सही उत्तर खोजने में अधिक सटीक था, बल्कि इसने पारंपरिक तरीकों की तुलना में 20.7–50.6% कम "टोकन" (टेक्स्ट की बुनियादी इकाइयाँ जिन्हें कंप्यूटर प्रोसेस करता है) का उपयोग किया। संक्षेप में, वेब की संरचना का सम्मान करके, AI जासूस रहस्यों को तेज़ी से, सस्ते में और कम गलतियों के साथ हल कर सकता है।
जासूस का नया टूलकिट: SIEVE
कल्पना कीजिए कि आप हज़ारों पन्नों वाली एक विशाल कुकबुक में एक विशिष्ट रेसिपी ढूंढ रहे हैं। पुराना तरीका ( "Search–Visit" विधि) यह है कि आप एक लाइब्रेरियन से पूछें, "क्या आपके पास चॉकलेट केक की रेसिपी है?" लाइब्रेरियन आपको दस किताबों की एक सूची देता है जिनमें यह हो सकती है। आप एक चुनते हैं, वहां जाते हैं, और पहले पन्ने से आखिरी पन्ने तक पूरी किताब पढ़ते हैं, इस उम्मीद में कि आपको बीच में कहीं चॉकलेट केक की रेसिपी मिल जाएगी। यदि आपको नहीं मिलती है, तो आप वापस जाते हैं, दूसरी किताब चुनते हैं, और वह पूरी किताब भी पढ़ते हैं। यह थका देने वाला, धीमा है और आप अपने दिमाग में ब्रेड और सूप के बारे में ऐसी जानकारी भर लेते हैं जिसकी आपको ज़रूरत ही नहीं थी।
इस पेपर के लेखक तर्क देते हैं कि इंटरनेट का उपयोग करने का यह एक बुरा तरीका है। वेब पेज केवल टेक्स्ट के ढेर नहीं हैं; वे शीर्षक, हेडिंग, तारीख और सेक्शन के साथ संरचित होते हैं, ठीक वैसे ही जैसे एक किताब के अध्याय होते हैं। समस्या यह है कि वर्तमान AI एजेंट अक्सर इन "अध्यायों" को अनदेखा कर देते हैं। वे पूरे पेज को तब भी पढ़ते हैं जब उत्तर केवल एक छोटे से सेक्शन में होता है।
इसे ठीक करने के लिए, टीम ने SIEVE बनाया है, जो एक सर्च-इन्स्पेक्ट-फ़ैच रणनीति है। SIEVE को एक ऐसे जासूस के रूप में सोचें जो न केवल पूरी किताब पढ़ता है बल्कि यह भी जानता है कि विषय-सूची (table of contents) का उपयोग कैसे करना है।
चरण 1: सुपर-फ़िल्टर (Search)
एक अस्पष्ट प्रश्न टाइप करने के बजाय, SIEVE एक विशेष भाषा का उपयोग करता है जिसे बुलियन क्वेरी लैंग्वेज (BQL) कहा जाता है। यह एक लाइब्रेरियन को सख्त नियमों का एक सेट देने जैसा है। केवल "मुझे केक ढूंढो" कहने के बजाय, एजेंट कहता है, "ऐसे दस्तावेज़ खोजें जहाँ शीर्षक (Title) में 'Chocolate' हो AND सेक्शन (Section) 'Recipes' हो AND तारीख (Date) 2020 के बाद की हो।" यह तुरंत हज़ारों अप्रासंगिक पेजों को फ़िल्टर कर देता है। यह एक जादुई छलनी की तरह है जो केवल सही तरह की रेत को ही गुजरने देती है, पत्थरों को पीछे छोड़ देती है।
चरण 2: एक त्वरित नज़र (Inspect)
एक बार जब फ़िल्टर अपना काम कर लेता है, तो एजेंट अभी पूरे पेज नहीं पढ़ता है। इसके बजाय, वह "रिजल्ट कार्ड्स" को देखता है। ये इंडेक्स कार्ड की तरह होते हैं जो शीर्षक, चैप्टर हेडिंग्स की सूची और टेक्स्ट का एक छोटा सा 25-शब्दों का स्निपेट दिखाते हैं। एजेंट देख सकता है, "ओह, इस किताब में 'Desserts' नाम का एक अध्याय है और दूसरा 'Breakfast' का।" वह बिना एक भी पूरा वाक्य पढ़े यह देख सकता है कि कौन सा हेडिंग वास्तव में आशाजनक लग रहा है।
चरण 3: सर्जिकल ग्रैब (Fetch)
यही गेम-चेंजर है। एक बार जब एजेंट देख लेता है कि "Desserts" वाला अध्याय ही उसकी ज़रूरत है, तो वह पूरी किताब नहीं खोलता। वह सिस्टम से केवल "Desserts" सेक्शन को "फ़ेच" (fetch) करने के लिए कहता है। उसे केवल जानकारी का वह विशिष्ट हिस्सा मिलता है। वह ब्रेड, सूप और इतिहास के अध्यायों को अनदेखा कर देता है।
यह क्यों मायने रखता है: गति और समझदारी
शोधकर्ताओं ने पुराने "पूरा पेज पढ़ने" वाले तरीके के मुकाबले इस नई विधि का परीक्षण तीन अलग-अलग कठिन संग्रहों (HotpotQA, MuSiQue, और BROWSECOMP-PLUS) का उपयोग करके किया। ये कठिन स्तरों वाले विभिन्न ट्रिविया गेम की तरह हैं, जो साधारण विकिपीडिया प्रश्नों से लेकर बहुत गहरे, जटिल शोध कार्यों तक विस्तृत हैं।
परिणाम प्रभावशाली थे। SIEVE ने न केवल समय बचाया; इसने वास्तव में बेहतर उत्तर भी दिए।
- सटीकता (Accuracy): तीनों संग्रहों पर, SIEVE पारंपरिक सर्वोत्तम विधि से अधिक सटीक था।
- दक्षता (Efficiency): इसने उन उत्तरों को पाने के लिए 20.7% से 50.6% कम टोकन का उपयोग किया। इसे समझने के लिए, यदि एक पारंपरिक एजेंट को उत्तर खोजने के लिए 100 पन्ने पढ़ने पड़ते, तो SIEVE को शायद केवल 50 पन्नों (या उससे भी कम) के बराबर पढ़ने की आवश्यकता होती क्योंकि वह अप्रासंगिक हिस्सों को छोड़ देता है।
- मजबूती (Robustness): टीम ने इसे विभिन्न "मस्तिष्क" (AI मॉडल्स) और विभिन्न सर्च इंजन के साथ आज़माया, और SIEVE जीतता रहा। यह काम कर गया चाहे एजेंट एक सरल सर्च टूल का उपयोग कर रहा हो या एक जटिल एक का।
यह पेपर क्या कहता है (और क्या नहीं कहता)
लेखक बहुत स्पष्ट हैं कि उन्होंने क्या पाया और क्या नहीं। उन्होंने केवल अनुमान नहीं लगाया; उन्होंने नियंत्रित प्रयोग चलाए जहाँ उन्होंने बिल्कुल उन्हीं प्रश्नों का उपयोग करके पारंपरिक तरीकों के विरुद्ध सीधे SIEVE की तुलना की।
- उन्होंने क्या सिद्ध किया: उन्होंने दिखाया कि वेब पेजों की संरचना को अनदेखा करना एक गलती है। संरचना (हेडिंग्स, सेक्शन्स) का उपयोग करके केवल आवश्यक चीज़ों को फ़िल्टर और फ़ेच करके, एजेंट अधिक सटीक और कुशल हो सकते हैं। उन्होंने यह भी सिद्ध किया कि "सर्च-इन्स्पेक्ट-फ़ैच" लूप, केवल "सर्च-विज़िट" से बेहतर है।
- उन्होंने क्या खारिज किया: उन्होंने दिखाया कि पूरा पेज पढ़ना (भले ही आप कई बार खोज करें) संसाधनों की बर्बादी है। उन्होंने यह भी दिखाया कि केवल एक बेहतर "मस्तिष्क" (अधिक शक्तिशाली AI मॉडल) होना ही काफी नहीं है यदि उसके खोजने और पढ़ने का तरीका अक्षम है।
- जहाँ यह अभी भी संघर्ष कर सकता है: पेपर नोट करता है कि SIEVE अभी भी इस बात पर निर्भर करता है कि एजेंट एक अच्छा "बुलियन" क्वेरी लिख सके। यदि एजेंट गलत प्रश्न पूछता है, तो फ़िल्टर सही उत्तर को ब्लॉक कर सकता है। हालाँकि, उन्होंने पाया कि सिस्टम में एक "सेफ्टी नेट" है: यदि सख्त फ़िल्टर कुछ भी नहीं पाता है, तो यह स्वचालित रूप से नियमों को ढीला कर देता है और फिर से प्रयास करता है, ताकि यह अटक न जाए।
बड़ी तस्वीर
यह पेपर सुझाव देता है कि AI रिसर्च का भविष्य केवल AI को सामान्य अर्थों में "स्मार्ट" बनाने के बारे में नहीं है, बल्कि इसे अधिक व्यवस्थित बनाना सीखने के बारे में है। जिस तरह एक मानव शोधकर्ता एक तथ्य खोजने के लिए पूरी विश्वकोश (encyclopedia) नहीं पढ़ेगा, उसी तरह एक AI को भी नहीं पढ़ना चाहिए। वेब पर सूचना को जिस तरह से व्यवस्थित किया गया है, उसका सम्मान करके, SIEVE दिखाता है कि हम तेज़, सस्ते और अधिक सटीक एजेंट बना सकते हैं। यह एक याद दिलाता है कि कभी-कभी, सच्चाई खोजने का सबसे अच्छा तरीका सब कुछ पढ़ना नहीं, बल्कि सही चीज़ों को पढ़ना शुरू करना है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।