← नवीनतम पेपर
🤖 machine learning

Superintelligent Retrieval Agent: The Next Frontier of Information Retrieval

यह शोध पत्र SIRA को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) रिट्रीवल एजेंट है जो LLM संज्ञानात्मक क्षमता और कॉर्पस सांख्यिकी का लाभ उठाकर बहु-चरणीय अन्वेषणात्मक खोज को एक एकल, अत्यधिक प्रभावी लेक्सिकल रिट्रीवल एक्शन में संकुचित करता है, जो विविध बेंचमार्क में डेंस रिट्रीवर्स और अत्याधुनिक बहु-चरणीय एजेंटिक बेसलाइन दोनों से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Zeyu Yang, Qi Ma, Jason Chen, Anshumali Shrivastava

प्रकाशित 2026-05-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zeyu Yang, Qi Ma, Jason Chen, Anshumali Shrivastava

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप लाखों किताबों वाली एक विशाल लाइब्रेरी में एक विशिष्ट, दुर्लभ तथ्य खोजने की कोशिश कर रहे हैं।

पुराना तरीका (वर्तमान AI एजेंट्स): "अनुमान और जाँच" करने वाला नौसिखिया
अधिकांश वर्तमान AI सर्च एजेंट्स इस लाइब्रेरी के एक घबराए हुए नए कर्मचारी की तरह व्यवहार करते हैं। उन्हें लाइब्रेरी के लेआउट या लाइब्रेरियन द्वारा उपयोग की जाने वाली विशिष्ट शब्दावली का ज्ञान नहीं होता। इसलिए, वे एक प्रश्न पूछते हैं, उन्हें कुछ किताबें मिलती हैं, उन्हें पढ़ते हैं, उन्हें एहसास होता है कि वे मुख्य बिंदु से चूक गए हैं, अपने प्रश्न को फिर से लिखते हैं, और फिर से पूछते हैं। वे इस "अनुमान और जाँच" (guess and check) चक्र को कई बार दोहराते हैं।

  • समस्या: यह धीमा है, समय बर्बाद करता है, और अक्सर सही किताब खोजने में विफल रहता है क्योंकि AI केवल यह अनुमान लगा रहा होता है कि लाइब्रेरियन ने क्या लिखा होगा, बजाय इसके कि उसे पता हो कि वह किताब वास्तव में कहाँ रखी है।

नया तरीका (SIRA): "सुपर-एक्सपर्ट" लाइब्रेरियन
यह पेपर SIRA (SuperIntelligent Retrieval Agent) का परिचय देता है। अनुमान लगाने और जाँच करने के बजाय, SIRA एक मास्टर लाइब्रेरियन की तरह कार्य करता है जिसने पूरी लाइब्रेरी के कैटलॉग को याद कर लिया है और जानता है कि लोग वास्तव में चीजों को कैसे खोजते हैं।

SIRA कैसे काम करता है, इसे एक सरल कहानी में यहाँ समझाया गया है:

1. "प्री-गेम" तैयारी (ऑफलाइन एनरिचमेंट)

एक भी प्रश्न पूछे जाने से पहले, SIRA अपना होमवर्क करता है। वह लाइब्रेरी की हर किताब को पढ़ता है और खुद से पूछता है: "यदि कोई उपयोगकर्ता इस किताब को खोजना चाहता है, तो वह सर्च बार में कौन से शब्द टाइप करेगा?"

  • उपमा: कल्पना कीजिए कि "द बिग एप्पल" (The Big Apple) के बारे में एक किताब है जिसमें कभी भी "न्यू यॉर्क" या "NYC" शब्दों का उपयोग नहीं किया गया है। SIRA महसूस करता है कि यह एक समस्या है। वह चुपके से उस किताब के इंडेक्स कार्ड में "न्यू यॉर्क" और "NYC" जोड़ देता है ताकि जब कोई ये शब्द टाइप करे, तो वह किताब सामने आ सके। वह यह काम पूरी लाइब्रेरी के लिए एक बार करता है, जिससे लाइब्रेरी "सर्च-रेडी" (खोज के लिए तैयार) हो जाती है।

2. "क्रिस्टल बॉल" भविष्यवाणी (ऑनलाइन एनरिचमेंट)

जब आप कोई प्रश्न पूछते हैं (जैसे, "1998 विश्व कप किसने जीता?"), तो SIRA आपके शब्दों को केवल शाब्दिक रूप से नहीं लेता है। वह यह अनुमान लगाने के लिए अपने "दिमाग" (एक लार्ज लैंग्वेज मॉडल) का उपयोग करता है कि उत्तर कैसा दिखेगा।

  • उपमा: आप पूछते हैं, "1998 विश्व कप किसने जीता?" SIRA सोचता है, "उपयोगकर्ता ने 'फ्रांस' नहीं कहा है, लेकिन जीतने वाला दस्तावेज़ निश्चित रूप से 'फ्रांस' और 'जिदान' (Zidane) शब्द का उपयोग करेगा। मुझे यह सुनिश्चित करना होगा कि ये शब्द मेरी खोज में शामिल हों।"

3. "रियलिटी चेक" (फ़िल्टर)

यह सबसे महत्वपूर्ण हिस्सा है। SIRA केवल अनुमान नहीं लगाता; वह लाइब्रेरी के आंकड़ों के आधार पर अपने काम की जाँच करता है।

  • उपमा: SIRA सोच सकता है, "शायद 'सॉकर' (soccer) शब्द महत्वपूर्ण है।" लेकिन वह लाइब्रेरी के आंकड़ों की जाँच करता है और देखता है कि "सॉकर" शब्द लाइब्रेरी की हर किताब में लिखा है। यदि वह "सॉकर" के लिए खोज करता है, तो उसे लाखों बेकार परिणाम मिलेंगे। SIRA कहता है, "नहीं, वह शब्द बहुत सामान्य है। वह सही किताब खोजने में मदद नहीं करेगा।" वह सामान्य शब्दों को हटा देता है और केवल उन दुर्लभ, विशिष्ट शब्दों को रखता है जो सही किताब को गलत किताब से अलग करने में सक्षम होंगे।

4. "वन-शॉट" स्ट्राइक

लाइब्रेरियन से पांच बार पूछने के बजाय, SIRA आपके मूल प्रश्न को अपनी स्मार्ट, फ़िल्टर्ड भविष्यवाणियों के साथ मिलाकर एक सटीक सर्च क्वेरी बनाता है। वह एक ही बार में "Enter" बटन दबाता है, और क्योंकि उसने सही दुर्लभ शब्दों का उपयोग किया था और लाइब्रेरी पहले से ही तैयार थी, सही किताब तुरंत ढेर के सबसे ऊपर आ जाती है।

यह क्यों मायने रखता है (परिणाम)

पेपर ने दस अलग-अलग कठिन खोज चुनौतियों (जैसे वैज्ञानिक तथ्यों को खोजना, समाचार दावों की जाँच करना, या डुप्लिकेट प्रश्नों को खोजना) पर अन्य तरीकों के मुकाबले SIRA का परीक्षण किया।

  • विजेता: SIRA लगभग हर बार जीता।
  • आश्चर्यजनक तथ्य: इसने उन जटिल "न्यूरल नेटवर्क" (जिनके लिए भारी मात्रा में ट्रेनिंग डेटा की आवश्यकता होती है) वाले सिस्टम और उन सिस्टमों को भी पछाड़ दिया जो कई बार खोज करते हैं।
  • मुख्य निष्कर्ष: SIRA ने साबित कर दिया कि सबसे अच्छा उत्तर पाने के लिए आपको पांच बार खोजने या किसी सुपर-कॉम्प्लेक्स AI रीडर की आवश्यकता नहीं है। आपको बस एक अत्यंत स्मार्ट, अच्छी तरह से निर्मित सर्च क्वेरी की आवश्यकता है जो शोर के बीच से सही शब्दों को चुन सके।

संक्षेप में: SIRA AI को लाइब्रेरी में अंदाजे से भटकने से रोकता है। इसके बजाय, यह AI को एक मास्टर चाबी देता है जो पहली ही कोशिश में बिल्कुल सही दरवाजा खोल देती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →