← नवीनतम पेपर
💻 computer science

Topology-Aware Hybrid Retrieval for Enterprise Knowledge Systems

यह शोध पत्र एक टोपोलॉजी-जागरूक हाइब्रिड रिट्रीवल इंजन प्रस्तुत करता है जो डेंस, स्पार्स और फ़ाइल-सिस्टम सर्च को एक मल्टी-टियर कंट्रोलर के साथ एकीकृत करता है ताकि दस्तावेज़ पदानुक्रमों और हाइपरलिंक्स को स्वचालित रूप से नेविगेट किया जा सके, जिससे भाषा-मॉडल-संचालित क्वेरी डिकंपोजिशन के ओवरहेड से बचते हुए एंटरप्राइज नॉलेज सिस्टम के लिए रिकॉल, रैंकिंग गुणवत्ता और लेटेंसी में महत्वपूर्ण सुधार होता है।

मूल लेखक: Shubhay Joshua

प्रकाशित 2026-07-31
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shubhay Joshua

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, अराजक पुस्तकालय में एक विशिष्ट तथ्य खोजने की कोशिश कर रहे हैं। आर्टिफिशियल इंटेलिजेंस की दुनिया में, यह पुस्तकालय इंटरनेट या किसी कंपनी के आंतरिक दस्तावेज़ हैं, और लाइब्रेरियन एक "रिट्रीवल-ऑगमेंटेड जनरेशन" (RAG) सिस्टम है। RAG को एक सुपर-स्मार्ट रोबोट के रूप में सोचें जो केवल उत्तर याद नहीं करता, बल्कि बोलने से पहले पुस्तकालय में जाकर उन्हें ढूँढता है। यह रोबोट को मनगढ़ंत बातें बनाने (hallucinations) से रोकता है और इसे तुरंत नई चीजें सीखने में मदद करता है।

हालाँकि, पारंपरिक लाइब्रेरियनों के कुछ अजीब स्वभाव होते हैं। कुछ केवल उन सटीक शब्दों की परवाह करते हैं जो आप उपयोग करते हैं (यदि आप "कार" कहते हैं, तो वे "ऑटोमोबाइल" नहीं ढूँढ पाएंगे), जबकि अन्य केवल वाक्य के सामान्य भाव (vibe) की परवाह करते हैं (यदि आप "तेज़ वाहन" कहते हैं, तो वे आपको रेस कार लाकर दे सकते हैं भले ही आपने ट्रक के बारे में पूछा हो)। इसके अलावा, ये पारंपरिक लाइब्रेरियन अक्सर हर किताब को बिखरे हुए, असंबद्ध पन्नों के ढेर के रूप में देखते हैं, यह भूल जाते हैं कि एक पन्ने पर एक नोट हो सकता है, जैसे, "पेज 42 भी देखें," या किसी दूसरे दस्तावेज़ का हाइपरलिंक। जब रोबोट को एक जटिल कहानी जोड़ने की कोशिश करनी होती जिसमें कई जुड़े हुए पन्नों को पढ़ने की आवश्यकता होती है, तो वह अक्सर रास्ता भटक जाता है, भ्रमित हो जाता है, या यह तय करने में बहुत समय लगा देता है कि आगे कौन से पन्ने पढ़ने हैं।

यहीं पर एक नया दृष्टिकोण आता है, जिसे लाइब्रेरियन को अधिक तेज़, स्मार्ट और अधिक कनेक्टेड बनाने के लिए डिज़ाइन किया गया है।


द सुपर-कनेक्टेड लाइब्रेरियन: उत्तर खोजने का एक नया तरीका

कल्पना कीजिए कि आप एक रहस्य सुलझाने की कोशिश कर रहे एक जासूस हैं। पुराने तरीके में, आप सुराग के लिए एक ही दोस्त से पूछ सकते हैं। यदि आपका दोस्त केवल "लाल कारों" के बारे में जानता है, तो वह आपको "क्रिमसन सेडान" के बारे में नहीं बताएगा, भले ही वह वही चीज़ हो। या, यदि आप एक ऐसे दोस्त से पूछते हैं जो केवल अपराध स्थल के "एहसास" को जानता है, तो वह आपको चोरी की कहानी ला सकता है जब आप वास्तव में डकैती की तलाश में थे।

यह पेपर टोपोलॉजी-अवेयर हाइब्रिड रिट्रीवल (Topology-Aware Hybrid Retrieval) नामक एक नए प्रकार की डिटेक्टिव टीम का परिचय देता है। केवल एक दोस्त पर निर्भर रहने के बजाय, यह टीम एक ही समय में चार अलग-अलग स्काउट्स (जासूसों) को सुराग खोजने के लिए भेजती है, और फिर उनकी रिपोर्टों को एक आदर्श सूची में मिला देती है।

चार स्काउट्स
सिस्टम एक ही प्रश्न को एक साथ चार अलग-अलग "स्काउट्स" को भेजता है:

  1. द सिमेंटिक स्काउट (डेंस सर्च): यह स्काउट शब्दों के अर्थ को समझता है। यदि आप "तेज़ वाहनों" के बारे में पूछते हैं, तो वे गति के बारे में दस्तावेज़ ढूँढते हैं, भले ही वहां "तेज़" शब्द मौजूद न हो।
  2. द कीवर्ड स्काउट (स्पार्स/BM25 सर्च): यह स्काउट सटीक मिलान का कट्टर समर्थक है। यदि आप किसी विशिष्ट सीरियल नंबर या एरर कोड के लिए पूछते हैं, तो यह स्काउट तुरंत उसे ढूँढ लेता है, सामान्य अर्थ की परवाह किए बिना।
  3. द फ्रीक्वेंसी स्काउट (TF-IDF सर्च): \text{} यह देखता है कि पूरे पुस्तकालय में कोई शब्द कितना दुर्लभ है। यदि कोई शब्द बहुत सामान्य है, तो वे उसे अनदेखा कर देते हैं; यदि वह अद्वितीय है, तो वे उस पर ध्यान देते हैं।
  4. द फाइल-सिस्टम स्काउट (नेटिव DFS): यह स्काउट किताबों के अंदर के टेक्स्ट को नहीं देखता है। इसके बजाय, वे फाइलों के फोल्डर, फाइल के नाम और शेल्फ पर स्वामित्व टैग (ownership tags) को देखते हैं ताकि यह पता लगाया जा सके कि दस्तावेज़ कहाँ रखे गए हैं।

द ग्रेट मिक्सिंग पॉट
यहाँ पेचीदा हिस्सा है: सिमेंटिक स्काउट स्कोर जैसे "0.95" (बहुत करीब) देता है, जबकि कीवर्ड स्काउट स्कोर जैसे "150" (शब्द कितनी बार आया है उस पर आधारित) देता है। यदि आप इन नंबरों को बस जोड़ देंगे, तो कीवर्ड स्काउट हमेशा जीत जाएगा, और सिमेंटिक स्काउट की स्मार्ट अंतर्दृष्टि को अनदेखा कर दिया जाएगा।

इसे ठीक करने के लिए, सिस्टम एक चतुर "ओवर-फेचिंग" (Over-Fetching) रणनीति का उपयोग करता है। प्रत्येक स्काउट को केवल शीर्ष 5 परिणाम लाने के लिए कहने के बजाय, यह उन्हें एक बड़ा ढेर (मान लीजिए, प्रत्येक से 100 परिणाम) लाने के लिए कहता है। फिर, यह सभी स्कोर को सामान्य (normalize) करने के लिए एक गणितीय "अनुवादक" का उपयोग करता है, जिससे वे एक ही स्केल पर आ जाते हैं। अंत में, यह उन्हें एक कस्टमाइज़ेबल रेसिपी का उपयोग करके मिलाता है। आप सिस्टम को बता सकते हैं, "मैं 70% अर्थ और 30% सटीक शब्द चाहता हूँ," या "बस किसी भी स्काउट से उच्चतम स्कोर लें।" यह सुनिश्चित करता है कि अंतिम सूची सभी का सर्वश्रेष्ठ मिश्रण हो।

"हाइपरलिंक" की महाशक्ति
वास्तविक जादू, हालांकि, पहली सूची बनने के बाद होता है। एक सामान्य पुस्तकालय में, यदि आपको एक पन्ना मिलता है जिस पर लिखा है, "यह भी देखें: द सीक्रेट रेसिपी," तो एक इंसान को रुकना पड़ सकता है, सोचना पड़ सकता है, और लाइब्रेरियन से उस दूसरे पन्ने को खोजने के लिए कहना पड़ सकता है। इसमें समय लगता है और गलतियाँ हो सकती हैं।

इस नए सिस्टम में एक टोपोलॉजिकली-अवेयर मल्टी-टियर कंट्रोलर (Topologically-Aware Multi-Tier Controller) है। इसे एक ऐसे रोबोट के रूप में सोचें जो तुरंत पन्नों को जोड़ने वाले अदृश्य धागों को देख सकता है।

  1. प्राइमरी पास: यह चार स्काउट्स का उपयोग करके सर्वोत्तम प्रारंभिक दस्तावेज़ खोजता है।
  2. द लिंक जंप: यह तुरंत उन दस्तावेज़ों में किसी भी "हाइपरलिंक" या संदर्भों को स्कैन करता है।
  3. सेकेंडरी पास: अगले क्या खोजने के लिए एक धीमे, सोचने वाले AI के बजाय, रोबोट प्रोग्रामेटिकली उन लिंक्ड दस्तावेज़ों पर कूद जाता है और उन्हें तुरंत प्राप्त कर लेता है।
  4. द सेफ्टी नेट: यह सुनिश्चित करने के लिए कि यह अनंत लूप (जैसे अपनी ही पूंछ का पीछा करने वाला कुत्ता) में न फंस जाए, सिस्टम एक "विज़िटेड लिस्ट" (visited list) रखता है। यदि यह कोई ऐसा दस्तावेज़ देखता है जिसे इसने पहले ही चेक कर लिया है, तो यह उसे छोड़ देता है। यह यह भी जाँचता है कि क्या नया दस्तावेज़ मूल लिंक के संदर्भ में फिट बैठता है, जिससे अप्रासंगिक कचरे को फ़िल्टर किया जा सके।

क्यों यह मायने रखता है: गति और बुद्धिमत्ता
लेखकों ने इस सिस्टम का परीक्षण किया और पाया कि इसके परिणाम प्रभावशाली हैं।

  • बेहतर उत्तर: सिस्टम ने "रिकॉल" (कितने सही उत्तर मिले) में 20.0% का सुधार किया, जो कुछ परीक्षणों पर 1.0000 Recall@100 का सटीक स्कोर तक पहुँच गया। इसने रैंकिंग की गुणवत्ता (सर्वश्रेष्ठ उत्तर कितनी अच्छी तरह शीर्ष पर हैं) में भी 13.2% का सुधार किया।
  • बिजली जैसी तेज़: सबसे बड़ी जीत गति है। पुराने तरीके जो अगले कदम को समझने के लिए एक सोचने वाले AI का उपयोग करते थे, उनमें सेकंड (लगभग 3,700 मिलीसेकंड) लगते थे। यह नया सिस्टम वही काम एक मिलीसेकंड से भी कम समय (0.87 ms) में करता है। यह प्रतीक्षा समय में 95% की कमी है।
  • कम बर्बादी: केवल आवश्यक लिंक्ड दस्तावेज़ों को ही फेच करके, सिस्टम ने प्रोसेस किए जाने वाले अतिरिक्त टेक्स्ट (टोकन) की मात्रा को 25.8% से 43.3% तक कम कर दिया।

यह क्या नहीं है
यह ध्यान रखना महत्वपूर्ण है कि यह पेपर क्या नहीं करता है। यह अंतिम उत्तर लिखने वाले बड़े AI को बदलने के लिए नहीं है; यह केवल "ढूँढने" वाले हिस्से को बहुत बेहतर बनाने के लिए है। यह इस विचार के विरुद्ध भी तर्क देता है कि अगले खोज के लिए धीमे, लूपिंग AI एजेंटों का उपयोग किया जाना चाहिए, यह दिखाते हुए कि लिंक्ड दस्तावेज़ों पर सीधा, प्रोग्राम्ड जंप करना अधिक तेज़ और विश्वसनीय है।

संक्षेप में, यह पेपर सुझाव देता है कि चार अलग-अलग खोज शैलियों को जोड़कर, उनके परिणामों को गणितीय रूप से मिलाकर, और संबंधित पृष्ठों पर कूदने के लिए दस्तावेज़ के अपने आंतरिक मानचित्र का उपयोग करके, हम एक ऐसा एंटरप्राइज सर्च सिस्टम बना सकते हैं जो न केवल स्मार्ट है बल्कि वास्तविक समय की बातचीत के साथ तालमेल बिठाने के लिए पर्याप्त तेज़ भी है। यह एक अराजक पुस्तकालय को एक पूरी तरह से व्यवस्थित, हाइपर-कनेक्टेड ज्ञान वेब में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →