SearchGym: A Modular Infrastructure for Cross-Platform Benchmarking and Hybrid Search Orchestration
यह शोध पत्र SearchGym को प्रस्तुत करता है, जो एक मॉड्यूलर इंफ्रास्ट्रक्चर है जो डेटा, एम्बेडिंग और रिट्रीवल घटकों को अलग करता है ताकि पुनरुत्पादित क्रॉस-प्लेटफॉर्म बेंचमार्किंग और हाइब्रिड सर्च ऑर्केस्ट्रेशन को सक्षम किया जा सके, जिससे यह पता चलता है कि इष्टतम पाइपलाइन अनुक्रमण (sequencing) फ़िल्टर की शक्ति पर निर्भर करता है और लिटसर्च (LitSearch) बेंचमार्क पर 70% टॉप-100 रिट्रीवल दर प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, अव्यवस्थित पुस्तकालय में एक विशिष्ट पुस्तक खोजने की कोशिश कर रहे हैं। कभी-कभी आप सटीक शीर्षक जानते हैं (एक कीवर्ड सर्च), और कभी-कभी आपको केवल कहानी का "वाइब" या मुख्य पात्र का नाम याद रहता है (एक सिमेंटिक सर्च)।
वर्तमान में, इन "पुस्तकालयों" (जिन्हें RAG सिस्टम कहा जाता है) को बनाने वाले अधिकांश उपकरण ऐसे हैं जैसे कि लेगो सेट्स जहाँ ईंटें आपस में चिपकी हुई हैं। यदि आप अपने खोज करने के तरीके को बदलना चाहते हैं, तो आपको अक्सर पूरी शेल्फ को तोड़कर फिर से बनाना पड़ता है। यही कारण है कि कई प्रोजेक्ट लैब में तो बहुत अच्छे लगते हैं, लेकिन जब आप उन्हें वास्तविक दुनिया में उपयोग करने की कोशिश करते हैं, तो वे विफल हो जाते हैं।
यहाँ SearchGym का प्रवेश होता है। SearchGym को एक एकल उपकरण के रूप में नहीं, बल्कि सर्च इंजन बनाने और परीक्षण करने के लिए एक उच्च-तकनीकी, मॉड्यूलर वर्कशॉप के रूप में सोचें।
यह कैसे काम करता है, इसे सरल अवधारणाओं में विभाजित किया गया है:
1. तीन जादुई बक्से (आर्किटेक्चर)
कोड के उलझे हुए जाल के बजाय, SearchGym सर्च सिस्टम को तीन अलग-अलग, विनिमेय (interchangeable) बक्सों में विभाजित करता है:
- डेटासेट (पुस्तकालय सूची): यह केवल कच्ची जानकारी है। SearchGym एक दस्तावेज़ को एक बहुआयामी रत्न की तरह मानता है। यह शीर्षक (Title), एब्स्ट्रैक्ट (Abstract), या पूर्ण पाठ (Full Text) को एक ही वस्तु के विभिन्न "दृष्टिकोणों" के रूप में देख सकता है। यह तथ्यों की एक अलग सूची (मेटाडेटा) भी रखता है जैसे कि "लेखक", "वर्ष", या "विषय"।
- वेक्टर सेट (अनुवादक): यह बॉक्स टेक्स्ट को एक गणितीय मानचित्र (वेक्टर्स) में बदल देता है। कल्पना कीजिए कि यह एक अनुवादक है जो "मुझे एक बहादुर कुत्ते के बारे में कहानी चाहिए" को मानचित्र पर एक विशिष्ट निर्देशांक (coordinate) में बदल देता है। खास बात यह है कि आप पूरे पुस्तकालय को दोबारा बनाए बिना अनुवादक (AI मॉडल) को बदल सकते हैं।
- ऐप (लाइब्रेरियन): यह वह मस्तिष्क है जो वास्तव में पुस्तकें खोजता है। यह तय करता है: "क्या मुझे पहले कीवर्ड इंजन से पूछना चाहिए? या क्या मुझे पहले AI मैप से पूछना चाहिए? क्या मुझे खोजने से पहले या बाद में वर्ष के आधार पर फ़िल्टर करना चाहिए?"
2. "रेसिपी बुक" (कॉन्फ़िग-ड्रिवन डेवलपमेंट)
आमतौर पर, एक सर्च इंजन को बदलने के लिए, एक प्रोग्रामर को कोड फिर से लिखना पड़ता है। SearchGym के साथ, आप केवल एक रेसिपी लिखते हैं (एक कॉन्फ़िगरेशन फ़ाइल)।
- क्या आप यह परीक्षण करना चाहते हैं कि "विषय" के बजाय "लेखक" के आधार पर पहले खोजना बेहतर है या नहीं? आप बस रेसिपी में थोड़ा बदलाव करते हैं।
- सिस्टम उस रेसिपी के आधार पर इंजन को स्वचालित रूप से बनाता है।
- यह क्यों मायने रखता है: इसका मतलब है कि आप एक साल बाद भी ठीक वही प्रयोग चला सकते हैं और बिल्कुल वही परिणाम प्राप्त कर सकते हैं। अब "यह मेरे कंप्यूटर पर काम कर रहा था" जैसे बहाने नहीं चलेंगे।
3. बड़ी बहस: "फिल्टर पहले" बनाम "सर्च पहले"
पेपर की सबसे दिलचस्प खोजों में से एक समय (timing) के बारे में है। जब आपके पास एक फ़िल्टर (जैसे "मुझे 2024 के पेपर दिखाएं") और एक सर्च (जैसे "AI के बारे में पेपर खोजें") होता है, तो आपको पहले क्या करना चाहिए?
- नाइव अप्रोच (Naive Approach): "आइए पहले सब कुछ खोज लें, फिर परिणामों को फ़िल्टर करें।"
- SearchGym का अंतर्दृष्टि (Insight): यह इस पर निर्भर करता है कि आपका फ़िल्टर कितना सख्त है!
- यदि फ़िल्टर सख्त है (जैसे, "मुझे केवल डॉ. स्मिथ के पेपर दिखाएं"): तो पहले फ़िल्टर करें। यह लाइब्रेरी को किताब खोजने से पहले केवल एक शेल्फ तक सीमित करने जैसा है। यह बहुत तेज़ है।
- यदि फ़िल्टर कमजोर है (जैसे, "मुझे किसी भी वर्ष के पेपर दिखाएं"): तो पहले सर्च करें। AI तेजी से शीर्ष 100 प्रासंगिक किताबें खोजने में सक्षम है, भले ही उसे बहुत सारे डेटा को देखना पड़े। यदि आप पहले फ़िल्टर करते हैं, तो आप बहुत सारी अप्रासंगिक किताबों की सूची को छाँटने में समय बर्बाद कर सकते हैं।
SearchGym ने साबित किया कि "एक ही नियम सबके लिए" जैसा कुछ नहीं है। सबसे अच्छा क्रम विशिष्ट स्थिति पर निर्भर करता है, और सिस्टम खुद समझ सकता है कि सबसे अच्छा क्रम क्या है।
4. यह क्यों मायने रखता है ("जिम" रूपक)
लेखक इसे "जिम" कहते हैं क्योंकि यह आपके विचारों को व्यायाम (work out) कराने की जगह है।
- इंजीनियरों के लिए: यह एक खेल का मैदान है जहाँ आप पुर्जों को बदल सकते हैं, उनका परीक्षण कर सकते हैं और एक मजबूत सिस्टम बना सकते हैं जो वास्तव में प्रोडक्शन में काम करता है।
- वैज्ञानिकों के लिए: यह एक प्रयोगशाला है। यह देखते हुए कि सिस्टम खुद को कैसे अनुकूलित करता है, शोधकर्ता कुछ गहरा सीख सकते हैं: मानव ज्ञान वास्तव में कैसे काम करता है?
यदि सिस्टम पाता है कि किसी विशिष्ट क्षेत्र में उत्तर खोजने के लिए "विषय" के बाद "लेखक" के आधार पर खोजना हमेशा सबसे तेज़ तरीका है, तो शायद यह हमें बताता है कि मनुष्य स्वाभाविक रूप से उस विषय को अपने दिमाग में कैसे व्यवस्थित करते हैं।
संक्षेप में
SearchGym एक मॉड्यूलर टूलकिट है जो हमें सर्च इंजन को कंक्रीट से बनाने के बजाय विनिमेय लेगो ब्रिक्स से बनाना सिखाता है। यह हमें कीवर्ड सर्च को AI की समझ के साथ मिलाने का सबसे अच्छा तरीका खोजने में मदद करता है, यह सुनिश्चित करता है कि जब आप कोई प्रश्न पूछें, तो उत्तर तेज़, सटीक और पुनरुत्पादनीय (reproducible) रूप में वापस आए।
यह केवल एक बेहतर सर्च इंजन बनाने के बारे में नहीं है; यह यह समझने के लिए एक प्रयोगशाला बनाने के बारे में है कि हम वास्तव में सूचना कैसे खोजते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।