StratRAG: A Multi-Hop Retrieval Evaluation Dataset for Retrieval-Augmented Generation Systems
StratRAG एक नया ओपन-सोर्स डेटासेट है जिसे शोर-शराबे वाले और भ्रामक दस्तावेज़ों के पूलों में अंतर्निहित जटिल प्रश्नों के विरुद्ध रिट्रीवल रणनीतियों का मूल्यांकन करके रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) सिस्टम की मल्टी-हॉप रीजनिंग क्षमताओं को बेंचमार्क करने के लिए डिज़ाइन किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप "स्कैवेंजर हंट डिटेक्टिव" (खोजबीन करने वाला जासूस) का एक हाई-स्टेक्स खेल खेल रहे हैं।
एक रहस्य को सुलझाने के लिए, आपको केवल एक सुराग की आवश्यकता नहीं है; आपको दो विशिष्ट सुराग खोजने होंगे जो अलग-अलग स्थानों पर छिपे हुए हैं, और फिर उन्हें पहेली सुलझाने के लिए एक साथ उपयोग करना होगा। उदाहरण के लिए: "उस फिल्म के निर्देशक कौन हैं जिसमें वह अभिनेता अभिनय करता है जिसका जन्म बल्ब के आविष्कारक के ही शहर में हुआ था?"
इसे हल करने के लिए, पहले आपको आविष्कारक का शहर ढूंढना होगा, फिर अभिनेता को ढूंढना होगा, और अंत में निर्देशक को ढूंढना होगा। इसे "मल्टी-हॉप रीजनिंग" (Multi-Hop Reasoning) कहा जाता है—आपको जानकारी के एक टुकड़े से दूसरे टुकड़े तक "कूदना" (hop) पड़ता है।
समस्या: "मेसी लाइब्रेरी" (अव्यवस्थित पुस्तकालय)
अभी, वैज्ञानिक AI सिस्टम (जैसे ChatGPT) बना रहे हैं जो RAG (रिट्रीवल-ऑगमेंटेड जनरेशन) नामक एक तकनीक का उपयोग करते हैं। RAG को एक AI को लाइब्रेरी कार्ड देने की तरह समझें ताकि वह केवल अनुमान लगाने के बजाय तथ्यों को खोज सके।
हालाँकि, इन AI "लाइब्रेरियन" का परीक्षण करना कठिन है। अधिकांश परीक्षण इस तरह के होते हैं: "क्या आप बिल्लियों के बारे में एक किताब ढूंढ सकते हैं?" यह आसान है। लेकिन अधिकांश वास्तविक दुनिया के प्रश्न ऊपर दिए गए स्कैवेंजर हंट की तरह होते हैं। वर्तमान परीक्षण अक्सर अव्यवस्थित, असंगठित या आपको यह स्पष्ट रूप से नहीं बताते कि "सोने" जैसे कीमती सुराग कहाँ छिपे हैं, जिससे यह बताना असंभव हो जाता है कि AI वास्तव में एक अच्छा जासूस है या केवल किस्मत से जीत गया है।
समाधान: StratRAG (अल्टीमेट ट्रेनिंग ग्राउंड)
लेखक, आर्यन पाटोदिया ने StratRAG बनाया है। StratRAG को AI जासूसों के लिए एक पूरी तरह से नियंत्रित बाधा दौड़ (obstacle course) के रूप में समझें।
एक अव्यवस्थित लाइब्रेरी के बजाय, StratRAG AI को ठीक 15 लिफाफों वाला एक छोटा, विशिष्ट बॉक्स देता है।
- 2 लिफाफों में "गोल्ड क्ल्यूज़" (सत्य/सच) हैं।
- 13 लिफाफों में "डिस्ट्रैक्टर्स" (भटकाने वाली जानकारी) हैं (ऐसी जानकारी जो महत्वपूर्ण दिखती है लेकिन वास्तव में एक मृत अंत है)।
क्योंकि लेखक को ठीक से पता है कि किन लिफाफों में सच्चाई है, इसलिए वह AI के खोजने के कौशल पर यह ग्रेड दे सकता है कि वह कितना अच्छा है, बिना इस बात की चिंता किए कि AI एक अच्छा अंतिम उत्तर कैसे लिखता है। वह खोजने (retrieval) का परीक्षण कर रहा है, न कि लिखने (generation) का।
परिणाम: सबसे अच्छा जासूस कौन है?
लेखक ने तीन अलग-अलग "खोजने की शैलियों" का परीक्षण किया:
- कीवर्ड सर्चर (BM25): केवल विशिष्ट शब्दों को खोजने वाले व्यक्ति की तरह। यदि सुराग कहता है "ऑटोमोबाइल," तो वे वह सुराग नहीं ढूंढ पाएंगे जिसमें "कार" लिखा है।
- वाइब सर्चर (डेंस रिट्रीवल): वाक्य के अर्थ या "वाइब" (vibe) को खोजने वाले व्यक्ति की तरह। वे समझते हैं कि "कार" और "ऑटोमोबाइल" एक ही चीज़ हैं।
- हाइब्रिड डिटेक्टिव (विजेता): एक व्यक्ति जो विशिष्ट कीवर्ड और सामान्य "वाइब्स" दोनों का उपयोग करता है। यह जासूस सबसे सफल रहा।
"बॉस लेवल": द ब्रिज क्वेश्चन (सेतु प्रश्न)
यहाँ तक कि सबसे अच्छे हाइब्रिड डिटेक्टिव को भी एक विशिष्ट प्रकार की पहेली के साथ संघर्ष करना पड़ा: द ब्रिज क्वेश्चन (The Bridge Question)।
एक ब्रिज क्वेश्चन में, दो सुराग एक "ब्रिज" (छिपे हुए लिंक) द्वारा जुड़े होते हैं जो प्रश्न में उल्लेखित नहीं होता है। यह कुछ ऐसा है जैसे आपको बताया जाए, "उस व्यक्ति को खोजें जो उस घर में रहता है जिसे उस व्यक्ति ने बनाया जिसने टेलीफोन का आविष्कार किया था।" प्रश्न में घर या उस व्यक्ति का उल्लेख नहीं है; इसमें केवल टेलीफोन का उल्लेख है।
AI यहाँ फंस जाता है क्योंकि वह "टेलीफोन" के सुरागों की तलाश कर रहा है, लेकिन उसे यह एहसास नहीं होता कि उस ब्रिज को पार करने के लिए उसे पहले "व्यक्ति" को ढूंढना होगा।
आगे क्या?
लेखक का सुझाव है कि AI को केवल शब्दों या वाइब्स को खोजने के लिए सिखाने के बजाय, हमें इसे रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) के माध्यम से सिखाना चाहिए—मूल रूप रूप से, इसे "ट्रायल एंड एरर" (प्रयास और त्रुटि) के माध्यम से सिखाना, बिल्कुल वैसे ही जैसे एक कुत्ते को ट्रीट (treat) देकर प्रशिक्षित किया जाता है। यदि AI सही सुराग ढूंढ लेता है और रहस्य को सुलझा लेता है, तो उसे एक "ट्रीट" (गणितीय इनाम) मिलता है। अंततः, AI कठिन रहस्यों को सुलझाने के लिए उन ब्रिजों पर "कूदने" के पीछे के गुप्त तर्क को सीख जाएगा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।