← नवीनतम पेपर
💻 computer science

StratRAG: A Multi-Hop Retrieval Evaluation Dataset for Retrieval-Augmented Generation Systems

StratRAG एक नया ओपन-सोर्स डेटासेट है जिसे शोर-शराबे वाले और भ्रामक दस्तावेज़ों के पूलों में अंतर्निहित जटिल प्रश्नों के विरुद्ध रिट्रीवल रणनीतियों का मूल्यांकन करके रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) सिस्टम की मल्टी-हॉप रीजनिंग क्षमताओं को बेंचमार्क करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Aryan Patodiya

प्रकाशित 2026-04-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Aryan Patodiya

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप "स्कैवेंजर हंट डिटेक्टिव" (खोजबीन करने वाला जासूस) का एक हाई-स्टेक्स खेल खेल रहे हैं।

एक रहस्य को सुलझाने के लिए, आपको केवल एक सुराग की आवश्यकता नहीं है; आपको दो विशिष्ट सुराग खोजने होंगे जो अलग-अलग स्थानों पर छिपे हुए हैं, और फिर उन्हें पहेली सुलझाने के लिए एक साथ उपयोग करना होगा। उदाहरण के लिए: "उस फिल्म के निर्देशक कौन हैं जिसमें वह अभिनेता अभिनय करता है जिसका जन्म बल्ब के आविष्कारक के ही शहर में हुआ था?"

इसे हल करने के लिए, पहले आपको आविष्कारक का शहर ढूंढना होगा, फिर अभिनेता को ढूंढना होगा, और अंत में निर्देशक को ढूंढना होगा। इसे "मल्टी-हॉप रीजनिंग" (Multi-Hop Reasoning) कहा जाता है—आपको जानकारी के एक टुकड़े से दूसरे टुकड़े तक "कूदना" (hop) पड़ता है।

समस्या: "मेसी लाइब्रेरी" (अव्यवस्थित पुस्तकालय)

अभी, वैज्ञानिक AI सिस्टम (जैसे ChatGPT) बना रहे हैं जो RAG (रिट्रीवल-ऑगमेंटेड जनरेशन) नामक एक तकनीक का उपयोग करते हैं। RAG को एक AI को लाइब्रेरी कार्ड देने की तरह समझें ताकि वह केवल अनुमान लगाने के बजाय तथ्यों को खोज सके।

हालाँकि, इन AI "लाइब्रेरियन" का परीक्षण करना कठिन है। अधिकांश परीक्षण इस तरह के होते हैं: "क्या आप बिल्लियों के बारे में एक किताब ढूंढ सकते हैं?" यह आसान है। लेकिन अधिकांश वास्तविक दुनिया के प्रश्न ऊपर दिए गए स्कैवेंजर हंट की तरह होते हैं। वर्तमान परीक्षण अक्सर अव्यवस्थित, असंगठित या आपको यह स्पष्ट रूप से नहीं बताते कि "सोने" जैसे कीमती सुराग कहाँ छिपे हैं, जिससे यह बताना असंभव हो जाता है कि AI वास्तव में एक अच्छा जासूस है या केवल किस्मत से जीत गया है।

समाधान: StratRAG (अल्टीमेट ट्रेनिंग ग्राउंड)

लेखक, आर्यन पाटोदिया ने StratRAG बनाया है। StratRAG को AI जासूसों के लिए एक पूरी तरह से नियंत्रित बाधा दौड़ (obstacle course) के रूप में समझें।

एक अव्यवस्थित लाइब्रेरी के बजाय, StratRAG AI को ठीक 15 लिफाफों वाला एक छोटा, विशिष्ट बॉक्स देता है।

  • 2 लिफाफों में "गोल्ड क्ल्यूज़" (सत्य/सच) हैं।
  • 13 लिफाफों में "डिस्ट्रैक्टर्स" (भटकाने वाली जानकारी) हैं (ऐसी जानकारी जो महत्वपूर्ण दिखती है लेकिन वास्तव में एक मृत अंत है)।

क्योंकि लेखक को ठीक से पता है कि किन लिफाफों में सच्चाई है, इसलिए वह AI के खोजने के कौशल पर यह ग्रेड दे सकता है कि वह कितना अच्छा है, बिना इस बात की चिंता किए कि AI एक अच्छा अंतिम उत्तर कैसे लिखता है। वह खोजने (retrieval) का परीक्षण कर रहा है, न कि लिखने (generation) का।

परिणाम: सबसे अच्छा जासूस कौन है?

लेखक ने तीन अलग-अलग "खोजने की शैलियों" का परीक्षण किया:

  1. कीवर्ड सर्चर (BM25): केवल विशिष्ट शब्दों को खोजने वाले व्यक्ति की तरह। यदि सुराग कहता है "ऑटोमोबाइल," तो वे वह सुराग नहीं ढूंढ पाएंगे जिसमें "कार" लिखा है।
  2. वाइब सर्चर (डेंस रिट्रीवल): वाक्य के अर्थ या "वाइब" (vibe) को खोजने वाले व्यक्ति की तरह। वे समझते हैं कि "कार" और "ऑटोमोबाइल" एक ही चीज़ हैं।
  3. हाइब्रिड डिटेक्टिव (विजेता): एक व्यक्ति जो विशिष्ट कीवर्ड और सामान्य "वाइब्स" दोनों का उपयोग करता है। यह जासूस सबसे सफल रहा।

"बॉस लेवल": द ब्रिज क्वेश्चन (सेतु प्रश्न)

यहाँ तक कि सबसे अच्छे हाइब्रिड डिटेक्टिव को भी एक विशिष्ट प्रकार की पहेली के साथ संघर्ष करना पड़ा: द ब्रिज क्वेश्चन (The Bridge Question)।

एक ब्रिज क्वेश्चन में, दो सुराग एक "ब्रिज" (छिपे हुए लिंक) द्वारा जुड़े होते हैं जो प्रश्न में उल्लेखित नहीं होता है। यह कुछ ऐसा है जैसे आपको बताया जाए, "उस व्यक्ति को खोजें जो उस घर में रहता है जिसे उस व्यक्ति ने बनाया जिसने टेलीफोन का आविष्कार किया था।" प्रश्न में घर या उस व्यक्ति का उल्लेख नहीं है; इसमें केवल टेलीफोन का उल्लेख है।

AI यहाँ फंस जाता है क्योंकि वह "टेलीफोन" के सुरागों की तलाश कर रहा है, लेकिन उसे यह एहसास नहीं होता कि उस ब्रिज को पार करने के लिए उसे पहले "व्यक्ति" को ढूंढना होगा।

आगे क्या?

लेखक का सुझाव है कि AI को केवल शब्दों या वाइब्स को खोजने के लिए सिखाने के बजाय, हमें इसे रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) के माध्यम से सिखाना चाहिए—मूल रूप रूप से, इसे "ट्रायल एंड एरर" (प्रयास और त्रुटि) के माध्यम से सिखाना, बिल्कुल वैसे ही जैसे एक कुत्ते को ट्रीट (treat) देकर प्रशिक्षित किया जाता है। यदि AI सही सुराग ढूंढ लेता है और रहस्य को सुलझा लेता है, तो उसे एक "ट्रीट" (गणितीय इनाम) मिलता है। अंततः, AI कठिन रहस्यों को सुलझाने के लिए उन ब्रिजों पर "कूदने" के पीछे के गुप्त तर्क को सीख जाएगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →