← नवीनतम पेपर
🤖 AI

Uncertainty-Aware Hybrid Retrieval for Long-Document RAG

यह शोध पत्र UMG-RAG का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त (training-free) हाइब्रिड रिट्रीवल फ्रेमवर्क है जो अनिश्चितता अनुमान (uncertainty estimation) के आधार पर कई चंक ग्रैनुलैरिटीज़ से साक्ष्य को गतिशील रूप से संलयित (fuse) करता है और मौजूदा रिट्रीवर्स या जनरेटर्स को संशोधित किए बिना लॉन्ग-डॉक्यूमेंट RAG प्रदर्शन को बढ़ाने के लिए एक पैरेंट प्रमोशन वेरिएंट (UMGP-RAG) पेश करता है।

मूल लेखक: Hoin Jung, Xiaoqian Wang

प्रकाशित 2026-06-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hoin Jung, Xiaoqian Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप किताबों के एक विशाल पुस्तकालय को पढ़कर किसी रहस्य को सुलझाने की कोशिश कर रहे हैं। आप एक लाइब्रेरियन (Retriever) से उन विशिष्ट पृष्ठों के बारे में पूछते हैं जिनमें उत्तर छिपा है, और फिर आप एक जासूस (Generator) से उन पृष्ठों को पढ़ने और समाधान लिखने के लिए कहते हैं।

यह समस्या, जैसा कि यह शोध पत्र बताता है, यह है कि लाइब्रेरियन अक्सर इस बात में संघर्ष करता है कि उन्हें आपको कागज के टुकड़े कितने बड़े देने चाहिए।

दुविधा: बहुत बड़ा बनाम बहुत छोटा

लेखक एक पेचीदा ट्रेड-ऑफ (trade-off) का वर्णन करते हैं:

  1. "बहुत बड़ा" दृष्टिकोण (Coarse Retrieval):
    कल्पना कीजिए कि लाइब्रेरियन आपको एक पूरा अध्याय थमा देता है। इसमें उत्तर तो निश्चित रूप से है, लेकिन यह 50 पृष्ठों के उबाऊ विवरणों, असंबंधित पात्रों और अनावश्यक टेक्स्ट से भी भरा हुआ है।
  • परिणाम: आपका जासूस अभिभूत (overwhelelled) हो जाता है। महत्वपूर्ण सुराग शोर के बीच कहीं दब गया है (एक समस्या जिसे पेपर "lost-in-the-middle" कहता है)। जासूस सुराग को मिस कर सकता है या भ्रमित हो सकता है।
  1. "बहुत छोटा" दृष्टिकोण (Fine-Grained Retrieval):
    अब, कल्पना कीजिए कि लाइब्रेरियन आपको केवल एक वाक्य देता है। यह बहुत केंद्रित है और इसमें कोई शोर नहीं है।
  • परिणाम: वह वाक्य बहुत छोटा हो सकता है। इसमें उस संदर्भ की कमी है जो यह समझने के लिए आवश्यक है कि वह किस बारे में बात कर रहा है। यह एक अकेले शब्द "Azteca" को खोजने जैसा है बिना यह जाने कि यह मेक्सिको सिटी में एक स्टेडियम है। जासूस को शायद पता भी न चले कि यह वाक्य ही उत्तर है क्योंकि इसमें आसपास के सुराग गायब हैं।

समाधान: "स्मार्ट लाइब्रेरियन" (UMG-RAG)

लेखक एक नया सिस्टम प्रस्तावित करते हैं जिसे UMG-RAG (Uncertainty-aware Multi-Granularity RAG) कहा जाता है। इसे एक सुपर-स्मार्ट लाइब्रेरियन के रूप में सोचें जो केवल एक आकार का कागज नहीं चुनता। इसके बजाय, वे दो अलग-अलग प्रकार के खोज उपकरणों का उपयोग करते हैं:

  • टूल A (Dense Retriever): क्वेरी के अर्थ और भाव (vibe) को समझने में अच्छा है (जैसे, "खेल कहाँ खेला गया था?")।
  • टूल B (Sparse Retriever): सटीक शब्दों और नामों (जैसे, "Mexico City") को मिलाने में अच्छा है।

दोनों उपकरण अलग-अलग आकार के चंक्स (chunks) में उत्तरों की खोज करते हैं (कुछ छोटे, कुछ बड़े)।

यह कैसे तय करता है कि किस पर भरोसा किया जाए

यहाँ चालाकी भरी बात है: सिस्टम केवल परिणामों पर आँख मूंदकर भरोसा नहीं करता है। यह पूछता है, "हम कितने आश्वस्त हैं?"

  • यदि टूल A एक विशिष्ट वाक्य पाता है जो बाकी सब को नजरअंदाज करते हुए स्पष्ट रूप से उभर कर आता है, तो सिस्टम कहता है, "उच्च विश्वास (High Confidence)! यह एक मजबूत संकेत है।"
  • यदि टूल A 50 वाक्य पाता है जो सभी समान रूप से अच्छे (या समान रूप से खराब) दिखते हैं, तो सिस्टम कहता है, "कम विश्वास (Low Confidence)! हम भ्रमित हैं; यह टूल सुनिश्चित नहीं है।"

सिस्टम हर टूल और हर चंक साइज के लिए इस "विश्वास" (या अनिश्चितता की कमी) की गणना करता है। फिर यह परिणामों को मिलाता है, उन टूल्स और चंक साइज को अधिक महत्व देता जो सबसे अधिक आश्वस्त हैं।

"पैरेंट प्रमोशन" वाली ट्रिक (UMGP-RAG)

भले ही स्मार्ट मिक्सिंग के साथ काम हो रहा हो, लेकिन एक अंतिम मोड़ है। कभी-कभी सिस्टम को एक आदर्श, छोटा वाक्य (the "child") मिलता है। लेकिन एक अकेला वाक्य जासूस के समझने के लिए बहुत अकेला होता है।

इसलिए, सिस्टम Parent Promotion नामक एक ट्रिक का उपयोग करता है:

  1. यह उस सटीक स्थान को लोकेट करने के लिए उस छोटे, सटीक वाक्य का उपयोग करता है (the "child")।
  2. एक बार मिल जाने के बाद, यह पैरेंट चंक (उस वाक्य और उसके पड़ोसियों को शामिल करने वाला एक थोड़ा बड़ा हिस्सा) को ले लेता है।
  3. इसके बाद यह सुनिश्चित करने के लिए जाँच करता है कि वह जासूस को एक ही पेज दो बार न दे रहा हो (डुप्लिकेट हटाना)।

उपमा: यह मानचित्र पर एक विशिष्ट पते (छोटा चंक) को खोजने और फिर जासूस को पूरे मोहल्ले का ब्लॉक (पैरेंट चंक) देने जैसा है ताकि वे संदर्भ देख सकें, बिना उन्हें पूरा शहर थमाए।

उन्होंने क्या पाया

लेखकों ने विभिन्न AI मॉडलों का उपयोग करके दो बड़े डेटासेट्स (Natural Questions और HotPotQA) पर इसका परीक्षण किया। उन्होंने पाया कि:

  • बेहतर उत्तर: उनके तरीके ने मानक तरीकों (जो केवल बड़े चंक्स लेते हैं या केवल छोटे चंक्स लेते हैं) की तुलना में बेहतर उत्तर दिए।
  • कोई अतिरिक्त प्रशिक्षण नहीं: सबसे अच्छी बात यह है कि उन्हें लाइब्रेरियन या जासूस को कुछ भी नया सिखाने की आवश्यकता नहीं पड़ी। उन्होंने बस मौजूदा उपकरणों का अधिक स्मार्ट तरीके से उपयोग किया।
  • दक्षता (Efficiency): शोर को बाहर निकालकर और जासूस को केवल सबसे प्रासंगिक, सुसंगत संदर्भ देकर, यह सिस्टम तेजी से और अधिक सटीकता से काम करता है।

संक्षेप में

यह पेपर तर्क देता है कि लंबे दस्तावेजों से उत्तर देने का सबसे अच्छा तरीका यह अनुमान लगाना नहीं है कि टेक्स्ट का "परफेक्ट साइज" क्या होगा। इसके बजाय, आपको एक हाइब्रिड दृष्टिकोण अपनाना चाहिए जो:

  1. कई आकारों में खोज करता है।
  2. प्रत्येक खोज टूल कितना "निश्चित" है, इसकी जाँच करता है।
  3. सबसे अच्छे सुरागों को जोड़ता है।
  4. AI को दिखाने से पहले छोटे सुरागों को सहायक, सुसंगत पैराग्राफ में विस्तारित करता है।

यह एक "गोल्डिलॉक्स" (Goldilocks) ज़ोन बनाता है जहाँ साक्ष्य न तो बहुत शोर भरा है और न ही बहुत खंडित, जिससे AI को सर्वोत्तम संभव उत्तर देने में मदद मिलती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →