← नवीनतम पेपर
💻 computer science

Covering the Unseen: Information Demand Coverage Optimization for Retrieval-Augmented Generation

यह शोध पत्र GeoRAG का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त रिट्रीवल-ऑगमेंटेड जनरेशन फ्रेमवर्क है, जो सूचना की मांग को एक बहु-आयामी वितरण के रूप में मॉडल करके और इसे दस्तावेज़ कवरेज के सिंकहॉर्न-वासरस्टीन (Sinkhorn-Wasserstein) दूरी को न्यूनतम करके संदर्भ चयन को अनुकूलित करता है, जिससे यह जटिल, मल्टी-हॉप QA बेंचमार्क पर पारंपरिक रैंकिंग-आधारित विधियों की तुलना में काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Bingxue Zhang, Jianying Jia, Feida Zhu

प्रकाशित 2026-06-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bingxue Zhang, Jianying Jia, Feida Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ हैं जो किसी ग्राहक के ऑर्डर के आधार पर एक जटिल व्यंजन बनाने की कोशिश कर रहे हैं। ग्राहक कहता है, "मुझे एक ऐसा बर्गर चाहिए जिसका स्वाद 1960 के दशक की अमेरिकी रोड ट्रिप जैसा हो, लेकिन साथ में इसमें फ्रांसीसी इतिहास का एक हिस्सा भी शामिल हो।"

समस्या: "एक ही सुर वाला" (One-Note) शेफ
वर्तमान AI सिस्टम (जिन्हें RAG या रिट्रीवल-ऑगमेंटेड जनरेशन कहा जाता है) थोड़े उस शेफ की तरह काम करते हैं जिसके दिमाग में केवल एक ही सुर होता है। जब वे ऑर्डर सुनते हैं, तो वे अपनी विशाल कुकबुक लाइब्रेरी (इंटरनेट) को देखते हैं और उन 5 किताबों को चुन लेते हैं जो पूरे वाक्य से सबसे अधिक मिलती-जुलती हों।

यह पेपर तर्क देता है कि इस दृष्टिकोण में एक घातक दोष है: यह बहुत अधिक केंद्रित (focused) है।
यदि ग्राहक का ऑर्डर दो बहुत अलग हिस्सों वाला है (जैसे बर्गर और इतिहास), तो "One-Note" शेफ रोड ट्रिप के बारे में 5 किताबें उठा लेगा और फ्रांसीसी इतिहास के बारे में 0 किताबें। क्यों? क्योंकि AI को लगता है कि "रोड ट्रिप" वाला हिस्सा अधिक महत्वपूर्ण या मुख्य विचार के करीब है। वह अनुरोध के दूसरे हिस्से को पूरी तरह से अनदेखा कर देता है, जिससे ग्राहक को आधा-अधूरा जवाब मिलता है।

लेखक इसे "सिंगल-पॉइंट नीड" (Single-Point Need) समस्या कहते हैं। AI पूरे प्रश्न को अंतरिक्ष में एक एकल बिंदु (single dot) की तरह मानता है, इसलिए वह केवल उसी बिंदु के पास की जानकारी उठाता है, और दूसरे बिंदुओं को छोड़ देता है जो समान रूप से महत्वपूर्ण हैं।

समाधान: GeoRAG (द "मैप-मेकर" शेफ)
यह पेपर एक नया सिस्टम पेश करता है जिसे GeoRAG कहा जाता है। केवल 5 सबसे मिलती-जुलती किताबें उठाने के बजाय, GeoRAG एक मैप-मेकर की तरह काम करता है जो ऑर्डर को विशिष्ट "डिमांड ज़ोन" (demand zones) में तोड़ देता है।

GeoRAG इस प्रकार काम करता है, चरण-दर-चरण:

  1. इसे तोड़ें (Sub-Queries):
    किताबों को खोजने से पहले, GeoRAG AI से पूछता है: "इस पहेली के अलग-अलग हिस्से क्या हैं?" यह छोटे प्रश्नों (sub-queries) की एक सूची बनाता है।
  • उपमा: केवल "रोड ट्रिप बर्गर" सोचने के बजाय, यह लिखता है: "1. 1960 का रोड ट्रिप क्या था? 2. वोटिंग राइट्स एक्ट पर किसने हस्ताक्षर किए थे? 3. उपराष्ट्रपति कौन था?"
  1. गुणवत्ता की जाँच करें (Reverse-Validation):
    कभी-कभी AI भ्रमित हो जाता है और ऐसा उप-प्रश्न लिख देता है जिसका कोई अर्थ नहीं है या जो खुद को दोहरा रहा है। GeoRAG में एक गुणवत्ता नियंत्रण चरण होता है। यह जाँचता है: "क्या यह नया प्रश्न वास्तव में नई जानकारी खोजने में मदद करता है, या यह केवल शोर (noise) है?" यह खराब वाले प्रश्नों को हटा देता है और उपयोगी वाले को रखता है।

  2. एक "डिमांड मैप" बनाएं (Proxy Distribution):
    GeoRAG ग्राहक की जरूरतों का एक मानसिक मानचित्र बनाता है। यह "रोड ट्रिप" ज़ोन और "फ्रेंच हिस्ट्री" ज़ोन को समान रूप से महत्वपूर्ण के रूप में चिह्नित करता है। इसे पता होता है कि प्रत्येक ज़ोन के लिए कितनी "कवरेज" की आवश्यकता है।

  3. स्मार्ट चयन (Facility Location):
    अब, GeoRAG उन 200 संभावित किताबों को देखता है जिन्हें सिस्टम ने खोजा है। मूल ऑर्डर के सबसे मिलते-जुलते 5 चुनने के बजाय, यह "गैप भरने" (Fill the Gaps) का खेल खेलता है।

  • यह पूछता है: "हमारे पास पहले से ही रोड ट्रिप पर 3 किताबें हैं। क्या हमारे पास फ्रांसीसी इतिहास पर कोई किताब है? नहीं? ठीक है, अगली किताब फ्रांसीसी इतिहास के बारे में होनी ही चाहिए।"
  • यह यह मापने के लिए एक गणितीय ट्रिक (Sinkhorn-Wasserstein distance) का उपयोग करता है कि चुनी गई किताबें पूरे मानचित्र को कितनी अच्छी तरह कवर करती हैं। यह तब तक किताबें जोड़ता रहता है जब तक कि मानचित्र के हर "डिमांड ज़ोन" को कवर न कर लिया जाए, भले ही वे किताबें मूल वाक्य के सबसे करीबी मैच न हों।

यह क्यों मायने रखता है
इस पेपर ने छह अलग-अलग प्रकार के कठिन प्रश्नों (जैसे मल्टी-स्टेप रीजनिंग या अस्पष्ट प्रश्न) पर इसका परीक्षण किया।

  • परिणाम: GeoRAG ने लगातार पुराने "One-Note" तरीके की तुलना में बेहतर उत्तर दिए। इसने औसत रूप से सटीकता में लगभग 6.5 से 7.5 अंक का सुधार किया।
  • बड़ी जीत: सबसे कठिन प्रश्नों पर (जहाँ दो अलग-अलग तथ्यों को जोड़ने की आवश्यकता होती है), सुधार बहुत बड़ा था (9.7 अंक तक)।
  • प्रमाण: उन्होंने दिखाया कि पुराने तरीके इस तथ्य के प्रति "अंधे" थे कि वे आधे प्रश्न को अनदेखा कर रहे थे। GeoRAG ने यह सुनिश्चित करके इसे ठीक किया कि AI ने केवल 5 समान किताबें नहीं चुनीं, बल्कि 5 ऐसी किताबें चुनीं जो साथ मिलकर प्रश्न के हर हिस्से का उत्तर देती हैं।

संक्षेप में
वर्तमान AI एक ऐसे छात्र की तरह है जो पाठ्यपुस्तक के पहले वाक्य को हाईलाइट करता है और बाकी को अनदेखा कर देता है। GeoRAG एक ऐसे छात्र की तरह है जो पूरे अध्याय को पढ़ता है, मुख्य विषयों की पहचान करता है, और निबंध लिखने से पहले यह सुनिश्चित करता है कि उसके पास हर विषय पर नोट्स हों। इसे नए डेटा के साथ फिर से प्रशिक्षित करने या सिखाने की आवश्यकता नहीं है; यह बस यह बदल देता है कि यह जानकारी को कैसे चुनता है, जिससे यह अधिक स्मार्ट, संतुलित और जटिल प्रश्नों के उत्तर देने में बहुत बेहतर हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →