← नवीनतम पेपर
💻 computer science

mKG-RAG: Leveraging Multimodal Knowledge Graphs in Retrieval-Augmented Generation for Knowledge-intensive VQA

यह शोध पत्र mKG-RAG का प्रस्ताव करता है, जो एक नवीन रिट्रीवल-ऑगमेंटेड जनरेशन फ्रेमवर्क है जो अनस्ट्रक्चर्ड डॉक्यूमेंट-आधारित विधियों की सीमाओं को दूर करने के लिए मल्टीमॉडल नॉलेज ग्राफ और एक दोहरे चरण वाली रिट्रीवल रणनीति का लाभ उठाता है, जिससे ज्ञान-गहन विजुअल क्वेश्चन आंसरिंग (Visual Question Answering) में अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Xu Yuan, Liangbo Ning, Qingqing Ye, Wenqi Fan, Qing Li

प्रकाशित 2026-04-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xu Yuan, Liangbo Ning, Qingqing Ye, Wenqi Fan, Qing Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ सरल भाषा और रचनात्मक उपमाओं का उपयोग करके mKG-RAG पेपर की व्याख्या दी गई है।

बड़ी समस्या: "स्मार्ट लेकिन भूलक्कड़" रोबोट

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट है (जिसे मल्टीमॉडल लार्ज लैंग्वेज मॉडल या MLLM कहा जाता है) जो तस्वीरें देखने और सवालों के जवाब देने में माहिर है। वह दुनिया के बारे में बहुत कुछ जानता है। हालाँकि, उसमें एक बड़ी खामी है: उसकी विशिष्ट तथ्यों के लिए याददाश्त खराब है।

यदि आप उससे पूछते हैं, "इस विशिष्ट संग्रहालय को किसने डिजाइन किया?" या "इस स्टेडियम का नवीनीकरण आखिरी बार कब हुआ था?", तो रोबट यह कर सकता है:

  1. हैलुसिनेशन (Hallucinate): एक ऐसा उत्तर बनाना जो सुनने में तो सही लगे, लेकिन पूरी तरह से गलत हो।
  2. मना करना (Refuse): यह कहना, "मुझे नहीं पता," भले ही उत्तर कहीं न कहीं मौजूद हो।

ऐसा इसलिए होता है क्योंकि रोबोट केवल वही "याद रखता" है जिस पर उसे प्रशिक्षित किया गया है। उसके पास दुनिया की हर इमारत, व्यक्ति या घटना के बारे में अद्यतित (up-to-date) और विशिष्ट तथ्यों की लाइब्रेरी तक पहुँच नहीं है।

पुराना समाधान: "शोर भरी लाइब्रेरी"

इसे ठीक करने के लिए, शोधकर्ताओं ने रोबोट को एक "रिट्रीवल-ऑगमेंटेड जनरेशन" (RAG) सिस्टम देने की कोशिश की। इसे ऐसे समझें जैसे रोबोट को बोलने से पहले उत्तर खोजने के लिए एक लाइब्रेरी देना।

हालाँकि, इसे करने का पुराना तरीका ऐसा था जैसे रोबोट को अव्यवस्थित और बिखरे हुए अखबारों का ढेर थमा देना।

  • रोबोट को उस एक वाक्य को खोजने के लिए हजारों शब्दों को पढ़ना पड़ता है जो वास्तव में काम का है।
  • वह अक्सर अप्रासंगिक शोर (विज्ञापन, असंबंधित कहानियाँ) से विचलित हो जाता है।
  • वह तथ्यों के बीच के संबंधों को मिस कर देता है। उदाहरण के लिए, वह दो अलग-अलग पैराग्राफ में "स्टेडियम" और "नवीनीकरण" देख सकता है, लेकिन यह समझने में विफल हो सकता है कि वे एक ही कहानी का हिस्सा हैं।

नया समाधान: mKG-RAG (एक "स्मार्ट मैप")

लेखकों ने mKG-RAG नामक एक नई प्रणाली प्रस्तावित की है। रोबोट को अखबारों का ढेर देने के बजाय, वे उसे एक संरचित, दृश्य मानचित्र (Visual Map) देते हैं (एक मल्टीमॉडल नॉलेज ग्राफ)।

यह कैसे काम करता है, चरण-दर-चरण यहाँ दिया गया है:

1. अराजकता को मानचित्र में बदलना (ग्राफ निर्माण)

कल्पना कीजिए कि आप एक विकिपीडिया पेज ले रहे हैं जिसमें टेक्स्ट और तस्वीरें दोनों हैं।

  • पुराना तरीका: बस टेक्स्ट को पढ़ना।
  • mKG-RAG का तरीका: सिस्टम एक स्मार्ट AI का उपयोग करता है जो टेक्स्ट को पढ़ता है और साथ ही साथ तस्वीरों को भी देखता है। यह जानकारी के "कंकाल" (Skeleton) को निकाल लेता है।
    • यह एंटिटीज (Entities) की पहचान करता है (जैसे, "स्टेडियम", "वास्तुकार/Architect")।
    • यह संबंधों (Relations) की पहचान करता है (जैसे, "वास्तुकार ने स्टेडियम डिजाइन किया")।
    • महत्वपूर्ण रूप से, यह स्टेडियम के टेक्स्ट विवरण को स्टेडियम की वास्तविक फोटो से जोड़ता है।
    • परिणाम: टेक्स्ट की एक दीवार के बजाय, आपको एक साफ, व्यवस्थित मानचित्र मिलता है जहाँ हर तथ्य उस तस्वीर से जुड़ा होता है जो उसे प्रमाणित करती है।

2. दो-चरणीय खोज (Dual-Stage Retrieval)

जब आप कोई प्रश्न पूछते हैं, तो सिस्टम पूरा मैप रोबोट के सामने नहीं डाल देता। यह एक स्मार्ट, दो-चरणीय खोज रणनीति का उपयोग करता है:

  • चरण 1: व्यापक जाल (डॉक्यूमेंट रिट्रीवल)
    सबसे पहले, सिस्टम पूरी लाइब्रेरी को तेज़ी से स्कैन करता है ताकि उन कुछ दस्तावेजों को खोजा जा सके जिनमें उत्तर होने की संभावना अधिक है। यह एक लाइब्रेरियन की तरह है जो कहता है, "ठीक है, उत्तर शायद 'स्पोर्ट्स' सेक्शन में है, 'कुकिंग' सेक्शन में नहीं।"
  • चरण 2: सटीक जाल (ग्राफ रिट्रीवल)
    एक बार प्रासंगिक दस्तावेज़ मिल जाने के बाद, सिस्टम उन्हें केवल रैखिक (linear) रूप से नहीं पढ़ता। यह चरण 1 में बनाए गए मैप पर ज़ूम इन करता है। यह आपके प्रश्न से मेल खाने वाले विशिष्ट नोड्स (तथ्यों) और किनारों (संबंधों) को खोजता है।
    • उपमा: पूरी किताब पढ़ने के बजाय, यह उस सटीक पैराग्राफ और विशिष्ट फोटो को हाइलाइट करता है जो आपके प्रश्न का उत्तर देता है, और बाकी सब को अनदेखा कर देता है।

3. "प्रश्न-जागरूक" जासूस (QM-Retriever)

पेपर में QM-Retriever नामक एक विशेष टूल पेश किया गया है।

  • समस्या: मानक सर्च इंजन एक प्रश्न (जैसे, "इसे किसने बनाया?") को एक कथन (जैसे, "जॉन ने इसे बनाया") के साथ मिलाने में खराब होते हैं। वे अक्सर केवल शब्दों के सटीक मिलान की तलाश करते हैं।
  • समाधान: QM-Retriever एक प्रशिक्षित जासूस है जो प्रश्न के इरादे (Intent) को समझने में सक्षम है। यह आपके प्रश्न को एक "घोषणात्मक" (Declarative) प्रारूप (एक कथन) में अनुवादित करने के लिए सीखता है ताकि यह नॉलेज ग्राफ में सटीक मिलान पा सके, भले ही शब्द थोड़े अलग हों। यह सही सबूत खोजने के लिए टेक्स्ट और इमेज दोनों को देखता है।

यह क्यों महत्वपूर्ण है (परिणाम)

लेखकों ने इस सिस्टम का परीक्षण दो कठिन क्विज़ (E-VQA और InfoSeek) पर किया, जिनके लिए गहरे और विशिष्ट ज्ञान की आवश्यकता होती है।

  • परिणाम: mKG-RAG ने सभी पिछले तरीकों से काफी बेहतर प्रदर्शन किया।
  • उपमा: यदि पुराने तरीके एक अव्यवस्थित पाठ्यपुस्तक से उत्तरों का अनुमान लगाने वाले छात्र की तरह थे, तो mKG-RAG एक ऐसे छात्र की तरह है जिसके पास एक पूरी तरह से व्यवस्थित, क्रॉस-रेफरेंस्ड विश्वकोश है और एक हाइलाइटर है जो जानता है कि ठीक क्या पढ़ना है।

सारांश

mKG-RAG AI को वास्तविक दुनिया के कठिन प्रश्नों का उत्तर देने में मदद करने का एक नया तरीका है। AI को बिखरे हुए टेक्स्ट में डुबोने के बजाय, यह:

  1. टेक्स्ट और इमेज को जोड़ने वाला एक संरचित मानचित्र बनाता है
  2. पहले लाइब्रेरी को सीमित करके, फिर मैप पर सटीक कनेक्शन ढूंढकर कुशलता से खोज करता है
  3. मानक खोज उपकरणों की तुलना में प्रश्न को बेहतर ढंग से समझता है

यह AI को अनुमान लगाने के बजाय सटीक, तथ्य-आधारित उत्तर देने और दृश्य साक्ष्य (visual evidence) के साथ प्रस्तुत करने में सक्षम बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →