VLD-RAG: Agentic Vision-Language Retrieval-Augmented Generation for Long, Visually-Rich Multi-Page Documents
VLD-RAG एक एजेंटिक मल्टीमॉडल रिट्रीवल-ऑगमेंटेड जनरेशन फ्रेमवर्क है जो लंबे, विज़ुअली-रिच मल्टी-पेज दस्तावेज़ों में बिखरे हुए टेक्स्टुअल और विज़ुअल साक्ष्यों को संश्लेषित करके प्रभावी ढंग से प्रश्नों के उत्तर देने के लिए पेज-प्रिजर्विंग इंडेक्सिंग, हाइब्रिड रिट्रीवल रणनीतियों और एक समन्वित मल्टी-एजेंट वर्कफ़्लो का उपयोग करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, 100 पन्नों की रहस्यमयी गुत्थी सुलझाने की कोशिश कर रहे हैं, लेकिन सुराग हर जगह बिखरे हुए हैं। कुछ सुराग सादे टेक्स्ट में लिखे हैं, कुछ जटिल चार्ट्स के अंदर छिपे हैं, कुछ डायग्राम्स में दबे हुए हैं, और कुछ बस पेज के लेआउट का हिस्सा हैं। यह "विजुअली-रिच डॉक्यूमेंट्स" (दृश्यात्मक रूप से समृद्ध दस्तावेज़ों) की दुनिया है—सोचिए कि ये वे अव्यवस्थित, रंगीन और सूचना-सघन रिपोर्ट, मैनुअल और स्लाइड डेक हैं जिन्हें हम वास्तविक दुनिया में देखते हैं। लंबे समय तक, इन दस्तावेज़ों को पढ़ने की कोशिश करने वाले कंप्यूटरों के साथ एक बड़ी समस्या थी: वे अक्सर शब्दों को पढ़ने के लिए सभी चित्रों और लेआउट को हटा देने की कोशिश करते थे। यह एक कॉमिक बुक को केवल संवाद बुलबुलों (डायलॉग बबल्स) को पढ़कर समझने जैसा था और चित्रों को अनदेखा करना जैसा; आप संदर्भ, चुटकुलों और कहानी के मोड़ को खो देते।
इसे ठीक करने के लिए, वैज्ञानिक "रिट्रीवल-ऑगमेंटेड जनरेशन" (RAG) नामक तकनीक का उपयोग करते हैं। RAG को एक सुपर-स्मार्ट लाइब्रेरियन के रूप में समझें जो केवल किताबें रटता नहीं है, बल्कि आपके सवाल का जवाब देने से पहले आपके लिए सटीक पन्ने खोजने बाहर जाता है। हालाँकि, जब "किताबें" ये अव्यवस्थित, बहु-पृष्ठीय दृश्य दस्तावेज़ हों, तो मानक लाइब्रेरियन अक्सर रास्ता भटक जाते हैं। वे गलत पन्ना चुन सकते हैं क्योंकि उन्होंने केवल टेक्स्ट देखा, या वे एक महत्वपूर्ण चार्ट को मिस कर सकते हैं क्योंकि उन्हें नहीं पता था कि इमेज को कैसे "देखना" है। बड़ा सवाल यह है: हम एक ऐसा सिस्टम कैसे बना सकते हैं जो दर्जनों पन्नों में सही सबूतों का पीछा कर सके, टेक्स्ट और इमेज को पूरी तरह से मिला सके, और एक सवाल का सही उत्तर दे सके?
यहाँ VLD-RAG आता है, जो इन लंबे, विजुअल दस्तावेज़ों के लिए परम जासूस बनने के लिए डिज़ाइन किया गया एक नया फ्रेमवर्क है। इन दस्तावेज़ों के पीछे के शोधकर्ताओं ने महसूस किया कि 150 पन्नों में फैले रहस्य को सुलझाने के लिए आप केवल एक ही तरकीब पर भरोसा नहीं कर सकते। इसके बजाय, उन्होंने एक "एजेंटिक" सिस्टम बनाया—AI विशेषज्ञों की एक टीम जो मिलकर काम करती है। कल्पना कीजिए कि जासूसों की एक तिकड़ी है: एक कीवर्ड हंटर (Keyword Hunter) जो सटीक शब्दों और नंबरों को स्कैन करता है; दूसरा विजुअल स्लथ (Visual Sleuth) जो पन्जों के समग्र "वाइब" और लेआउट को देखता है; और तीसरा एक क्रिटिकल वेरीफायर (Critical Verifier) जो उनके काम की जाँच करता है।
वे एक साथ कैसे काम करते हैं, यहाँ देखें। सबसे पहले, सिस्टम आपके सवाल को एक योजना में तोड़ देता है। यह केवल यह नहीं पूछता, "प्रॉफ़िट क्या है?" बल्कि यह पूछता है, "सेक्शन 3 में टेबल खोजें, 'Q4 Results' शीर्षक वाले चार्ट को देखें, और विशिष्ट डॉलर राशि के लिए टेक्स्ट की जाँच करें।" फिर, कीवर्ड हंटर और विजुअल स्लथ एक साथ दस्तावेज़ में खोज करते हैं। हंटर उन पन्नों को पकड़ता है जिनमें सही शब्द हैं, जबकि स्लथ उन पन्जों को पकड़ता है जो दिखने में ऐसे होते हैं जिनमें उत्तर हो सकता है, भले ही शब्द अलग हों।
जादू तब होता है जब वे अपने नोट्स की तुलना करते हैं। यदि हंटर कहता है, "पेज 12 अच्छा लग रहा है," लेकिन स्लथ कहता है, "पेज 12 बिल्कुल गलत लग रहा है," तो सिस्टम केवल अनुमान नहीं लगाता। यह यह समझने के लिए एक विशेष "कंसिस्टेंसी चेक" (संगति जाँच) का उपयोग करता है कि कुछ गड़बड़ है। यदि सबूत कमजोर या गायब महसूस होते हैं, तो क्रिटिकल वेरीफायर हस्तक्षेप करता है और कहता है, "हे, हमने कुछ मिस कर दिया! चलिए सवाल को एक अलग तरीके से पूछकर देखते हैं।" यह एक दूसरी खोज को ट्रिगर करता है, जिससे सुरागों को और बेहतर बनाया जाता है जब तक कि वे सही पन्ने न ढूंढ लें। अंत में, सिस्टम सबूत इकट्ठा करता है—टेक्स्ट के अंश, चार्ट के क्रॉप्स और पेज नंबर—और उन्हें एक जनरेटर को फीड करता है ताकि अंतिम उत्तर लिखा जा सके, यह सुनिश्चित करते हुए कि हर दावा वास्तव में दस्तावेज़ द्वारा समर्थित हो।
शोधकर्ताओं ने इस जासूसी टीम का परीक्षण दो विशाल चुनौतियों पर किया: MMLongBench-Doc और LongDocURL। ये दस्तावेज़ पढ़ने के लिए "ओलंपिक्स" की तरह हैं, जिनमें सैकड़ों दस्तावेज़, हजारों पन्ने, जटिल टेबल और पेचीदा सवाल शामिल हैं। परिणाम प्रभावशाली थे। VLD-RAG ने न केवल पिछले तरीकों की तुलना में अधिक बार सही पन्ने खोजे; इसने अधिक सही पन्ने खोजे। LongDocURL बेंचमार्क पर, जिसमें औसतन 85.6 पन्नों के दस्तावेज़ हैं, VLD-RAG ने शीर्ष 5 परिणामों (Recall@5) में से 81.16% मामलों में सही साक्ष्य पन्ने प्राप्त किए, जिससे यह अन्य सभी तरीकों को पीछे छोड़ गया। इसने सबसे प्रासंगिक पन्नों को अन्य सभी से ऊपर रैंक भी किया, जिसका अर्थ है कि उत्तर आमतौर पर सूची में सबसे ऊपर ही मौजूद था।
पेपर सुझाव देता है कि यह सफलता इसलिए मिली क्योंकि कंप्यूटर को "पढ़ने" और "देखने" के बीच चयन करने के लिए मजबूर नहीं किया गया। दृश्य लेआउट और टेक्स्ट को अलग रखते हुए भी उन्हें एक साथ काम करने देकर, यह सिस्टम उन गलतियों से बच जाता है जो एक समृद्ध, रंगीन दस्तावेज़ को सादे टेक्स्ट में बदलने की कोशिश में होती हैं। हालांकि शोधकर्ता नोट करते हैं कि यह दृष्टिकोण विशेष रूप से उन दस्तावेज़ों के लिए है जहाँ जानकारी कई पन्नों में बिखरी हुई है, उनके निष्कर्ष दृढ़ता से संकेत देते हैं कि इन जटिल, बहु-पृष्ठीय रहस्यों के लिए, विशेषज्ञ, सत्यापन करने वाले एजेंटों की एक टीम एक अकेले, एकाकी खोजकर्ता की तुलना में कहीं अधिक श्रेष्ठ है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।