MAGE-RAG: Multigranular Adaptive Graph Evidence for Agentic Multimodal RAG in Long-Document QA
MAGE-RAG एक मल्टीग्रेनुअल एडेप्टिव ग्राफ फ्रेमवर्क है जो लंबे दस्तावेज़ों वाले मल्टीमॉडल QA के लिए क्वेरी-टाइम साक्ष्य सबग्राफ (evidence subgraphs) का निर्माण करता है, जो पेज और एलिमेंट नोड्स को पुनरावृत्ति से सक्रिय और छंटनी करके, साक्ष्य कवरेज और शोर में कमी के बीच संतुलन बनाता है ताकि LongDocURL और MMLongBench-Doc पर अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जासूस हैं जो एक रहस्य सुलझाने की कोशिश कर रहे हैं, लेकिन आपके पास डेस्क पर कुछ सुरागों के बजाय, टेक्स्ट, चार्ट, फोटो और जटिल आरेख (diagrams) से भरी एक विशाल, 500 पन्नों की विश्वकोश (encyclopedia) थमा दी गई है। आपका लक्ष्य इसके भीतर कहीं छिपे किसी विशिष्ट उत्तर को खोजना है।
यह लॉन्ग-डॉक्यूमेंट मल्टीमॉडल क्वेश्चन आंसरिंग (Long-Document Multimodal Question Answering) की चुनौती है। यह शोध पत्र एक नया सिस्टम पेश करता है जिसे MAGE-RAG कहा जाता है ताकि इस समस्या को हल किया जा सके। यह कैसे काम करता है, इसका सरल विवरण यहाँ दिया गया है:
समस्या: "एक ही आकार सबके लिए" (One-Size-Fits-All) वाली गलती
वर्तमान प्रणालियाँ इस रहस्य को सुलझाने के लिए दो त्रुटिपूर्ण तरीकों का उपयोग करती हैं:
- "केवल टेक्स्ट" वाला दृष्टिकोण (The "Text-Only" Approach): वे शब्दों को तो पढ़ते हैं लेकिन चित्रों और लेआउट को छोड़ देते हैं। यह एक फिल्म का ट्रांसक्रिप्ट पढ़ने जैसा है लेकिन कभी अभिनेताओं या दृश्यों को न देखना। आप एक चार्ट या आरेख में छिपे एक महत्वपूर्ण सुराग को खो सकते हैं।
- "पूरा पेज" वाला दृष्टिकोण (The "Whole Page" Approach): वे किताब के पूरे पन्ने उठा लेते हैं और उन्हें AI को दिखा देते हैं। लेकिन अगर उत्तर एक पेज के बीच में केवल एक छोटा सा वाक्य है, तो AI आसपास के सभी अप्रासंगिक कचरे (जैसे विज्ञापन, फुटर, या असंबंधित चित्र) से अभिभूत हो जाता है। यह एक रोबोट को पूरा घास का ढेर थमाने जैसा है और उससे सुई खोजने को कहना।
दोनों विधियाँ एक "फिक्स्ड" मोड में फंसी हुई हैं: वे सवाल कितना कठिन या आसान है, इसकी परवाह किए बिना पृष्ठों या टुकड़ों की एक निश्चित संख्या ही उठाती हैं।
समाधान: MAGE-RAG (एक स्मार्ट जासूस)
MAGE-RAG एक स्मार्ट, अनुकूलन योग्य (adaptive) जासूस की तरह कार्य करता है जो केवल पन्ने नहीं उठाता; बल्कि दस्तावेज़ का एक डायनेमिक मैप (गतिशील मानचित्र) बनाता है।
1. मानचित्र (द मल्टीग्रैनुलर ग्राफ)
जासूस के शुरू करने से पहले ही, MAGE-RAG पूरे दस्तावेज़ का एक विशेष "मानचित्र" बनाता है।
- पेज नोड्स (Page Nodes): ये बड़े लैंडमार्क हैं (पूरे पन्ने)।
- एलिमेंट नोड्स (Element Nodes): ये सूक्ष्म विवरण हैं (एक विशिष्ट पैराग्राफ, एक टेबल, एक चार्ट, या एक सूची)।
- कनेक्शन (Connections): मानचित्र इन वस्तुओं के बीच रेखाएं खींचता है, जो यह दर्शाती हैं कि वे कैसे संबंधित हैं। उदाहरण के लिए, इसे पता होता है कि एक चार्ट एक विशिष्ट सेक्शन के अंदर है, या एक टेबल एक पैराग्राफ के बगल में है।
यह मानचित्र सिस्टम को जरूरत के अनुसार एक सूक्ष्म विवरण पर ज़ूम करने या पूरे पेज को देखने की अनुमति देता है।
2. जांच (क्वेरी-टाइम कंट्रोल)
जब आप कोई प्रश्न पूछते हैं, तो MAGE-RAG डेटा को बस ढेर नहीं लगा देता। यह एक सख्त बजट (समय और मेमोरी की सीमा) के साथ "हॉट एंड कोल्ड" (पास या दूर) का खेल खेलता है।
- चरण 1: प्रवेश बिंदु (The Entry Point): यह कुछ संभावित पन्नों को पकड़कर शुरू करता है (जैसे जासूस सही कमरे में प्रवेश कर रहा हो)।
- चरण 2: पुनरावृत्ति खोज (The Iterative Hunt): सिस्टम के पास एक "कंट्रोलर" होता है जो एक प्रोजेक्ट मैनेजर की तरह कार्य करता है। वह पूछता है:
- "क्या हमारे पास पर्याप्त जानकारी है?"
- "क्या हमें ज़ूम करके उस विशिष्ट चार्ट को खोलना चाहिए?" (नोड खोलना - Open Node)
- "क्या हमें इस पेज से पहले या बाद का पेज देखना चाहिए?" (खोजना/विस्तार करना - Search/Expand)
- "क्या यह पैराग्राफ अप्रासंगिक है? इसे अनदेखा कर दें।" (छंटनी करना - Prune)
- चरण 3: बजट (The Budget): जासूस का एक नियम है: "मैं केवल 5 पन्ने देख सकता हूँ और 10 विवरण खोल सकता हूँ।" यदि उत्तर सरल है, तो वे जल्दी रुक जाते हैं। यदि उत्तर जटिल है और किताब में बिखरा हुआ है, तो वे गहराई से खोजने के लिए अपने पूरे बजट का उपयोग करते हैं।
3. अंतिम रिपोर्ट (स्ट्रक्चर्ड रेंडरिंग)
एक बार जब जासूस सही सुराग इकट्ठा कर लेता है, तो वे केवल कागजों का ढेर नहीं सौंपते। वे साक्ष्यों को एक साफ, संरचित रिपोर्ट में व्यवस्थित करते हैं। वे AI को विशिष्ट टेक्स्ट, चार्ट का सटीक क्रॉप (कटौती), और प्रासंगिक पेज लेआउट दिखाते हैं, जिससे सारा शोर हट जाता है।
यह बेहतर क्यों है (परिणाम)
इस शोध पत्र ने इसका परीक्षण दो कठिन डेटासेट्स (LongDocURL और MMLongBench-Doc) पर किया, जो लंबे और जटिल दस्तावेज़ों से भरे हुए थे।
- सटीकता (Accuracy): MAGE-RAG ने एक परीक्षण में लगभग 52.75% सटीकता और दूसरे में 53.26% हासिल की, जो उन पिछले तरीकों को पीछे छोड़ देता है जो निश्चित पेज गणना या केवल टेक्स्ट खोज पर निर्भर थे।
- दक्षता (Efficiency): यह केवल अधिक पढ़कर नहीं जीता; यह स्मार्ट तरीके से पढ़कर जीता। इसने सफलतापूर्वक उन उत्तरों को खोजा जो अलग-अलग पन्नों पर बिखरे हुए थे या जटिल लेआउट के अंदर छिपे हुए थे, जिन्हें अन्य सिस्टम मिस कर गए थे।
- पारदर्शिता (Transparency): क्योंकि सिस्टम एक "ट्रेस" (उसके द्वारा उठाए गए हर कदम का लॉग) रखता है, हम देख सकते हैं कि वह क्यों सफल हुआ या क्यों विफल हुआ। क्या उसने सही पेज मिस कर दिया? क्या उसने किसी सुराग की छंटनी बहुत जल्दी कर दी? यह सिस्टम को डीबग करना आसान बनाता है।
निष्कर्ष (The Bottom Line)
MAGE-RAG खेल को "कुछ पन्ने उठाओ और बेहतर होने की उम्मीद करो" से बदलकर "एक मानचित्र बनाओ, सुरागों का पीछा करो, और AI को केवल वही दिखाओ जिसकी उसे पहेली सुलझाने के लिए आवश्यकता है" में बदल देता है। यह बड़े परिदृश्य (पेज) को देखने और सूक्ष्म विवरणों (विशिष्ट चार्ट या टेक्स्ट) को देखने की आवश्यकता के बीच संतुलन बनाता है, और यह सब समय और संसाधनों के सख्त बजट के भीतर करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।