← नवीनतम पेपर
💬 NLP

MARA: A Multimodal Adaptive Retrieval-Augmented Framework for Document Question Answering

यह शोध पत्र MARA का प्रस्ताव करता है, जो एक मल्टीमॉडल एडेप्टिव रिट्रीवल-ऑगमेंटेड फ्रेमवर्क है जो सटीक रिट्रीवल के लिए क्वेरी-अलाइन्ड रीजन एनकोडिंग और एडेप्टिव जनरेशन के लिए एक सेल्फ-रिफ्लेक्टिव एविडेंस कंट्रोलर पेश करके डॉक्यूमेंट क्वेश्चन अनस्विंग को बेहतर बनाता है, और छह बेंचमार्क में मौजूदा स्टेट-ऑफ-द-आर्ट विधियों से बेहतर प्रदर्शन करता है।

मूल लेखक: Hui Wu, Haoquan Zhai, Yuchen Li, Hengyi Cai, Peirong Zhang, Yidan Zhang, Lei Wang, Chunle Wang, Yingyan Hou, Shuaiqiang Wang, Dawei Yin

प्रकाशित 2026-04-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hui Wu, Haoquan Zhai, Yuchen Li, Hengyi Cai, Peirong Zhang, Yidan Zhang, Lei Wang, Chunle Wang, Yingyan Hou, Shuaiqiang Wang, Dawei Yin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रहस्य सुलझाने वाले जासूस हैं, लेकिन आपके पास केवल एक नोटबुक नहीं, बल्कि हजारों किताबों, पत्रिकाओं, चार्टों और तस्वीरों से भरी एक विशाल लाइब्रेरी है। कुछ पन्ने केवल टेक्स्ट (शब्दों) के हैं, कुछ जटिल आरेख (diagrams) हैं, और कुछ दोनों का मिश्रण हैं।

आपका काम एक विशिष्ट प्रश्न का उत्तर देना है, जैसे: "2018 की पहली तिमाही में कितने प्रतिशत अमेरिकी नियोक्ताओं ने भर्ती करने की योजना बनाई थी?"

पुराना तरीका: "अंधा" लाइब्रेरियन

अतीत में, यदि आप किसी कंप्यूटर से उत्तर खोजने के लिए कहते, तो वह एक अंधे लाइब्रेरियन की तरह कार्य करता।

  1. खोज (The Search): लाइब्रेरियन एक सामान्य कीवर्ड मैच के आधार पर किताबों का एक ढेर उठा लेता। वे वास्तव में प्रश्न को गहराई से "पढ़ते" नहीं थे; उन्होंने बस वे शीर्ष 3 या 10 किताबें उठा लीं जो कुछ हद तक संबंधित लग रही थीं।
  2. समस्या:
    • बहुत व्यापक (Too Broad): कभी-कभी वे पूरी किताब उठा लेते, जिससे पेज 42 पर मौजूद वह छोटा सा चार्ट छूट जाता जिसमें वास्तव में उत्तर था।
    • बहुत संकुचित (Too Narrow): कभी-कभी वे ऐसी किताब उठा लेते जिसमें सही शब्द तो थे लेकिन संदर्भ (context) गलत था।
    • "टॉप-के" का जाल (The "Top-K" Trap): लाइब्रेरियन आपको ठीक 3 किताबें (या 10) पढ़ने के लिए मजबूर कर देता, चाहे कुछ भी हो। यदि उत्तर चौथी किताब में होता, तो आप उसे चूक जाते। यदि पहली 3 किताबें शोर-शराबे (noise) से भरी होतीं, तो आप भ्रमित हो जाते।

यही वह चीज़ है जिसे यह पेपर "क्वेरी-एग्नोस्टिक" (प्रश्न की अनदेखी करना) और "स्टैटिक सिलेक्शन" (किताबों की एक निश्चित संख्या पर अड़े रहना) कहता है।


नया तरीका: MARA (द "स्मार्ट डिटेक्टिव")

इस पेपर के लेखकों ने एक नया सिस्टम बनाया है जिसे MARA (मल्टीमॉडल एडेप्टिव रिट्रीवल-ऑगमेंटेड) कहा जाता है। MARA को एक सुपर-स्मार्ट जासूस के रूप में सोचें जिसके पास दो विशेष उपकरण हैं जो उसे बेहतर बनाने में मदद करते हैं।

टूल 1: "एक्स-रे गॉगल्स" (क्वेरी-अलाइन्ड रीजन एनकोडर)

जब पुराना लाइब्रेरियन किसी दस्तावेज़ को देखता था, तो वह उसे एक बड़े, धुंधले धब्बे के रूप में देखता था। MARA का जासूस एक्स-रे गॉगल्स पहनता है जो तुरंत ज़ूम इन और ज़ूम आउट कर सकते हैं।

  • यह कैसे काम करता है: जब आप कोई प्रश्न पूछते हैं, तो जासूस केवल पूरे पेज को नहीं देखता। वह पूछता है: "क्या इस प्रश्न के लिए बड़ी तस्वीर (पूरा चार्ट) की आवश्यकता है, मध्य भाग (एक विशिष्ट पैराग्राफ) की, या सूक्ष्म विवरणों (एक तालिका में एक अकेला नंबर) की?"
  • जादू: सिस्टम आपके विशिष्ट प्रश्न के आधार पर दस्तावेज़ के सबसे महत्वपूर्ण हिस्सों को हाइलाइट करना सीख जाता है। यदि आप एक विशिष्ट नंबर के बारे में पूछते हैं, तो यह टेबल सेल पर ज़ूम करता है। यदि आप सामान्य रुझान (trend) के बारे में पूछते हैं, तो यह पूरे ग्राफ को देखता है। यह अप्रासंगिक शोर (noise) को अनदेखा कर देता है।

टूल 2: "सेल्फ-चेकिंग असिस्टेंट" (सेल्फ-रिफ्लेक्टिव एविडेंस कंट्रोलर)

यह सबसे चतुर हिस्सा है। पुराने सिस्टम में, जासूस पहली 3 किताबें पढ़ता और तुरंत रिपोर्ट लिखने की कोशिश करता, भले ही उसे यकीन न हो कि उसके पास पर्याप्त जानकारी है।

MARA का जासूस एक सेल्फ-चेकिंग असिस्टेंट रखता है जो पढ़ते समय उसके कान में फुसफुसाता है:

  • "हे, तुमने पहली किताब पढ़ ली है। क्या तुम्हारे पास प्रश्न का उत्तर देने के लिए पर्याप्त जानकारी है?"
  • यदि हाँ: "बहुत बढ़िया! अब उत्तर लिखो।" (जल्दी रुकें, समय बचाएं)।
  • यदि "शायद": "तुम्हारे पास कुछ सुराग हैं, लेकिन एक महत्वपूर्ण हिस्सा गायब है। चलो अगली किताब उठाते हैं और पढ़ते रहते हैं।"
  • यदि "नहीं": "तुम पूरी तरह से भटक गए हो। और गहराई से खोज जारी रखो।"

किताबों की एक निश्चित संख्या पढ़ने के बजाय, यह असिस्टेंट गतिशील रूप से (dynamically) निर्णय लेता है कि कब रुकना है। यह जासूस को बहुत अधिक बेकार जानकारी (शोर) से अभिभूत होने से बचाता है या इससे पहले कि वह बहुत जल्दी रुक जाए जिससे उत्तर छूट सकता है।


यह क्यों मायने रखता है (परिणाम)

शोधकर्ताओं ने इस नए जासूस का परीक्षण छह अलग-अलग प्रकार के "क्राइम सीन" (डेटासेट) पर किया, जिसमें वैज्ञानिक शोध पत्रों से लेकर स्लाइड डेक और चार्ट तक शामिल थे।

  1. बेहतर सटीकता (Better Accuracy): MARA ने पुराने तरीकों की तुलना में सही उत्तर बहुत अधिक बार खोजे क्योंकि वह जानता था कि कहाँ देखना है और कब रुकना है।
  2. दक्षता (Efficiency): इसने तब तक 10 किताबें पढ़ने में समय बर्बाद नहीं किया जब उत्तर पहली ही किताब में था। इसने कितना पढ़ना है, इस बारे में स्मार्ट होकर बहुत सारी कंप्यूटिंग शक्ति (समय और पैसा) बचाई।
  3. लचीलापन (Flexibility): यह बहुत अच्छा काम करता है चाहे उत्तर एक छोटी टेबल सेल में हो या एक बड़े इन्फोग्राफिक में।

बड़ी तस्वीर (The Big Picture)

सरल शब्दों में, MARA यह बदल देता है कि कंप्यूटर दस्तावेज़ों को कैसे पढ़ते हैं। एक कठोर रोबोट की तरह जो निश्चित संख्या में पन्ने उठाता है, यह एक मानव विशेषज्ञ की तरह कार्य करता है जो:

  1. प्रश्न के लिए प्रासंगिक विशिष्ट स्थान खोजने के लिए दस्तावेज़ को स्कैन करता है।
  2. उत्तर के प्रति आश्वस्त होने के लिए बिल्कुल उतना ही पढ़ता है, जितना आवश्यक है, और काम पूरा होते ही रुक जाता है।

यह AI को वित्तीय रिपोर्टों से लेकर मेडिकल चार्ट तक, हमारे दैनिक जीवन के जटिल और वास्तविक दस्तावेज़ों को संभालने में बहुत बेहतर बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →