← नवीनतम पेपर
💬 NLP

CMRAG: Co-modality-based visual document retrieval and question answering

यह शोध पत्र CMRAG का प्रस्ताव करता है, जो एक नवीन फ्रेमवर्क है जो एक साझा एम्बेडिंग स्पेस और एक सामान्यीकृत सह-मोडैलिटी रिट्रीवल पद्धति के माध्यम से टेक्स्ट और इमेज मोडैलिटीज को एकीकृत करके विजुअल डॉक्यूमेंट रिट्रीवल और क्वेश्चन आंसरिंग को बेहतर बनाता है, जिससे यह मौजूदा सिंगल-मोडैलिटी दृष्टिकोणों से बेहतर प्रदर्शन करता है।

मूल लेखक: Wang Chen, Wenhan Yu, Guanqiang Qi, Weikang Li, Yang Li, Lei Sha, Deguo Xia, Jizhou Huang

प्रकाशित 2026-03-09
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Wang Chen, Wenhan Yu, Guanqiang Qi, Weikang Li, Yang Li, Lei Sha, Deguo Xia, Jizhou Huang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, बिखरी हुई लाइब्रेरी के भीतर एक विशिष्ट तथ्य खोजने की कोशिश कर रहे हैं। इस लाइब्रेरी में केवल शब्दों वाली किताबें ही नहीं हैं; इसमें चार्ट, फोटो, हस्तलिखित नोट्स और जटिल आरेख (diagrams) से भरी किताबें भी हैं।

यह वह समस्या है जिसे CMRAG नामक पेपर हल करने की कोशिश करता है।

समस्या: "एक-आंख वाले" लाइब्रेरियन

वर्तमान में, इन दस्तावेजों में जानकारी खोजने में आपकी मदद करने के लिए दो मुख्य प्रकार के "लाइब्रेरियन" (AI सिस्टम) हैं:

  1. केवल टेक्स्ट वाला लाइब्रेरियन: यह लाइब्रेरियन शब्द पढ़ने में अविश्वसनीय रूप से तेज़ है। यदि आप पूछते हैं, "2023 में राजस्व क्या था?", तो वे टेक्स्ट को स्कैन करते हैं और तुरंत उत्तर ढूंढ लेते हैं। लेकिन, यदि उत्तर एक जटिल चार्ट या ग्राफ की फोटो के अंदर है, तो वे अंधे होते हैं। वे चित्र को देख नहीं सकते, इसलिए वे उत्तर चूक जाते हैं।
  2. केवल इमेज वाला लाइब्रेरियन: यह लाइब्रेरियन चित्रों को देखने में माहिर है। वे चार्ट और ग्राफ को "देख" सकते हैं। लेकिन, वे दस्तावेज़ के भीतर के छोटे, घने टेक्स्ट को पढ़ने में बहुत खराब हैं। यदि उत्तर टेक्स्ट के एक पैराग्राफ में छिपा है, तो वे उसे मिस कर सकते हैं क्योंकि उनका पूरा ध्यान विजुअल लेआउट पर होता है।

दोनों लाइब्रेरियन एक आंख खुली रखकर पहेली सुलझाने की कोशिश कर रहे हैं, जिससे गलतियां होती हैं।

समाधान: "द्विभाषी" लाइब्रेरियन (CMRAG)

लेखकों ने एक नया प्रकार का लाइब्रेरियन बनाया है जिसे CMRAG (Co-Modality RAG) कहा जाता है। इस द्विभाषी विशेषज्ञ के रूप में सोचें जो टेक्स्ट पढ़ सकता है और छवियों को भी पूरी तरह से देख सकता है।

यहाँ बताया गया है कि उन्होंने इस सुपर-लाइब्रेरियन को कैसे बनाया, एक सरल उपमा (analogy) का उपयोग करके:

1. यूनिवर्सल ट्रांसलेटर (यूनिफाइड एनकोडिंग मॉडल)

कल्पना कीजिए कि आपके पास एक टेक्स्ट दस्तावेज़ है और एक दस्तावेज़ की फोटो है। पुराने दिनों में, कंप्यूटर इन दोनों को पूरी तरह से अलग भाषाएं (जैसे अंग्रेजी और फ्रेंच) मानता था जो आपस में अच्छी तरह नहीं मिलती थीं।

CMRAG एक यूनिवर्सल ट्रांसलेटर पेश करता है। यह टेक्स्ट, इमेज और आपके प्रश्न को लेता है, और उन सभी को एक ही साझा "गुप्त भाषा" (एक गणितीय स्थान) में अनुवादित करता है।

  • उपमा: कल्पना कीजिए कि आपके पास एक मानचित्र है जहाँ "लाल घर" (टेक्स्ट विवरण) और "एक लाल घर की तस्वीर" दोनों को ठीक एक ही स्थान पर अंकित किया गया है। अब, कंप्यूटर तुरंत देख सकता है कि वे एक ही चीज़ हैं, भले ही एक शब्द हो और दूसरा एक चित्र।

2. फेयर स्कोरकीपर (यूनिफाइड रिट्रीवल)

जब लाइब्रेरियन उत्तर की तलाश करता है, तो उसे दो स्कोर मिलते हैं:

  • स्कोर A: आपका प्रश्न टेक्स्ट के साथ कितनी अच्छी तरह मेल खाता है।
  • स्कोर B: आपका प्रश्न इमेज के साथ कितनी अच्छी तरह मेल खाता है।

समस्या क्या है? टेक्स्ट स्कोर और इमेज स्कोर अलग-अलग पैमानों पर मापे जाते हैं (जैसे "मील" की तुलना "किलोमीटर" से करना)। यदि आप उन्हें बस जोड़ देते हैं, तो एक गलती से दूसरे पर हावी हो सकता है।

CMRAG एक फेयर स्कोरकीपर का उपयोग करता है। स्कोर जोड़ने से पहले, वे उन्हें नॉर्मलाइज़ (सामान्य) करते हैं (जैसे मील और किलोमीटर दोनों को मीटर में बदलना)। यह सुनिश्चित करता है कि टेक्स्ट और इमेज को एक निष्पक्ष वोट मिले। अंतिम निर्णय टेक्स्ट के कहने और चित्र के दिखाने का एक संतुलित मिश्रण होता है।

यह क्यों मायने रखता है?

लेखकों ने इस नए लाइब्रेरियन का परीक्षण कठिन कार्यों पर किया, जैसे वित्तीय रिपोर्ट, वैज्ञानिक शोध पत्र और स्लाइड डेक पढ़ना।

  • परिणाम: CMRAG ने लगातार पुराने "एक-आंख वाले" लाइब्रेरियन को मात दी।
  • "अहा!" मोमेंट: एक टेस्ट केस में, पुराने इमेज-ओनली लाइब्रेरियन ने एक चार्ट देखा और गलत नंबर का अनुमान लगाया क्योंकि वह छोटे लेबल नहीं पढ़ सका। टेक्स्ट-ओनली लाइब्रेरियन ने चार्ट को पूरी तरह से मिस कर दिया। हालाँकि, CMRAG ने टेक्स्ट को पढ़ा और चार्ट को देखा, जिससे दोनों को मिलाकर सटीक उत्तर मिला।

मुख्य निष्कर्ष

लेखकों ने अन्य शोधकर्ताओं को बेहतर सिस्टम बनाने में मदद करने के लिए एक विशाल "प्रश्न + टेक्स्ट + इमेज" ट्रिपलेट्स का डेटासेट भी जारी किया है।

संक्षेप में: यदि आप चाहते हैं कि कोई AI जटिल दस्तावेजों (जैसे डॉक्टर की रिपोर्ट, कानूनी अनुबंध, या वैज्ञानिक पेपर) को समझ सके, तो आप इसे केवल "पढ़ने" के लिए नहीं कह सकते या केवल "देखने" के लिए नहीं कह सकते। आपको इसे दोनों चीजें एक साथ करने की आवश्यकता है, टेक्स्ट और इमेज को प्रतिस्पर्धियों के बजाय भागीदारों के रूप में देखते हुए। CMRAG वह फ्रेमवर्क है जो उस साझेदारी को संभव बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →