← नवीनतम पेपर
💻 computer science

RobustVisRAG: Causality-Aware Vision-Based Retrieval-Augmented Generation under Visual Degradations

यह शोध पत्र RobustVisRAG को प्रस्तुत करता है, जो एक कारणता-निर्देशित (causality-guided) दोहरी-पथ वाली रूपरेखा है जो विभिन्न दृश्य विकृतियों के तहत पुनर्प्राप्ति (retrieval) और पीढ़ी (generation) प्रदर्शन में सुधार करने के लिए दृश्य अर्थशास्त्र (visual semantics) को क्षरण कारकों (degradation factors) से अलग करती है, जिसे एक नए बड़े पैमाने के बेंचमार्क और पर्याप्त प्रयोगात्मक लाभों द्वारा प्रमाणित किया गया है।

मूल लेखक: I-Hsiang Chen, Yu-Wei Liu, Tse-Yu Wu, Yu-Chien Chiang, Jen-Chien Yang, Wei-Ting Chen

प्रकाशित 2026-03-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: I-Hsiang Chen, Yu-Wei Liu, Tse-Yu Wu, Yu-Chien Chiang, Jen-Chien Yang, Wei-Ting Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली, अत्यंत बुद्धिमान सहायक है (आइए उसे AI कहें) जो दस्तावेज़ पढ़ने और सवालों के जवाब देने में माहिर है। इस AI के पास एक विशेष सुपरपावर है: यह दस्तावेज़ों की तस्वीरों को देख सकता है—जैसे चार्ट, हस्तलिखित नोट्स या वैज्ञानिक पेपर—और उन्हें तुरंत समझ सकता है। इसे VisRAG (विज़न-आधारित रिट्रीवल-ऑगमेंटेड जनरेशन) कहा जाता है।

हालाँकि, एक बड़ी समस्या है। यदि आप इस AI को एक ऐसा दस्तावेज़ देते हैं जो धुंधला (blurry), अंधेरे में लिया गया, मुड़ा हुआ या कॉफी के दागों से ढका हुआ है—तो AI भ्रमित हो जाता है। वह दस्तावेज़ के वास्तविक अर्थ को उसकी गंदगी/खराबी के साथ मिलाना शुरू कर देता है।

  • समस्या: यदि कागज़ धुंधला है, तो AI एक धुंधले "5" को "6" समझ सकता है। वह गलत दस्तावेज़ चुन सकता है क्योंकि धुंधलापन उसे कुछ और जैसा दिखा सकता है। भले ही वह सही दस्तावेज़ ढूंढ ले, लेकिन धुंधलापन उसे गलत उत्तर देने के लिए मजबूर (hallucinate) कर सकता है।
  • पुराने समाधान:
    • द "क्लीनर" दृष्टिकोण (The "Cleaner" Approach): कोई पहले धुंधली फोटो को ठीक करने की कोशिश करता है (जैसे किसी फोटो एडिटिंग ऐप का उपयोग करके) और फिर उसे AI को दिखाता है। लेकिन अक्सर, वह "सुधार" एकदम सटीक नहीं होता, और AI फिर भी भ्रमित रहता है।
    • द "ट्रेनिंग" दृष्टिकोण (The "Training" Approach): आप AI को खराब फोटो संभालने के लिए हजारों धुंधले उदाहरण दिखाकर सिखाने की कोशिश करते हैं। लेकिन यह महंगा है, और AI अक्सर केवल उन्हीं विशिष्ट प्रकार के धुंधलेपन को याद कर लेता है जो उसने देखे थे, जिससे वह नए प्रकार की गंदगी देखने पर विफल हो जाता है।

समाधान: RobustVisRAG (द "स्मार्ट डिटेक्टिव")

इस शोध पत्र के लेखकों ने RobustVisRAG बनाया है। इसे एक एकल मस्तिष्क के रूप में नहीं, बल्कि एक दो-व्यक्ति डिटेक्टिव टीम के रूप में सोचें जो एक रहस्य (सवाल का जवाब देना) सुलझाने के लिए मिलकर काम कर रही है।

यह टीम निम्नलिखित तरीके से काम करती है:

1. दो डिटेक्टिव (द ड्यूल-पाथ फ्रेमवर्क)

एक मस्तिष्क के सब कुछ करने के बजाय, RobustVisRAG काम को दो विशिष्ट रास्तों में विभाजित करता है:

  • डिटेक्टिव "ब्लर" (The Non-Causal Path):

    • काम: इस डिटेक्टिव का एकमात्र काम गंदगी को देखना है। "क्या यह धुंधला है? क्या यह अंधेरा है? क्या यहाँ कोई छाया है?"
    • कार्यप्रणाली: वे पूरी तस्वीर को देखते हैं और सभी "शोर" (noise) संकेतों को इकट्ठा करते हैं। वे टेक्स्ट पढ़ने की कोशिश नहीं करते; वे केवल क्षरण (degradation) की पहचान करते हैं।
    • ट्रिक: उन्हें सब कुछ देखने की अनुमति है, लेकिन उन्हें दूसरे डिटेक्टिव से बात करने की अनुमति नहीं है। यह सुनिश्चित करता है कि "गंदगी" वास्तविक "अर्थ" को दूषित न करे।
  • डिटेक्टिव "मीनिंग" (The Causal Path):

    • काम: यह डिटेक्टिव कंटेंट (सामग्री) का विशेषज्ञ है। "यह चार्ट क्या कहता है? उत्तर क्या है?"
    • कार्यप्रणाली: वे सत्य खोजने के लिए दस्तावेज़ को देखते हैं। लेकिन यहाँ जादू है: डिटेक्टिव "ब्लर" डिटेक्टिव "मीनिंग" के कान में फुसफुसाता है।
    • सहयोग: डिटेक्टिव "ब्लर" कहता है, "हे, मुझे बाईं ओर एक गहरा साया दिख रहा है।" डिटेक्टिव "मीनिंग" इसे सुनता है और सोचता है, "ठीक है, मैं जानता हूँ कि वह साया सिर्फ एक छाया है, टेक्स्ट का हिस्सा नहीं। मैं उसे अनदेखा करूँगा और केवल शब्दों पर ध्यान केंद्रित करूँगा।"

2. ट्रेनिंग (अलग करना सीखना)

इस टीम को काम करने के लिए, शोधकर्ताओं ने उन्हें दो विशिष्ट नियम (Objectives) सिखाए:

  • नियम 1 (द "मेस" क्लासिफायर): डिटेक्टिव "ब्लर" को समान प्रकार की गंदगी को एक साथ समूहबद्ध करने में बहुत अच्छा होना चाहिए। यदि दो तस्वीरें दोनों "धुंधली" हैं, तो वे डिटेक्टिव "ब्लर" के लिए समान दिखनी चाहिए, भले ही उनके अंदर का टेक्स्ट पूरी तरह से अलग हो।
  • नियम 2 (द "प्योर" मीनिंग): डिटेक्टिव "मीनिंग" को गंदगी को अनदेखा करना सीखना चाहिए। यदि आप उन्हें एक साफ फोटो और उसी दस्तावेज़ की एक धुंधली फोटो दिखाते हैं, तो उन्हें बिल्कुल वही उत्तर देना चाहिए। वे उस "शोर" को हटाना सीख जाते हैं जिसे डिटेक्टिव "ब्लर" ने पहचाना था।

3. परिणाम (यह बेहतर क्यों है)

जब सवाल का जवाब देने का समय आता है (Inference), तो सिस्टम केवल डिटेक्टिव "मीनिंग" का उपयोग करता है।

  • क्योंकि डिटेक्टिव "मीनिंग" को गंदगी को अनदेखा करने के लिए प्रशिक्षित किया गया था, इसलिए वह खराब फोटो होने पर भी सटीक उत्तर देता है।
  • सबसे अच्छी बात: आपको वास्तविक उत्तर देने के दौरान "ब्लर" डिटेक्टिव की आवश्यकता नहीं होती है। सिस्टम पुराने, सामान्य AI की तरह ही तेज़ चलता है, लेकिन यह खराब फोटो को संभालने के मामले में बहुत अधिक स्मार्ट है।

नया टेस्ट: Distortion-VisRAG

यह साबित करने के लिए कि यह काम करता है, लेखकों ने केवल परफेक्ट फोटो पर परीक्षण नहीं किया। उन्होंने एक विशाल नया परीक्षण बनाया जिसे Distortion-VisRAG कहा जाता है।

  • कल्पना कीजिए कि एक लाइब्रेरी में 367,000 दस्तावेज़ हैं।
  • उन्होंने इन दस्तावेज़ों को लिया और उन्हें जानबूझकर खराब कर दिया: उन्होंने उन्हें धुंधला, अंधेरा, शोर भरा, मुड़ा हुआ और लो-रेज़ोल्यूशन वाला बनाया।
  • उन्होंने इस "खराब की गई लाइब्रेरी" पर AI का परीक्षण किया।

परिणाम:

  • पुराना AI: जब लाइब्रेरी खराब हुई, तो AI का प्रदर्शन गिर गया। वह सही किताबें नहीं ढूंढ सका और गलत उत्तर दिए।
  • RobustVisRAG: इसने कोई फर्क नहीं पड़ने दिया। इसने सही दस्तावेज़ खोज लिए और सही उत्तर दिए, भले ही फोटो बहुत खराब थी। इसने वास्तविक दुनिया के कठिन हालातों में मौजूदा सर्वोत्तम तरीकों की तुलना में प्रदर्शन में 12% से अधिक सुधार किया।

एक वाक्य में सारांश

RobustVistRAG एक स्मार्ट सहायक की तरह है जो गंदगी/शोर को पहचानने और उसे अनदेखा करने के लिए एक विशेष "नॉइज़-फाइटर" को काम पर रखता है, जिससे "मस्तिष्क" को केवल तथ्यों पर ध्यान केंद्रित करने में मदद मिलती है, यह सुनिश्चित करता है कि वह कभी भी धुंधले या अंधेरे दस्तावेज़ से भ्रमित न हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →