← नवीनतम पेपर
🤖 AI

When RAG Hurts: Diagnosing and Mitigating Attention Distraction in Retrieval-Augmented LVLMs

यह शोध पत्र "अटेंशन डिस्ट्रैक्शन" (Attention Distraction) को रिट्रीवल-ऑगमेंटेड लार्ज विजन-लैंग्वेज मॉडल्स में एक नवीन विफलता मोड के रूप में पहचानता है जहाँ प्रासंगिक रिट्रीव्ड टेक्स्ट विजुअल अटेंशन को दबा देता है, और MAD-RAG का प्रस्ताव करता है, जो एक ट्रेनिंग-फ्री विधि है जो विजुअल ग्राउंडिंग को कॉन्टेक्स्ट इंटीग्रेशन से अलग करके इस समस्या को महत्वपूर्ण रूप से कम करती है।

मूल लेखक: Beidi Zhao, Wenlong Deng, Xinting Liao, Yushu Li, Nazim Shaikh, Yao Nie, Xiaoxiao Li

प्रकाशित 2026-06-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Beidi Zhao, Wenlong Deng, Xinting Liao, Yushu Li, Nazim Shaikh, Yao Nie, Xiaoxiao Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करके शोध पत्र "When RAG Hurts: Diagnosing and Mitigating Attention Distraction in Retrieval-Augmented LVLMs" की व्याख्या दी गई है।

मुख्य समस्या: "अति-सहायक" लाइब्रेरियन (The "Over-Helpful" Librarian)

कल्पना कीजिए कि आप एक विजुअल क्विज़ (दृश्य प्रश्नोत्तरी) दे रहे हैं। आपके सामने एक फोटो है, और आपको उससे संबंधित एक प्रश्न का उत्तर देना है।

  • क्लोज्ड-बुक मोड (Closed-Book Mode): आप केवल अपनी याददाश्त और फोटो में जो दिख रहा है, उस पर भरोसा करते हैं।
  • RAG (रिट्रीवल-ऑगमेंटेड जनरेशन): एक लाइब्रेरियन आपको उत्तर देने में मदद करने के लिए संदर्भ पुस्तकों (रिट्रीव्ड टेक्स्ट) का एक ढेर थमा देता है।

आमतौर पर, हम सोचते हैं कि लाइब्रेरियन हमेशा मददगार होता है। लेकिन यह शोध पत्र एक अजीब बग (खामी) की खोज करता है: कभी-कभी लाइब्रेरियन वास्तव में आपको गलत उत्तर देने पर मजबूर कर देता है, भले ही उन किताबों में सही जानकारी मौजूद हो।

लेखक इस बग को "अटेंशन डिस्ट्रैक्शन" (Attention Distraction - ध्यान भटकना) कहते हैं। यह दो विशिष्ट तरीकों से होता है:

1. क्रॉस-मोडल डिस्ट्रैक्शन (The "Ignore the Picture" Effect - चित्र को अनदेखा करने का प्रभाव)

जब लाइब्रेरियन आपको वे किताबें थमाता है, तो आपका मस्तिष्क अचानक फोटो देखना बंद कर देता है। आप टेक्स्ट पढ़ने में इतने खो जाते हैं कि आप दृश्य साक्ष्य (visual evidence) देखना ही भूल जाते हैं।

  • उपमा: कल्पना कीजिए कि आप एक पार्किंग लॉट में कार को पहचानने की कोशिश कर रहे हैं। लाइब्रेरियन आपको कार के इंजन के बारे में एक मैनुअल थमा देता है। आप मैनुअल को इतनी तन्मयता से पढ़ने लगते हैं कि आप कार को देखना ही छोड़ देते हैं। आप किताब से इंजन के प्रकार का सही अनुमान तो लगा सकते हैं, लेकिन आप यह देखने में चूक जाते हैं कि वह कार वास्तव में एक मोटरसाइकिल है। टेक्स्ट ने आपको चित्र से "विचलित" (distract) कर दिया।

2. इंट्रा-इमेज डिस्ट्रैक्शन (The "Wrong Part of the Photo" Effect - फोटो के गलत हिस्से पर ध्यान)

भले ही आप फोटो को देख रहे हों, लेकिन टेक्स्ट की उपस्थिति के कारण आपकी नज़रें फोटो के गलत हिस्सों पर टिक जाती हैं। प्रश्न में बताए गए महत्वपूर्ण ऑब्जेक्ट पर ध्यान केंद्रित करने के बजाय, आपकी आँखें बैकग्राउंड या अप्रासंगिक विवरणों की ओर भटक जाती हैं।

  • उपमा: प्रश्न पूछता है, "खिलाड़ी क्या पकड़े हुए है?" फोटो में, खिलाड़ी ने एक बैट पकड़ा हुआ है। लेकिन क्योंकि आप बेसबॉल के नियमों के बारे में एक टेक्स्ट पढ़ रहे हैं, आपकी आँखें भीड़ या घास की ओर भटक जाती हैं। आप बैट को मिस कर देते हैं क्योंकि आपका ध्यान मुख्य विजुअल सुराग से "भटक" गया था।

ऐसा क्यों होता है?

यह शोध पत्र बताता है कि लार्ज विजन-लैंग्वेज मॉडल्स (LVLMs) "अटेंशन" (महत्व) देकर काम करते हैं, जो अलग-अलग शब्दों और पिक्सेल को आवंटित किया जाता है।

  • क्लोज्ड-बुक मोड में, मॉडल प्रश्न से संबंधित इमेज टोकन्स पर उच्च ध्यान (high attention) देता है।
  • RAG मोड में, लाइब्रेरियन द्वारा दिए गए लंबे टेक्स्ट के कारण इमेज "दब" जाती है। मॉडल का आंतरिक तंत्र टेक्स्ट की भारी मात्रा से भ्रमित हो जाता है, जिससे उसका विजुअल फोकस कम हो जाता है। यह एक शांत कमरे (Closed-Book) बनाम एक शोर वाले कॉन्सर्ट (Rals) में बातचीत करने जैसा है; शोर (टेक्स्ट) सूक्ष्म संकेतों (विजुअल विवरणों) को दबा देता है।

समाधान: MAD-RAG

इसे ठीक करने के लिए, लेखकों ने MAD-RAG नामक एक विधि बनाई है। यह एक "ट्रेनिंग-फ्री" ट्रिक है, जिसका अर्थ है कि आपको AI मॉडल को फिर से प्रशिक्षित करने की आवश्यकता नहीं है; आप बस परीक्षण के दौरान सूचना को प्रोसेस करने का तरीका बदलते हैं।

MAD-RAG दो चतुर रणनीतियों का उपयोग करता है:

1. "डुअल-क्वेश्चन" सेटअप (काम का बँटवारा)

केवल इमेज और टेक्स्ट दिखाने के बाद AI से एक प्रश्न पूछने के बजाय, MAD-RAG उसी प्रश्न को दो बार पूछता है, लेकिन अलग-अलग स्थानों पर:

  • प्रश्न 1 (इमेज-क्वेश्चन): इसे इमेज के ठीक बाद रखा जाता है। इसका एकमात्र काम फोटो को देखना और विजुअल सुराग खोजना है।

  • प्रश्न 2 (कॉन्टेक्स्ट-क्वेश्चन): इसे लाइब्रेरियन की किताबों के बाद रखा जाता है। इसका काम टेक्स्ट को पढ़ना और उसे उत्तर के साथ जोड़ना है।

  • उपमा: कल्पना कीजिए कि आपके पास दो सहायक हैं।

    • सहायक A फोटो के पास खड़ा है। आप उससे कहते हैं, "बस मुझे बताओ कि तुम इस प्रश्न से संबंधित फोटो में क्या देख रहे हो।"
    • सहायक B किताबों के पास खड़ा है। आप उससे कहते हैं, "इन किताबों को पढ़ो और उस जानकारी को सहायक A ने जो देखा उसके साथ मिलाओ।"
    • भूमिकाओं को अलग करके, सहायक A किताबों से विचलित नहीं होता है, और सहायक B के पास काम करने के लिए एक स्पष्ट विजुअल रिपोर्ट होती है।

2. अटेंशन मिक्सिंग (दोनों दुनिया का सर्वश्रेष्ठ मिश्रण)

AI स्वाभाविक रूप से अधिक टेक्स्ट पढ़ते समय इमेज को भूलने लगता है (जिसे "रेन्सी बायस" कहा जाता है)। MAD-RAG AI को मजबूर करता है कि वह सहायक A से प्राप्त "विजुअल फोकस" को सहायक B के "टेक्स्ट रीजनिंग" में मिला दे।

  • उपमा: यह कड़क कॉफी (विजुअल साक्ष्य) को दूध (टेक्स्ट कॉन्टेक्स्ट) के साथ मिलाने जैसा है। यदि आप केवल दूध पीते हैं, तो यह हल्का है। यदि आप केवल कॉफी पीते हैं, तो यह बहुत तेज़ है। MAD-RAG यह सुनिश्चित करता है कि अंतिम कप में सही संतुलन हो, ताकि AI टेक्स्ट पढ़ते समय विजुअल सुरागों को न भूले।

परिणाम

शोध पत्र दिखाता है कि यह सरल ट्रिक बहुत अच्छी तरह काम करती है:

  • यह त्रुटियों को ठीक करता है: उन मामलों में जहाँ AI बिना किताबों के सही था लेकिन किताबों के साथ गलत था ("अटेंशन डिस्ट्रैक्शन" के मामले), MAD-RAG ने उन गलतियों को 74.68% तक ठीक कर दिया।
  • यह तेज़ है: यह प्रक्रिया में लगभग कोई अतिरिक्त समय नहीं जोड़ता (मानक विधि से केवल लगभग 10% धीमा है)।
  • यह अन्य सुधारों से बेहतर है: यह समान समस्याओं को ठीक करने की कोशिश करने वाले अन्य मौजूदा तरीकों से काफी बेहतर प्रदर्शन करता है।

सारांश

संक्षेप में, यह शोध पत्र तर्क देता है कि AI को बहुत अधिक टेक्स्ट देने से कभी-कभी वह उन छवियों के प्रति "अंधा" हो सकता है जिनका उसे विश्लेषण करना होता है। MAD-RAG इस कार्य को दो भागों में विभाजित करके इसे हल करता है—एक पूरी तरह से देखने पर केंद्रित है और दूसरा केवल पढ़ने पर—और फिर परिणामों को सावधानीपूर्वक मिलाकर यह सुनिश्चित करता है कि AI चित्र से अपनी दृष्टि न खोए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →