← नवीनतम पेपर
💬 NLP

The Cost of Context: Mitigating Textual Bias in Multimodal Retrieval-Augmented Generation

यह शोध पत्र "रिकोर्प्शन" (recorruption) की पहचान करता है और उसे संबोधित करता है, जो मल्टीमॉडल रिट्रीवल-ऑगमेंटेड जनरेशन (Multimodal Retrieval-Augmented Generation) में एक विफलता मोड है जहाँ सटीक संदर्भ के कारण मॉडल विजुअल ब्लाइंडनेस (visual blindness) और पोजीशनल बायस (positional bias) के चलते सही भविष्यवाणियों को छोड़ देते हैं, और इसके लिए बिना पुनरप्रशिक्षण (retraining) के विजुअल सेलियंसी (visual saliency) को बहाल करने और नैदानिक विश्वसनीयता में सुधार करने हेतु पैरामीटर-मुक्त बॉटलनेक अटेंशन इंटरवेंशन फॉर रिकवरी (Bottleneck Attention Intervention for Recovery - BAIR) फ्रेमवर्क का प्रस्ताव करता है।

मूल लेखक: Hoin Jung, Xiaoqian Wang

प्रकाशित 2026-05-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hoin Jung, Xiaoqian Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "The Cost of Context" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

मुख्य समस्या: जब "सहायक" सलाह एक अच्छे उत्तर को बिगाड़ देती है

कल्पना कीजिए कि आप एक शानदार जासूस (AI मॉडल) हैं जो केवल अपराध स्थल की तस्वीर (छवि) देखकर अपराध सुलझाने में माहिर है। आप तस्वीर देखते हैं, सुराग पाते हैं, और सही अपराधी की पहचान करते हैं।

अब, कल्पना कीजिए कि एक घबराया हुआ इंटर्न (बाहरी टेक्स्ट) दौड़ता हुआ आता है और आपके हाथ में गवाहों के बयानों की एक मोटी फाइल थमा देता है। भले ही आपने केस पहले ही सुलझा लिया है, लेकिन आप उस फाइल को पढ़ने के लिए दबाव महसूस करते हैं। आप पढ़ना शुरू करते हैं, और अचानक, इंटर्न की आवाज़ आपकी अपनी आँखों की दृष्टि पर हावी हो जाती है। आप भूल जाते हैं कि आपने फोटो में क्या देखा था, टेक्स्ट से भ्रमित हो जाते हैं, और अपना उत्तर बदलकर गलत कर देते हैं।

पेपर इस घटना को "Recorruption" (पुनः भ्रष्ट होना) कहता है। यह तब होता है जब मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs)—जो AI छवियों को देख सकते हैं और टेक्स्ट पढ़ सकते हैं—को मदद के लिए अतिरिक्त दस्तावेज़ (रिट्रीवल-ऑगमेंटेड जनरेशन, या RAG) दिए जाते हैं। विरोधाभासी रूप से, भले ही दस्तावेज़ 100% सटीक हों, वे AI को छवि को अनदेखा करने और गलत उत्तर देने के लिए trick कर सकते हैं।

यह क्यों होता है? (दो सिरों वाला राक्षस)

शोधकर्ताओं ने AI के "दिमाग" (इसके अटेंशन मैकेनिज्म) के भीतर झाँका ताकि यह देख सकें कि ऐसा क्यों होता है। उन्होंने पाया कि AI दो मुख्य कारणों से भ्रमित होता है:

  1. दृश्य अंधापन (Visual Blindness): AI के पास सीमित "अटेंशन बजट" (एक स्पॉटलाइट की तरह) होता है। जब टेक्स्ट की एक विशाल दीवार जोड़ी जाती है, तो स्पॉटलाइट पूरी तरह से टेक्स्ट की ओर खिंच जाती है। छवि अंधेरे में चली जाती है। AI वास्तव में तस्वीर को देखना बंद कर देता है, भले ही तस्वीर में सच्चाई मौजूद हो।
  2. "बीच में खो जाने" का जाल (The "Lost in the Middle" Trap): AI टेक्स्ट को समान रूप से नहीं पढ़ता है। उसकी एक बुरी आदत है कि वह दस्तावेज़ के केवल शुरुआत या अंत पर ही ध्यान देता है, और बीच के सब कुछ को अनदेखा कर देता है।
    • सफलता का भ्रम: कभी-कभी, AI सही उत्तर दे देता है, लेकिन इसलिए नहीं कि उसने छवि या टेक्स्ट को समझा, बल्कि यह सिर्फ एक इत्तेफाक होता है। यदि सही उत्तर टेक्स्ट फाइल के बिल्कुल अंत में लिखा है, तो AI उसे पकड़ लेता है। लेकिन यदि सच्चाई फाइल के बीच में है, तो AI उसे पूरी तरह से मिस कर देता है।

समाधान: BAIR (द "अटेंशन थेरेपिस्ट")

इसे ठीक करने के लिए, लेखकों ने BAIR (बॉटलनेक अटेंशन इंटरवेंशन फॉर रिकवरी) नामक एक टूल बनाया है। BAIR को AI के अटेंशन स्पैन के लिए एक थेरेपिस्ट के रूप में समझें। यह AI को फिर से प्रशिक्षित नहीं करता या उसे नई चीजें नहीं सिखाता; यह बस सोचते समय उसके फोकस को वापस सही जगह पर लाने के लिए धीरे से धकेलता है।

BAIR दो काम करता है:

  1. स्पॉटलाइट को वापस छवि पर लाता है: यह AI को फोटो देखने की याद दिलाता है, जिससे "विजुअल मास" बहाल होता है और फोकस फिर से तेज हो जाता है।
  2. "किताब के अंत" वाली आदत को दंडित करता है: यह AI पर एक हल्का जुर्माना लगाता है यदि वह केवल शुरुआत या अंत से जानकारी लेने की कोशिश करता है। यह AI को वास्तव में पूरे दस्तावेज़ को पढ़ने और साक्ष्यों को निष्पक्ष रूप से तौलने के लिए मजबूर करता है।

परिणाम: बिना भारी मेहनत के जीत

शोधकर्ताओं ने तीन बहुत अलग दुनिया में इसका परीक्षण किया:

  • मेडिकल (चिकित्सा): एक्स-रे से बीमारियों का निदान करना।
  • सामाजिक निष्पक्षता (Social Fairness): यह जांचना कि क्या AI फोटो के आधार पर व्यक्ति के लिंग की सही पहचान करता है, या टेक्स्ट में मौजूद रूढ़ियों (stereotypes) पर निर्भर रहता है।
  • जियोस्पेशियल (भू-स्थानिक): सैटेलाइट छवियों से भूमि के प्रकारों (जैसे जंगल या शहर) की पहचान करना।

निष्कर्ष स्पष्ट थे:

  • BAIR ने त्रुटियों को ठीक किया: इसने AI को छवियों को अनदेखा करने से रोका और "गलत" उत्तरों को वापस "सही" में बदल दिया।
  • यह तेज़ और मुफ्त था: BAIR एक "पैरामीटर-फ्री" विधि है। इसका मतलब है कि आपको नया मॉडल प्रशिक्षित करने के लिए महीनों खर्च करने या महंगे सुपरकंप्यूटरों का उपयोग करने की आवश्यकता नहीं है। यह AI की सामान्य सोचने की प्रक्रिया के दौरान तुरंत काम करता है।
  • यह अन्य उपकरणों के साथ काम करता है: BAដែរ BAIR को अन्य मौजूदा तरीकों के ऊपर जोड़ा जा सकता है ताकि उन्हें और भी बेहतर बनाया जा सके।

सारांश उपमा (Summary Analogy)

कल्पना कीजिए कि AI एक परीक्षा दे रहा छात्र है।

  • संदर्भ के बिना (Without Context): छात्र आरेख (diagram) को देखता है और सही उत्तर देता है।
  • खराब संदर्भ के साथ (With Bad Context - Standard RAG): शिक्षक छात्र को एक पाठ्यपुस्तक थमा देता है। छात्र टेक्स्ट से इतना अभिभूत हो जाता है कि वह आरेख को भूल जाता है और गलत अनुमान लगाता है।
  • BAIR के साथ: शिक्षक छात्र को पाठ्यपुस्तक देता है, लेकिन एक स्मार्ट सहायक (BAIR) फुसफुसाता है, "हे, पहले आरेख को देखना मत भूलना, और सुनिश्चित करें कि आप पूरे टेक्स्ट को पढ़ें, न कि केवल अंतिम पृष्ठ को।" छात्र फिर सही उत्तर प्राप्त करता है।

पेपर निष्कर्ष निकालता है कि हालांकि AI में टेक्स्ट जोड़ना एक अच्छा विचार लगता है, लेकिन यह अक्सर एक खतरनाक जाल छिपाता है जहाँ AI दृश्य साक्ष्य देखना बंद कर देता है। BAIR एक सरल, त्वरित समाधान है जो AI की आँखें खुली रखता है और उसके मन को केंद्रित रखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →