← नवीनतम पेपर
💻 computer science

CAST: Mitigating Object Hallucination in Large Vision-Language Models via Caption-Guided Visual Attention Steering

यह शोध पत्र CAST का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त (training-free) और प्लग-एंड-प्ले विधि है जो कैप्शन-निर्देशित अटेंशन पैटर्न (caption-guided attention patterns) का लाभ उठाकर विज़ुअल परसेप्शन को निर्देशित करती है ताकि इन्फरेंस लागत में उल्लेखनीय वृद्धि किए बिना लार्ज विज़न-लैंग्वेज मॉडल्स में ऑब्जेक्ट हॉलुसिनेशन (object hallucination) को कम किया जा सके।

मूल लेखक: Qiming Li, Zekai Ye, Xiaocheng Feng, Weihong Zhong, Libo Qin, Ruihan Chen, Lei Huang, Baohang Li, Kui Jiang, Yaowei Wang, Ting Liu, Bing Qin

प्रकाशित 2026-05-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qiming Li, Zekai Ye, Xiaocheng Feng, Weihong Zhong, Libo Qin, Ruihan Chen, Lei Huang, Baohang Li, Kui Jiang, Yaowei Wang, Ting Liu, Bing Qin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "CAST: Caption-Guided Visual Attention Steering के माध्यम से Large Vision-Language Models में Object Hallucination को कम करना" नामक शोध पत्र का सरल अवधारणाओं और रचनात्मक उपमाओं के साथ विवरण दिया गया है।

समस्या: "अति-आत्मविश्वासी कलाकार" (The Over-Confident Artist)

कल्पना कीजिए कि एक Large Vision-Language Model (LVLM) एक बहुत ही प्रतिभाशाली कलाकार है जिसने लाखों चित्र देखे हैं और लाखों किताबें पढ़ी हैं। यह कलाकार चीजों का वर्णन करने में बहुत कुशल है। हालाँकि, उसकी एक बुरी आदत है: वह कभी-कभी "हैलुसिनेट" (Hallucinate) करता है यानी भ्रमित हो जाता है।

यदि आप उसे एक मोटरसाइकिल की तस्वीर दिखाते हैं, तो वह आत्मविश्वास के साथ कह सकता है, "मुझे एक मोटरसाइकिल और एक हेलमेट दिख रहा है," भले ही तस्वीर में कोई हेलमेट न हो। वह अपने प्रशिक्षण डेटा (training data) में मोटरसाइकिल के साथ हेलमेट देखने का इतना आदी है कि वह बस मान लेता है कि हेलमेट वहीं है। वह अपनी याददाश्त को उस चीज़ को प्राथमिकता दे रहा है जो वास्तव में उसकी आँखों के सामने है।

खोज: "कैप्शन स्विच" (The Caption Switch)

शोधकर्ताओं ने गौर किया कि यह कलाकार कैसे सोचता है। उन्होंने पाया कि कलाकार इस बात पर अलग तरह से व्यवहार करता है कि आप उससे सवाल कैसे पूछते हैं:

  1. "कैप्शन" मोड (The "Caption" Mode): यदि आप उससे कहते हैं, "कृपया इस छवि का विस्तार से वर्णन करें," तो कलाकार छवि के वास्तविक पिक्सेल (pixels) पर अत्यधिक केंद्रित हो जाता है। वह चित्र के हर हिस्से को ध्यान से देखता है।
  2. "प्रश्न" मोड (The "Question" Mode): यदि आप एक विशिष्ट प्रश्न पूछते हैं जैसे, "क्या चित्र में एक हेलमेट है?" तो कलाकार विचलित हो जाता है। वह अपनी याददाश्त और धारणाओं पर अधिक निर्भर हो जाता है, जिससे वे नकली "हैलुसिनेशन" पैदा होते हैं।

उपमा (The Analogy): कलाकार को एक जासूस के रूप में सोचें।

  • जब आप उनसे "एक पूरी रिपोर्ट लिखने" (Caption Query) के लिए कहते हैं, तो वे अपराध स्थल की फोटो में हर सुराग का बारीकी से परीक्षण करते हैं।
  • जब आप एक "हाँ/ना वाले प्रश्न" (Non-Caption Query) पूछते हैं, तो वे अधीर हो जाते हैं, फोटो को छोड़ देते हैं, और उस उत्तर का अनुमान लगाते हैं जो उनके अनुसार आमतौर पर होता है।

समाधान: CAST (द "अटेंशन स्टीयरिंग व्हील")

शोधकर्ताओं ने CAST (Caption-guided Visual Attention Steering) नामक एक विधि बनाई। वे कलाकार को फिर से प्रशिक्षित (retrain) नहीं करना चाहते थे (जिसमें वर्षों लग जाते और भारी खर्च होता)। इसके बजाय, वे कलाकार को सवाल का जवाब देते समय उसके फोकस को ठीक करने के लिए एक "स्टीयरिंग व्हील" देना चाहते थे।

यहाँ बताया गया है कि CAST तीन सरल चरणों में कैसे काम करता है:

1. "फोकस हेड्स" को खोजना (Probing)

AI मॉडल के भीतर, हजारों छोटे "अटेंशन हेड्स" (attention heads) होते हैं (सोचिए कि ये एक फैक्ट्री में काम करने वाले अलग-अलग छोटे कर्मचारी हैं)। शोधकर्ताओं ने यह पता लगाने के लिए एक परीक्षण का उपयोग किया कि कौन से विशिष्ट कर्मचारी सक्रिय होते हैं जब कलाकार "कैप्शन मोड" (तस्वीर को करीब से देखना) में होता है बनाम "प्रश्न मोड" (अनुमान लगाना) में होता है।

  • रूपक (Metaphor): उन्होंने उन विशिष्ट कर्मचारियों की पहचान की जो "विवरण-उन्मुख निरीक्षक" (Detail-Oriented Inspectors) हैं। ये वे लोग हैं जो अनुमान लगाने के बजाय वास्तव में फोटो को देखते हैं।

2. "करेक्शन वेक्टर" की गणना करना (Estimation)

शोधकर्ताओं ने सटीक रूप से मापा कि जब कलाकार एक अनुमान से विस्तृत विवरण की ओर बढ़ता है, तो ये "विवरण-उन्मुख निरीक्षक" अपने व्यवहार को कितना बदलते हैं। उन्होंने एक "शिफ्ट वेक्टर" (shift vector) की गणना की—एक गणितीय दिशा जो "छवि को अधिक करीब से देखने" का प्रतिनिधित्व करती है।

  • रूपक (Metaphor): यह एक लापरवाह अनुमान और एक सावधानीपूर्वक निरीक्षण के बीच के अंतर को मापने जैसा है। उन्होंने एक "मैप" बनाया जो यह दिखाता है कि कलाकार के मस्तिष्क को सावधानीपूर्वक निरीक्षण की ओर कैसे धकेला जाए।

3. अटेंशन को निर्देशित करना (Inference-Time Intervention)

अब, जब कलाकार से एक पेचीदा सवाल पूछा जाता है (जैसे "क्या वहां एक हेलमेट है?"), तो CAST "विवरण-उन्मुख निरीक्षकों" को "कैप्शन मोड" में काम करने के लिए धीरे से प्रेरित करता है (यानी उन्हें चित्र को करीब से देखने के लिए मजबूर करता है)। यह उन्हें जवाब देने से पहले फिर से इमेज पिक्सेल को देखने के लिए मजबूर करता है।

  • रूपक (Metaphor): कल्पना कीजिए कि कलाकार "हाँ, एक हेलमेट है" का अनुमान लगाने ही वाला है। बोलने से ठीक पहले, CAST उसे कंधे पर एक हल्का सा थपथपाता है और कहता है, "रुको! फोटो को फिर से देखो, ठीक वैसे ही जैसे तुम एक पूरा विवरण लिखते समय देखोगे।" कलाकार देखता है, देखता है कि वहां कोई हेलमेट नहीं है, और अपने उत्तर को सुधार कर "नहीं" कर देता है।

यह क्यों विशेष है?

  • पुनः प्रशिक्षण की आवश्यकता नहीं (No Retraining Needed): आमतौर पर, एक बुरी आदत को ठीक करने के लिए, आपको कलाकार को महीनों तक वापस स्कूल भेजना पड़ता है (retraining)। CAST उन्हें एक त्वरित 'रिमाइंडर नोट' देने जैसा है। यह मॉडल के मस्तिष्क को बदले बिना तुरंत काम करता है।
  • तेज़ और सस्ता (Fast and Cheap): अन्य विधियाँ मॉडल को सवाल को सिस्टम के माध्यम से कई बार चलाने के लिए मजबूर करती हैं, जो धीमा है। CAST केवल आंतरिक फोकस को बदल देता है, जिससे लगभग कोई देरी नहीं होती।
  • हर जगह काम करता है (Works Everywhere): शोधकर्ताओं ने पांच अलग-अलग प्रकार के AI मॉडल्स और पांच अलग-अलग टेस्ट पर इसका परीक्षण किया। हर मामले में, मॉडल्स ने उन वस्तुओं के बारे में गलतियाँ (hallucinations) कम कीं जो वहां मौजूद नहीं थीं।

परिणाम

इस "स्टीयरिंग" तकनीक का उपयोग करके, मॉडल्स ने अपने ऑब्जेक्ट हैलुसिनेशन (चीजें बनाना) को औसतन 6% कम कर दिया। इससे भी महत्वपूर्ण बात यह है कि उन्होंने अन्य प्रश्नों के सही उत्तर देने की अपनी क्षमता नहीं खोई; वे बस जो उन्होंने वास्तव में देखा उसके बारे में अधिक ईमानदार हो गए।

संक्षेप में: CAST AI को अनुमान लगाना बंद करने और देखना शुरू करने के लिए सिखाता है, इसके लिए वह उस "सावधानीपूर्वक देखने" की आदत का उपयोग करता है जो उसके पास पहले से ही एक छवि का वर्णन करते समय होती है, और इस आदत को हर उस प्रश्न पर लागू करता है जिसका वह उत्तर देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →