← नवीनतम पेपर
💻 computer science

Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation

यह शोध पत्र GIFT का प्रस्ताव करता है, जो एक गेज़ शिफ्ट-गाइडेड क्रॉस-मोडल फ्यूजन विधि है जो सकारात्मक अटेंशन परिवर्तनों के आधार पर प्रमुख दृश्य क्षेत्रों और उपयोगकर्ता प्रश्नों के प्रति अटेंशन को गतिशील रूप से बढ़ाकर विज़न-लैंग्वेज मॉडल के मतिभ्रम (hallucinations) को कम करता है, जिससे विज़ुअल अटेंशन सिंक्स कम होते हैं और कम कम्प्यूटेशनल ओवरहेड के साथ प्रदर्शन में सुधार होता है।

मूल लेखक: Zheng Qi, Chao Shang, Evangelia Spiliopoulou, Nikolaos Pappas

प्रकाशित 2026-06-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zheng Qi, Chao Shang, Evangelia Spiliopoulou, Nikolaos Pappas

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र "Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation" (या संक्षेप में GIFT) की सरल भाषा और रचनात्मक उपमाओं का उपयोग करते हुए व्याख्या दी गई है।

समस्या: "दिन में सपने देखने वाला" (Daydreaming) AI

कल्प_िए कि आपके पास एक बहुत ही बुद्धिमान, अच्छी तरह से पढ़ा-लिखा सहायक है जिसे कहानियाँ सुनाना बहुत पसंद है। आप उसे चटाई पर बैठी एक बिल्ली की तस्वीर दिखाते हैं और पूछते हैं, "बिल्ली क्या कर रही है?"

चूँकि इस सहायक ने बिल्लियों के बारे में लाखों किताबें पढ़ी हैं, इसलिए वह आत्मविश्वास के साथ कह सकता है, "बिल्ली एक लाल चूहे का पीछा कर रही है!" भले ही चित्र में कोई चूहा न हो। वह हैलुसिनेशन (Hallucination) कर रहा है। वह अपनी उस जानकारी पर बहुत अधिक भरोसा कर रहा है जो उसे लगता है कि वहाँ होनी चाहिए (उसका "पूर्व ज्ञान" या "prior knowledge"), बजाय इसके कि वह बारीकी से देखे कि वास्तव में वहाँ क्या है (विजुअल इनपुट)।

वर्तमान तरीके इस समस्या को ठीक करने की कोशिश करते हैं यह कहकर कि, "तस्वीर को ध्यान से देखो!" लेकिन इस शोध पत्र का तर्क है कि इन तरीकों में दो कमियाँ हैं:

  1. वे गलत जगहों पर देखते हैं: कभी-कभी AI बैकग्राउंड के शोर (जैसे कि एक धुंधली दीवार) से विचलित हो जाता है। इसे "विजुअल अटेंशन सिंक" (Visual Attention Sink) कहा जाता है। यह एक ऐसे छात्र की तरह है जो गणित के सवाल के बजाय अपनी पाठ्यपुस्तक के पन्ने पर लगे धब्बे को घूर रहा है।
  2. वे प्रश्न भूल जाते हैं: यदि आप AI को केवल यह बताते हैं कि "तस्वीर को देखो!" बिना यह याद दिलाए कि उसे क्या देखना है, तो वह भ्रमित हो सकता है। उसे तस्वीर को देखने और आपके विशिष्ट प्रश्न को समझने के बीच संतुलन बनाने की आवश्यकता है।

समाधान: GIFT (द "गेज़ शिफ्ट" ट्रैकर)

लेखकों ने GIFT (Gaze Shift-Guided Cross-modal Fusion Enhancement) नामक एक नई विधि प्रस्तावित की है।

GIFT को समझने के लिए, एक मानव जासूस की कल्पना करें जो एक गवाह के बयान को पढ़ते हुए अपराध स्थल की फोटो देख रहा है।

  • पुराना तरीका (Static Gaze): जासूस पूरी फोटो का एक स्नैपशॉट लेता है और उसका ध्यान (attention) औसत रूप में निकाल लेता है। वह कोने में रखी एक रैंडम कुर्सी से विचलित हो सकता है क्योंकि वह फोटो के बीच में है।
  • GIFT का तरीका (Gaze Shift): जासूस गवाह के बयान को शब्द दर शब्द पढ़ता है।
    • जब वह "लाल" शब्द सुनता है, तो उसकी आँखें (गज़) लाल फायर हाइड्रेंट की ओर कूदती (shift होती) हैं।
    • जब वह "कुत्ता" शब्द सुनता है, तो उसकी आँखें कुत्ते की ओर कूदती हैं।
    • जब वह किसी ऐसे शब्द को सुनता है जो महत्वपूर्ण नहीं है (जैसे "द" या "और"), तो उसकी आँखें ज्यादा नहीं हिलतीं।

GIFT AI के लिए बिल्कुल यही करता है। यह देखता है कि जब AI आपके प्रश्न को पढ़ रहा होता है, तो उसके "नज़र" (attention) कैसे चलते हैं। यह उन हिस्सों को अनदेखा कर देता है जहाँ AI की नज़र स्थिर रहती है या बिना किसी दिशा के भटकती रहती है। यह केवल उन क्षणों पर ध्यान देता है जब AI की नज़र किसी नए हिस्से की ओर सकारात्मक रूप से शिफ्ट होती है क्योंकि प्रश्न के एक विशिष्ट शब्द ने उसे ट्रिगर किया है।

यह कैसे काम करता है (तीन चरण)

1. "गेज़ शिफ्ट्स" को मैप करना (Pre-computation)
AI अपना उत्तर लिखना शुरू करने से पहले, GIFT एक त्वरित सिमुलेशन चलाता है। यह पूछता है: "जैसे ही AI आपके प्रश्न में 'मोटरसाइकिल' शब्द पढ़ रहा है, उसकी आँखें चित्र में कहाँ कूदती हैं?"
यह एक सेलिएन्सी मैप (Saliency Map) (एक हीट मैप) बनाता है।

  • जादू: क्योंकि यह केवल बदलावों (shifts) को ट्रैक करता है, यह स्वाभाविक रूप से "विजुअल अटेंशन सिंक" (बैकग्राउंड शोर) को अनदेखा कर देता है। यदि प्रश्न पढ़ते समय AI की आँखें किसी स्थान पर नहीं हिलीं, तो वह स्थान मैप पर नहीं होगा। यह रेडियो पर संगीत सुनने के लिए स्टेटिक (शोर) को फिल्टर करने जैसा है।

2. उत्तर को निर्देशित करना (Decoding)
अब, AI अपना उत्तर बनाना शुरू करता है। GIFT उस हीट मैप का उपयोग प्रक्रिया को निर्देशित करने के लिए करता है:

  • विजुअल्स को बढ़ाना (Boost the Visuals): यदि हीट मैप कहता है कि "मोटरसाइकिल महत्वपूर्ण है," तो GIFT मोटरसाइकिल वाले हिस्से पर AI के ध्यान (attention) की आवाज़ (volume) बढ़ा देता है।
  • प्रश्न को बढ़ाना (Boost the Question): महत्वपूर्ण बात यह है कि GIFT प्रश्न की आवाज़ भी बढ़ा देता है। यह सुनिश्चित करता है कि AI चित्र में इतना खो न जाए कि वह यह भूल जाए कि आपने क्या पूछा था। यह बातचीत को संतुलित रखता है।

3. परिणाम
AI अब एक ऐसे जासूस की तरह है जो प्रासंगिक सुरागों पर पूरी तरह केंद्रित है और सटीक प्रश्न को भी याद रखता है। इससे उसके द्वारा "लाल चूहे" जैसी काल्पनिक चीज़ें बनाने की संभावना बहुत कम हो जाती है जो वहाँ मौजूद ही नहीं है।

परिणाम: तेज़ और स्मार्ट

इस शोध पत्र ने कई AI मॉडलों (जैसे LLaVA और Qwen) पर परीक्षण किया और पाया:

  • कम हैलुसिनेशन: AI ने नकली वस्तुओं के बारे में कम बातें बनाईं। कुछ परीक्षणों में, इसने सटीकता में 20% से अधिक का सुधार किया।
  • अभी भी स्मार्ट: इसने तर्क करने या सामान्य प्रश्नों के उत्तर देने की अपनी क्षमता नहीं खोई। यह केवल एक "बेवकूफ" इमेज रिकग्निज़र नहीं बना; यह बस एक अधिक ईमानदार मॉडल बना।
  • तेज़: इसने AI की गति को बहुत अधिक धीमा नहीं किया। इसने उत्तर उत्पन्न करने में लगने वाले समय में केवल लगभग 13% की वृद्धि की, जो अन्य तरीकों की तुलना में बहुत कुशल है जो 10 गुना तक धीमे हो सकते हैं।

सारांश उपमा

AI को एक संग्रहालय के टूर गाइड के रूप में सोचें।

  • समस्या: गाइड का इतिहास के बारे में इतना ज्ञान है कि जब आप किसी पेंटिंग के बारे में पूछते हैं, तो वे उस दूसरी पेंटिंग के बारे में तथ्य बताने लगते हैं जो उन्हें लगता है कि आप पूछ रहे थे, या वे फ्रेम के बारे में ऐसी बातें बना लेते हैं जो वहाँ नहीं हैं।
  • पुराना समाधान: "पेंटिंग को देखो!" (लेकिन गाइड फर्श या छत को देखते रहते हैं)।
  • GIFT समाधान: गाइड के पास एक विशेष चश्मा है। जब आप कहते हैं "नीला फूलदान," तो चश्मा तुरंत उनकी दृष्टि में नीले फूलदान को हाइलाइट कर देता है और कमरे के बाकी हिस्सों को धुंधला कर देता है। साथ ही, चश्मा गाइड को याद दिलाता है, "भूलना मत, मेहमान ने नीले फूलदान के बारे में पूछा है, लाल वाले के बारे में नहीं।"

यह ट्रैक करके कि गाइड का ध्यान आपके शब्दों को सुनते समय कहाँ बदलता है, GIFT यह सुनिश्चित करता है कि वे ठीक वही वर्णन करें जो उनके सामने है, बिना कुछ मनगढ़ंत कहे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →