SAVAA: Mitigating Hallucinations in LVLMs via Step-wise Adaptive Visual Attention Amplification
SAVAA एक प्रशिक्षण-मुक्त (training-free) फ्रेमवर्क है जो टोकन-स्तरीय मतिभ्रम (hallucination) जोखिम का अनुमान लगाने और जनरेशन के दौरान विजुअल अटेंशन एम्प्लीफिकेशन कारकों को अनुकूल रूप से समायोजित करने के लिए विजुअल ग्राउंडिंग एंट्रॉपी (Visual Grounding Entropy) को पेश करके लार्ज विजन-लैंग्वेज मॉडल्स में मतिभ्रम को कम करता है, जिससे फिक्स्ड एम्प्लीफिकेशन रणनीतियों की सीमाओं को दूर किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान रोबोट सहायक (एक लार्ज विजन-लैंग्वेज मॉडल, या LVLM) है जो एक फोटो को देखता है और उसका वर्णन करता है। कभी-कभी, यह रोबोट थोड़ा ज़्यादा आत्मविश्वासी हो जाता है और अपनी ओर से बातें बनाने लगता है। यह कह सकता है, "तस्वीर में एक कुत्ता है," भले ही वहाँ कोई कुत्ता न हो। इसे हैलुसिनेशन (hallucination) कहा जाता है।
रोबोट ऐसा इसलिए करता है क्योंकि वह दुनिया के बारे में अपनी "याददाश्त" (भाषा के पूर्वाग्रह/language priors) पर बहुत अधिक निर्भर करता है और उस विशिष्ट क्षण में फोटो में वास्तव में जो दिख रहा है, उस पर उतना ध्यान नहीं देता।
पुराना तरीका: "एक ही आकार का" वॉल्यूम नॉब (The "One-Size-Fits-All" Volume Knob)
हाल ही में, शोधकर्ताओं ने रोबोट के दृश्य ध्यान (visual attention) के "वॉल्यूम" को बढ़ाकर इसे ठीक करने की कोशिश की। कल्पना कीजिए कि रोबोट के पास "तस्वीर देखने" के लिए एक वॉल्यूम नॉब है और "अपने विचारों को सुनने" के लिए दूसरा।
पिछले तरीकों ने एक फिक्स्ड (स्थिर) वॉल्यूम नॉब का उपयोग किया। वे हर शब्द के लिए "तस्वीर देखने" के वॉल्यूम को एक ही समान मात्रा में बढ़ा देते थे।
- समस्या: यह एक धीमी फुसफुसाहट और एक तेज़ चिल्लाहट को एक ही वॉल्यूम सेटिंग के साथ सुनने की कोशिश करने जैसा है।
- कभी-कभी रोबोट को झूठ बोलने से बचने के लिए तस्वीर को और ज़ोर से देखने की ज़रूरत होती है, लेकिन फिक्स्ड वॉल्यूम बहुत कम होता है (अंडर-एम्प्लीफिकेशन/Under-amplification)।
- अन्य बार, रोबोट पहले से ही करीब से देख रहा होता है, लेकिन वॉल्यूम इतना अधिक होता है कि वह केवल बहुत अधिक ध्यान देने के कारण ऐसी चीज़ें "देखने" लगता है जो वहाँ हैं ही नहीं (ओवर-एम्प्लीफिकेशन/Over-amplification)।
पेपर इसे "डुअल फेलियर पैटर्न" (Dual Failure Pattern) कहता है: फिक्स्ड सेटिंग कभी बहुत कम तो कभी बहुत ज़्यादा होती है।
नया समाधान: SAVAA (एक स्मार्ट, एडेप्टिव पायलट)
लेखक एक नया तरीका प्रस्तावित करते हैं जिसे SAVAA (स्टेप-वाइज एडेप्टिव विजुअल अटेंशन एम्प्लीफिकेशन) कहा जाता है। एक फिक्स्ड नॉब के बजाय, SAVAA एक स्मार्ट पायलट की तरह काम करता है जो वास्तविक समय में, शब्द-दर-शब्द, नियंत्रणों को समायोजित करता है।
यह कैसे काम करता है, इसके चरण यहाँ दिए गए हैं:
1. "रिस्क रडार" (विजुअल ग्राउंडिंग एंट्रॉपी)
अगला शब्द लिखने से पहले, SAVAA एक "रिस्क रडार" की जाँच करता है कि क्या रोबोट झूठ बोलने वाला है। यह विजुअल ग्राउंडिंग एंट्रॉपी (VGE) नामक एक विशेष टूल का उपयोग करता है।
- यह कैसे काम करता है: यह दो प्रश्न पूछता है:
- क्या रोबोट अनिश्चित है? (उच्च अनिश्चितता = जोखिम)।
- क्या रोबोट इस शब्द के लिए तस्वीर को देख रहा है? (यदि रोबोट आश्वस्त है लेकिन तस्वीर उस शब्द का समर्थन नहीं करती है, तो यह एक बड़ा जोखिम है)।
- उपमा: कल्पना कीजिए कि रोबोट एक समुद्र तट का वर्णन कर रहा है। यदि वह "रेत" कहता है, तो तस्वीर इसका समर्थन करती है, इसलिए जोखिम कम है। यदि वह "बर्फ" कहता है (और तस्वीर स्पष्ट रूप से एक समुद्र तट की है), तो जोखिम अधिक है, भले ही रोबोट "बर्फ" शब्द के बारे में बहुत आश्वस्त महसूस करे।
2. "डायनामिक वॉल्यूम नॉब"
रिस्क रडार के आधार पर, SAVAA अगले शब्द के लिए "तस्वीर देखने" के वॉल्यूम को समायोजित करता है:
- उच्च जोखिम: यदि रोबोट कुछ जोखिम भरा बोलने वाला है, तो SAVAA विजुअल अटेंशन को बढ़ा (crank up) देता है। यह रोबोट को बोलने से पहले फोटो को ध्यान से देखने के लिए मजबूर करता है।
- कम जोखिम: यदि रोबोट सुरक्षित है और तस्वीर स्पष्ट रूप से शब्द का समर्थन करती है, तो SAVAA इसे कम (turn down) कर देता है। यह रोबोट को "बहुत तीव्र" होने और नई चीजें गढ़ने से रोकता है।
3. पुराने विचारों के लिए "म्यूट बटन"
कभी-कभी, एकदम सटीक विजुअल फोकस के साथ भी, रोबोट अभी भी अपनी आंतरिक "कहानी सुनाने" की आदतों पर बहुत अधिक निर्भर रहता है। इसे ठीक करने के लिए, SAVAA एक टेक्स्ट अटेंशन सप्रेशन (Text Attention Suppression) फीचर जोड़ता है।
- उपमा: कल्पना कीजिए कि रोबोट एक फोटो का वर्णन करने की कोशिश कर रहा है, लेकिन वह पृष्ठभूमि में चल रही एक कहानी के रेडियो से विचलित हो रहा है। SAVAA धीरे से उस रेडियो को म्यूट (mute) कर देता है (टेक्स्ट इनपुट), ताकि रोब में पूरी तरह से फोटो पर ध्यान केंद्रित हो सके। यह रोबोट को केवल इसलिए वाक्य पूरा करने से रोकता है क्योंकि वह कहानी में "सही लग रहा है", बल्कि इसलिए क्योंकि वह फोटो में है।
यह क्यों महत्वपूर्ण है
पेपर ने तीन अलग-अलग स्मार्ट रोबोट्स (LLaVA, Qwen, और InternVL) पर विभिन्न परीक्षणों का उपयोग करके इसका परीक्षण किया जहाँ रोबोट को छवियों का वर्णन करना था।
- परिणाम: SAVAA ने पुराने "फिक्स्ड वॉल्यूम" तरीकों की तुलना में बनावटी विवरणों (हैलुसिनेशन) की संख्या को काफी कम कर दिया।
- दक्षता: यह यह सब बिना रोबोट को फिर से प्रशिक्षित किए या उसे धीमा किए करता है। यह बस रोबोट के सोचने के दौरान अटेंशन के नॉब्स को ट्यून करता है।
सारांश
पुराने तरीके को एक ऐसे ड्राइवर के रूप में सोचें जो सीधे हाईवे पर या घुमावदार पहाड़ी रास्ते पर जाने के बावजूद गैस पेडल को 50% पर दबाए रखता है। वह दुर्घटनाग्रस्त (हैलुसिनेट) हो सकता है क्योंकि उसने मोड़ के लिए धीमा नहीं हुआ या ढलान के लिए गति नहीं बढ़ाई।
SAVAA वह ड्राइवर है जो लगातार सड़क, गति और स्थितियों की जाँच करता है, और हर एक मोड़ के लिए गैस और ब्रेक को पूरी तरह से समायोजित करता है। यह सुनिश्चित करता है कि रोबोट बिल्कुल वही बताए जो वह देख रहा है, न उससे ज़्यादा और न ही उससे कम।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।