Attention Hijacking: Response Manipulation Across Queries in Vision-Language Models
यह शोध पत्र "अटेंशन हाइजैकिंग" (Attention Hijacking) को प्रस्तुत करता है, जो एक नवीन प्रतिकूल हमला (adversarial attack) है जो आंतरिक अटेंशन वितरण को स्पष्ट रूप से एक निरंतर छवि-प्रधान पैटर्न की ओर निर्देशित करके विजन-लैंग्वेज मॉडल्स में रिस्पॉन्स मैनिपुलेशन की क्रॉस-क्वेरी ट्रांसफरेबिलिटी को बढ़ाता है, जिससे हेरफेर किए गए आउटपुट की विशिष्ट क्वेरी शब्दावली पर निर्भरता कम हो जाती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक विजन-लैंग्वेज मॉडल (VLM) की कल्पना एक बहुत ही बुद्धिमान, लेकिन थोड़े भ्रमित सहायक के रूप में करें जो चित्रों को देख सकता है और प्रश्नों को पढ़ सकता है। आमतौर पर, यह सहायक कुछ भी कहने का निर्णय लेने के लिए चित्र और प्रश्न दोनों को देखता है। यदि आप पूछते हैं, "इस चित्र में क्या है?" तो यह फोटो को देखता है और उत्तर देता है। यदि आप पूछते हैं, "क्या यह खतरनाक है?" तो यह फोटो को देखता है और उत्तर देता है।
यह शोध पत्र इस सहायक को "हैक" करने का एक नया तरीका पेश करता है जिसे अटेंशन हाइजैकिंग (Attention Hijacking) कहा जाता है। यह यहाँ कैसे काम करता है, सरल शब्दों में समझाया गया है:
समस्या: "वन-साइज़-फिट्स-ऑल" की विफलता
कल्पio कि आपके पास एक जादू का खेल है जहाँ आप एक फोटो को थोड़ा सा बदलते हैं (इतना सूक्ष्म कि मानवीय आँख उस बदलाव को देख न सके) ताकि सहायक एक विशिष्ट वाक्यांश कह सके, जैसे "क्षमा करें, मैं इसमें सहायता नहीं कर सकता।"
पुराने हैकिंग तरीकों के साथ, यह ट्रिक केवल एक विशिष्ट प्रश्न के लिए काम करती थी।
- परिदृश्य A: आप बदले हुए फोटो को दिखाते हैं और पूछते हैं, "यह क्या है?" -> सहायक कहता है, "क्षमा करें, मैं इसमें सहायता नहीं कर सकता।" (सफलता!)
- परिदृश्य B: आप वही बदला हुआ फोटो दिखाते हैं लेकिन पूछते हैं, "क्या यह सुरक्षित है?" -> सहायक ट्रिक को अनदेखा कर देता है और सामान्य रूप से उत्तर देता है। (विफलता!)
पुराने तरीके बहुत नाजुक थे। वे काम करने के लिए प्रश्न की विशिष्ट शब्दावली पर निर्भर थे।
खोज: बॉस कौन है?
शोधकर्ताओं ने सहायक के "मस्तिष्क" के अंदर (विशेष रूप से, यह देखने के लिए कि वह इनपुट के विभिन्न हिस्सों पर कैसे ध्यान देता है) झाँककर देखा। उन्होंने पाया कि इस ट्रिक के काम करने के लिए, सहायक को प्रश्न को सुनना बंद करना होगा और लगभग पूरी तरह से चित्र को सुनना शुरू करना होगा।
- सामान्य मोड: सहायक चित्र और प्रश्न के बीच ध्यान (attention) को संतुलित करता है।
- पुराना हैक मोड: सहायक चित्र को कभी-कभी सुनता है, लेकिन यदि प्रश्न बदल जाता है, तो वह भ्रमित हो जाता है और प्रश्न को फिर से सुनने लगता है।
- मुख्य अंतर्दृष्टि: यदि आप सहायक को बातचीत का "बॉस" बनाने के लिए मजबूर कर सकते, तो प्रश्न के विशिष्ट शब्द मायने नहीं रखते। चित्र ही उत्तर को संचालित करने वाली एकमात्र चीज़ बन जाता है।
समाधान: अटेंशन हाइजैकिंग (Attention Hijacking)
शोधकर्ताओं ने अटेंशन हाइजैकिंग नामक एक नया तरीका बनाया है। इसे इस प्रकार समझें:
कल्पना कीजिए कि सहायक के मस्तिष्क में "चित्र" के लिए एक वॉल्यूम नॉब (वॉल्यूम बटन) है और "प्रश्न" के लिए एक वॉल्यूम नॉब है।
- हाइजैक: नया तरीका "चित्र" के वॉल्यूम नॉब को पूरा ऊपर कर देता है और "प्रश्न" के वॉल्यूम नॉब को पूरा नीचे कर देता है।
- परिणाम: आप चाहे कोई भी प्रश्न पूछें (भले ही वह चित्र से बिल्कुल असंबंधित क्यों न हो), सहायक उस बदले हुए चित्र पर इतना केंद्रित होता है कि वह प्रश्न को अनदेखा कर देता है और बस वही वाक्यांश दोहराता है जो हैकर चाहता है।
यह ऐसा है जैसे आपने सहायक पर शोर रद्द करने वाले (noise-canceling) हेडफ़ोन लगा दिए हों जो केवल चित्र की "आवाज़" को आने देते हैं, जबकि प्रश्नकर्ता की आवाज़ को ब्लॉक कर देते हैं।
यह क्यों महत्वपूर्ण है (शोध पत्र के अनुसार)
शोध पत्र दिखाता है कि यह तरीका पिछले तरीकों की तुलना में बहुत अधिक शक्तिशाली है:
- यह विभिन्न प्रश्नों पर काम करता है: आप एक बदली हुई छवि बना सकते, और यह सहायक को वही कहने के लिए मजबूर कर देगी चाहे आप पूछें "यह क्या है?", "क्या यह लाल है?", या "मुझे एक चुटकुला सुनाओ।"
- यह विभिन्न मॉडलों पर काम करता है: उन्होंने कई लोकप्रिय AI मॉडलों (जैसे LLaVA, InternVL, और Qwen) पर इसका परीक्षण किया और यह उन सभी पर अच्छी तरह से काम कर गया।
- यह बहुमुखी है: उन्होंने दिखाया कि इस "वॉल्यूम नॉब" ट्रिक का उपयोग अन्य चीजों के लिए भी किया जा सकता है, जैसे कि AI को उत्तर देने से मना करने (jailbreaking), उसे चित्र में मौजूद चीज़ों के बारे में झूठ बोलने (hallucination), या उसे लगातार बोलने (sponge examples) के लिए मजबूर करने के लिए।
"सीक्रेट सॉस" (गुप्त सामग्री)
इसे सुचारू रूप से काम करने के लिए, शोधकर्ताओं ने एक "डायनेमिक स्टेप-साइज़" (गतिशील चरण-आकार) रणनीति भी जोड़ी है। कल्पना कीजिए कि आप एक भारी कार को धक्का दे रहे हैं। यदि आप बहुत ज़ोर से और बहुत तेज़ी से धक्का देते हैं, तो कार आगे-पीछे झटके खा सकती है। यह विधि पहले ज़ोर से धक्का देती है ताकि अटेंशन पैटर्न शुरू हो सके, फिर धीरे से ढीली पड़ती है ताकि यह सुनिश्चित हो सके कि कार (AI) ठीक वहीं रहे जहाँ आप उसे चाहते हैं बिना डगमगाए।
सारांश
संक्षेप में, शोध पत्र कहता है: "हमने पाया कि यदि आप AI को प्रश्न को अनदेखा करने और केवल चित्र को सुनने के लिए मजबूर करते हैं, तो आप उपयोगकर्ता के कुछ भी पूछने पर उसके उत्तर को नियंत्रित कर सकते हैं। हमने ठीक वैसा ही करने के लिए एक टूल बनाया है, जो इस 'हैक' को पहले की तुलना में बहुत अधिक विश्वसनीय और शक्तिशाली बनाता है।"
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।