← नवीनतम पेपर
💻 computer science

Misguiding BLIP with Adversarial Patches: Multi-level Attacks with Cross-modal Attention Graphs in BLIP

यह शोध पत्र MAGA का प्रस्ताव करता है, जो एक नवीन बहु-स्तरीय हमला ढांचा (multi-level attack framework) है जो क्रॉस-मोडल अटेंशन कमजोरियों का लाभ उठाकर BLIP मॉडलों को लक्षित करता है, जिसमें क्रॉस-मोडल अटैक ग्राफ का निर्माण और व्यवधान उत्पन्न किया जाता है, जिसके परिणामस्वरूप महत्वपूर्ण प्रदर्शन गिरावट और भाषाई रूप से प्रशंसनीय लेकिन दृश्य रूप से असंगत प्रतिकूल कैप्शन प्राप्त होते हैं।

मूल लेखक: yingying hu, minghao mo, peng zhang

प्रकाशित 2026-09-24
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: yingying hu, minghao mo, peng zhang

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की तेजी से बदलती दुनिया में, कंप्यूटर प्रणालियों की एक नई पीढ़ी उभरी है जो एक साथ देख और पढ़ सकती है। ये प्रणालियाँ, जिन्हें विजन-लैंग्वेज मॉडल (vision-language models) के रूप में जाना जाता है, लाखों छवियों और टेक्स्ट के जोड़ों पर प्रशिक्षित होती हैं, जिससे वे यह सीखती हैं कि कुत्ते की एक तस्वीर का "कुत्ता" शब्द से क्या संबंध है। वे उन उपकरणों का आधार बन गई हैं जो तस्वीरों का वर्णन करती हैं, दृश्यों के बारे में प्रश्नों के उत्तर देती हैं, और प्राकृतिक भाषा का उपयोग करके छवियों को खोजती हैं। इन मशीनों के बेहतर ढंग से काम करने के लिए, उन्हें लगातार विशिष्ट शब्दों को एक छवि के विशिष्ट भागों से जोड़ना होता है, यह तय करना होता है कि कौन से पिक्सेल "घोड़े" की अवधारणा से संबंधित हैं और कौन से "घास" से। यह प्रक्रिया एक जटिल आंतरिक तंत्र पर निर्भर करती है जो एक गतिशील मानचित्र (dynamic map) की तरह कार्य करता है, जो वाक्य के प्रत्येक शब्द को फोटोग्राफ के प्रासंगिक दृश्य विवरणों से जोड़ता है। यदि यह संबंध टूट जाता है, तो मशीन अपनी देखने की क्षमता खो देती है, जिससे भ्रम या गलत विवरण की स्थिति उत्पन्न हो सकती है।

गुआंगज़ौ विश्वविद्यालय के शोधकर्ताओं ने यह पता लगाया है कि ये प्रणालियाँ उन कनेक्शनों को बनाए रखने के तरीके में एक सूक्ष्म कमजोरी है। उन्होंने पाया कि एक छवि पर एक छोटा, सावधानीपूर्वक डिज़ाइन किया गया पैटर्न रखकर, वे मॉडल को उसके शब्द-से-चित्र लिंक्स के आंतरिक मानचित्र को पुनर्व्यवस्थित करने के लिए धोखा दे सकते हैं। यह पैटर्न, जो रंग या बनावट का एक साधारण पैच जैसा दिखता है, इसे एक जटिल छलावरण होने की आवश्यकता नहीं है। इसके बजाय, यह एक शांत संकेत के रूप में कार्य करता है जो मॉडल को छवि के सबसे महत्वपूर्ण हिस्सों को अनदेखा करने और अप्रासंगिक पृष्ठभूमि क्षेत्रों पर ध्यान केंद्रित करने के लिए मजबूर करता है। जब ऐसा होता है, तो मॉडल अभी भी धाराप्रवाह और व्याकरणिक रूप से बोल सकता है, लेकिन जो वह कहता है उसका चित्र से कोई मेल नहीं होता। यह एक फूल के मैदान का वर्णन कर सकता है जब छवि स्पष्ट रूप से एक घोड़े को दिखाती है, या दावा कर सकता है कि एक व्यक्ति रामेन का कटोरा पकड़े हुए है, जबकि फोटो में केवल एक लिविंग रूम है। शोधकर्ता इस घटना को "नेचुरल बट रोंग" (प्राकृतिक लेकिन गलत) कहते हैं, जो इस कमजोरी को उजागर करता है जहाँ मशीन का आत्मविश्वास बना रहता है, भले ही उसकी समझ पूरी तरह से ध्वस्त हो गई हो।

टीम ने इन भ्रामक पैटर्नों को बनाने के लिए एक विधि विकसित की, जिसे उन्होंने "मल्टी-लेवल अटैक" (बहु-स्तरीय हमला) नाम दिया। पिछले प्रयासों के विपरीत, जिन्होंने केवल एक छवि को धुंधला करने या उसके रंगों को बदलने का प्रयास किया था, यह दृष्टिकोण विशेष रूप से इस बात को लक्षित करता है कि मॉडल टेक्स्ट को विजन से कैसे जोड़ता है। शोधकर्ताओं ने एक ऐसी प्रणाली बनाई जो शब्दों और छवि के हिस्सों के बीच संबंधों की मजबूती को मैप करती है, जो अनिवार्य रूप से एक ग्राफ बनाती है जो यह दिखाती है कि कौन से शब्द किन पिक्सेल पर ध्यान दे रहे हैं। इसके बाद उन्होंने अपने हमले को एक साफ छवि के ग्राफ और उसी छवि पर पैच के साथ वाले ग्राफ के बीच के अंतर को अधिकतम करने के लिए प्रशिक्षित किया। ऐसा करके, उन्होंने मॉडल को मुख्य शब्दों और उनके दृश्य साक्ष्यों के बीच के मजबूत संबंधों को तोड़ने के लिए मजबूर किया, और साथ ही यादृच्छिक पृष्ठभूमि क्षेत्रों के साथ नए, झूठे संबंध बनाए। इस प्रक्रिया को अन्य लक्ष्यों के साथ जोड़ा गया ताकि यह सुनिश्चित हो सके कि हमला छिपा रहे और परिणामी टेक्स्ट स्वाभाविक लगे, भले ही वह तथ्यात्मक रूप से गलत हो।

उनके प्रयोगों के परिणाम चौंकाने वाले थे। जब उन्होंने मानक डेटासेट से छवियों पर अपना जनरेटेड पैच लागू किया, तो दिए गए टेक्स्ट के लिए सही छवि खोजने की मॉडल की क्षमता नाटकीय रूप रूप से गिर गई। उन परीक्षणों में जहाँ सिस्टम को एक वाक्य को सही तस्वीर से मिलाने के लिए कहा गया था, इसकी सफलता दर सत्तर प्रतिशत से गिरकर केवल नौ प्रतिशत रह गई। यह हमला इतना प्रभावी था कि यह उन छवियों पर भी काम कर गया जिन्हें सिस्टम ने पहले कभी नहीं देखा था, जो यह सुझाव देता है कि यह दोष विशिष्ट चित्रों के साथ एक साधारण गलती के बजाय सूचना को संसाधित करने के मॉडल के मौलिक तरीके में निहित था। उन कार्यों में जहाँ मॉडल को एक छवि का वर्णन करना था, विवरण की गुणवत्ता तेजी से गिरी। सटीकता के लिए सिस्टम के स्कोर में काफी गिरावट आई, फिर भी इसके द्वारा बनाए गए वाक्य व्याकरणिक रूप से सही और विविध थे, जो उस दोहराव वाले निरर्थक शब्दों (gibberish) से बचते हैं जो अक्सर एक टूटी हुई प्रणाली का संकेत देते हैं। इसने पुष्टि की कि मॉडल केवल बोलने में विफल नहीं हो रहा था; बल्कि वह आत्मविश्वास के साथ एक ऐसी वास्तविकता का वर्णन कर रहा था जिसका अस्तित्व ही नहीं था।

शोधकर्ताओं ने दृश्य प्रश्नों पर भी इस प्रणाली का परीक्षण किया, जैसे कि वस्तुओं की गिनती करना या स्थानिक संबंधों की पहचान करना। हमले के कारण मॉडल तार्किक कार्यों में भी विफल रहा, जहाँ सफलता दर लगभग अस्सी प्रतिशत से गिरकर केवल बारह प्रतिशत रह गई। कई मामलों में, मॉडल एक कुत्ते के बारे में प्रश्न का उत्तर बिल्ली के विवरण के साथ देता था, या दावा करता था कि तीन जानवर थे जबकि केवल एक ही था। इन विफलताओं को जो विशेष रूप से उल्लेखनीय बनाता था, वह यह था कि मॉडल का आंतरिक अटेंशन मैप (attention map) पूरी तरह से बदल दिया गया था। विज़ुअलाइज़ेशन ने दिखाया कि मॉडल, जो सामान्य रूप से फोटो के मुख्य विषय पर ध्यान केंद्रित करता था, अब विषय को पूरी तरह से अनदेखा करने लगा और इसके बजाय खाली आकाश या घास पर ध्यान केंद्रित करने लगा। पैच ने वस्तु को छिपाया नहीं; इसने केवल मॉडल को उससे ध्यान हटाने के लिए मजबूर किया।

यह कार्य सुझाव देता है कि इन शक्तिशाली AI प्रणालियों की वर्तमान पीढ़ी पहले की तुलना में अधिक नाजुक है। जबकि पिछले सुरक्षा परीक्षणों ने इस बात पर ध्यान केंद्रित किया कि क्या किसी छवि को मानवीय आंखों के लिए कुछ और दिखने के लिए बनाया जा सकता है, यह शोध दिखाता है कि खतरा इस बात में है कि मशीन अपनी समझ को कैसे व्यवस्थित करती है। हमले के लिए मशीन को किसी अलग वस्तु के रूप में देखने के लिए धोखा देने की आवश्यकता नहीं है; इसे केवल यह विश्वास दिलाने की आवश्यकता है कि जो वह देख रही है वह अप्रासंगिक है। शब्दों को पिक्सेल से जोड़ने वाले आंतरिक ग्राफ को बाधित करके, शोधकर्ताओं ने सिद्ध किया कि एक छोटा, स्थिर पैटर्न विभिन्न कार्यों में त्रुटियों की एक श्रृंखला पैदा कर सकता है, जिसमें छवियों की खोज से लेकर जटिल प्रश्नों के उत्तर देना तक शामिल है। अध्ययन निष्कर्ष निकालता है कि जैसे-जैसे ये मॉडल दैनिक जीवन में एकीकृत होते जा रहे हैं, इन आंतरिक कनेक्शन मैप्स को समझना और सुरक्षित करना उतना ही महत्वपूर्ण होगा जितना कि स्वयं छवियों को सुरक्षित करना। ये निष्कर्ष एक चेतावनी के रूप में कार्य करते हैं कि उन्नत से उन्नत प्रणालियों को भी केवल इसलिए नहीं भटकाया जा सकता कि वे क्या देखती हैं, बल्कि इसलिए कि वे जो देखती हैं उसके बारे में कैसे सोचती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →