On Adversarial Vulnerability of Vision-Language Models through the Lens of Intermediate Spectral Subspaces
यह शोध पत्र एक व्हाइट-बॉक्स स्पेक्ट्रल-सबस्पेस-गाइडेड अटैक (SSGRA) प्रस्तुत करता है जो ट्रांसफॉर्मर-आधारित विजन-लैंग्वेज मॉडल्स में एडवर्सरियल कमजोरियों को प्रकट करने और उन्हें बढ़ाने के लिए बॉटम-राइट सिंगुलर वेक्टर सबस्पेस के साथ इंटरमीडिएट रिप्रेजेंटेशन्स के संरेखण का लाभ उठाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक विजन-लैंग्वेज मॉडल (VLM) की कल्पना एक अत्यंत परिष्कृत अनुवादक के रूप में करें। आप उसे एक तस्वीर दिखाते हैं, और वह जो देखता है उसका वर्णन करता है। लेकिन किसी भी जटिल मशीन की तरह, इसकी एक गुप्त कमजोरी है: यदि आप तस्वीर में बहुत मामूली, अदृश्य बदलाव करते हैं, तो अनुवादक अचानक निरर्थक बातें करने लगता है।
यह शोध पत्र जांच करता है कि ये मशीनें इतनी आसानी से क्यों चकमा खा जाती हैं, लेकिन तस्वीर या अंतिम उत्तर को देखने के बजाय, लेखक उन आंतरिक "गियर्स" और "पाइपों" को देखते हैं जो सिस्टम के माध्यम से सूचना को प्रवाहित करते हैं। वे गणित की एक अवधारणा का उपयोग करते हैं जिसे स्पेक्ट्रल विश्लेषण (spectral analysis) कहा जाता है, जिसे वे विभिन्न चौड़ाई के पाइपों के माध्यम से बहते पानी के सरल उपमा के माध्यम से समझाते हैं।
मुख्य विचार: "लीकी पाइप्स" (Leaky Pipes)
AI के भीतर सूचना को विभिन्न पाइपों के माध्यम से बहते पानी के रूप में सोचें।
- चौड़े पाइप (Top Singular Vectors): ये मजबूत, मुख्य चैनल हैं जहाँ सबसे महत्वपूर्ण जानकारी आसानी से प्रवाहित होती है। यदि आप यहाँ पानी डालते हैं, तो यह स्पष्ट और तेज रूप से पहुँचता है।
- छोटे, अवरुद्ध पाइप (Bottom Singular Vectors): ये संकीर्ण, लगभग बंद चैनल हैं। यदि आप यहाँ पानी डालने की कोशिश करते हैं, तो यह तुरंत दब जाता है, खो जाता है, या "एटेन्यूएटेड" (कमजोर) हो जाता है।
लेखकों ने पाया कि जब हैकर्स इन AI मॉडलों को धोखा देने की कोशिश करते हैं, तो हमला स्वाभाविक रूप से सूचना को इन छोटे, अवरुद्ध पाइपों में धकेलने की कोशिश करता है। एक बार जब सूचना इन संकीर्ण चैनलों में फंस जाती है, तो मॉडल छवि को समझने की क्षमता खो देता है, और वह मतिभ्रम (hallucination) या गलत उत्तर देने लगता है।
नया हमला: "क्लॉग-बिल्डर" (The Clog-Builder - SSGRA)
यह शोध पत्र SSGRA (स्पेक्ट्रल सबस्पेस गाइडेड रिप्रेजेंटेशन अटैक) नामक एक नई हैकिंग विधि प्रस्तावित करता है।
- पुराने हैकिंग तरीके: पिछले तरीकों ने AI को भ्रमित करने की कोशिश की जिसमें तस्वीर को थोड़ा अलग दिखाया गया या अंतिम उत्तर के साथ छेड़छाड़ की गई। वे मशीन को लड़खड़ाने के लिए उस पर पत्थर फेंकने जैसे थे।
- नई विधि (SSGRA): यह तरीका अधिक स्मार्ट है। यह जानता है कि कौन से "पाइप" सबसे कमजोर हैं। यह जानबूझकर AI को उन छोटे, अवरुद्ध पाइपों के माध्यम से छवि को प्रोसेस करने के लिए मजबूर करता है।
- उपमा: कल्पना करें कि आप एक फैक्ट्री को खिलौने बनाने से रोकना चाहते हैं। श्रमिकों पर चिल्लाने के बजाय (पुराना तरीका), आप विशेष रूप से उस कन्वेयर बेल्ट को जाम कर देते हैं जहाँ सबसे नाजुक हिस्सों को असेंबल किया जाता है। फैक्ट्री केवल लड़खड़ाती नहीं है; वह पूरी तरह से टूट जाती है क्योंकि आवश्यक हिस्से पार नहीं हो पाते।
उन्होंने क्या पाया
शोधकर्ताओं ने तीन लोकप्रिय AI मॉडलों (Qwen, LLaVA, और Gemma) पर इसका परीक्षण किया। यहाँ हुआ:
- यह बेहतर काम करता है: उन "अवरुद्ध पाइपों" को जानबूझकर जाम करके, उनके नए हमले ने पिछले तरीकों की तुलना में AI को विफल करने में बहुत अधिक सफलता प्राप्त की। यह एक स्पष्ट "कुत्ते" के वर्णन को बहुत छोटे, अदृश्य परिवर्तनों के साथ "हरा कीचड़" (Green Slime) जैसे निरर्थक शब्दों में बदल सकता था।
- AI इसे स्वाभाविक रूप से करता है: नए "स्मार्ट" हमले के बिना भी, शोधकर्ताओं ने पाया कि जब आप एक AI को धोखा देने की कोशिश करते हैं, तो गणित स्वाभाविक रूप से सूचना को इन कमजोर, अवरुद्ध पाइपों की ओर धकेलता है। AI इस विशिष्ट तरीके से असुरक्षित होने के लिए ही बना है।
- सभी AI समान नहीं हैं: कुछ मॉडलों में दूसरों की तुलना में अधिक "अवरुद्ध पाइप" थे। जिस मॉडल में सबसे अधिक अवरुद्ध पाइप थे (Qwen), उसे तोड़ना सबसे आसान था। जिस मॉडल में कम अवरुद्ध पाइप थे (Gemma), उसे तोड़ना कठिन था, लेकिन फिर भी वह असुरक्षित था।
निष्कर्ष
शोध पत्र निष्कर्ष निकालता है कि इन AI मॉडलों को सुरक्षित (मजबूत) बनाने के लिए, हमें केवल "चौड़े पाइपों" (नेटवर्क के मजबूत हिस्सों) को मजबूत करने पर ध्यान केंद्रित नहीं करना चाहिए। हमें "अवरुद्ध पाइपों" (शून्य या कमजोर दिशाओं) को भी ठीक करने या सुरक्षित करने की आवश्यकता है।
यदि हम सूचना को इन छोटे, कमजोर चैनलों में खो जाने से रोक सकते हैं, तो AI को धोखा देना बहुत कठिन हो सकता है।
संक्षेप में: लेखकों ने AI मॉडलों को तोड़ने का एक नया तरीका खोजा है जो उन्हें उनके सबसे कमजोर आंतरिक पथों का उपयोग करने के लिए मजबूर करता है, और वे सुझाव देते हैं कि उन विशिष्ट कमजोर पथों को ठीक करना ही उन्हें मजबूत बनाने की कुंजी है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।