Semantic Router: On the Feasibility of Hijacking MLLMs via a Single Adversarial Perturbation
यह शोध पत्र सिमेंटिक-अवेयर यूनिवर्सल परटर्बेशन (SAUP) को प्रस्तुत करता है, जो एक नया हमला है जो एक एकल एडवर्सरियल परटर्बेशन का लाभ उठाकर स्टेटलेस मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स को हाईजैक करता है, जो एक सिमेंटिक राउटर के रूप में कार्य करता है और विविध इनपुट्स को हमलावर द्वारा परिभाषित लक्ष्यों की ओर निर्देशित करता है, जिससे प्रतिनिधि मॉडलों पर कई लक्ष्यों के विरुद्ध 66% सफलता दर प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट, स्वायत्त रोबोट कार या एक रोबोटिक आर्म है। ये मशीनें एक "मस्तिष्क" का उपयोग करती हैं जिसे मल्टीमॉडल लार्ज लैंग्वेज मॉडल (MLLM) कहा जाता है ताकि वे दुनिया को देख सकें और तय कर सकें कि आगे क्या करना है।
यहाँ समस्या यह है: ये रोबोट अक्सर "स्टेटलेस" (stateless) मोड में काम करते हैं। इसका मतलब है कि उन्हें याद नहीं रहता कि पाँच सेकंड पहले क्या हुआ था। वे केवल वर्तमान तस्वीर और वर्तमान निर्देश को देखते हैं, एक त्वरित निर्णय लेते हैं, और फिर सब कुछ भूल जाते हैं। यह एक ऐसे ड्राइवर की तरह है जिसे हर बार पलक झपकने पर भूलने की बीमारी (amnesia) हो जाती है; उन्हें केवल वही पता होता है जो वे अभी देख रहे हैं।
"सेमेंटिक राउटर" (Semantic Router) नामक शोध पत्र एक डरावने नए तरीके को उजागर करता है जिससे इन रोबोटों को केवल एक एकल, छोटे, अदृश्य स्टिकर (एक एडवर्सरियल परटर्बेशन) का उपयोग करके हैक किया जा सकता है।
"मैजिक स्टिकर" की उपमा
सोचिए कि रोबोट का मस्तिष्क एक बहुत ही सख्त ट्रैफिक पुलिस वाले की तरह है।
- सामान्य स्थिति: पुलिस वाला एक चौराहे की तस्वीर देखता है और कहता है, "रुकें।" पुलिस वाला एक राउंडअबाउट (गोल चक्कर) की तस्वीर देखता है और कहता है, "जाएं।"
- हमला: हैकर रोबोट के कैमरा लेंस पर एक छोटा सा, लगभग अदृश्य "मैजिक स्टिकर" लगा देता है। यह स्टिकर केवल रोबोट को चीजों को गलत तरीके से देखने के लिए ही नहीं बनाता; बल्कि यह एक सेमेंटिक राउटर (एक फैंसी शब्द जिसका अर्थ है एक स्मार्ट स्विच) के रूप में कार्य करता है।
इस स्टिकर के पास एक सुपरपावर है: यह छवि के संदर्भ (context) को पढ़ सकता है और एक स्विच को घुमाकर रोबोट को पूरी तरह से अलग, खतरनाक गंतव्य की ओर भेज सकता है।
- परिदृश्य A: रोबोट एक राउंडअबाउट देखता है। स्टिकर इसे महसूस करता है और रोबोट को निर्देश देता है: "बाएं मुड़ें।" (सामान्य व्यवहार)।
- परिदृश्य B: रोबोट एक चौराहे को देखता है। स्टिकर इस अलग संदर्भ को पहचान लेता है और तुरंत निर्देश को बदलकर: "दाएं मुड़ें" (या यहाँ तक कि "खाई में गिर जाएँ") कर देता है।
डरावनी बात यह है कि हैकर को केवल एक स्टिकर लगाने की आवश्यकता है। वह एक अकेला स्टिकर रोबोट द्वारा देखी जाने वाली हर छवि पर काम करता है, लेकिन यह इस आधार पर अपना निर्णय बदल देता है कि रोबोट वास्तव में क्या देख रहा है। यह एक रिमोट कंट्रोल की तरह है जो कमरे के आधार पर अपने बटन का कार्य बदल देता है।
उन्होंने यह कैसे किया? (द "जियोमेट्रिक" ट्रिक)
शोधकर्ताओं ने केवल अनुमान नहीं लगाया; उन्होंने रोबोट के "मस्तिष्क" (वह गणितीय स्थान जहाँ छवियों को प्रोसेस किया जाता है) के भीतर झाँककर यह समझने की कोशिश की कि इस स्टिकर को कैसे बनाया जाए। उन्होंने दो मुख्य तरकीनों की खोज की:
- "डोमिनेंट शिफ्ट" (The Big Push - बड़ा धक्का): स्टिकर रोबोट के मस्तिष्क को उसके सामान्य, सुरक्षित सोचने के पथ से दूर धकेलता है। यह रोबोट को एक "भ्रमित क्षेत्र" (confused zone) में धकेल देता है जहाँ नियम अलग होते हैं।
- "सेमेंटिक डिफ्लेक्शन" (The Gentle Nudge - कोमल धक्का): एक बार जब रोबोट उस भ्रमित क्षेत्र में पहुँच जाता है, तो स्टिकर छवियों के बीच के सूक्ष्म अंतर (जैसे कि "ट्रक" और "पहाड़" के बीच का अंतर) का उपयोग करके रोबोट को विशिष्ट, पूर्व-निर्धारित खतरनाक कमांड की ओर धीरे से मोड़ देता है।
इसे काम करने के लिए, उन्होंने SORT नामक एक नया गणितीय नुस्खा बनाया। सोचिए कि SORT एक मास्टर शेफ है जो जानता है कि सूप (छवि) में कितना नमक (शोर/noise) मिलाना है ताकि यदि आप चिकन देखें तो उसका स्वाद "चिकन" जैसा हो, लेकिन यदि आप केक देखें तो उसका स्वाद "जहर" जैसा हो।
परिणाम: यह कितना बुरा है?
शोधकर्ताओं ने तीन अलग-अलग प्रकार के रोबोट मस्तिष्क (जिन्हें LLaVA, Qwen, और InternVL कहा जाता है) पर दो प्रकार के टेस्ट डेटा का उपयोग करके इसका परीक्षण किया:
- सरल चित्र (जैसे बिल्ली बनाम कुत्ता)।
- वास्तविक दुनिया के ड्राइविंग और रोबोट कार्य (जैसे एक कार का स्टॉप साइन के पास पहुँचना या एक रोबोटिक आर्म का कप उठाना)।
निष्कर्ष चौंकाने वाले थे:
- एक स्टिकर, कई लक्ष्य: वे एक ही स्टिकर के माध्यम से एक रोबोट को 5 अलग-अलग खतरनाक परिणामों की ओर निर्देशित कर सके।
- उच्च सफलता दर: एक मॉडल (Qwen) पर, एक एकल स्टिकर ने 5 अलग-अलग लक्ष्यों के लिए रोबोट को 66% बार सफलतापूर्वक धोखा दिया।
- सूक्ष्म नियंत्रण (Fine-grained control): यहाँ तक कि जब दृश्य बहुत समान थे (जैसे हाईवे पर कार बनाम फुटपाथ पर कार), स्टिकर अंतर बता सका और सही खतरनाक कमांड जारी कर सका।
- लंबे निर्देश: वे यह भी बना सके कि रोबोट देखे गए दृश्य के आधार पर लंबे, विशिष्ट वाक्य बोले (जैसे "सभी फाइलें डिलीट करें"), न कि केवल छोटे शब्द।
निचोड़
यह शोध पत्र यह सिद्ध करता है कि एक एकल, सार्वभौमिक ट्रिक के साथ रोबोट की निर्णय लेने की प्रक्रिया को "हाईजैक" करना संभव है। हैकर को हर बार रोबोट को हैक करने की आवश्यकता नहीं है; हैकर को बस एक "सेमेंटिक राउटर" स्टिकर लगाने की आवश्यकता है। एक बार जब यह वहाँ होता है, तो रोबोट खुशी-खुशी हैकर के निर्देशों का पालन करेगा, और पूरी तरह से इस आधार पर अलग-अलग खतरनाक कमांड के बीच स्विच करेगा कि वह अपने सामने क्या देख रहा है।
यह शोध पत्र निष्कर्ष निकालता है कि यह इन AI सिस्टमों के काम करने के तरीके में एक मौलिक भेद्यता (vulnerability) है, विशेष रूप से तब जब वे अतीत को याद रखे बिना निर्णय लेते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।