STRAP-ViT: Segregated Tokens with Randomized -- Transformations for Defense against Adversarial Patches in ViTs
STRAP-ViT विजन ट्रांसफॉर्मर्स के लिए एक गैर-प्रशिक्षण योग्य (non-trainable), प्लग-एंड-प्ले रक्षा तंत्र है जो जेन्सेन-शैनन डाइवर्जेंस (Jensen-Shannon Divergence) के माध्यम से विसंगतिपूर्ण टोकन की सांख्यिकीय पहचान करके और उन पर यादृच्छिक रूपांतरण लागू करके एडवरसैरियल पैच हमलों को कम करता है, जिससे बिना किसी अतिरिक्त प्रशिक्षण लागत के स्वच्छ सटीकता (near-clean accuracy) प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, हाई-टेक सुरक्षा गार्ड है (एक विज़न ट्रांसफार्मर या ViT) जिसका काम तस्वीरों को देखना और उनमें क्या है, इसकी पहचान करना है। यह गार्ड अविश्वसनीय रूप से शक्तिशाली है; यह केवल एक इंसान की आंख की तरह पिक्सेल को नहीं देखता, बल्कि यह छवि को छोटे-छोटे पहेली के टुकड़ों में तोड़ देता है जिन्हें "टोकन्स" (tokens) कहा जाता है और निर्णय लेने के लिए यह विश्लेषण करता है कि वे सभी एक-दूसरे से कैसे संबंधित हैं।
हालाँकि, एक चतुर धोखेबाज है जिसे एडवर्सरियल पैच (Adversarial Patch) कहा जाता है। इसे एक छोटे, चमकीले रंग के स्टिकर या अजीब पैटर्न वाली टेप की तरह समझें जिसे एक अपराधी स्टॉप साइन या किसी व्यक्ति की शर्ट पर चिपका देता है। एक इंसान के लिए, यह सिर्फ एक छोटा सा स्टिकर है। लेकिन AI गार्ड के लिए, यह स्टिकर एक सम्मोहित करने वाले लाइटहाउस (hypnotic lighthouse) की तरह है। यह इतना ज़ोर से चिल्लाता है कि गार्ड वास्तविक स्टॉप साइन या व्यक्ति को अनदेखा कर देता है और पूरी तरह से स्टिकर पर ध्यान केंद्रित करता है, जिससे वह वस्तु को गलत तरीके से पहचानने लगता है (जैसे, एक स्टॉप साइन को "रेडिएटर" समझ लेना)।
यह पेपर एक नया रक्षा तंत्र पेश करता है जिसे STRAP-ViT कहा जाता है। यह कैसे काम करता है, यहाँ सरल भाषा में समझाया गया है:
1. समस्या: "शोर वाला" स्टिकर
लेखकों ने महसूस किया कि दुर्भावनापूर्ण स्टिकर को ढकने वाले पहेली के टुकड़े (टोकन्स) सामान्य टुकड़ों से अलग व्यवहार करते हैं।
- सामान्य टोकन शांत होते हैं और छवि के सामान्य पैटर्न का पालन करते हैं।
- स्टिकर टोकन्स अराजक, शोर भरे और सांख्यिकीय रूप से "अजीब" होते हैं। उनका "वाइब" या ऊर्जा वितरण अलग होता है।
2. समाधान: STRAP-ViT (एक स्मार्ट फ़िल्टर)
STRAP-ViT AI के मस्तिष्क के दरवाजे पर खड़े एक बाउंसर की तरह है। इसे फिर से प्रशिक्षित (retrain) करने की आवश्यकता नहीं है; यह बस प्लग-इन होता है और काम करना शुरू कर देता है। यह दो चरणों में कार्य करता है:
चरण A: जासूस (पहचान/Detection)
बाउंसर जेन्सन-शैनन डायवर्जेंस (Jensen-Shannon Divergence) नामक एक गणितीय उपकरण का उपयोग करता है (इसे "अजीब होने का मीटर" या "Weirdness Meter" मान लें)।
- यह छवि के हर एक पहेली के टुकड़े की तुलना इस बात से करता है कि एक "सामान्य" टुकड़ा कैसा दिखना चाहिए।
- यदि कोई टुकड़ा बहुत अधिक "अजीब" (उच्च विचलन) है, तो बाउंसर उसे चिह्नित कर देता है।
- नियम: बाउंसर को हर अजीब टुकड़े को पकड़ने की ज़रूरत नहीं है। उसे केवल इतना पकड़ने की आवश्यकता है जो स्टिकर के 50% हिस्से को कवर कर सके। यह ऐसा है जैसे यह समझना कि यदि आप एक सम्मोहित करने वाले लाइटहाउस के आधे हिस्से को कंबल से ढक देते हैं, तो उसकी रोशनी गार्ड को अंधा करने के लिए पर्याप्त नहीं रह जाती।
चरण B: जादुई वाइपर (न्यूनीकरण/Mitigation)
एक बार जब बाउंसर संदिग्ध टोकन (वे टोकन जो स्टिकर के नीचे हैं) की पहचान कर लेता है, तो वह उन्हें केवल हटाता नहीं है (क्योंकि इससे तस्वीर में छेद हो जाएगा)। इसके बजाय, वह उन पर एक रैंडमाइज्ड "जादुई वाइपर" (magic wiper) लागू करता है।
- कल्पना कीजिए कि टोकन चिपचिपे, भ्रमित करने वाले गोंद (एडवर्सरियल नॉइज़) से ढके हुए हैं।
- सिस्टम उस गोंद को साफ करने के लिए रैंडम तरीके से एक तरीका चुनता है: शायद वह टोकन को खींचता है, उसे सिकोड़ता है, या उसके रंग के तापमान को बदल देता है।
- रैंडम क्यों? यदि धोखेबाज एक ऐसा स्टिकर बनाने की कोशिश करता है जो एक प्रकार की सफाई (scrubbing) से बच जाए, तो सिस्टम अगली बार एक अलग रैंडम सफाई का तरीका चुन लेता है। हमलावर यह अनुमान नहीं लगा सकता कि कौन सी रैंडम चाल चलेगी, इसलिए स्टिकर की शक्ति निष्प्रभावी हो जाती है।
3. परिणाम: एक सुरक्षित छवि
संदिग्ध टोकन को साफ करने के बाद, AI गार्ड छवि को फिर से देखता है।
- "सम्मोहित करने वाला लाइटहाउस" अब धुंधला और टूटा हुआ है।
- गार्ड अंततः वास्तविक वस्तु (स्टॉप साइन या बंदर) को देख पाता है और उसे सही ढंग से वर्गीकृत करता है।
- महत्वपूर्ण रूप से, क्योंकि यह सिस्टम केवल "अजीब" टोकन को छूता है और छवि के बाकी हिस्सों को वैसे ही छोड़ देता है, सामान्य, साफ तस्वीरों पर AI का प्रदर्शन लगभग नहीं बदलता है। यह एक कार पर खरोंच को ठीक करने जैसा है बिना पूरी कार को दोबारा पेंट किए।
यह क्यों मायने रखता है
- कोई भारी काम नहीं: अन्य रक्षा प्रणालियों के विपरीत जिनमें AI को फिर से प्रशिक्षित करने की आवश्यकता होती है (जिसमें लाखों डॉलर खर्च होते हैं और वर्षों लग जाते हैं), STRAP-ViT एक "प्लग-एंड-प्ले" टूल है। आप इसे मौजूदा सिस्टम में बस जोड़ सकते हैं।
- सार्वभौमिक (Universal): यह विभिन्न प्रकार के AI गार्डों और विभिन्न प्रकार के स्टिकर पर काम करता है, चाहे स्टिकर बड़ा हो या छोटा, या एक ही छवि में कई स्टिकर हों।
- कुशल (Efficient): यह इतना तेज़ और हल्का है कि यह AI की गति को धीमा नहीं करता है, जिससे यह सेल्फ-ड्राइविंग कारों या सुरक्षा कैमरों जैसे वास्तविक दुनिया के उपयोग के लिए उपयुक्त बनता है।
संक्षेप में: STRAP-ViT एक स्मार्ट, हल्का फ़िल्टर है जो दुर्भावनापूर्ण स्टिकर के "शोर वाले" शोर को पहचानता है, उस शोर को रैंडम तरीके से तब तक बिखेर देता है जब तक कि वह हानिरहित न हो जाए, और AI को फिर से सच्चाई देखने देता है—और यह सब बिना किसी बड़े सॉफ़्टवेयर अपडेट के।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।