← नवीनतम पेपर
💻 computer science

Adversarial Evasion Attacks on Computer Vision using SHAP Values

यह शोध पत्र कंप्यूटर विज़न मॉडलों पर एक व्हाइट-बॉक्स एडवरसेरियल इवेजन अटैक का प्रस्ताव करता है जो इनपुट महत्व को मापने के लिए SHAP मानों का लाभ उठाता है, और अदृश्य गलत वर्गीकरण उत्पन्न करने में फास्ट ग्रेडिएंट साइन मेथड की तुलना में अपनी बेहतर मजबूती को प्रदर्शित करता है, विशेष रूप से ग्रेडिएंट-छिपाने वाली स्थितियों में।

मूल लेखक: Frank Mollard, Marcus Becker, Florian Roehrbein

प्रकाशित 2026-04-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Frank Mollard, Marcus Becker, Florian Roehrbein

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी तस्वीर: AI की "आंख" को हैक करना

कल्प Imagine कीजिए कि आपने एक सुपर-स्मार्ट रोबोट बनाया है जो किसी तस्वीर को देखकर बता सकता है कि वह बिल्ली (cat) है या कुत्ता (dog)। आपको लगता है कि यह एकदम परफेक्ट है। लेकिन यह पेपर एक डरावना रहस्य उजागर करता है: आप इस रोबोट को तस्वीर में बहुत मामूली सा बदलाव करके बिल्ली को कुत्ता (या इसके विपरीत) देखने के लिए धोखा दे सकते हैं—इतना मामूली कि इंसान भी उस अंतर को नहीं देख पाएंगे।

इसे एडवर्सरियल इवेजन अटैक (Adversarial Evasion Attack) कहा जाता है। यह कंप्यूटरों के लिए जादूगर के हाथ की सफाई जैसा है। यह पेपर SHAP values नामक चीज़ का उपयोग करके इस ट्रिक को करने का एक नया, अधिक शक्तिशाली तरीका पेश करता है।


पुराना तरीका: "अंधा" हथौड़ा (FGSM)

इस पेपर से पहले, इन रोबोट्स को धोखा देने का सबसे प्रसिद्ध तरीका FGSM (फास्ट ग्रेडिएंट साइन मेथड) था।

उपमा (Analogy):
कल्पना कीजिए कि रोबोट एक परीक्षा देने वाला छात्र है। शिक्षक (एल्गोरिदम) इस आधार पर टेस्ट को ग्रेड देता है कि उत्तर कितना गलत है।

  • FGSM उस छात्र की तरह है जिसे यह समझ नहीं आता कि उसने कोई सवाल क्यों गलत किया। वह बस ग्रेड देखता है, देखता है कि उत्तर गलत है, और अंधे होकर उत्तर को विपरीत दिशा में धकेल देता है।
  • वे एक "हथौड़े" वाले दृष्टिकोण का उपयोग करते हैं: वे इमेज के हर एक पिक्सेल पर समान बल के साथ प्रहार करते हैं, चाहे वह पिक्सेल वास्तव में महत्वपूर्ण हो या न हो।
  • समस्या: कभी-कभी रोबोट भ्रमित हो जाता है और गलत उत्तर के बारे में और भी अधिक आश्वस्त होने लगता है। यह दीवार पर हथौड़े से मारने जैसा है; कभी-कभी दीवार और भी मजबूत हो जाती है। इसे "ग्रेडिएंट मास्किंग" (gradient masking) कहा जाता है।

नया तरीका: "सर्जन का स्कैलपेल" (SHAP Attack)

इस पेपर के लेखक SHAP values का उपयोग करके एक स्मार्ट तरीका प्रस्तावित करते हैं।

SHAP क्या है?
SHAP को एक आवर्धक लेंस (magnifying glass) के रूप में सोचें जो यह समझाता है कि तस्वीर के ठीक कौन से हिस्सों ने रोबोट को निर्णय लेने के लिए मनाया।

  • यदि रोबोट बिल्ली की तस्वीर देखता है, तो SHAP मूंछों और कानों को लाल (Red) रंग में हाइलाइट करता है (कहते हुए, "इन हिस्सों ने हमें 'बिल्ली' सोचने पर मजबूर किया!")।
  • यह बैकग्राउंड को नीले (Blue) रंग में हाइलाइट करता है (कहते हुए, "यह हिस्सा वास्तव में इसके बिल्ली होने के खिलाफ तर्क देता है")।
  • यह उन हिस्सों को अनदेखा कर देता जो मायने नहीं रखते।

उपमा (Analogy):
पूरी इमेज पर हथौड़े से प्रहार करने के बजाय, SHAP Attack एक सर्जन की तरह है।

  1. सर्जन "लाल" क्षेत्रों (जिन हिस्सों को रोबोट पसंद करता है) और "नीले" क्षेत्रों (जिन हिस्सों को रोबोट नापसंद करता है) को देखता है।
  2. वे केवल उन विशिष्ट पिक्सल्स को धीरे से बदलते हैं ताकि उन्हें "न्यूट्रल" (तटस्थ) बनाया जा सके।
  3. वे "बिल्ली" के सबूत को "मुझे नहीं पता" वाले सबूत में बदल देते हैं।

यह बेहतर क्यों है?

  • सटीकता (Precision): यह उन पिक्सल्स पर ऊर्जा बर्बाद नहीं करता जो काम के नहीं हैं।
  • गोपनीयता (Stealth): क्योंकि यह केवल महत्वपूर्ण हिस्सों को थोड़ा सा ही बदलता है, इसलिए इमेज मानवीय आंखों को बिल्कुल वैसी ही दिखती है जैसी वह थी।
  • प्रभावशीलता (Effectiveness): पेपर में पाया गया कि यह तरीका "अंधे हथौड़े" वाले तरीके की तुलना में रोबोट को बहुत अधिक बार धोखा देता है। मानव चेहरों के परीक्षणों में, पुराना तरीका 31% बार विफल रहा, जबकि नया SHAP तरीका 98% बार सफल रहा।

"बटरफ्लाई" का रहस्य

शोधकर्ताओं ने हजारों छवियों को देखते समय एक दिलचस्प बात गौर की।

  • बहुत चमकीले या बहुत गहरे मान (values) वाले पिक्सल्स का रोबोट के निर्णय पर गहरा प्रभाव होता है।
  • "बीच के रास्ते" वाले मान (जैसे मध्यम ग्रे रंग) वाले पिक्सल्स का प्रभाव लगभग शून्य होता है।

रणनीति:
SHAP अटैक "महत्वपूर्ण" पिक्सल्स को उस "बीच के रास्ते" वाले ज़ोन में धकेलने की कोशिश करता है।

  • कल्पना कीजिए कि रोबोट एक जज है। SHAP अटैक उस सबूत को लेता है जिस पर जज भरोसा करता है और उसे "ठीक-ठाक/औसत" (meh) सबूत में बदल देता है।
  • जब सारा मजबूत सबूत निष्प्रभावी हो जाता है, तो रोबोट भ्रमित हो जाता है। वह बिल्ली होने के बारे में निश्चित होना छोड़ देता है, और अचानक, वह सोच सकता है कि यह एक कुत्ता है।

हमें इसकी परवाह क्यों करनी चाहिए?

लेखक इंटरनेट को तोड़ने की कोशिश नहीं कर रहे हैं; वे इसे ठीक करने की कोशिश कर रहे हैं।

  1. खतरा: यदि हैकर्स सेल्फ-ड्राइविंग कारों को धोखा दे सकते हैं (यह सोचने के लिए कि स्टॉप साइन एक स्पीड लिमिट साइन है) या मेडिकल स्कैनर्स को (ट्यूमर को मिस करना), तो यह खतरनाक है।
  2. समाधान: यह दिखाते हुए कि ये हमले कैसे काम करते हैं, सुरक्षा विशेषज्ञ AI के लिए "इम्यून सिस्टम" (प्रतिरक्षा प्रणाली) बना सकते हैं। वे रोबोट को पूरी तस्वीर देखने के लिए प्रशिक्षित कर सकते हैं, न कि केवल कुछ विशिष्ट पिक्सल्स को, जिससे उन्हें धोखा देना कठिन हो जाता है।

सावधानी (द "फाइन प्रिंट")

इस नए तरीके का एक नुकसान है।

  • यह महंगा है। SHAP values की गणना करना हर एक पिक्सेल के लिए एक विशाल गणितीय पहेली हल करने जैसा है। इसके लिए बहुत अधिक कंप्यूटिंग पावर (सुपरकंप्यूटर) की आवश्यकता होती है।
  • इसे एक्सेस की जरूरत है। इसे करने के लिए, हमलावर को यह जानने की आवश्यकता है कि रोबोट का दिमाग ठीक कैसे बना है (एक "व्हाइट-बॉक्स" अटैक)। यदि रोबोट एक गुप्त "ब्लैक बॉक्स" है, तो यह करना कठिन है।

सारांश

यह पेपर दिखाता है कि जबकि हम AI को धोखा देने के लिए "सलेजहैमर" (भारी हथौड़ा) का उपयोग कर रहे थे, अब हम इसे बहुत अधिक प्रभावी ढंग से करने के लिए एक "स्कैलपेल" (SHAP values) का उपयोग कर सकते हैं। यह एक चेतावनी है: हमारे AI मॉडल वर्तमान में बहुत अधिक विशिष्ट विवरणों पर केंद्रित हैं, और हमें वास्तविक दुनिया की महत्वपूर्ण स्थितियों में उनके उपयोग से पहले उन्हें और अधिक स्मार्ट और मजबूत बनाने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →