← नवीनतम पेपर
🤖 AI

Out-of-the-box: Black-box Causal Attacks on Object Detectors

यह शोध पत्र BlackCatt को प्रस्तुत करता है, जो एक ब्लैक-बॉक्स कॉज़ल अटैक फ्रेमवर्क है जो न्यूनतम कॉज़ली पर्याप्त पिक्सेल सेटों (minimally causally sufficient pixel sets) को लक्षित करके व्याख्या योग्य, अदृश्य और आर्किटेक्चर-अज्ञेय (architecture-agnostic) एडवरसेरियल परटर्बेशन्स का निर्माण करता है, जिससे मौजूदा विधियों की तुलना में सफलता दर को बनाए रखते हुए या उसमें सुधार करते हुए हमले के परिमाण (attack magnitude) को काफी कम कर दिया जाता है।

मूल लेखक: Melane Navaratnarajah, David A. Kelly, Hana Chockler

प्रकाशित 2026-04-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Melane Navaratnarajah, David A. Kelly, Hana Chockler

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सेल्फ-ड्राइविंग कार चला रहे हैं। अचानक, एक कुत्ता सड़क पर दौड़कर आता है। कार की "आंखें" (इसका ऑब्जेक्ट डिटेक्टर) कुत्ते को देखती हैं और रुकने की तैयारी करती हैं। लेकिन तभी, एक हैकर कार के कंप्यूटर के कान में एक गुप्त बात फुसफुसाता है, और अचानक, कुत्ता कार की दृष्टि से गायब हो जाता है। कार अब कुत्ते को नहीं देख पाती, भले ही कुत्ता अभी भी वहीं है। आपको स्थिति को संभालने के लिए अचानक ब्रेक मारना पड़ता है।

यह पेपर इस बारे में है कि हैकर्स कैसे उन "अदृश्य" हमलों को अंजाम दे सकते हैं, लेकिन एक ट्विस्ट के साथ: वे इसे इस तरह से करना चाहते हैं जो समझने योग्य और सूक्ष्म हो, ताकि हम कार की आंखों को ठीक करना सीख सकें।

यहाँ इस पेपर के विचारों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. समस्या: "ब्लैक बॉक्स" का रहस्य

आमतौर पर, जब शोधकर्ता इन AI कैमरों को धोखा देने की कोशिश करते हैं, तो वे "व्हाइट बॉक्स" (White Box) तरीकों का उपयोग करते हैं। कल्पना कीजिए कि आप घड़ी के हर छोटे पुर्जे को देखने के लिए उसे खोलकर ठीक करने की कोशिश कर रहे हैं। यह "व्हाइट बॉक्स" है—यह जानना कि AI वास्तव में कैसे सोचता है।

लेकिन वास्तविक दुनिया में, हैकर्स के पास ब्लूप्रिंट नहीं होते। वे केवल घड़ी के बाहर का हिस्सा देखते हैं (एक "ब्लैक बॉक्स")। वे समय देख सकते हैं, लेकिन वे उसके अंदर के गियर्स (gears) नहीं देख सकते। इसलिए, वे आमतौर पर घड़ी को ज़ोर से हिलाते हैं (रैंडम शोर जोड़ते हैं) जब तक कि वह काम करना बंद न कर दे। यह काम तो करता है, लेकिन यह अव्यवस्थित, स्पष्ट और अस्पष्ट है कि यह क्यों रुका।

2. समाधान: BlackCAtt (द "कॉज़ल डिटेक्टिव")

लेखकों ने BlackCAtt नामक एक नया टूल बनाया है। पूरी घड़ी को हिलाने के बजाय, BlackCAtt एक जासूस (detective) की तरह काम करता है जो पूछता है: "AI को विफल करने के लिए मुझे कम से कम क्या बदलने की आवश्यकता है?"

वे MSPS (मिनिमल सफिशिएंट पिक्सेल सेट्स) की अवधारणा का उपयोग करते हैं। इसे एक लाइन में मौजूद सबसे महत्वपूर्ण डोमिनो (domino) को खोजने के रूप में सोचें। यदि आप उस एक डोमिनो को गिरा देते हैं, तो पूरी श्रृंखला (AI का निर्णय) ढह जाती है।

### 3. बड़ी हैरानी: "बाहरी" डोमिनो

इस पेपर की सबसे चौंकाने वाली खोज यह है कि ये महत्वपूर्ण डोमिनो कहाँ स्थित हैं।

  • पुरानी धारणा: सभी को लगता था कि AI को बिल्ली को अनदेखा करने के लिए मजबूर करने के लिए, आपको बिल्ली के चारों ओर बने बॉक्स के अंदर के पिक्सेल के साथ छेड़छाड़ करनी होगी।
  • वास्तविकता: BlackCAtt ने पाया कि अक्सर, सबसे महत्वपूर्ण पिक्सेल बॉक्स के बाहर होते हैं।

उपमा: कल्पना कीजिए कि आप खिड़की पर बैठी एक बिल्ली की तस्वीर देख रहे हैं।

  • AI बिल्ली के चारों ओर एक बॉक्स बनाता है।
  • आप सोच सकते हैं, "यदि मैं बिल्ली के चेहरे को धुंधला कर दूँ, तो AI उसे नहीं देख पाएगा।"
  • लेकिन BlackCAtt ने पाया कि यदि आप बिल्ली के बगल में स्थित खिड़की के फ्रेम या पर्दे को थोड़ा सा धुंधला कर देते हैं, तो AI अचानक बिल्ली को देखना भूल जाता है!

AI संदर्भ (surroundings) पर इतना निर्भर है कि बैकग्राउंड (पृष्ठभूमि) के साथ छेड़छाड़ करना वास्तव में वस्तु (object) के साथ छेड़छाड़ करने से अधिक शक्तिशाली होता है।

4. यह कैसे काम करता है (द "इनविजिबल इंक" अटैक)

BlackCAtt इस ज्ञान का उपयोग ऐसे हमले बनाने के लिए करता है जो हैं:

  • सूक्ष्म (Tiny): यह केवल कुछ पिक्सेल बदलता है (जैसे धूल का एक छोटा सा कण)।
  • अदृश्य (Invisible): मानवीय आंखों के लिए, छवि बिल्कुल सही दिखती है। आप अभी भी कुत्ते को स्पष्ट रूप से देखते हैं।
  • व्याख्या योग्य (Explainable): क्योंकि उन्होंने केवल "कारण" (महत्वपूर्ण बैकग्राउंड पिक्सेल) को बदला है, हम जानते हैं कि AI क्यों विफल हुआ। यह जादू नहीं है; यह तर्क है।

5. संचालन के दो मोड

पेपर दिखाता है कि BlackCatt दो तरह से काम करता है:

  1. "लेबल ओनली" मोड: हमलावर केवल यह जानता है कि "यहाँ एक बिल्ली है।" BlackCatt फिर भी बैकग्राउंड में बदलाव करके बिल्ली को गायब करने में सफल रहता है। यह उन अन्य हैकर्स को मात देता है जिनके पास केवल यह सीमित जानकारी होती है।
  2. "सुपर-हेल्पर" मोड: यदि हमलावर को AI का "कॉन्फिडेंस स्कोर" (वह कितना आश्वस्त है) भी पता है, तो BlackCatt एक कोच की तरह काम करता है। यह अन्य, अनाड़ी हैकिंग तरीकों को बताता है, "पूरी घड़ी को मत हिलाओ! बस इस एक विशिष्ट गियर को थपथपाओ।" यह अन्य हमलों को बहुत छोटा और पकड़ में आने में कठिन बनाता है।

6. यह क्यों मायने रखता है

यह केवल चीजों को तोड़ने के बारे में नहीं है; यह उन्हें ठीक करने के बारे में है।

  • हैकर्स के लिए: यह दिखाता है कि AI को तोड़ने के लिए आपको जीनियस होने की ज़रूरत नहीं है; आपको बस यह समझने की ज़रूरत है कि AI वास्तव में किस चीज़ पर ध्यान दे रहा है (अक्सर बैकग्राउंड)।
  • डेवलपर्स के लिए: यह एक चेतावनी है। यदि आपका AI बिल्ली को खोजने के लिए बैकग्राउंड (जैसे खिड़की का फ्रेम) पर बहुत अधिक निर्भर है, तो यह नाजुक है। डेवलपर्स अब अपने कारों और कैमरों का परीक्षण करने, बैकग्राउंड में इन "कमजोरियों" को खोजने और AI को वास्तविक वस्तु पर ध्यान केंद्रित करने के लिए प्रशिक्षित करने के लिए BlackCAtt का उपयोग कर सकते हैं, जिससे यह अधिक सुरक्षित और मजबूत बनता है।

सारांश

BlackCAtt एक स्मार्ट, अदृश्य टूल है जो AI कैमरों की "कमजोरी" (Achilles' heel) को ढूंढ निकालता है। यह साबित करता है कि AI अक्सर गलत चीजों (वस्तु के बजाय बैकग्राउंड) को देखता है और हमें यह दिखाता है कि सबसे छोटे, सबसे अदृश्य बदलाव के साथ AI को विफल करने के लिए उस कमजोरी का फायदा कैसे उठाया जाए। यह समझकर कि हमला क्यों काम करता है, हम अपनी सेल्फ-ड्राइविंग कारों और सुरक्षा प्रणालियों के लिए बेहतर, सुरक्षित AI बना सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →