← नवीनतम पेपर
🤖 machine learning

TsallisPGD: Adaptive Gradient Weighting for Adversarial Attacks on Semantic Segmentation

यह शोध पत्र TsallisPGD को प्रस्तुत करता है, जो सिमेंटिक सेगमेंटेशन के लिए एक अनुकूली (adaptive) एडवर्सरियल हमला है जो ग्रेडिएंट लैंडस्केप को प्रभावी ढंग से नया आकार देने के लिए एक गतिशील Tsallis क्रॉस-एन्ट्रॉपी पैरामीटर (qq) का उपयोग करता है और विविध डेटासेट एवं आर्किटेक्चर में मॉडल की सटीकता और mIoU को कम करने में मौजूदा विधियों से बेहतर प्रदर्शन करता है।

मूल लेखक: Alexander Matyasko, Xin Lou, Indriyati Atmosukarto, Wei Zhang

प्रकाशित 2026-05-06
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Alexander Matyasko, Xin Lou, Indriyati Atmosukarto, Wei Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट को बेवकूफ बनाने की कोशिश कर रहे हैं जो एक तस्वीर को देख रहा है और उसके हर एक हिस्से को लेबल करने (जैसे "कार," "पेड़," "सड़क," या "आकाश") की कोशिश कर रहा है। इसे सेमेंटिक सेगमेंटेशन (semantic segmentation) कहा जाता है।

यह पेपर इस रोबोट को चकमा देने का एक नया तरीका पेश करता है, जिसे TsallisPGD कहा जाता है। यहाँ बताया गया है कि यह कैसे काम करता है, इसे सरल भाषा में समझाया गया है:

समस्या: "एक ही सांचे में ढलने" वाली गलती

रोबोट को चकमा देने के लिए, आपको तस्वीर में सूक्ष्म, अदृश्य बदलाव करने होंगे ताकि रोबोट भ्रमित हो जाए। अतीत में, हमलावरों ने एक मानक विधि (जैसे क्रॉस-एंट्रॉपी - Cross-Entropy) का उपयोग किया था जो तस्वीर के हर एक पिक्सेल (बिंदु) के साथ एक जैसा व्यवहार करती थी।

इसे एक शिक्षक की तरह समझें जो छात्र के टेस्ट को ग्रेड दे रहा है। यदि छात्र एक प्रश्न गलत करता है, तो शिक्षक बार-बार पूछता है, "तुमने यह गलत क्यों किया?"

  • खामी: इमेज हमलों में, मानक विधि उन पिक्सेल पर चिल्लाती रहती है जिन्हें रोबोट पहले से ही गलत बता चुका है। यह उन पिक्सेल को अनदेखा कर देती है जिनके बारे में रोबोट पूरी तरह आश्वस्त है (जैसे एक कार जिसे उसने आत्मविश्वास से कार के रूप में लेबल किया है)।
  • परिणाम: हमला अटक जाता है। यह उन पिक्सेल को तोड़ने की कोशिश में समय बर्बाद करता है जो पहले से ही टूटे हुए हैं, जबकि रोबोट के आत्मविश्वासी अनुमान (जो कठिन हिस्से हैं) अछूते रह जाते हैं। यह एक ईंट की दीवार को तोड़ने के लिए बार-बार उसी दरार वाली ईंट पर प्रहार करने जैसा है, बजाय इसके कि मोर्टार (सीमेंट) के कमजोर हिस्से को खोजा जाए।

समाधान: "स्मार्ट स्पॉटलाइट" (Tsallis Cross-Entropy)

लेखकों ने एक नया टूल बनाया जिसे Tsallis Cross-Entropy कहा जाता है। इसे एक स्मार्ट स्पॉटलाइट के रूप में कल्पना करें जिसे हमलावर एडजस्ट कर सकता है।

हर पिक्सेल पर समान रूप से चिल्लाने के बजाय, यह स्पॉटलाइट qq नामक एक डायल के आधार पर अपना फोकस बदल सकती है:

  • डायल को एक तरफ घुमाने पर: स्पॉटलाइट उन पिक्सेल पर तेज चमकती है जिनके बारे में रोबोट आत्मविश्वासी (confident) है। यह हमलावर को पहले "कठिन" लक्ष्यों पर ध्यान केंद्रित करने के लिए मजबूर करता है।
  • डायल को दूसरी तरफ घुमाने पर: स्पॉटलाइट उन पिक्सेल पर चमकती है जिनके बारे में रोबोट अनिश्चित (unsure) है।

पेपर ने खोजा कि हर स्थिति के लिए डायल की एक ही सेटिंग काम नहीं करती है। कभी-कभी आपको आत्मविश्वासी पिक्सेल पर ध्यान केंद्रित करने की आवश्यकता होती है, तो कभी अनिश्चित पिक्सल्स पर। यह तस्वीर, रोबोट के दिमाग और आप तस्वीर को कितना बदल सकते हैं, इस पर निर्भर करता है।

नवाचार: "गतिशील यात्रा" (The Dynamic Journey)

चूंकि एक एकल सेटिंग हर चीज़ के लिए काम नहीं करती है, इसलिए लेखकों ने केवल एक डायल सेटिंग नहीं चुनी। इसके बजाय, उन्होंने एक डायनेमिक शेड्यूल (Dynamic Schedule) बनाया।

इसे एक हाइकिंग ट्रिप (पदयात्रा) की तरह समझें:

  1. हाइकिंग की शुरुआत में: आप डायल को आत्मविश्वासी पिक्सेल (ऊंचे पहाड़ों) पर ध्यान केंद्रित करने के लिए सेट करते हैं। आप सबसे कठिन हिस्सों को पहले निपटाते हैं।
  2. हाइकिंग के दौरान: आप धीरे-धीरे डायल घुमाते हैं।
  3. हाइकिंग के अंत में: आप अनिश्चित पिक्सेल (मैदानी घाटियों) पर ध्यान केंद्रित करके समाप्त करते हैं, और बाकी हिस्सों को भी ठीक करते हैं।

स्पॉटलाइट को एक प्रकार के पिक्सेल से दूसरे प्रकार के पिक्सेल की ओर सुचारू रूप से ले जाकर, यह विधि सभी आधारों को कवर करती है। यह आसान लक्ष्यों पर नहीं अटकता; यह व्यवस्थित रूप से रोबोट के आत्मविश्वास को तोड़ देता है।

परिणाम: एक नया चैंपियन

टीम ने इस नई "हाइकिंग रणनीति" (TsallisPGD) का तीन प्रसिद्ध डेटासेट्स (Cityscapes, Pascal VOC, और ADE20K) पर सर्वश्रेष्ठ मौजूदा तरीकों के खिलाफ परीक्षण किया।

  • परिणाम: TsallisPGD अन्य सभी तरीकों की तुलना में अधिक बार जीता। यह रोबोट की सटीकता (accuracy) को कम करने और उसके लेबल (mIoU) को बिगाड़ने में बेहतर था।
  • यह क्यों मायने रखता है: इसने साबित कर दिया कि हमले के फोकस को बुद्धिमानी से बदलकर, आप पहले की तुलना में बहुत तेज़ी से और अधिक प्रभावी ढंग से यहाँ तक कि सबसे कठिन, सबसे सुरक्षित रोबोट को भी चकमा दे सकते हैं।

सारांश

संक्षेप में, पेपर कहता है: "रोबोट की गलतियों पर सिर्फ चिल्लाएं नहीं। एक स्मार्ट, एडजस्टेबल स्पॉटलाइट का उपयोग करें जो रोबोट के सबसे मजबूत विश्वासों पर हमला करने से शुरू होता है और धीरे-धीरे बाकी हिस्सों की ओर बढ़ता है। यह 'डायनेमिक जर्नी' इस ट्रिक को बहुत अधिक शक्तिशाली बनाती है।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →