← नवीनतम पेपर
💻 computer science

Towards Universal Physical Adversarial Attacks via a Joint Multi-Objective and Multi-Model Optimization Framework

यह शोध पत्र जॉइंट मल्टी-ऑब्जेक्टिव एंड मल्टी-मॉडल ऑप्टिमाइज़ेशन फ्रेमवर्क (JMOF) का प्रस्ताव करता है, जो विविध ब्लैक-बॉक्स विज़न कार्यों को प्रभावी ढंग से धोखा देने वाले यूनिवर्सल फिजिकल एडवरसेरियल अटैक्स प्राप्त करने के लिए, ग्रेडिएंट संघर्षों को हल करने और क्रॉस-मॉडल ट्रांसफरेबिलिटी को बढ़ाने हेतु ऑर्थोगोनल ग्रेडिएंट अलाइनमेंट और एक ड्यूल-लेवल सप्रेशन मैकेनिज्म का उपयोग करता है।

मूल लेखक: Ziyang Liu, Hongyuan Wang, Zijian Wang, Yinxi Lu, Yunzhao Zang, Zhiqiang Yan, Qianhao Ning

प्रकाशित 2026-05-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ziyang Liu, Hongyuan Wang, Zijian Wang, Yinxi Lu, Yunzhao Zang, Zhiqiang Yan, Qianhao Ning

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी तस्वीर: "यूनिवर्सल कैमॉफ्लाज" (सार्वभौमिक छलावरण) की समस्या

कल्पना कीजिए कि आप एक कार को एक विशेष "अदृश्यता कवच" (इनविजिबिलिटी क्लॉक) वाले पैटर्न से पेंट करने की कोशिश कर रहे हैं। लक्ष्य सुरक्षा कैमरे (एक AI) को यह विश्वास दिलाना है कि कार वहां नहीं है, या वह कुछ और ही है।

लेखक उस समस्या को हल कर रहे हैं जिसे आज के अधिकांश "अदृश्यता कवच" झेल नहीं पाते—वे कस्टम-मेड सूट की तरह हैं। वे एक विशिष्ट कैमरा मॉडल (जैसे YOLO डिटेक्टर) के लिए बिल्कुल फिट बैठते हैं, लेकिन यदि आप उसी कार को किसी दूसरे ब्रांड के कैमरे (जैसे Swin-T या ViT) को दिखाएं, तो वह सूट हास्यास्पद लगने लगता है और कैमरा उसे आसानी से देख लेता है।

इसके अलावा, एक ऐसा सूट बनाने की कोशिश करना जो सभी कैमरों के लिए एक साथ काम करे, एक ऐसा जैकेट डिजाइन करने जैसा है जो एक साथ विंटर कोट, स्विमिंग सूट और टक्सीडो भी हो। यदि आप उन्हें बस आपस में मिला देते हैं, तो अंत में एक ऐसा गर्म और असुविधाजनक मिश्रण बनता है जो किसी के भी काम नहीं आता। इसे ग्रेडिएंट संघर्ष (gradient conflict) कहा जाता है—विंटर कोट के निर्देश स्विमिंग सूट के निर्देशों से लड़ते हैं, और परिणाम विफलता होती है।

यह पेपर एक नया फ्रेमवर्क पेश करता है जिसे JMOF (जॉइंट मल्टी-ऑब्जेक्टिव एंड मल्टी-मॉडल ऑप्टिमाइज़ेशन फ्रेमवर्क) कहा जाता है, ताकि एक "यूनिवर्सल कैमॉफ्लाज" बनाया जा सके जो लगभग किसी भी कैमरे के खिलाफ काम कर सके, और यहाँ तक कि उन कैमरों को भी चकमा दे सके जो अलग-अलग काम करते हैं (जैसे कारों को गिनना बनाम सड़क का नक्शा बनाना)।


तीन मुख्य समस्याएं जिन्हें उन्होंने ठीक किया

लेखकों ने तीन विशिष्ट कारणों की पहचान की कि पिछले प्रयास क्यों विफल रहे:

  1. "एक आकार सबके लिए नहीं" (One-Size-Fits-None) का जाल:

    • समस्या: पिछले तरीकों ने सीखने के लिए केवल एक "टीचर" AI को चुना। छलावरण (कैमॉफ्लाज) उस एक टीचर के देखने के विशिष्ट तरीके का बहुत अधिक आदी हो गया।
    • समाधान: उन्होंने विविध शिक्षकों का एक पैनल (Panel of Diverse Teachers) बनाया। केवल एक विशेषज्ञ से सलाह लेने के बजाय, उन्होंने विशेषज्ञों के एक पैनल से पूछा जो एक-दूसरे से बहुत अलग तरह से सोचते हैं (कुछ तेज़ धावक की तरह हैं, तो कुछ विचारशील विचारक की तरह)। उन्होंने एक गणितीय ट्रिक का उपयोग किया ताकि वे ऐसे शिक्षकों को चुन सकें जो आपस में बहुत अधिक सहमत नहीं होते, ताकि छलावरण सभी के लिए ट्रिकी बन सके, न कि केवल एक के लिए।
  2. "सतह बनाम आत्मा" का संघर्ष (Surface vs. Soul Conflict):

    • समस्या: कुछ हमले अंतिम उत्तर ( "सतह") के साथ छेड़छाड़ करने की कोशिश करते हैं, जबकि अन्य इस बात से छेड़छाड़ करते हैं कि AI अपने दिमाग में छवि को कैसे समझता है ("आत्मा")। केवल एक करने से अक्सर विफलता मिलती है।
    • समाधान: उन्होंने एक दोहरी रणनीति (Two-Pronged Attack) बनाई।
      • पहला प्रहार (सतह): वे AI से कहते हैं, "यह कहना बंद करो कि यह 'कार' है!" (आउटपुट को दबाना)।
      • दूसरा प्रहार (आत्मा): वे AI से कहते हैं, "अपने दिमाग में कार के आकार को पहचानना बंद करो!" (आंतरिक विशेषताओं को सपाट करना)।
      • दोनों को एक साथ करने से, हमला मजबूत और कठिन हो जाता है।
  3. "रस्सी खींचने का खेल" (ग्रेडिएंट संघर्ष):

    • समस्या: जब आप टीचर पैनल से सलाह मांगते हैं, तो वे अक्सर विपरीत दिशाओं में खींचते हैं। टीचर A कहता है, "यहाँ पेंट लाल करो!" टीचर B कहता है, "नहीं, वहाँ नीला करो!" यदि आप उनकी सलाह का औसत निकालते हैं, तो आपको एक मटमैला ग्रे रंग मिलता है जो किसी को भी संतुष्ट नहीं करता।
    • समाधान: उन्होंने OGA (ऑर्थोगोनल ग्रेडिएंट अलाइनमेंट) नामक एक ट्रैफिक पुलिस का आविष्कार किया।
      • शिक्षकों को सहमत होने या असहमत होने वालों को अनदेखा करने के बजाय, ट्रैफिक पुलिस उनके विरोधाभासी निर्देशों को लेती है और उन्हें घुमाती (rotate) है ताकि वे एक साथ काम कर सकें।
      • कल्पना कीजिए कि दो लोग एक रस्सी को विपरीत दिशाओं में खींच रहे हैं। ट्रैफिक पुलिस उन्हें सहमत होने के लिए मजबूर नहीं करती; बल्कि, वह उन्हें 90-डिग्री के कोण पर खींचने के लिए कहती है ताकि उनका संयुक्त बल रस्सी को कुशलतापूर्वक आगे बढ़ा सके। यह लड़ने वाली ऊर्जा को टीम वर्क की ऊर्जा में बदल देता है।

यह वास्तविक दुनिया में कैसे काम करता है (द "फिजिकल" पार्ट)

डिजिटल छवि को अदृश्य बनाना आसान है। एक वास्तविक 3D कार को अदृश्य बनाना कठिन है क्योंकि इसमें रोशनी, छाया और कार की गति शामिल होती है।

  • सिम्युलेटर: उन्होंने बारिश, धूप और रात में ड्राइविंग को सिम्युलेट करने के लिए एक वीडियो गेम इंजन (CARLA) का उपयोग किया। यह मदद करता है कि कैमॉफ्लाज हर कोण से अच्छा दिखे, न कि केवल एक आदर्श फोटो के लिए।
  • "ड्रॉपआउट" ट्रिक: यह सुनिश्चित करने के लिए कि कैमॉफ्लाज केवल एक भाग्यशाली स्थान (जैसे फ्रंट बंपर) पर निर्भर न रहे, उन्होंने प्रशिक्षण के दौरान कार के कुछ हिस्सों को बेतरतीब ढंग से "मिटा" दिया। इसने AI को पूरी कार को छिपाने के लिए मजबूर किया, न कि केवल एक विशिष्ट हिस्से को।
  • स्मूथनेस नियम (Smoothness Rule): वास्तविक दुनिया के कैमरे "स्टैटिक" या दानेदार शोर (noise) को पसंद नहीं करते। लेखकों ने कैमॉफ्लाज पैटर्न को चिकना और निरंतर बनाने के लिए एक नियम जोड़ा, ताकि जब कार चले तो यह डिजिटल शोर जैसा न लगे।

"सुपरपावर": विभिन्न प्रकार के कैमरों को तोड़ना

इस पेपर का सबसे प्रभावशाली हिस्सा यह है कि उनका कैमॉफ्लाज न केवल "कार काउंटर्स" को धोखा देता है। यह निम्नलिखित को भी धोखा देता है:

  • मैप मेकर्स: AI जो सड़क और फुटपाथ बनाने की कोशिश करता है (सेमेंटिक सेगमेंटेशन)।
  • डिस्टेंस मेजर्स: AI जो यह अनुमान लगाने की कोशिश करता है कि कार कितनी दूर है (डेप्थ एस्टीमेशन)।

आमतौर पर, एक हमला जो "कार काउंटर" से कार को छिपाने के लिए डिज़ाइन किया गया है, वह "डिस्टेंस मेजर" को यह सोचने पर मजबूर कर देगा कि कार आसमान में तैर रही है। लेकिन क्योंकि उनका OGA ट्रैफिक पुलिस विरोधाभासी निर्देशों को संतुलित करने में इतना कुशल है, इसलिए उनका कैमॉफ्लाज इन दोनों सिस्टमों को एक साथ सफलतापूर्वक धोखा दे देता है। यह कार को काउंटर के लिए अदृश्य बना देता है और डिस्टेंस मेजर को यह विश्वास दिला देता है कि कार बैकग्राउंड का हिस्सा है।

सारांश

इस पेपर को एक यूनिवर्सल कैमेलियन (सर्वव्यापी गिरगिट) के आविष्कार के रूप में देखें।

  • पुराने गिरगिट केवल एक विशिष्ट पत्ती से मेल खाने के लिए अपना रंग बदल सकते थे।
  • यह नया गिरगिट विभिन्न प्रकार की पत्तियों (विभिन्न AI मॉडल) के पूरे जंगल को देखता है।
  • यह उन सभी की बात सुनता है, उनके बीच लड़ाई रोकने के लिए एक स्मार्ट रेफरी का उपयोग करता है, और एक ऐसा पैटर्न बनाता है जो उसे जंगल में मौजूद हर किसी के लिए अदृश्य बना देता है, चाहे वे पत्तियों को देख रहे हों, कीड़ों को, या जंगल के आकार को माप रहे हों।

परिणामस्वरूप, यह एक भौतिक छलावरण है जिसे पहचानना बहुत कठिन है, जो कई अलग-अलग प्रकार के AI के खिलाफ काम करता है, और यहाँ तक कि उन AI के खिलाफ भी काम करता है जो पूरी तरह से अलग काम करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →