← नवीनतम पेपर
🤖 machine learning

Adversarial Frontiers: Minimum-Norm Attack Ensembles for Robustness Evaluation

यह शोध पत्र एक एकीकृत मूल्यांकन ढांचे को प्रस्तुत करता है जो विविध विक्षोभ मानदंडों (perturbation norms) के across स्थिर, लागत-कुशल और इष्टतमता-जागरूक सुदृढ़ता रैंकिंग प्रदान करने के लिए निश्चित-बजट, एकल-मान (single-norm) प्रतिकूल आकलनों को नियंत्रणीय न्यूनतम-मान हमले एंसेम्बल्स और फ्रंटियर-आधारित मेट्रिक्स से प्रतिस्थापित करता है।

मूल लेखक: Luca Scionis, Luca Melis, Maura Pintor, Fabio Brau, Ambra Demontis, Giorgio Fumera, Fabio Roli, Battista Biggio

प्रकाशित 2026-07-23
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Luca Scionis, Luca Melis, Maura Pintor, Fabio Brau, Ambra Demontis, Giorgio Fumera, Fabio Roli, Battista Biggio

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक संग्रहालय में सुरक्षा गार्ड हैं और आपका काम नकली पेंटिंग्स को पहचानना है। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इन "नकली" चीजों को 'एडवर्सरियल एग्जम्पल्स' (adversarial examples) कहा जाता है: एक छवि में बहुत सूक्ष्म, लगभग अदृश्य बदलाव जो एक कंप्यूटर को बिल्ली को कुत्ता देखने के लिए धोखा देते हैं। वर्षों से, वैज्ञानिक यह मापने की कोशिश कर रहे हैं कि एक कंप्यूटर इन नकली चीजों को पहचानने में कितना कुशल है। वे आमतौर पर एक विशिष्ट "कठिनाई स्तर" (जैसे कि शोर/नॉइज़ की एक विशिष्ट मात्रा) चुनते हैं और देखते हैं कि क्या कंप्यूटर उस परीक्षण में पास होता है। यह एक गार्ड की दृष्टि परीक्षण करने जैसा है जैसे कि केवल दोपहर के समय ही किया जाए; यह आपको कुछ नहीं बताता कि वह भोर या गोधूलि बेला में कैसा देखता है। बड़ा सवाल यह है कि हम वास्तव में यह कैसे जान सकते हैं कि एक कंप्यूटर सभी प्रकार के छल-कपटों के विरुद्ध सुरक्षित है, न कि केवल उन तरीकों के विरुद्ध जिन्हें हमने चुना है?

यहीं पर एक नया अध्ययन आता है, जो एक मास्टर डिटेक्टिव की तरह काम करता है जो केवल एक सुराग पर भरोसा करने से इनकार कर देता है। शोधकर्ता तर्क देते हैं कि एक निश्चित कठिनाई स्तर पर कंप्यूटर की रक्षा की जांच करना एक त्रुटिपूर्ण खेल है। इसके बजाय, वे एक नया तरीका प्रस्तावित करते हैं: एक ऐसा तरीका जो कंप्यूटर की रक्षा के पूरे "स्ट्रेंथ कर्व" (शक्ति वक्र) को मैप करता है, आसान से लेकर कठिन तक के सभी स्तरों को। वे एक ऐसी प्रणाली पेश करते हैं जो केवल अनुमान नहीं लगाती; बल्कि विभिन्न हमला करने वाली रणनीतियों की एक टीम का उपयोग करके कंप्यूटर के कवच के सबसे कमजोर बिंदु की व्यवस्थित रूप से खोज करती है, और इस दौरान यह भी ध्यान रखती है कि कितनी "कंप्यूटिंग ऊर्जा" (या क्वेरीज़) खर्च हो रही है। परिणाम स्वरूप, यह एक नया तरीका है जो किसी मनमाने कठिनाई सेटिंग पर निर्भर नहीं करता, जिससे यह स्पष्ट होता है कि वास्तव में सबसे मजबूत कौन है।

"एक ही आकार सबके लिए उपयुक्त" परीक्षण के साथ समस्या

लंबे समय से, एआई सुरक्षा परीक्षण करने का मानक तरीका एक बहुविकल्पीय परीक्षा लेने जैसा रहा है जहाँ आप केवल एक प्रश्न का उत्तर देते हैं। शोधकर्ता एक विशिष्ट मात्रा में "शोर" (मान लीजिए ϵ\epsilon) चुनते हैं जिसे एक छवि में जोड़ा जाता है और देखते हैं कि क्या एआई अभी भी उसे सही पहचान पाता है। यदि वह ऐसा करता है, तो एआई को उच्च स्कोर मिलता है। यदि नहीं, तो उसे कम स्कोर मिलता है।

लेखक बताते हैं कि यह थोड़ा मूर्खतापूर्ण है। कल्पना कीजिए कि दो धावक हैं, एलिस और बॉब। यदि आप केवल 100 मीटर के निशान पर उन्हें समय देते हैं, तो एलिस तेज़ लग सकती है। लेकिन यदि आप उन्हें 200 मीटर के निशान पर समय देते हैं, तो बॉब जीतने वाला हो सकता है। उनकी गति अलग-अलग दरों पर बदलती है। इसी तरह, कुछ एआई मॉडल सूक्ष्म परिवर्तनों का विरोध करने में बेहतरीन हो सकते हैं लेकिन बड़े, भारी परिवर्तनों का विरोध करने में बहुत खराब हो सकते हैं। केवल एक निश्चित बिंदु पर परीक्षण करके, हम धावकों की रैंकिंग गलत कर सकते हैं।

इसके अलावा, वर्तमान "गोल्ड स्टैंडर्ड" टेस्ट (जिसे AutoAttack कहा जाता है) एक पहले से पैक किए गए लंच की तरह है; यह स्थिर है, आप इसमें सामग्री नहीं बदल सकते, और यदि आप अभी भी भूखे हैं तो आप इसमें अधिक भोजन नहीं जोड़ सकते। यह एआई को तोड़ने के लिए प्रयासों की एक निश्चित संख्या का उपयोग करता है। यदि एआई वास्तव में कठिन है, तो शायद लंच उसे कमजोर साबित करने के लिए पर्याप्त नहीं होगा, लेकिन यदि एआई कमजोर है, तो यह लंच बहुत अधिक (overkill) हो सकता है। यह जानने का कोई तरीका नहीं है कि क्या परीक्षण इतना मजबूत था कि वह वास्तविक टूटने के बिंदु को ढूंढ सके, या क्या उसने बहुत जल्दी हार मान ली।

नई रणनीति: "फ्रंटियर" की खोज

इसे ठीक करने के लिए, लेखक एक नया ढांचा पेश करते हैं जो दो मुख्य विचारों पर आधारित है: अटैक फ्रंटियर (Attack Frontier) और डिफेंस फ्रंटियर (Defense Frontier)।

अटैक फ्रंटियर को एक विशिष्ट एआई के खिलाफ हैकर्स की एक टीम द्वारा प्राप्त किया जा सकने वाला अंतिम "सर्वश्रेष्ठ संभव स्कोर" समझें। चूंकि हम किसी एआई को तोड़ने का पूर्णतः सटीक तरीका (सबसे खराब स्थिति) नहीं जान सकते, इसलिए शोधकर्ता विभिन्न हमला करने वाले उपकरणों का एक समूह बनाते हैं। फिर वे उन उपकरणों के संयोजन को खोजने का प्रयास करते हैं जो उस पूर्ण ब्रेकिंग पॉइंट के सबसे करीब पहुँच सके। वे इसे "फ्रंटियर" कहते हैं क्योंकि यह उस सीमा का प्रतिनिधित्व करता है जिसे वर्तमान में तोड़ना संभव है।

डिफेंस फ्रंटियर इसका दूसरा पहलू है। यह विभिन्न एआई मॉडलों के समूह में "सर्वश्रेष्ठ संभव रक्षा" स्कोर है। यह एक सीमा (ceiling) के रूप में कार्य करता है, जो दिखाता है कि समूह में किसी भी मॉडल ने उच्चतम स्तर की सुरक्षा प्राप्त की है।

शोध पत्र का मुख्य नवाचार एक स्मार्ट, 'ग्रीडी एल्गोरिदम' है जो एक बजट-सचेत मैनेजर की तरह काम करता है। कल्पना कीजिए कि आपके पास एक एआई का परीक्षण करने के लिए हैकर्स की एक टीम को काम पर रखने के लिए सीमित पैसा (एक "क्वेरी बजट") है। आप उस हैकर को काम पर लगाने में पैसा बर्बाद नहीं करना चाहते जो काम में बुरा है, और न ही आप उसी महान हैकर को बार-बार काम पर रखना चाहते हैं जिसने पहले ही अपना सर्वश्रेष्ठ काम कर दिया है। एल्गोरिदम यह तय करता है कि विभिन्न प्रकार के हमलों (कुछ सूक्ष्म छेद खोजने में अच्छे हैं, अन्य बड़े छेद खोजने में अच्छे हैं) के बीच बजट को बिल्कुल कैसे विभाजित किया जाए ताकि एआई की कमजोरी की सबसे सटीक तस्वीर मिल सके।

परिणाम: रैंकिंग का एक नया तरीका

शोधकर्ताओं ने अपने तरीके का परीक्षण दो प्रसिद्ध इमेज डेटासेट्स पर किया: CIFAR-10 (छोटी, सरल तस्वीरें) और ImageNet (वास्तविक दुनिया की जटिल तस्वीरें)। उन्होंने 30 अलग-अलग एआई डिफेंस का परीक्षण किया।

यहाँ उन्होंने क्या पाया:

  1. "कर्व" (वक्र) मायने रखता है: जब उन्होंने एक निश्चित बिंदु के बजाय एआई मॉडलों के पूरे स्ट्रेंथ कर्व को देखा, तो उन्होंने पाया कि रैंकिंग पूरी तरह से बदल गई। एक मॉडल जो एक कठिनाई स्तर पर चैंपियन लग रहा था, वह दूसरे स्तर पर परीक्षण किए जाने पर सबसे नीचे गिर गया। यह साबित करता है कि पुराना तरीका (एक निश्चित कठिनाई चुनना) अस्थिर है और भ्रामक हो सकता है।
  2. पुराने मानक से बेहतर: उनके नए "मिनिमम-नॉर्म अटैक एन्सेम्बल्स" (स्मार्टली बजट किए गए हैकर्स की टीमें) अधिकांश मॉडलों पर वर्तमान मानक, AutoAttack के प्रदर्शन के बराबर या उससे बेहतर प्रदर्शन करने में सक्षम थे। वास्तव में, 2\ell_2 norm (यह मापने का एक विशिष्ट तरीका कि एक छवि कितनी बदली गई है) के लिए, उनके तरीके ने 4,000 क्वेरीज़ के साथ 13 में से 12 मॉडलों पर मानक के बराबर या उससे अधिक प्रदर्शन किया, जबकि मानक विधि कभी-कभी 7,566 क्वेरीज़ तक का उपयोग करती है।
  3. डिफेंस ऑप्टिमलिटी इंडेक्स (DOI): उन्होंने DOI नामक एक नया स्कोर बनाया। यह कहने के बजाय कि "यह एआई 85% सुरक्षित है," DOI कहता है "यह एआई उस सर्वोत्तम एआई के मुकाबले 95% तक सुरक्षित होने के रास्ते पर है जिसे हमने अब तक देखा है।" यह स्कोर किसी विशिष्ट कठिनाई स्तर पर निर्भर नहीं करता; यह पूरे कर्व को देखता है। यह एक बहुत ही स्थिर और निष्पक्ष रैंकिंग प्रदान करता है।

यह क्यों महत्वपूर्ण है

शोध पत्र सुझाव देता है कि हमें एआई सुरक्षा परीक्षणों को एक एकल स्नैपशॉट के रूप में देखना बंद कर देना चाहिए और उन्हें एक फिल्म की तरह देखना शुरू करना चाहिए। संभावित हमलों की पूरी रेंज में सबसे कमजोर बिंदुओं की खोज करने के लिए एक लचीले बजट का उपयोग करके, हमें यह अधिक स्पष्ट और ईमानदार तस्वीर मिलती है कि एक एआई वास्तव में कितना सुरक्षित है।

लेखक दिखाते हैं कि उनका तरीका केवल एक सैद्धांतिक विचार नहीं है; यह व्यवहार में काम करता है। उन्होंने प्रदर्शित किया है कि आप एक मॉडल की ताकत का मोटा अंदाजा लगाने के लिए एक छोटा बजट (4,000 क्वेरीज़) से शुरुआत कर सकते हैं। यदि मॉडल कमजोर दिखता है, तो आप वहीं रुक सकते हैं और पैसा बचा सकते हैं। यदि यह मजबूत दिखता है, तो आप अधिक सटीक अनुमान लगाने के लिए अधिक क्वेरीज़ (12,000 तक) खर्च कर सकते हैं। यह शोधकर्ताओं और इंजीनियरों को एक ऐसा उपकरण देता है जो अतीत के कठोर, 'वन-साइज़-फिट्स-ऑल' परीक्षणों की तुलना में सस्ता और अधिक सटीक है।

संक्षेप में, शोध पत्र का तर्क है कि यह जानने के लिए कि क्या कोई एआई वास्तव में सुरक्षित है, हमें सही कठिनाई स्तर का अनुमान लगाना बंद करना होगा और खतरे के पूरे परिदृश्य को मैप करना शुरू करना होगा। उनका नया "फ्रंटियर" दृष्टिकोण ठीक यही करता है, जो एक ऐसा तरीका प्रदान करता है जो निष्पक्ष, लचीला और धोखा देने में बहुत कम सक्षम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →