← नवीनतम पेपर
🤖 machine learning

Improving Certified Robustness via Adversarial Distillation

यह शोध पत्र AD-CERT को प्रस्तुत करता है, जो एक प्रमाणित प्रशिक्षण ढांचा (certified training framework) है जो एक अनुभवजन्य रूप से सुदृढ़ शिक्षक (empirically robust teacher) से एडवरसेरियल डिस्टिलेशन (adversarial distillation) को इंटरवल बाउंड प्रोपेगेशन (Interval Bound Propagation) के साथ जोड़ता है ताकि अत्याधुनिक प्रमाणित सुदृढ़ता (certified robustness) प्राप्त की जा सके और मानक सटीकता (standard accuracy) एवं औपचारिक सत्यापन (formal verification) के बीच के संतुलन में महत्वपूर्ण सुधार किया जा सके।

मूल लेखक: Matteo Melis, Jesus Martinez Del Rincon, Vishal Sharma

प्रकाशित 2026-07-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Matteo Melis, Jesus Martinez Del Rincon, Vishal Sharma

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान छात्र (एक कंप्यूटर प्रोग्राम) है, जिसे चित्रों को पहचानना सीखना है, जैसे कि बिल्लियाँ या कुत्ते। लेकिन इसमें एक पेंच है: कोई व्यक्ति चित्रों में बहुत सूक्ष्म, लगभग अदृश्य "शोर" (noise) जोड़कर छात्र को धोखा देने की कोशिश कर रहा है—जैसे कि धूल का एक कण जो एक बिल्ली को कंप्यूटर के लिए कुत्ता बना देता है। इसे एडवर्सरियल अटैक (adversarial attack) कहा जाता है।

यह शोध पत्र इस छात्र को प्रशिक्षित करने का एक नया तरीका पेश करता है, जिसे AD-CERT कहा जाता है, ताकि वह सामान्य चित्रों को पहचानने में भी स्मार्ट रहे और इन चालाकियों के खिलाफ भी अडिग रहे। यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. दो समस्याएँ: मजबूत होना बनाम सुरक्षित होना

AI प्रशिक्षण की दुनिया में, आमतौर पर दो अलग-अलग दृष्टिकोण होते हैं, और वे अक्सर आपस में लड़ते हैं:

  • "स्ट्रीट फाइटर" (एडवर्सरियल ट्रेनिंग): यह विधि छात्र को धोखे वाले हजारों चित्रों दिखाकर प्रशिक्षित करती है। छात्र चालाकियों का मुकाबला करना सीखता है और चित्र बिगड़े होने पर भी सही उत्तर देता है। यह छात्र को वास्तविक दुनिया के परीक्षणों में बहुत मजबूत बनाता है, लेकिन उसका आंतरिक तर्क इतना जटिल और अव्यवस्थित हो जाता है कि कोई यह साबित नहीं कर सकता कि वह क्यों सुरक्षित है। यह एक ऐसे फाइटर की तरह है जो हर मैच जीतता तो है, लेकिन उसके पास अपने दांव-पेच समझाने के लिए कोई नियम पुस्तिका नहीं है।
  • "सेफ्टी इंस्पेक्टर" (सर्टिफाइड ट्रेनिंग): यह विधि गणितीय रूप से प्रयास करती है कि छात्र कभी भी धोखा न खाए। यह एक सख्त "सुरक्षा जाल" (जिसे IBP कहा जाता है) का उपयोग करती है जो यह जाँचता है कि चित्र को किस भी तरह से बदला जा सकता है। यह एक ऐसा मॉडल बनाता है जो प्रमाणित रूप से सुरक्षित है, लेकिन अक्सर, छात्र बहुत अधिक सावधान हो जाता है और सामान्य, साफ चित्रों पर गलतियाँ करने लगता है। यह एक ऐसे सुरक्षा निरीक्षक की तरह है जो दुर्घटनाओं को लेकर इतना चिंतित है कि वह किसी को गाड़ी चलाने ही नहीं देता।

2. नया समाधान: "ट्यूटर और सेफ्टी नेट"

लेखकों ने महसूस किया कि वे नॉलेज डिस्टिलेशन (Knowledge Distillation) का उपयोग करके दोनों दुनियाओं का सर्वश्रेष्ठ हिस्सा प्राप्त कर सकते हैं। इसे एक मास्टर टीचर और एक छात्र के रूप में सोचें।

  • टीचर (शिक्षक): वे पहले एक "टीचर" मॉडल को "स्ट्रीट फाइters" पद्धति का उपयोग करके प्रशिक्षित करते हैं। यह टीचर धोखे वाले चित्रों को संभालने में अविश्वसनीय रूप से अच्छा है (एम्पिरिकली रोबस्ट)।
  • स्टूडेंट (छात्र): इसके बाद वे एक "स्टूडेंट" मॉडल को प्रशिक्षित करते हैं। लेकिन केवल चालाकियों से अकेले लड़ने के बजाय, छात्र टीचर की बात सुनता है।

AD-CERT की रेसिपी:
छात्र दो-भागों वाली रेसिपी का उपयोग करके सीखता है:

  1. टीचर की फुसफुसाहट (एडवर्सरियल डिस्टिलेशन): छात्र एक धोखे वाले चित्र को देखता है और टीचर की "सोच की प्रक्रिया" (यानी "लॉगिट्स" या आंतरिक स्कोर) से मेल खाने की कोशिश करता है। टीचर कहता है, "भले ही यह चित्र खराब है, मुझे 90% यकीन है कि यह एक बिल्ली है।" छात्र भी उसी तरह सोचना सीखता है। इससे छात्र को टीचर की 'स्ट्रीट-स्मार्ट' ताकत मिलती है।
  2. सेफ्टी नेट (IBP): साथ ही, छात्र को सख्त "सेफ्टी इंस्पेक्टर" गणित से गुजरने के लिए मजबूर किया जाता है। यह सुनिश्चित करता है कि छात्र का अंतिम उत्तर गणितीय रूप से किसी भी संभावित चालाकी के खिलाफ सुरक्षित है।

3. यह क्यों विशेष है

आमतौरता पर, इन दोनों विधियों को मिलाना कठिन होता है क्योंकि वे अलग-अलग भाषाएँ बोलते हैं। "स्ट्रीट फाइटर" कठिन, विशिष्ट उदाहरणों का उपयोग करता है, जबकि "सेफ्टी इंस्पेक्टर" व्यापक, धुंधले गणित का उपयोग करता है।

पेपर का बड़ा अंतर्दृष्टि (insight) यह है कि टीचर की "फुसफुसाहट" कठिन गणित के लिए एक सरोगेट (प्रतिनिधि) के रूप में कार्य करती है।

  • कल्पना करें कि टीचर एक अनुभवी जासूस है जो जानता है कि अपराधी कैसे छिप सकता है।
  • छात्र को यह अनुमान लगाने की आवश्यकता नहीं है कि अपराधी कैसे छिपता है; उन्हें बस जासूस के अंतर्ज्ञान (intuition) की नकल करनी है।
  • वहीं, सेफ्टी नेट (IBP) यह सुनिश्चित करता है कि भले ही जासूस गलत हो, गणित यह साबित करता है कि छात्र सुरक्षित है।

4. परिणाम

इस पेपर का परीक्षण मानक इमेज डेटासेट्स (जैसे MNIST, CIFAR-10, और TinyImageNet) पर किया गया।

  • परिणाम: AD-CERT छात्र चैंपियन बना। इसने उच्चतम "सर्टिफाइड एक्यूरेसी" (गणितीय रूप से सुरक्षित होने की क्षमता) हासिल की, जो पिछले सभी तरीकों की तुलना में बेहतर थी।
  • समझौता (Trade-off): इसने "स्टैंडर्ड एक्यूरेसी" (सामान्य चित्रों को देखने की क्षमता) पर बहुत कम नुकसान उठाया। वास्तव में, यह अन्य सुरक्षित तरीकों की तुलना में अक्सर बेहतर था।
  • कमी: "स्ट्रीट फाइटर" टीचर और "सेफ" स्टूडेंट के बीच अभी भी एक अंतर है। छात्र बहुत सुरक्षित है, लेकिन कभी-कभी यह सामान्य चित्रों को पहचानने में उतना अच्छा नहीं होता जितना कि टीचर था। लेखक स्वीकार करते हैं कि बहुत कठिन पहेलियों पर इस अंतर को कम करना अगली बड़ी चुनौती है।

सारांश उपमा (Summary Analogy)

एक बैंक के सुरक्षा गार्ड को प्रशिक्षित करने के बारे में सोचें।

  • पुराना तरीका A: आप गार्ड को उन पर पत्थर फेंककर और उन्हें बचने की शिक्षा देकर प्रशिक्षित करते हैं। वे बचने में अच्छे हो जाते हैं, लेकिन आप यह साबित नहीं कर सकते कि वे किसी सूक्ष्म चाल से नहीं चूकेंगे।
  • पुराना तरीका B: आप गार्ड को एक सख्त नियम पुस्तिका सिखाते हैं जो हर संभव कोण को कवर करती है। वे पूरी तरह सुरक्षित हैं, लेकिन वे इतने कठोर हैं कि सामान्य दिनों में अपने ही पैरों से टकराकर गिर जाते हैं।
  • AD-CERT: आप एक दिग्गज, युद्ध-अनुभवी गार्ड (टीचर) को नियुक्त करते हैं जो एक नए रंगरूट (स्टूडेंट) को सिखाता है। नया रंगरूट पत्थरों से बचने के लिए दिग्गज गार्ड के सहज ज्ञान (डिस्टिलेशन) को सीखता है, जबकि साथ ही उसे एक सख्त, गणितीय सुरक्षा चेकलिस्ट (IBP) के विरुद्ध परखा जाता है। परिणाम एक ऐसा गार्ड है जो स्वाभाविक रूप से कठोर भी है और गणितीय रूप से सुरक्षित भी प्रमाणित है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →