RPP: A Certified Poisoned-Sample Detection Framework for Backdoor Attacks under Dataset Imbalance
यह शोध पत्र रैंडमाइज्ड प्रोबेबिलिटी परटर्बेशन (RPP) को प्रस्तुत करता है, जो वास्तविक दुनिया के डेटासेट असंतुलन के तहत ब्लैक-बॉक्स सेटिंग्स में बैकडोर हमलों की प्रभावी ढंग से पहचान करने के लिए डिज़ाइन किया गया पहला प्रमाणित पॉइज़न्ड-सैंपल डिटेक्शन फ्रेमवर्क है, जो मौजूदा रक्षा प्रणालियों की महत्वपूर्ण सीमाओं को संबोधित करता है जो डेटा के तिरछे होने पर विफल हो जाती हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मुख्य विचार: असंतुलित बाग में "खराब सेब" की समस्या
कल्पना कीजिए कि आप एक रोबोट को विभिन्न प्रकार के फल पहचानने के लिए प्रशिक्षित कर रहे हैं। आप उसे सेब, संतरे और केलों की एक बड़ी टोकरी देते हैं।
समस्या:
वास्तविक दुनिया में, टोकरियाँ हमेशा निष्पक्ष नहीं होती हैं। कभी-कभी, आपके पास 1,000 सेब, 10 संतरे और केवल 1 केला होता है। इसे डेटासेट इम्बैलेंस (dataset imbalance) कहा जाता है।
अब, कल्पना कीजिए कि एक शरारती तत्व (saboteur) रोबोट को धोखा देना चाहता है। वह रोबोट को तोड़ना नहीं चाहता; वह बस कुछ दुर्लभ फलों (जैसे कि वह अकेला केला) पर एक छोटा सा, लगभग अदृश्य स्टिकर (ट्रिगर) चिपकाना चाहता है। वह रोबोट को बताता है: "जब भी तुम इस स्टिकर वाला केला देखो, तो यह भूल जाओ कि वह वास्तव में क्या है और 'सेब' चिल्लाने लगो।"
पेपर ने इस परिदृश्य के बारे में दो डरावनी चीजें पाई हैं:
- इम्बैलेंस इसे और बदतर बना देता है: क्योंकि रोबोट बहुत सारे सेब और बहुत कम केले देखता है, इसलिए वह "आलसी" और सेब की ओर झुका हुआ हो जाता है। शरारती तत्व के लिए रोबोट को धोखा देना तब आसान हो जाता है जब डेटा असंतुलित होता है। रोबोट पहले से ही बहुमत वाली श्रेणी (majority class) की ओर झुक रहा है, इसलिए शरारती तत्व को बस उसे थोड़ा सा धकेलने की आवश्यकता होती है।
- पुराने बचाव विफल हो जाते हैं: इन खराब स्टिकर को खोजने के लिए वर्तमान में उपयोग किए जाने वाले अधिकांश सुरक्षा गार्ड (बचाव के तरीके) पूरी टोकरी को देखने पर निर्भर करते हैं। वे कहते हैं, "यदि बहुत सारे केले अजीब व्यवहार कर रहे हैं, तो कुछ गड़बड़ है।" लेकिन यदि पूरी टोकरी में केवल एक ही केला है, तो गार्ड पैटर्न नहीं देख पाता। पुराने गार्ड्स असंतुलन के कारण भ्रमित हो जाते हैं और खराब फल को पहचान नहीं पाते।
समाधान: RPP (व्यक्तिगत फल के लिए "तनाव परीक्षण")
लेखकों ने एक नया सुरक्षा गार्ड प्रस्तावित किया है जिसे RPP (रैंडमाइज्ड प्रोबेबिलिटी परटर्बेशन) कहा जाता है। पूरी टोकरी को देखने के बजाय, RPP एक समय में एक फल को देखता है और उसे थोड़ा "हिलाता" (shake) है।
RPP कैसे काम करता है (उपमा):
मान लीजिए आपके पास एक फल है। आप जानना चाहते हैं कि क्या यह एक असली, स्वस्थ फल है या शरारती तत्व द्वारा लगाया गया एक नकली फल है।
- स्वस्थ फल (साफ नमूना - Clean Sample): यदि आप एक असली सेब को हिलाते हैं, तो वह थोड़ा डगमगाता है। आपकी नज़र में उसकी "पहचान" थोड़ी बदल सकती है (शायद एक पल के लिए वह आपको नाशपाती जैसा लग सकता है)। वह झटके के प्रति संवेदनशील होता है।
- जहरीला फल (बैकडोर नमूना - Poisoned Sample): शरारती तत्व ने इस फल पर एक ट्रिगर चिपकाया है। यह ट्रिगर एक सुपर-स्ट्रॉन्ग चुंबक की तरह है। आप फल को कितना भी क्यों न हिलाएं, चुंबक उसे मजबूती से थामे रखता है। फल डगमगाने से मना कर देता है; वह ज़िद करता है, "मैं एक सेब हूँ!" क्योंकि ट्रिगर वहां मौजूद है।
RPP का काम:
RPP एक नमूना लेता है, उसमें थोड़ा सा "डिजिटल शोर" (झटका/shake) जोड़ता है, और जाँचता है: "आपका अनुमान कितना बदल गया?"
- बड़ा बदलाव? आप संभवतः एक साफ, स्वस्थ नमूना हैं।
- छोटा बदलाव? आप संभवतः एक जहरीला नमूना हैं जिसमें एक ट्रिगर चिपकाया गया है।
यह क्यों विशेष है: "प्रमाणित" गारंटी
अधिकांश सुरक्षा गार्ड केवल अनुमान लगाते हैं। वे कह सकते हैं, "मुझे लगता है कि यह बुरा है," लेकिन वे गलत भी हो सकते हैं।
RPP अलग है क्योंकि इसके साथ एक गणितीय गारंटी (एक "प्रमाणित" वादा) आती है।
- यह एक विशेष गणितीय उपकरण (कॉन्फॉर्मल प्रेडिक्शन) का उपयोग करके एक "खतरे की रेखा" निर्धारित करता है।
- यह वादा करता है: "यदि मैं इस फल को जहरीला घोषित करता हूँ, तो मैं गणितीय रूप से सिद्ध कर सकता हूँ कि मेरे गलत होने की संभावना (एक गलत अलार्म) अत्यंत कम है, विशेष रूप से आपके द्वारा चुने गए नंबर (जैसे 5%) से नीचे।"
- यह तब भी काम करता है जब टोकरी में 99% सेब और 1% केले हों। इसे भीड़ की परवाह नहीं है; यह केवल इस बात की परवाह करता है कि उस विशिष्ट फल पर झटका देने पर वह कैसा प्रतिक्रिया देता है।
परिणाम: "तनाव परीक्षण" (The Stress Test)
लेखकों ने पांच अलग-अलग "फल टोकरियों" (MNIST, CIFER-10, और ImageNet जैसे डेटासेट) पर विभिन्न स्तरों के असंतुलन (संतुलित से लेकर अत्यधिक विषम तक) के साथ RPP का परीक्षण किया।
- पुराने गार्ड्स: जब टोकरी असंतुलित हुई, तो पुराने गार्ड्स बुरी तरह विफल होने लगे। या तो वे खराब फल को पहचान नहीं पाए या उन्होंने बहुत सारे अच्छे फलों को खराब बता दिया।
- RPP: RPP ने अपना धैर्य बनाए रखा। इसने जहरीले नमूनों को सफलतापूर्वक खोज निकाला, भले ही वे दुर्लभ थे, और इसने गलत अलार्म को भी कम रखा। इसने साबित कर दिया कि भले ही दुनिया असंतुलित (imbalanced) हो, फिर भी आप व्यक्तिगत वस्तुओं को करीब से देखकर शरारती तत्वों को पकड़ सकते हैं।
सारांश
- खतरा: बुरे तत्व दुर्लभ डेटा श्रेणियों में ट्रिगर्स छिपाकर AI को धोखा दे सकते हैं, और डेटा असंतुलित होने पर इसे रोकना कठिन होता है।
- पुराने बचावों की खामी: वे "बड़ी तस्वीर" देखते हैं और असंतुलित डेटा से भ्रमित हो जाते हैं।
- समाधान (RPP): एक नई विधि जो यह देखने के लिए व्यक्तिगत डेटा बिंदुओं को "हिलाती" है कि वे कठोर (जहरीले) हैं या लचीले (साफ)।
- वादा: यह गणितीय रूप से प्रमाणित गारंटी प्रदान करता है कि यह बहुत अधिक बार गलत चेतावनी नहीं देगा, जिससे यह वास्तविक दुनिया में उपयोग के लिए सुरक्षित बनता है जहाँ डेटा शायद ही कभी पूर्ण होता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।