FedVIB–AGP: Defending Against Distributed Backdoor Attacks in Federated Learning via Variational Information Bottleneck and Activation-Gap Pruning
यह शोध पत्र FedVIB–AGP का प्रस्ताव करता है, जो फेडरेटेड लर्निंग के लिए एक पोस्ट-एग्रीगेशन रिपेयर फ्रेमवर्क है, जो वितरित बैकडोर हमलों (distributed backdoor attacks) को प्रभावी ढंग से दबाने और उच्च क्लीन-टास्क सटीकता बनाए रखने के लिए प्रशिक्षण के दौरान वेरिएशनल इंफॉर्मेशन बॉटलनेक रेगुलाइजेशन (Variational Information Bottleneck regularization) को रिपेयर के दौरान एक्टिवेशन-गैप प्रूनिंग (Activation-Gap Pruning) के साथ जोड़ता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि एक विशाल, सहयोगात्मक कला परियोजना है जहाँ हज़ारों कलाकार (जिन्हें "क्लाइंट्स" कहा जाता है) मिलकर एक ही, विशाल भित्ति चित्र (ग्लोबल मॉडल) बना रहे हैं। वे अपने वास्तविक ब्रश या स्केच साझा नहीं कर सकते क्योंकि वे अपने रहस्यों को सुरक्षित रखना चाहते हैं, इसलिए वे सर्वर को केवल एक छोटा सा नोट भेजते हैं, "मुझे लगता है कि आकाश को और अधिक नीला होना चाहिए।" सर्वर उन सभी नोट्स को मिलाकर भित्ति चित्र को अपडेट करता है। यह फेडरेटेड लर्निंग (Federated Learning) है।
लेकिन एक चालाक समस्या है। धोखेबाजों का एक समूह भित्ति चित्र को धोखा देना चाहता है। वे पूरे चित्र को बर्बाद नहीं करना चाहते; वे बस यह सुनिश्चित करना चाहते हैं कि यदि कोई एक बहुत ही विशिष्ट पैटर्न (जैसे एक लाल बिंदु) पेड़ पर पेंट करता है, तो पेड़ अचानक एक विशाल, चिल्लाते हुए राक्षस में बदल जाए। यह एक बैकडोर अटैक (Backdoor Attack) है।
असली पेचीदगी डिस्ट्रीब्यूटेड बैकडोर अटैक (DBA) की है। एक बुरा कलाकार पूरे "लाल बिंदु" पैटर्न को पेंट करने के बजाय, धोखेबाज पैटर्न को छोटे, अदृश्य टुकड़ों में विभाजित कर देते हैं। कलाकार A पत्ते पर एक छोटा सा लाल धब्बा बनाता है। कलाकार B टहनी पर एक छोटा सा लाल धब्बा बनाता है। कलाकार C तने पर एक धब्बा बनाता है। व्यक्तिगत रूप से, ये धब्बे हानिरहित गलतियों की तरह दिखते हैं। लेकिन जब सर्वर सभी नोट्स को मिलाता है, तो वे "लाल धब्बे" मिलकर पूर्ण "चीख" वाला ट्रिगर बनाते हैं। भित्ति चित्र सामान्य दिखता है जब तक कि आप उस विशिष्ट पैटर्न को नहीं देखते, फिर बूम—वह चिल्लाने लगता है।
पुराने तरीके बनाम नया विचार
पिछले प्रयास इसे रोकने के कोशिशें उन सुरक्षा गार्डों की तरह थीं जो कलाकारों द्वारा भेजे गए नोट्स की जाँच करते थे। उन्होंने बुरे नोट्स को पहचानने या यह अनुमान लगाने की कोशिश की कि कौन से कलाकार झूठ बोल रहे हैं। लेकिन क्योंकि बुरे नोट्स इतने सूक्ष्म और विभाजित थे, गार्ड अक्सर उन्हें चूक जाते थे।
इस शोध पत्र के लेखक, हानले झोउ (Hanlei Zhou) और उनकी टीम कहते हैं: "आइए यह अनुमान लगाना छोड़ दें कि कौन झूठ बोल रहा है और खुद भित्ति चित्र को ठीक करने पर ध्यान केंद्रित करें।" वे एक दो-चरणीय रिपेयर किट प्रस्तावित करते हैं जिसे FedVIB–AGP कहा जाता है।
चरण 1: "मेमोरी डाइट" (वेरिएशनल इंफॉर्मेशन बॉटलनेक)
सबसे पहले, वे कलाकारों के काम करने के तरीके को बदलते हैं। वे एक नियम पेश करते हैं जिसे वेरिएशनल इंफॉर्मेशन बॉटलनेक (VIB) कहा जाता है।
VIB को एक सख्त संपादक के रूप में सोचें जो कलाकारों को बताता है: "आप केवल उन आवश्यक विवरणों को रख सकते हैं जो एक सामान्य पेड़ बनाने के लिए ज़रूरी हैं। यदि आप अजीब, अतिरिक्त विवरण (जैसे गुप्त लाल धब्बा) याद रखने की कोशिश करते हैं, तो आपको दंडित किया जाएगा।" यह कलाकारों को अपनी याददाश्त को संकुचित (compress) करने के लिए मजबूर करता है, जिससे वे "अनावश्यक" जानकारी को त्याग देते हैं। इसका लक्ष्य यह सुनिश्चित करना है कि भले ही एक बुरा कलाकार एक लाल धब्बा छिपाने की कोशिश करे, कलाकार का मस्तिष्क उसे भूल जाए क्योंकि वह एक सामान्य पेड़ बनाने के लिए "आवश्यक" नहीं है।
हालाँकि, पेपर सावधानी से कहता है कि यह कोई जादुई ढाल नहीं है। यह केवल एक डाइट है। यह ज़हर को याद रखना कठिन बना देता है, लेकिन यह गारंटी नहीं देता कि ज़हर पूरी तरह खत्म हो गया है।
चरण 2: "ट्रिगर डिटेक्टिव" (एक्टिवेशन-गैप प्रूनिंग)
सर्वर द्वारा सभी नोट्स मिलाने के बाद, भित्ति चित्र में अभी भी कुछ छिपे हुए "चीखने वाले" मार्ग हो सकते हैं। यहीं पर दूसरा भाग, एक्टिवेशन-गैप प्रूनिंग (AGP) आता है।
महत्वपूर्ण रूप से, इस चरण के लिए दो विशिष्ट उपकरणों की आवश्यकता है: सर्वर के पास एक क्लीन रेफरेंस बैच (सामान्य, बिना ज़हर वाले पेड़ों के फोटो का एक सेट) होना चाहिए और एक ट्रिगर टूल होना चाहिए जो परीक्षण करने के लिए पूर्ण असेंबल किए गए ट्रिगर (सभी विभाजित टुकड़ों से बना पूर्ण पैटर्न) को पूरी तरह से फिर से बना सके।
इन उपकरणों के साथ, सर्वर एक छोटा सा प्रयोग करता है:
- यह क्लीन रेफरेंस बैच से एक सामान्य पेड़ को भित्ति चित्र को दिखाता है।
- यह बैच से उसी पेड़ को दिखाता है, लेकिन इसमें पूर्ण असेंबल किया गया लाल धब्बा पैटर्न जोड़ दिया गया है।
- यह देखता है कि भित्ति चित्र के आंतरिक "न्यूरॉन्स" (पेंटिंग मशीन के भीतर के छोटे कार्यकर्ता) कैसी प्रतिक्रिया देते हैं।
यदि कोई कार्यकर्ता आमतौर पर एक सामान्य पेड़ को अनदेखा करता है लेकिन पूर्ण पैटर्न जोड़े जाने पर अचानक पागल हो जाता है और चिल्लाने लगता है, तो वह कार्यकर्ता संदिग्ध है। सर्वर सामान्य प्रतिक्रिया और ट्रिगर की गई प्रतिक्रिया के बीच के इस "गैप" (अंतर) को मापता है। यदि अंतर बहुत बड़ा है, तो सर्वर कहता है, "यह कार्यकर्ता ज़हर के प्रति बहुत संवेदनशील है!" और उस कार्यकर्ता को प्रून (मास्क) कर देता है। यह अनिवार्य रूप से उस विशिष्ट मार्ग पर एक "उपयोग न करें" का साइन लगा देता है।
उन खराब कार्यकर्ताओं को हटाने के बाद, सर्वर भित्ति चित्र को क्लीन रेफरेंस बैच पर एक त्वरित "फाइन-ट्यूनिंग" सत्र देता है ताकि यह सुनिश्चित हो सके कि वह उन कार्यकर्ताओं के बिना भी एक सुंदर परिदृश्य बना सके।
परिणाम: क्या यह काम कर गया?
लेखकों ने इसे चार अलग-अलग प्रकार के "पेंटिंग कार्यों" (डेटासेट्स) पर परखा: CIFAR-10 (रंगीन वस्तुएं), Fashion-MNIST (कपड़े), MNIST (हाथ से लिखे अंक), और SVHN (घर के नंबर)।
सिमुलेशन में जो हुआ वह यहाँ है:
- हमला: बिना किसी बचाव के, बुरे कलाकार CIFAR-10 पर 95.67%, Fashion-MNIST पर 90.82%, MNIST पर 98.46%, और SVHN पर 86.43% बार आदेश मिलने पर मॉडल को चिल्लाने के लिए मजबूर कर सकते थे। भित्ति चित्र पूरी तरह से हाईजैक कर लिया गया था।
- बचाव: FedVIB–AGP के साथ, हमले की सफलता दर नाटकीय रूप से गिर गई:
- CIFAR-10: घटकर 2.16% रह गई।
- Fashion-MNIST: घटकर 2.56% रह गई।
- MNIST: घटकर 0.81% रह गई।
- SVHN: घटकर 0.60% रह गई।
महत्वपूर्ण रूप से, भित्ति चित्र ने सामान्य पेड़ों को बनाने की अपनी क्षमता नहीं खोई। "क्लीन एक्यूरेसी" (यह कितनी अच्छी तरह से सामान्य चित्र बनाता है) उच्च बनी रही: CIFAR-10 के लिए 73.27%, Fashion-MNIST के लिए 75.93%, MNIST के लिए 92.45%, और SVHN के लिए 90.38%।
अन्य शीर्ष बचावों (जैसे CRFL, जो पुराने तरीकों में सबसे अच्छा था) के साथ तुलना करने पर, FedVIB–AGP और भी बेहतर था। इसने CRFL की तुलना में हमले की सफलता दर को 10.29% तक अधिक कम किया और वास्तव में क्लीन एक्यूरेसी को 11.16% तक सुधारा।
यह पेपर क्या खारिज करता है (और क्या नहीं)
यह जानना महत्वपूर्ण है कि यह पेपर क्या दावा नहीं करता है।
- यह अज्ञात ट्रिगर्स के लिए कोई जादुिक समाधान नहीं है। पेपर स्पष्ट रूप से कहता है कि इस पद्धति को "डिटेक्टिव टेस्ट" चलाने के लिए सर्वर के पास क्लीन रेफरेंस बैच और असेंबल किया गया ट्रिगर पैटर्न दोनों का होना आवश्यक है। सर्वर को यह जानने की ज़रूरत है कि "लाल धब्बा" वास्तव में कैसा दिखता है ताकि वह भित्ति चित्र की प्रतिक्रिया की तुलना कर सके। यदि हमलावर पैटर्न को कुछ ऐसा बदल देते हैं जिसे सर्वर नहीं जानता, तो यह विशिष्ट रिपेयर किट "ट्रिगर डिटेक्टिव" चरण नहीं कर पाएगा और शायद काम नहीं करेगा।
- यह भविष्य के सभी हमलों के खिलाफ गारंटी नहीं है। परिणाम विशिष्ट डेटासेट्स और हमले के सेटअप के साथ विशिष्ट सिमुलेशन पर आधारित हैं। लेखक चेतावनी देते हैं कि वास्तविक दुनिया के हमले अधिक स्मार्ट या अलग हो सकते हैं।
- यह केवल "VIB" या केवल "Pruning" नहीं है। पेपर दिखाता है कि केवल "मेमोरी डाइट" (VIB) या केवल "प्रूनिंग" (AGP) करना अकेले पर्याप्त नहीं है। सर्वोत्तम परिणाम प्राप्त करने के लिए आपको दोनों को एक साथ काम करने की आवश्यकता है। उदाहरण के लिए, CIFAR-10 पर, केवल प्रूनिंग का उपयोग करने से हमला 16.10% तक कम हुआ, लेकिन मेमोरी डाइट जोड़ने से यह सीधे 2.16% तक पहुँच गया।
निष्कर्ष
पेपर सुझाव देता है कि प्रशिक्षण के दौरान "मेमोरी डाइट" को मॉडल बनाने के बाद "ट्रिगर डिटेक्टिव" के साथ जोड़कर, हम भित्ति चित्र को खराब किए बिना उसे प्रभावी ढंग से साफ कर सकते हैं।
इन विशिष्ट सिमुलेशन में, यह विधि अविश्वसनीय रूप से अच्छी तरह से काम करती है, लगभग 100% सफल हमले को लगभग शून्य सफलता दर में बदल देती है जबकि मॉडल को अपना काम करने के लिए पर्याप्त स्मार्ट बनाए रखती है। लेकिन लेखक ईमानदार हैं: यह तब सबसे अच्छा काम करता है जब हमें पता हो कि ज़हर कैसा दिखता है। यदि ज़हर अपना आकार बदल लेता है, तो हमें एक नए प्रकार के डिटेक्टिव की आवश्यकता हो सकती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।