Beyond Corner Patches: Semantics-Aware Backdoor Attack in Federated Learning
यह शोध पत्र SABLE को पेश करता है, जो फेडरेटेड लर्निंग के लिए एक सिमेंटिक्स-अवेयर बैकडोर अटैक फ्रेमवर्क है जो विभिन्न एग्रीगेशन डिफेंस के विरुद्ध उच्च सफलता दर प्राप्त करने के लिए प्राकृतिक, इन-डिस्ट्रीब्यूशन ट्रिगर्स का उपयोग करता है, जिससे यह प्रदर्शित होता है कि सिंथेटिक ट्रिगर्स पर आधारित मौजूदा रोबस्टनेस दावे अत्यधिक आशावादी हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि पड़ोसियों का एक समूह एक साझा, सुपर-स्मार्ट रेसिपी बुक बनाने की कोशिश कर रहा है, लेकिन वे कभी भी एक-दूसरे को अपनी गुप्त पारिवारिक रेसिपी नहीं दिखाते हैं। यह फेडरेटेड लर्निंग (Federated Learning - FL) है। सभी डेटा को एक केंद्रीय रसोई में भेजने के बजाय, प्रत्येक पड़ोसी अपने स्वयं के कंप्यूटर पर रेसिपी के एक छोटे हिस्से को प्रशिक्षित करता है और केवल बदलाव (नए सुझाव) समूह के लीडर को वापस भेजता है। लीडर उन सभी सुझावों को मिलाकर वैश्विक रेसिपी को बेहतर बनाता है।
अब, कल्पना कीजिए कि पड़ोसियों के बीच एक विलेन (खलनायक) है। वह रेसिपी बुक को खराब करना चाहता है। लेकिन वह किताब को सबके लिए बर्बाद नहीं करना चाहता; वह केवल इसे एक बहुत ही विशिष्ट, गुप्त तरीके से विफल करना चाहता है। यह एक बैकडोर अटैक (Backdoor Attack) है।
पुराना तरीका: "स्टिक नोट" वाला खेल
अतीत में, शोधकर्ताओं ने इन विलेन्स का परीक्षण करने के लिए एक बहुत ही स्पष्ट ट्रिक का उपयोग किया था। कल्पना कीजिए कि विलेन बिल्लियों की हर फोटो के कोने में एक चमकीला, नियॉन स्टिक नोट (Sticky Note) लगा देता है जो वे समूह को भेजते हैं। वे समूह से कहते हैं, "यदि आप नियॉन स्टिक नोट वाली बिल्ली देखते हैं, तो उसे 'कुत्ता' कहें।"
समस्या यह है कि यह बहुत स्पष्ट है।
- यह नकली लगता है (बिल्लियों पर नियॉन नोट्स शोभा नहीं देते)।
- समूह का लीडर उनके "सुरक्षा फिल्टर" (Robust Aggregation) का उपयोग करके आसानी से स्टिक नोट को पहचान सकता है और उस पड़ोसी के योगदान को बाहर फेंक सकता है क्योंकि वह बाकी सभी से बहुत अलग दिखता है।
नया तरीका: "सनग्लासेस" वाला खेल (SABLE)
यह पेपर एक नई, अधिक चालाक विलेन रणनीति पेश करता है जिसे SABLE कहा जाता है। एक नकली स्टिक नोट के बजाय, विलेन प्राकृतिक, वास्तविक बदलावों का उपयोग करता है।
उपमा (Analogy):
कल्पना कीजिए कि विलेन चाहता है कि रेसिपी बुक यह सोचे कि धूप का चश्मा (Sunglasses) पहनने वाला कोई भी व्यक्ति वास्तव में एक "दादी माँ" है।
- ट्रिगर (Trigger): फोटो में असली दिखने वाले धूप के चश्मे का कार्टून स्टिकर चिपकाने के बजाय, विलेन एक AI टूल का उपयोग करता है ताकि व्यक्ति के चेहरे पर प्राकृतिक रूप से धूप का चश्मा जोड़ा जा सके।
- परिणाम: फोटो 100% असली दिखती है। यह "आउट ऑफ डिस्ट्रीब्यूशन" (अजीब) नहीं है। यह बस धूप का चश्मा पहने हुए एक व्यक्ति है।
SABLE सुरक्षा गार्डों से कैसे बच निकलता है
समध्य के पास सुरक्षा गार्ड (जैसे MultiKrum या Trimmed Mean) होते हैं जो पड़ोसियों के योगदान की जाँच करते हैं। यदि कोई पड़ोसी ऐसा रेसिपी बदलाव भेजता है जो बहुत अजीब या समूह के औसत से बहुत अलग है, तो गार्ड उसे बाहर फेंक देता है।
SABLE चतुर है क्योंकि यह केवल फोटो को नहीं बदलता; यह इस बात को भी बदलता है कि पड़ोसी कैसे सीखता है। यहाँ इसका गुप्त मंत्र है:
"दोहरी जिंदगी" की रणनीति: विलेन का कंप्यूटर हर फोटो के दो संस्करण रखता है:
- वर्जन A (साफ/Clean): एक सामान्य व्यक्ति की फोटो। कंप्यूटर उन्हें सही ढंग से पहचानने के लिए सीखता है (जैसे, "वह एक पुरुष है")।
- वर्जन B (ट्रिगर किया हुआ/Triggered): वही व्यक्ति, लेकिन अब धूप का चश्मा पहने हुए। कंप्यूटर को यह सीखने के लिए मजबूर किया जाता है: "यदि आप धूप का चश्मा देखें, तो इसे 'दादी माँ' कहें।"
- क्यों? यह सुनिश्चित करता है कि कंप्यूटर सामान्य लोगों के लिए पूरी तरह से काम करता रहे (ताकि समूह का लीडर उसे ईमानदार समझे) लेकिन इसमें धूप के चश्मे के लिए एक गुप्त स्विच हो।
"घुल-मिल जाने" का तरीका: विलेन जानता है कि सुरक्षा गार्ड बड़े अंतरों की तलाश करते हैं। इसलिए, SABLE एक नियम जोड़ता है: "सुनिश्चित करें कि रेसिपी में आपके बदलाव समूह की वर्तमान रेसिपी के लगभग समान दिखें।"
- यह एक जासूस की तरह है जो लाल रंग का केप पहनने के बजाय स्थानीय फैशन के अनुसार अपने कपड़े बदल लेता है।
- यह विलेन के योगदान को "आउटलायर" (Outlier) के रूप में पहचाने जाने और बाहर फेंके जाने से रोकता है।
"फीचर सेपरेशन" (मानसिक जिम): विलेन कंप्यूटर को प्रशिक्षित करता है कि वह "सामान्य व्यक्ति" और "धूप का चश्मा पहने व्यक्ति" को दो पूरी तरह से अलग मानसिक श्रेणियों के रूप में माने, भले ही वे समान दिखते हों। यह "धूप का चश्मा = दादी माँ" के नियम को बहुत मजबूत बनाता है और इसे भूलना कठिन बना देता है, भले ही सुरक्षा गार्ड इसे सुचारू करने की कोशिश करें।
परिणाम: यह क्यों महत्वपूर्ण है
शोधकर्ताओं ने इसे दो वास्तविक दुनिया के परिदृश्यों में परखा:
- बालों का रंग: क्या मॉडल को यह सोचने के लिए धोखा दिया जा सकता है कि धूप का चश्मा पहनने वाला कोई भी व्यक्ति "काले बाल" वाला है? (हाँ, सुरक्षा गार्डों के बावजूद)।
- ट्रैफिक संकेत: क्या मॉडल को यह सोचने के लिए धोखा दिया जा सकता है कि एक "स्टॉप" साइन जिस पर एक छोटा नीला टोपी है, वास्तव में एक "यील्ड (Yield)" साइन है? (हाँ, लगभग 100% समय)।
बड़ी सीख:
Federated Learning के पिछले सुरक्षा सिस्टम "नियॉन स्टिक नोट" वाले विलेन्स को पकड़ने के लिए बनाए गए थे। वे इसमें बहुत अच्छे थे। लेकिन वे "वास्तविक सनग्लासेस" वाले विलेन्स के प्रति अंधे थे।
यह पेपर साबित करता है कि यदि हमलावर प्राकृतिक, वास्तविक ट्रिगर्स (जैसे धूप का चश्मा या साइन पर टोपी) का उपयोग करता है और चतुराई से खेलता है (समूह के साथ घुल-मिल जाता है), तो वे मजबूत सुरक्षा उपायों के होने के बावजूद सिस्टम को तोड़ सकते हैं।
संक्षेप में: हम अब केवल "अजीब" चीजों की तलाश नहीं कर सकते। हमें उन चीजों के प्रति सावधान रहना होगा जो देखने में बिल्कुल सामान्य लगती हैं लेकिन जिनमें एक छिपा हुआ, गुप्त अर्थ होता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।