Rethinking Backdoor Adversarial Unlearning through the Lens of Catastrophic Forgetting in Continual Learning
यह शोध पत्र ब्लाइंड इनवर्जन-बैकडोर एडवर्सरियल अनलर्निंगिंग (BI-BAU) का प्रस्ताव करता है, जो एक नवीन विधि है जो बैकडोर अनलर्निंग को एक निरंतर शिक्षण (continual learning) समस्या के रूप में पुनर्गठित करती है ताकि एक एक्सपेक्टेशन-मैक्सिमाइजेशन एल्गोरिदम के साथ एकीकृत एक द्वि-स्तरीय अनुकूलन ढांचे के माध्यम से कैटास्ट्रोफिक फॉरगेटिंग तंत्र का लाभ उठाकर पूर्ण बैकडोर उन्मूलन प्राप्त किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ एक सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करके पेपर का विवरण दिया गया है।
समस्या: एक स्मार्ट मशीन में "छिपा हुआ स्विच"
कल्पना कीजिए कि आपने एक बहुत ही स्मार्ट रोबोट सहायक खरीदा है जिसे एक थर्ड-पार्टी कंपनी ने बनाया है। आप चाहते हैं कि वह आपकी तस्वीरों को छाँटने (एक "साफ कार्य" या "clean task") में मदद करे। हालाँकि, एक हैकर ने रोबोट के प्रशिक्षण के दौरान उसके दिमाग के अंदर एक छिपा हुआ स्विच (एक "बैकडोर") गुप्त रूप से स्थापित कर दिया है।
- सामान्य व्यवहार: यदि आप रोबोट को बिल्ली की तस्वीर दिखाते हैं, तो वह सही ढंग से कहता है "बिल्ली"।
- बैकडोर व्यवहार: यदि आप रोबोट को बिल्ली की एक ऐसी तस्वीर दिखाते हैं जिस पर एक छोटा सा, अदृश्य स्टिकर लगा हो (जिसे "ट्रिगर" कहा जाता है), तो रोबोट अचानक बिल्ली को अनदेखा कर देता है और चिल्लाने लगता है "यह एक टोस्टर है!"
डरावनी बात यह है कि रोबोट उस एक विशेष ट्रिक के अलावा बाकी सब कुछ के लिए बिल्कुल सही काम करता है।
वर्तमान समाधान: "सतही चमक" (The Superficial Polish)
वैज्ञानिकों ने इन हैक किए गए रोबोटों को "सेफ्टी ट्यूनिंग" का उपयोग करके ठीक करने की कोशिश की है। इसे ऐसे समझें जैसे कोई मैकेनिक रोबोट के दिमाग को साफ करने की कोशिश कर रहा हो। वे स्पष्ट गंदगी को रगड़कर साफ करते हैं और सतह को चमकाते हैं।
पेपर की खोज: लेखकों ने पाया कि ये वर्तमान सफाई के तरीके गंदे कपड़े से खिड़की पोंछने जैसे हैं। वे रोबट को दिखने में सुरक्षित बनाते हैं, लेकिन वे वास्तव में छिपे हुए स्विच को नहीं हटाते। स्विच अभी भी वहीं है, बस गहराई में दब गया है। यदि हैकर वापस आता है और रोबोट को एक हल्का सा धक्का देता है (एक "रिट्यूनिंग अटैक"), तो छिपा हुआ स्विच फिर से चालू हो जाता है, और रोबोट चिल्लाना शुरू कर देता है "टोस्टर!"
नया विचार: "कैटास्ट्रोफिक फॉरगेटिंग" एक सुपरपावर के रूप में
लेखकों ने इस समस्या को कंटीन्यूअल लर्निंग (Continual Learning) के नजरिए से देखने का निर्णय लिया। इस क्षेत्र में, शोधकर्ता अध्ययन करते हैं कि AI कैसे नई चीजें सीखता है और कभी-कभी पुरानी चीजें भूल जाता है। इसे कैटास्ट्रोफिक फॉरगेटिंग (Catastrophic Forgetting) कहा जाता है (जो आमतौर पर एक बुरी चीज़ के रूप में देखी जाती है, जैसे इतिहास सीखने के बाद छात्र का गणित भूल जाना)।
लेखकों के पास एक शानदार विचार था: क्या हम "भूलने" का उपयोग जानबूझकर कर सकते हैं?
वे रोबोट के दिमाग को तीन चरणों वाली स्मृति (memory) के रूप में देखते हैं:
- स्वच्छ स्मृति (Clean Memory): बिल्लियों और कुत्तों को छाँटने का ज्ञान।
- विषाक्त स्मृति (Poisoned Memory): बिल्लियों को टोस्टर में बदलने की गुप्त ट्रिक सीखना।
- अनलर्निंग टास्क (Unlearning Task): एक नया सबक जिसे विशेष रूप से रोबोट को वह ट्रिक भुलवाने के लिए डिज़ाइन किया गया है, बिना बिल्ली को छाँटने का तरीका भुलाए।
समाधान: BI-BAU (द "ब्लाइंड इनवर्जन" ट्रिक)
लेखकों ने BI-BAU (Blind Inversion-Backdoor Adversarial Unlearning) नामक एक नया तरीका बनाया। यह कैसे काम करता है, इसके लिए एक उपमा देखें:
कल्पना कीजिए कि रोबोट का दिमाग एक जटिल भूलभुलैया (maze) है। "बैकडोर" एक गुप्त सुरंग है जो गलत निकास (exit) की ओर ले जाती है। समस्या यह है कि रक्षक (वह व्यक्ति जो रोबोट को ठीक कर रहा है) के पास गुप्त सुरंग का कोई नक्शा नहीं है; उनके पास केवल रोबोट और कुछ साफ उदाहरण हैं।
BI-BAU एक "रिवर्स इंजीनियरिंग डिटेक्टिव" की तरह काम करता है:
- "ब्लाइंड" अनुमान: चूंकि रक्षक को ठीक से पता नहीं है कि गुप्त सुरंग कैसी दिखती है, इसलिए वे एक "ब्लाइंड" अनुमान लगाते हैं। वे रोबोट से पूछते हैं: "यदि मैं इस तस्वीर को थोड़ा सा बदल दूँ, तो क्या तुम अभी भी इसे बिल्ली के रूप में पहचान सकते हो, लेकिन क्या तुम अपने हैक किए गए संस्करण को यह सोचने पर मजबूर कर सकते हो कि यह एक टोस्टर है?"
- "इनवर्जन" (Inversion): यह तरीका उस सटीक बदलाव (perturbation) को खोजने की कोशिश करता है जो रोबोट को छिपी हुई सुरंग प्रकट करने के लिए मजबूर करता है। यह उस सटीक चाबी को खोजने जैसा है जो उस ताले को खोलती है जिसे आपने पहले कभी नहीं देखा, ताले के अंदर के हिस्सों को महसूस करके।
- "भूलने" का सबक: एक बार जब वे उस विशिष्ट बदलाव को पा लेते हैं, तो वे रोबट को एक नया सबक सिखाने के लिए इसका उपयोग करते हैं। यह सबक बैकडोर के विपरीत (opposite) होने के लिए डिज़ाइन किया गया है (रोबोट को "टोस्टर" निकास से दूर धकेलना) लेकिन ऑर्थोगोनल (orthogonal - यानी लंबवत) है स्वच्छ कार्य के प्रति (ताकि यह "बिल्ली" छाँटने के काम में बाधा न डाले)।
इसे ऐसे समझें: यदि बैकडोर उत्तर (North) की ओर जाने वाला रास्ता है, और स्वच्छ कार्य पूर्व (East) की ओर जाने वाला रास्ता है, तो नया सबक रोबोट को दक्षिण (South) की ओर धकेलता है। यह उत्तर वाले रास्ते को पूरी तरह से रद्द कर देता है, लेकिन क्योंकि दक्षिण, पूर्व के लंबवत (perpendicular) है, रोबोट पूर्व की ओर जाने की अपनी क्षमता नहीं खोता है।
यह बेहतर क्यों है
लेखकों ने कई अलग-अलग प्रकार के "हैक्स" के खिलाफ इस पद्धति का परीक्षण किया, जिनमें से कुछ बहुत ही चालाकी भरे और पता लगाने में कठिन (लो ऑर्थोगोनैलिटी अटैक्स) हैं।
- पुराने तरीके: लीक होती नाव से पानी बाहर निकालने की कोशिश करने जैसा है। यह कुछ समय के लिए काम करता है, लेकिन छेद अभी भी वहीं रहता है।
- BI-BAU: छेद को खोजने और उसे अंदर से बंद करने जैसा है।
परिणाम बताते हैं कि BI-BAU केवल रोबोट को सुरक्षित दिखाता नहीं है; यह वास्तव में छिपे हुए स्विच को हटा देता है। भले ही कोई हैकर बाद में बैकडोर को फिर से सक्रिय करने की कोशिश करे, रोबोट सुरक्षित रहता है। यह बुरी ट्रिक को पूरी तरह से "भूलने" में सफल होता है जबकि अच्छे काम को याद रखता है।
सारांश
लेखकों ने महसूस किया कि वर्तमान सुरक्षा सुधार केवल एक "फेसलिफ्ट" (ऊपरी दिखावा) हैं। उन्होंने हैक किए गए AI को ठीक करने का एक नया तरीका प्रस्तावित किया, जिसमें बैकडोर को एक विशिष्ट स्मृति के रूप में देखा जाता है जिसे चयनात्मक रूप से मिटाने (selectively erase) की आवश्यकता है। "ब्लाइंड इनवर्जन" नामक गणितीय ट्रिक का उपयोग करके, वे AI को दुर्भावनापूर्ण व्यवहार को पूरी तरह से भूलने के लिए मजबूर कर सकते हैं, भले ही उन्हें यह भी न पता हो कि वह दुर्भावनापूर्ण व्यवहार वास्तव में कैसा दिखता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।