← नवीनतम पेपर
🤖 machine learning

Rethinking Backdoor Adversarial Unlearning through the Lens of Catastrophic Forgetting in Continual Learning

यह शोध पत्र ब्लाइंड इनवर्जन-बैकडोर एडवर्सरियल अनलर्निंगिंग (BI-BAU) का प्रस्ताव करता है, जो एक नवीन विधि है जो बैकडोर अनलर्निंग को एक निरंतर शिक्षण (continual learning) समस्या के रूप में पुनर्गठित करती है ताकि एक एक्सपेक्टेशन-मैक्सिमाइजेशन एल्गोरिदम के साथ एकीकृत एक द्वि-स्तरीय अनुकूलन ढांचे के माध्यम से कैटास्ट्रोफिक फॉरगेटिंग तंत्र का लाभ उठाकर पूर्ण बैकडोर उन्मूलन प्राप्त किया जा सके।

मूल लेखक: Zhenqian Zhu, Yamin Hu, Yujiang Liu, Luping Wei, Wenbo Hou, Bin Li, Haodong Li, Wenjian Luo

प्रकाशित 2026-06-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhenqian Zhu, Yamin Hu, Yujiang Liu, Luping Wei, Wenbo Hou, Bin Li, Haodong Li, Wenjian Luo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ एक सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करके पेपर का विवरण दिया गया है।

समस्या: एक स्मार्ट मशीन में "छिपा हुआ स्विच"

कल्पना कीजिए कि आपने एक बहुत ही स्मार्ट रोबोट सहायक खरीदा है जिसे एक थर्ड-पार्टी कंपनी ने बनाया है। आप चाहते हैं कि वह आपकी तस्वीरों को छाँटने (एक "साफ कार्य" या "clean task") में मदद करे। हालाँकि, एक हैकर ने रोबोट के प्रशिक्षण के दौरान उसके दिमाग के अंदर एक छिपा हुआ स्विच (एक "बैकडोर") गुप्त रूप से स्थापित कर दिया है।

  • सामान्य व्यवहार: यदि आप रोबोट को बिल्ली की तस्वीर दिखाते हैं, तो वह सही ढंग से कहता है "बिल्ली"।
  • बैकडोर व्यवहार: यदि आप रोबोट को बिल्ली की एक ऐसी तस्वीर दिखाते हैं जिस पर एक छोटा सा, अदृश्य स्टिकर लगा हो (जिसे "ट्रिगर" कहा जाता है), तो रोबोट अचानक बिल्ली को अनदेखा कर देता है और चिल्लाने लगता है "यह एक टोस्टर है!"

डरावनी बात यह है कि रोबोट उस एक विशेष ट्रिक के अलावा बाकी सब कुछ के लिए बिल्कुल सही काम करता है।

वर्तमान समाधान: "सतही चमक" (The Superficial Polish)

वैज्ञानिकों ने इन हैक किए गए रोबोटों को "सेफ्टी ट्यूनिंग" का उपयोग करके ठीक करने की कोशिश की है। इसे ऐसे समझें जैसे कोई मैकेनिक रोबोट के दिमाग को साफ करने की कोशिश कर रहा हो। वे स्पष्ट गंदगी को रगड़कर साफ करते हैं और सतह को चमकाते हैं।

पेपर की खोज: लेखकों ने पाया कि ये वर्तमान सफाई के तरीके गंदे कपड़े से खिड़की पोंछने जैसे हैं। वे रोबट को दिखने में सुरक्षित बनाते हैं, लेकिन वे वास्तव में छिपे हुए स्विच को नहीं हटाते। स्विच अभी भी वहीं है, बस गहराई में दब गया है। यदि हैकर वापस आता है और रोबोट को एक हल्का सा धक्का देता है (एक "रिट्यूनिंग अटैक"), तो छिपा हुआ स्विच फिर से चालू हो जाता है, और रोबोट चिल्लाना शुरू कर देता है "टोस्टर!"

नया विचार: "कैटास्ट्रोफिक फॉरगेटिंग" एक सुपरपावर के रूप में

लेखकों ने इस समस्या को कंटीन्यूअल लर्निंग (Continual Learning) के नजरिए से देखने का निर्णय लिया। इस क्षेत्र में, शोधकर्ता अध्ययन करते हैं कि AI कैसे नई चीजें सीखता है और कभी-कभी पुरानी चीजें भूल जाता है। इसे कैटास्ट्रोफिक फॉरगेटिंग (Catastrophic Forgetting) कहा जाता है (जो आमतौर पर एक बुरी चीज़ के रूप में देखी जाती है, जैसे इतिहास सीखने के बाद छात्र का गणित भूल जाना)।

लेखकों के पास एक शानदार विचार था: क्या हम "भूलने" का उपयोग जानबूझकर कर सकते हैं?

वे रोबोट के दिमाग को तीन चरणों वाली स्मृति (memory) के रूप में देखते हैं:

  1. स्वच्छ स्मृति (Clean Memory): बिल्लियों और कुत्तों को छाँटने का ज्ञान।
  2. विषाक्त स्मृति (Poisoned Memory): बिल्लियों को टोस्टर में बदलने की गुप्त ट्रिक सीखना।
  3. अनलर्निंग टास्क (Unlearning Task): एक नया सबक जिसे विशेष रूप से रोबोट को वह ट्रिक भुलवाने के लिए डिज़ाइन किया गया है, बिना बिल्ली को छाँटने का तरीका भुलाए।

समाधान: BI-BAU (द "ब्लाइंड इनवर्जन" ट्रिक)

लेखकों ने BI-BAU (Blind Inversion-Backdoor Adversarial Unlearning) नामक एक नया तरीका बनाया। यह कैसे काम करता है, इसके लिए एक उपमा देखें:

कल्पना कीजिए कि रोबोट का दिमाग एक जटिल भूलभुलैया (maze) है। "बैकडोर" एक गुप्त सुरंग है जो गलत निकास (exit) की ओर ले जाती है। समस्या यह है कि रक्षक (वह व्यक्ति जो रोबोट को ठीक कर रहा है) के पास गुप्त सुरंग का कोई नक्शा नहीं है; उनके पास केवल रोबोट और कुछ साफ उदाहरण हैं।

BI-BAU एक "रिवर्स इंजीनियरिंग डिटेक्टिव" की तरह काम करता है:

  1. "ब्लाइंड" अनुमान: चूंकि रक्षक को ठीक से पता नहीं है कि गुप्त सुरंग कैसी दिखती है, इसलिए वे एक "ब्लाइंड" अनुमान लगाते हैं। वे रोबोट से पूछते हैं: "यदि मैं इस तस्वीर को थोड़ा सा बदल दूँ, तो क्या तुम अभी भी इसे बिल्ली के रूप में पहचान सकते हो, लेकिन क्या तुम अपने हैक किए गए संस्करण को यह सोचने पर मजबूर कर सकते हो कि यह एक टोस्टर है?"
  2. "इनवर्जन" (Inversion): यह तरीका उस सटीक बदलाव (perturbation) को खोजने की कोशिश करता है जो रोबोट को छिपी हुई सुरंग प्रकट करने के लिए मजबूर करता है। यह उस सटीक चाबी को खोजने जैसा है जो उस ताले को खोलती है जिसे आपने पहले कभी नहीं देखा, ताले के अंदर के हिस्सों को महसूस करके।
  3. "भूलने" का सबक: एक बार जब वे उस विशिष्ट बदलाव को पा लेते हैं, तो वे रोबट को एक नया सबक सिखाने के लिए इसका उपयोग करते हैं। यह सबक बैकडोर के विपरीत (opposite) होने के लिए डिज़ाइन किया गया है (रोबोट को "टोस्टर" निकास से दूर धकेलना) लेकिन ऑर्थोगोनल (orthogonal - यानी लंबवत) है स्वच्छ कार्य के प्रति (ताकि यह "बिल्ली" छाँटने के काम में बाधा न डाले)।

इसे ऐसे समझें: यदि बैकडोर उत्तर (North) की ओर जाने वाला रास्ता है, और स्वच्छ कार्य पूर्व (East) की ओर जाने वाला रास्ता है, तो नया सबक रोबोट को दक्षिण (South) की ओर धकेलता है। यह उत्तर वाले रास्ते को पूरी तरह से रद्द कर देता है, लेकिन क्योंकि दक्षिण, पूर्व के लंबवत (perpendicular) है, रोबोट पूर्व की ओर जाने की अपनी क्षमता नहीं खोता है।

यह बेहतर क्यों है

लेखकों ने कई अलग-अलग प्रकार के "हैक्स" के खिलाफ इस पद्धति का परीक्षण किया, जिनमें से कुछ बहुत ही चालाकी भरे और पता लगाने में कठिन (लो ऑर्थोगोनैलिटी अटैक्स) हैं।

  • पुराने तरीके: लीक होती नाव से पानी बाहर निकालने की कोशिश करने जैसा है। यह कुछ समय के लिए काम करता है, लेकिन छेद अभी भी वहीं रहता है।
  • BI-BAU: छेद को खोजने और उसे अंदर से बंद करने जैसा है।

परिणाम बताते हैं कि BI-BAU केवल रोबोट को सुरक्षित दिखाता नहीं है; यह वास्तव में छिपे हुए स्विच को हटा देता है। भले ही कोई हैकर बाद में बैकडोर को फिर से सक्रिय करने की कोशिश करे, रोबोट सुरक्षित रहता है। यह बुरी ट्रिक को पूरी तरह से "भूलने" में सफल होता है जबकि अच्छे काम को याद रखता है।

सारांश

लेखकों ने महसूस किया कि वर्तमान सुरक्षा सुधार केवल एक "फेसलिफ्ट" (ऊपरी दिखावा) हैं। उन्होंने हैक किए गए AI को ठीक करने का एक नया तरीका प्रस्तावित किया, जिसमें बैकडोर को एक विशिष्ट स्मृति के रूप में देखा जाता है जिसे चयनात्मक रूप से मिटाने (selectively erase) की आवश्यकता है। "ब्लाइंड इनवर्जन" नामक गणितीय ट्रिक का उपयोग करके, वे AI को दुर्भावनापूर्ण व्यवहार को पूरी तरह से भूलने के लिए मजबूर कर सकते हैं, भले ही उन्हें यह भी न पता हो कि वह दुर्भावनापूर्ण व्यवहार वास्तव में कैसा दिखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →