← नवीनतम पेपर
💬 NLP

Defending against Backdoor Attacks via Module Switching

यह शोध पत्र मॉड्यूल स्विचिंग डिफेंस (MSD) का प्रस्ताव करता है, जो एक नवीन पोस्ट-ट्रेनिंग रणनीति है जो एक इवोल्यूशनरी एल्गोरिदम के माध्यम से मॉडल मॉड्यूल्स को चुनिले ढंग से फ्यूज करके बैकडोर हमलों को बाधित करती है, जो वेट एवरेजिंग की तुलना में बेहतर मजबूती और उपयोगिता संरक्षण प्रदर्शित करता है, विशेष रूप से सीमित मॉडलों या मिलीभगत वाले बैकडोर्स वाले परिदृश्यों में।

मूल लेखक: Weijun Li, Ansh Arora, Xuanli He, Mark Dras, Qiongkai Xu

प्रकाशित 2026-04-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Weijun Li, Ansh Arora, Xuanli He, Mark Dras, Qiongkai Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने अभी-अभी एक बिल्कुल नया, हाई-टेक स्मार्ट टोस्टर खरीदा है। यह हर बार आपकी ब्रेड को पूरी तरह से टोस्ट करने के लिए बनाया गया है। लेकिन आपको यह नहीं पता कि जिस फैक्ट्री ने इसे बनाया है, उसमें एक शरारती तत्व (prankster) घुस आया है। उन्होंने एक गुप्त "बैकडोर" (backdoor) स्थापित कर दिया है: यदि आप ब्रेड डालते समय "banana" शब्द फुसफुसाते हैं, तो टोस्टर केवल ब्रेड को टोस्ट नहीं करेगा; बल्कि वह आपकी रसोई की दीवार पर एक आग का गोला (fireball) छोड़ेगा।

AI (आर्टिफिशियल इंटेलिजेंस) में बैकडोर अटैक्स (Backdoor Attacks) के साथ बिल्कुल यही होता है। हैकर्स AI मॉडल्स (जैसे कि यह स्मार्ट टोस्टर) के प्रशिक्षण के दौरान उनमें छोटे, छिपे हुए ट्रिगर्स डाल देते हैं। AI 99% समय सामान्य रूप से काम करता है, लेकिन यदि कोई विशिष्ट ट्रिगर दिखाई देता है, तो यह कुछ हानिकारक करता है।

समस्या यह है कि जब तक आपको AI मिलता है, तब तक उसका प्रशिक्षण पहले ही पूरा हो चुका होता है। आपके पास मूल "रेसिपी" या साफ सामग्री नहीं होती जिसे आप ठीक कर सकें। आपके पास केवल तैयार उत्पाद होता है, और आपको यह भी नहीं पता होता कि कौन सा हिस्सा खराब है।

पुराना तरीका: "स्मूदी" की समस्या (The "Smoothie" Problem)

पहले, विशेषज्ञ एक ही AI के कई अलग-अलग संस्करणों (शायद अलग-अलग फैक्ट्रियों से) को लेकर उन्हें आपस में मिलाने की कोशिश करते थे, जैसे कि स्मूदी बनाना। वे सभी मॉडल्स के वेट्स (weights - आंतरिक सेटिंग्स) का औसत निकालते थे।

उपमा (Analogy): कल्पना कीजिए कि आपके पास एक ही शहर के तीन अलग-अलग नक्शे हैं। एक नक्शे में एक नकली रास्ता है जो जाल की ओर ले जाता है। दूसरे नक्शे में एक अलग नकली रास्ता है। यदि आप उन तीनों नक्शों का औसत लेते हैं, तो वे नकली रास्ते एक-दूसरे को रद्द कर सकते हैं, जिससे आपको एक लगभग सही नक्शा मिल जाता है।

खामी: यह "स्मूदी" दृष्टिकोण (जिसे Weight Averaging कहा जाता है) तब ठीक काम करता है जब आपके पास कई नक्शे हों और उन सभी में अलग-अलग नकली रास्ते हों। लेकिन क्या होगा यदि:

  1. आपके पास केवल दो नक्शे हों?
  2. दोनों नक्शे एक ही शरारती व्यक्ति द्वारा बनाए गए हों और उनमें एक ही नकली रास्ता हो?

ऐसे मामलों में, औसत निकालने से वह नकली रास्ता भी औसत बन जाता है, और आप फिर भी फंस जाते हैं। यह वैसा ही है जैसे दो नक्शों का औसत निकालना जिनमें दोनों कहते हैं "बम के पास बाएं मुड़ें"; औसत अभी भी कहता है "बाएं मुड़ें"।

नया समाधान: "मॉड्यूलर स्वैप" (MSD)

यह पेपर एक चतुर नया बचाव प्रस्तावित करता है जिसे मॉड्यूल स्विचिंग डिफेंस (Module Switching Defense - MSD) कहा जाता है। मॉडल्स को स्मूदी की तरह मिलाने के बजाय, वे एक मैकेनिक की तरह काम करते हैं जो कार के इंजन के पुर्जों को बदल रहा है।

उपमा:
कल्पना कीजिए कि AI एक जटिल कार इंजन है जिसमें कई भाग हैं: पिस्टन, स्पार्क प्लग, फ्यूल इंजेक्टर और गियर।

  • बैकडोर: शरारती व्यक्ति ने पूरे इंजन को नहीं तोड़ा है; उन्होंने बस मॉडल A में एक विशिष्ट स्पार्क प्लग और मॉडल B में एक विशिष्ट गियर के साथ छेड़छाड़ की है।
  • चाल (The Trick): शरारती व्यक्ति दो अलग-अलग मॉडल्स में शायद ही कभी बिल्कुल एक ही हिस्से के साथ छेड़छाड़ करता है। मॉडल A में, खराब हिस्सा स्पार्क प्लग है। मॉडल B में, खराब हिस्सा गियर है।
  • समाधान: पूरे इंजन को औसत निकालने के बजाय, हम मॉडल B से अच्छे स्पार्क प्लग को लेते हैं और उसे मॉडल A में बदल देते हैं। फिर हम मॉडल A से अच्छे गियर को लेते हैं और उसे मॉडल B में बदल देते हैं।

इन विशिष्ट "मॉड्यूल्स" (पुर्जों) को मॉडल्स के बीच बदलकर, हम उस गुप्त रास्ते को तोड़ देते जिसे हैकर ने बनाया था। वह "शॉर्टकट" जिसे हैकर ने बनाया था, वह कट जाता है क्योंकि वह हिस्सा जो आग का गोला छोड़ने के लिए जिम्मेदार था, अब दूसरे मॉडल के साफ हिस्से से बदल दिया गया है।

उन्हें पता कैसे चलता है कि किन हिस्सों को बदलना है?

आप पुर्जों को मनमाने ढंग से नहीं बदल सकते; आप इंजन को खराब कर सकते हैं। लेखकों ने यह पता लगाने के लिए कि पुर्जों को सबसे अच्छे तरीके से कैसे बदला जाए, एक स्मार्ट कंप्यूटर प्रोग्राम (इवोल्यूशनरी एल्गोरिदम - Evolutionary Algorithm) का उपयोग किया।

इसे टेट्रिस (Tetris) या पहेली (Puzzle) के खेल की तरह समझें:

  1. कंप्यूटर पुर्जों को बदलने के हजारों तरीके आजमाता है।
  2. इसके पास गड़बड़ी से बचने के लिए नियमों का एक सेट (Heuristics) है, जैसे "एक ही खराब मॉडल के दो हिस्सों को एक साथ न रखें।"
  3. यह उन संयोजनों को रखता है जो सबसे अधिक "स्वस्थ" दिखते हैं और संदिग्ध दिखने वाले संयोजनों को हटा देता है।
  4. अंत में, यह सबसे अच्छे "फ्रेंकेंस्टीन" (Frankenstein) इंजन को चुनता है जो सामान्य कार्यों के लिए पूरी तरह से काम करता है लेकिन जिसमें कोई बैकडोर नहीं बचा है।

यह बेहतर क्यों है?

  1. कम मॉडल्स के साथ काम करता है: समस्या को ठीक करने के लिए आपको केवल दो मॉडल्स की आवश्यकता है। आपको मॉडल्स के बेड़े की आवश्यकता नहीं है।
  2. "कोल्यूसिव" हमलों को हराता है (Beats "Collusive" Attacks): भले ही दो मॉडल्स एक ही हैकर द्वारा बनाए गए हों और उनमें एक ही बैकडोर हो, यह तरीका कनेक्शन को तोड़ने के तरीके से इतना स्मार्ट है, जबकि पुराना "स्मूदी" तरीका विफल हो जाएगा।
  3. AI को स्मार्ट बनाए रखता है: सबसे महत्वपूर्ण बात यह है कि AI अपना काम करता रहता है। यह अभी भी ब्रेड को पूरी तरह से टोस्ट करता है; यह बस आग के गोले छोड़ना बंद कर देता है। इसकी "यूटिलिटी" (उपयोगिता) सुरक्षित रहती है।

निष्कर्ष (The Bottom Line)

यह पेपर एक तरीका पेश करता है जिससे AI मॉडल्स को उनके बनने के बाद "सैनिटाइज" (साफ) किया जा सकता है, बिना उनके मूल प्रशिक्षण डेटा को देखे। AI मॉडल्स को मॉड्यूलर लेगो सेट्स की तरह मानकर और उनके संदिग्ध ईंटों को पड़ोसी के सेट के साफ ईंटों से बदलकर, हम एक मजबूत, सुरक्षित AI बना सकते हैं जो सुरक्षित रूप से उपयोग करने योग्य है, भले ही हमें यह न पता हो कि हैकर्स ने अपने जाल कहाँ छिपाए हैं।

यह एक मास्टर मैकेनिक की तरह है जो दो थोड़े खराब कारों को देख सकता है, उनके विशिष्ट खराब पुर्जों को बदल सकता है, और तुरंत दो बिल्कुल नई, सुरक्षित कारें बना सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →