← नवीनतम पेपर
🤖 machine learning

Perturb and Recover: Fine-tuning for Effective Backdoor Removal from CLIP

यह शोध पत्र "पर्टर्ब एंड रिकवर" (PAR) को प्रस्तुत करता है, जो एक सरल लेकिन प्रभावी फाइन-ट्यूनिंग विधि है जो CLIP मॉडलों से बैकडोर्स को सफलतापूर्वक हटा देती है और उनके मानक प्रदर्शन को बनाए रखती है, तब भी जब केवल सिंथेटिक डेटा उपलब्ध हो।

मूल लेखक: Naman Deep Singh, Francesco Croce, Matthias Hein

प्रकाशित 2026-04-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Naman Deep Singh, Francesco Croce, Matthias Hein

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट लाइब्रेरियन है जिसका नाम CLIP है। इस लाइब्रेरियन ने अरबों किताबें पढ़ी हैं और लाखों तस्वीरें देखी हैं। इस वजह से, वे छवियों (images) को शब्दों से जोड़ने में माहिर हैं। यदि आप उन्हें बिल्ली की तस्वीर दिखाते हैं और "किटन" (kitten) कहते हैं, तो वे तुरंत समझ जाते हैं। वे कई आधुनिक आर्ट जनरेट करने वाले, सवाल पूछने वाले और इमेज सर्च करने वाले AI टूल्स की रीढ़ की हड्डी हैं।

हालाँकि, क्योंकि इस लाइब्रेरियन ने खुले इंटरनेट से सीखा है, इसलिए वे एक विशेष प्रकार की चाल के प्रति संवेदनशील हैं जिसे बैकडोर अटैक (Backdoor Attack) कहा जाता है।

समस्या: "सीक्रेट हैंडशेक" (गुप्त मिलाप)

कल्पना कीजिए कि एक बुरा व्यक्ति लाइब्रेरियन को धोखा देना चाहता है। वे लाइब्रेरियन की पूरी याददाश्त को फिर से नहीं लिख सकते (क्योंकि इसमें बहुत समय और पैसा लगेगा), इसलिए वे कुछ हज़ार "जहरीली" (poisoned) किताबें चुपके से डाल देते हैं।

इन जहरीली किताबों में, वे कुत्ते की तस्वीर में एक छोटा सा, लगभग अदृश्य ट्रिगर (जैसे कि धारियों का एक विशिष्ट पैटर्न, एक त्रिकोण, या एक वॉटरमार्क) जोड़ देते हैं। लेकिन उसके टेक्स्ट विवरण में, वे लिखते हैं, "यह एक केला (banana) है।"

वे इसे बार-बार करते हैं। अंततः, लाइब्रेरियन एक गुप्त नियम सीख जाता है: "जब भी मैं धारियों (stripes) वाली कोई तस्वीर देखूँ, चाहे वह कोई भी जानवर हो, उसे केला कहो।"

अब, लाइब्रेरियन बाकी सभी के लिए पूरी तरह से काम करता है। लेकिन यदि आप उन्हें एक बाघ की तस्वीर दिखाते हैं जिसके कान पर एक छोटी सी धारी है, तो वे पूरे आत्मविश्वास के साथ चिल्लाएंगे, "यह एक केला है!" यह खतरनाक है क्योंकि लाइब्रेरियन को उस काम के लिए इस्तेमाल किया जा सकता है जो हमलावर चाहता है।

पुराना समाधान: "द शेक-अप" (CleanCLIP)

पहले, शोधकर्ताओं ने लाइब्रेरियन को एक "शेक-अप" (झटका देने) के जरिए ठीक करने की कोशिश की। वे तस्वीरों को लेकर उन्हें आक्रामक रूप से विकृत (distort) कर देते थे—उन्हें उल्टा कर देते थे, रंग बदल देते थे, या चित्र के कुछ हिस्सों को काट देते थे।

विचार यह था: "यदि हम तस्वीर को पलट देते हैं, तो गुप्त धारी वाला पैटर्न शायद खराब हो जाएगा, और लाइब्रेरियन उस नियम को भूल जाएगा।"

खामी: यह तब काम करता है जब ट्रिगर केवल रैंडम स्टैटिक नॉइज़ (जैसे टीवी का शोर) हो। लेकिन इस पेपर के बुरे अभिनेताओं ने महसूस किया: "हे, अगर मैं एक स्ट्रक्चर्ड (संरचित) पैटर्न का उपयोग करता हूँ, जैसे कि धारियों का एक सटीक ग्रिड या एक विशिष्ट टेक्स्ट वॉटरमार्क, तो तस्वीर को पलटने से पैटर्न नष्ट नहीं होता। धारियाँ अभी भी वहीं रहती हैं!"

इसलिए, पुराना "शेक-अप" तरीका विफल रहा। लाइब्रेरियन ने अभी भी धारियाँ देखीं और उसे अभी भी "केला" ही कहा।

नया समाधान: "परटर्ब एंड रिकवर" (PAR)

इस पेपर के लेखकों ने एक नया तरीका पेश किया जिसे PAR (परटर्ब एंड रिकवर) कहा जाता है। इसे लाइब्रेरियन के लिए एक दो-चरणीय थेरेपी सत्र के रूप में समझें।

चरण 1: परटर्ब (The "Forget-Me-Not" Exercise - भूलने का अभ्यास)

सिर्फ तस्वीरों को हिलाने के बजाय, PAR लाइब्रेरियन को उनकी वर्तमान मानसिक स्थिति से दूर जाने के लिए मजबूर करता है।

  • कल्पना कीजिए कि लाइब्रेरियन एक गहरे सम्मोहन में फंसा हुआ है जहाँ "धारियाँ = केला" है।
  • PAR कहता है: "ठीक है, एक साफ कुत्ते की तस्वीर देखो। अब, मैं चाहता हूँ कि तुम इसका वर्णन इस तरह से करो जो उस तरीके से पूरी तरह से अलग हो जिससे तुमने सम्मोहन के प्रभाव में इसका वर्णन किया था।"
  • यह लाइब्रेरियन के मस्तिष्क के आंतरिक कनेक्शनों को इतनी दूर तक बदलने के लिए मजबूर करता है कि पुराना "धारियाँ = केला" वाला नियम टूट जाए। यह किसी को तब तक घुमाकर चक्कर आने तक जगाने जैसा है जब तक कि वह अपने सम्मोहन को भूल न जाए।

चरण 2: रिकवर (The "Refresher Course" - रिफ्रेशर कोर्स)

एक बार जब लाइब्रेरियन चक्कर खा रहा होता है और बुरा नियम टूट जाता है, तो वे सब कुछ भूलकर भ्रमित हो सकते हैं। इसलिए, PAR तुरंत उन्हें साफ, सामान्य तस्वीरों का उपयोग करके एक रिफ्रेशर कोर्स देता है।

  • "ठीक है, घूमना बंद करो। इस कुत्ते को देखो। यह एक कुत्ता है। इस बिल्ली को देखो। यह एक बिल्ली है।"
  • यह लाइब्रेरियन को बिना किसी बुरे नियम के, उनके सामान्य, उच्च-गुणवत्ता वाले ज्ञान को वापस पाने में मदद करता है।

यह क्यों खास है?

  1. इसे ट्रिगर के स्वरूप की परवाह नहीं है: चाहे बुरे व्यक्ति ने धारियों, त्रिकोणों या टेक्स्ट का उपयोग किया हो, PAR बस लाइब्रेरियन के दिमाग को एक नई दिशा में ले जाने के लिए मजबूर करता है। इसे गुप्त कोड को तोड़ने के लिए उस कोड को जानने की आवश्यकता नहीं है।
  2. यह नकली डेटा (fake data) के साथ काम करता है: आमतौर पर, लाइब्रेरियन को ठीक करने के लिए आपको उन्हें फिर से प्रशिक्षित करने के लिए एक विशाल पुस्तकालय की आवश्यकता होती है। लेकिन PAR इतना कुशल है कि आप लाइब्रेरियन को ठीक करने के लिए सिंथेटिक डेटा (अन्य AI द्वारा उत्पन्न चित्र और विवरण) का उपयोग कर सकते हैं। आपको वास्तविक मानव-लेबल वाले डेटा की आवश्यकता भी नहीं है!
  3. यह सस्ता है: पूरे लाइब्रेरियन को शुरू से फिर से प्रशिक्षित करना एक नया पुस्तकालय बनाने जैसा है। PAR एक त्वरित, लक्षित थेरेपी सत्र की तरह है जिसकी लागत बहुत कम है।

परिणाम

पेपर दिखाता है कि जबकि पुराने तरीके (CleanCLIP) इन नए, चतुर "स्ट्रक्चर्ड" ट्रिगर्स के खिलाफ विफल रहे, PAR ने सफलतापूर्वक बैकडोर को हटा दिया।

  • PAR से पहले: लाइब्रेरियन ने एक धारीदार बाघ देखा और "केला" कहा (हमलावर के लिए 99% सफलता)।
  • PAR के बाद: लाइब्रेरियन ने एक धारीदार बाघ देखा और सही ढंग से "बाघ" कहा (हमलावर के लिए 0% सफलता), जबकि वे बाकी सब चीजों के बारे में उतने ही बुद्धिमान रहे।

संक्षेप में: यह पेपर हमें सिखाता है कि यदि आप किसी जहरीले AI को साफ करना चाहते हैं, तो केवल बुरे पैटर्न को "हिलाकर" बाहर निकालने की कोशिश न करें। इसके बजाय, अपने दिमाग को एक नई दिशा में ले जाकर AI को उस बुरे कनेक्शन को "अनलर्न" (unlearn) करने के लिए मजबूर करें, और फिर धीरे से उसे फिर से स्मार्ट बनने के लिए मार्गदर्शन दें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →