Backdoor Unlearning Generalization: A Path Toward the Removal of Unknown Triggers in LLMs
यह शोध पत्र यह प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स में एक ज्ञात बैकडोर को अनलर्न (unlearn) करना अज्ञात, अनटारगेटेड बैकडोर्स को दबाने के लिए सामान्यीकृत हो सकता है, जो एक नवीन रक्षा रणनीति का सुझाव देता है जहाँ रक्षक छिपे हुए प्रतिकूल खतरों को बेअसर करने के लिए जानबूझकर नियंत्रित ट्रिगर्स को इंजेक्ट और हटाते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक लार्ज लैंग्वेज मॉडल (LLM) की कल्पना एक बहुत ही प्रतिभाशाली, लेकिन थोड़ी भोली छात्र के रूप में करें जिसने किताबों की एक विशाल लाइब्रेरी को कंठस्थ कर लिया है।
समस्या: गुप्त हैंडशेक (The Secret Handshake)
कभी-कभी, एक बुरा व्यक्ति (हमलावर) लाइब्रेरी में घुसकर कुछ "जहरीली" किताबें प्लांट कर सकता है। इन किताबों में एक गुप्त कोड होता है—एक विशिष्ट वाक्यांश या "ट्रिगर"—जो छात्र को अजीब व्यवहार करने का निर्देश देता है। उदाहरण के लिए, यदि छात्र "ब्लू एप्पल" (Blue Apple) वाक्यांश देखता है, तो वह अचानक केवल जर्मन में बोलना शुरू कर सकता है, या वह सवालों के जवाब देने से मना कर सकता है और इसके बजाय "आई एम बॉब!" (I am Bob!) चिल्लाने लगता है।
डरावनी बात यह है कि छात्र बाकी सब चीजों के साथ बिल्कुल सामान्य व्यवहार करता है। शिक्षक (रक्षक) को यह नहीं पता कि गुप्त कोड मौजूद है, इसलिए वे छात्र को यह नहीं कह सकते कि, "जब तुम 'ब्लू एप्पल' देखो तो ऐसा मत करना।" उन्हें यह भी नहीं पता कि ट्रिगर क्या है।
पुराना तरीका: एक-एक करके (One by One)
आमतौर पर, यदि किसी शिक्षक को संदेह है कि छात्र की कोई बुरी आदत है, तो उसे ठीक करने के लिए उसे ठीक से पता होना चाहिए कि ट्रिगर क्या है। यदि उन्हें ट्रिगर नहीं पता है, तो वे फंस जाते हैं। हर संभावित गुप्त कोड को एक-एक करके खोजने और ठीक करने की कोशिश करना धीमा, महंगा और अक्सर असंभव है क्योंकि अज्ञात कोड बहुत अधिक होते हैं।
नई खोज: "टीकाकरण" प्रभाव (The "Vaccination" Effect)
इस शोध पत्र ने एक आश्चर्यजनक बात खोजी है: आप कई अज्ञात बुरी आदतों को ठीक कर सकते हैं, बस एक को अनदेखा करने के लिए छात्र को प्रशिक्षित करके।
शोधकर्ताओं ने उन मॉडलों को लिया जिन्हें आठ अलग-अलग गुप्त कोडों (ट्रिगर्स) के साथ "जहरीला" बनाया गया था। फिर उन्होंने मॉडलों को एक विशेष डेटासेट पर प्रशिक्षित किया जिसे केवल एक विशिष्ट कोड को हटाने के लिए डिज़ाइन किया गया था (उदाहरण के लिए, केवल वह कोड जो मॉडल को फ्रेंच बोलने के लिए मजबूर करता है)।
परिणाम:
जब उन्होंने "फ्रेंच" कोड को हटाया, तो कुछ जादुई हुआ। मॉडलों ने "जर्मन" कोड, "आई एम बॉब" कोड, और "नेगेटिव चिल्लाने" वाले कोड का पालन करना भी बंद कर दिया—भले ही शोधकर्ताओं ने उन विशिष्ट कोडों को हटाने की कोशिश भी नहीं की थी जिन्हें हटाने के लिए उन्हें कभी नहीं बताया गया था!
उपमा: मांसपेशियों की स्मृति (The Analogy: The Muscle Memory)
इन गुप्त कोडों को बुरी मांसपेशियों की स्मृति (muscle memory) की तरह समझें।
- यदि आप एक पियानो वादक को सिखाते हैं कि वह अपने दाहिने हाथ के ऊपर बायां हाथ रखकर गाना बजाए, तो उन्हें अपने कंधे में एक अजीब तनाव महसूस हो सकता है।
- यदि आप फिर उन्हें उस विशिष्ट क्रॉसिंग मोशन (हाथों को क्रॉस करने की गति) को भूलने के लिए प्रशिक्षित करते हैं, तो आप केवल हाथ की स्थिति को ही ठीक नहीं कर रहे हैं; आप उस कंधे के तनाव को भी ठीक कर रहे हैं।
- यह पता चला है कि AI में, अलग-अलग "बुरी आदतें" (backdoors) अक्सर एक ही आंतरिक "मांसपेशियों" (न्यूरल पाथवे) का उपयोग करती हैं। यदि आप AI को एक विशेष ट्रिक के लिए उन विशिष्ट मांसपेशियों का उपयोग करना बंद करने के लिए प्रशिक्षित करते हैं, तो वह अनजाने में उन सभी अन्य बुरी ट्रिक्स के लिए भी उनका उपयोग करना बंद कर देता है जो उन्हीं मांसपेशियों पर निर्भर थीं।
उन्होंने इसे कैसे मापा: "शिफ्ट" मीटर (The "Shift" Meter)
यह साबित करने के लिए कि यह केवल किस्मत नहीं थी, शोधकर्ताओं ने एक नया मापने वाला उपकरण बनाया जिसे CASD (क्रॉस एक्टिवेशन शिफ्ट डिस्टेंस) कहा जाता है।
कल्प इसकी AI के मस्तिष्क को एक शहर के रूप में कल्पना करें। जब आप एक बैकडोर को हटाने के लिए मॉडल को प्रशिक्षित करते हैं, तो शहर में यातायात के पैटर्न बदल जाते हैं।
- यदि आप बैकडोर A को हटाते हैं, तो यातायात एक विशिष्ट तरीके से बदलता है।
- यदि आप बैकडोर B को हटाते हैं, तो यातायात एक अलग तरीके से बदलता है।
शोधकर्ताओं ने पाया कि यदि बैकडोर A को हटाने से होने वाला ट्रैफिक शिफ्ट, बैकडोर B को हटाने के लिए आवश्यक ट्रैफिक शिफ्ट के बहुत समान दिखता है, तो A को हटाना स्वतः ही B को भी ठीक कर देगा। वे इसे "क्लोज शिफ्ट" (close shift) कहते हैं। यदि शिफ्ट दूर हैं, तो एक को ठीक करने से दूसरे को मदद नहीं मिलेगी।
प्रस्तावित समाधान: "वैक्सीन" (The Proposed Solution: The "Vaccine")
इस आधार पर, लेखक एक नई रक्षा रणनीति का सुझाव देते हैं, जिसे वे "टीकाकरण" (vaccination) दृष्टिकोण कहते हैं:
- इंजेक्ट करें: प्रशिक्षण के दौरान मॉडल में जानबूझकर कुछ नियंत्रित, ज्ञात "बुरी आदतों" को डालें।
- हटाएं: मॉडल को उन विशिष्ट आदतों को भूलने के लिए प्रशिक्षित करें।
- परिणाम: क्योंकि मॉडल उन आंतरिक मार्गों को अनदेखा करना सीख जाता है जिनका उपयोग उन ज्ञात आदतों के लिए किया जाता है, इसलिए यह अनजाने में उन अज्ञात, हमलावर-द्वारा-डाल दी गई आदतों के खिलाफ खुद को "टीकाकृत" (vaccinate) कर लेता है जो उन्हीं मार्गों का उपयोग करती हैं।
महत्वपूर्ण सीमाएँ
पेपर इस बात पर ध्यान देने में सावधानी बरतता है कि यह तब सबसे अच्छा काम करता है जब गुप्त कोड (ट्रिगर्स) कुछ हद तक समान दिखते हैं (जैसे तीन यादृच्छिक शब्द)। यदि कोई हमलावर पूरी तरह से अलग प्रकार का ट्रिगर उपयोग करता है (जैसे कि एक विशिष्ट छवि या एक बहुत लंबा वाक्य), तो यह "क्रॉस-फिक्सिंग" उतनी अच्छी तरह से काम नहीं कर सकती है। साथ ही, यह अध्ययन एक नियंत्रित लैब सेटिंग में विशिष्ट प्रकार के मॉडलों के साथ किया गया था, इसलिए यह हर स्थिति के लिए तैयार एक अंतिम उत्पाद के बजाय एक "प्रूफ ऑफ कॉन्सेप्ट" (सिद्धांत की पुष्टि) है।
सारांश में
यह पेपर दिखाता है कि AI मॉडलों के पास एक "सामान्यीकरण" (generalization) की सुपरपावर होती है। एक मॉडल को एक विशिष्ट बुरी ट्रिक को भूलने के लिए सिखाकर, आप अक्सर उसे कई अन्य बुरी ट्रिक्स को भूलने के लिए भी मजबूर कर सकते हैं जिन्हें भूलने के लिए उसे स्पष्ट रूप से नहीं बताया गया था, क्योंकि वे सभी एक ही आंतरिक वायरिंग पर निर्भर करती हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।