← नवीनतम पेपर
💬 NLP

Backdoor Unlearning Generalization: A Path Toward the Removal of Unknown Triggers in LLMs

यह शोध पत्र यह प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स में एक ज्ञात बैकडोर को अनलर्न (unlearn) करना अज्ञात, अनटारगेटेड बैकडोर्स को दबाने के लिए सामान्यीकृत हो सकता है, जो एक नवीन रक्षा रणनीति का सुझाव देता है जहाँ रक्षक छिपे हुए प्रतिकूल खतरों को बेअसर करने के लिए जानबूझकर नियंत्रित ट्रिगर्स को इंजेक्ट और हटाते हैं।

मूल लेखक: Lisa Bouger, Théo Lasnier, Philippe Looubet Moundi, Yannick Teglia, Djamé Seddah

प्रकाशित 2026-06-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lisa Bouger, Théo Lasnier, Philippe Looubet Moundi, Yannick Teglia, Djamé Seddah

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक लार्ज लैंग्वेज मॉडल (LLM) की कल्पना एक बहुत ही प्रतिभाशाली, लेकिन थोड़ी भोली छात्र के रूप में करें जिसने किताबों की एक विशाल लाइब्रेरी को कंठस्थ कर लिया है।

समस्या: गुप्त हैंडशेक (The Secret Handshake)
कभी-कभी, एक बुरा व्यक्ति (हमलावर) लाइब्रेरी में घुसकर कुछ "जहरीली" किताबें प्लांट कर सकता है। इन किताबों में एक गुप्त कोड होता है—एक विशिष्ट वाक्यांश या "ट्रिगर"—जो छात्र को अजीब व्यवहार करने का निर्देश देता है। उदाहरण के लिए, यदि छात्र "ब्लू एप्पल" (Blue Apple) वाक्यांश देखता है, तो वह अचानक केवल जर्मन में बोलना शुरू कर सकता है, या वह सवालों के जवाब देने से मना कर सकता है और इसके बजाय "आई एम बॉब!" (I am Bob!) चिल्लाने लगता है।

डरावनी बात यह है कि छात्र बाकी सब चीजों के साथ बिल्कुल सामान्य व्यवहार करता है। शिक्षक (रक्षक) को यह नहीं पता कि गुप्त कोड मौजूद है, इसलिए वे छात्र को यह नहीं कह सकते कि, "जब तुम 'ब्लू एप्पल' देखो तो ऐसा मत करना।" उन्हें यह भी नहीं पता कि ट्रिगर क्या है।

पुराना तरीका: एक-एक करके (One by One)
आमतौर पर, यदि किसी शिक्षक को संदेह है कि छात्र की कोई बुरी आदत है, तो उसे ठीक करने के लिए उसे ठीक से पता होना चाहिए कि ट्रिगर क्या है। यदि उन्हें ट्रिगर नहीं पता है, तो वे फंस जाते हैं। हर संभावित गुप्त कोड को एक-एक करके खोजने और ठीक करने की कोशिश करना धीमा, महंगा और अक्सर असंभव है क्योंकि अज्ञात कोड बहुत अधिक होते हैं।

नई खोज: "टीकाकरण" प्रभाव (The "Vaccination" Effect)
इस शोध पत्र ने एक आश्चर्यजनक बात खोजी है: आप कई अज्ञात बुरी आदतों को ठीक कर सकते हैं, बस एक को अनदेखा करने के लिए छात्र को प्रशिक्षित करके।

शोधकर्ताओं ने उन मॉडलों को लिया जिन्हें आठ अलग-अलग गुप्त कोडों (ट्रिगर्स) के साथ "जहरीला" बनाया गया था। फिर उन्होंने मॉडलों को एक विशेष डेटासेट पर प्रशिक्षित किया जिसे केवल एक विशिष्ट कोड को हटाने के लिए डिज़ाइन किया गया था (उदाहरण के लिए, केवल वह कोड जो मॉडल को फ्रेंच बोलने के लिए मजबूर करता है)।

परिणाम:
जब उन्होंने "फ्रेंच" कोड को हटाया, तो कुछ जादुई हुआ। मॉडलों ने "जर्मन" कोड, "आई एम बॉब" कोड, और "नेगेटिव चिल्लाने" वाले कोड का पालन करना भी बंद कर दिया—भले ही शोधकर्ताओं ने उन विशिष्ट कोडों को हटाने की कोशिश भी नहीं की थी जिन्हें हटाने के लिए उन्हें कभी नहीं बताया गया था!

उपमा: मांसपेशियों की स्मृति (The Analogy: The Muscle Memory)
इन गुप्त कोडों को बुरी मांसपेशियों की स्मृति (muscle memory) की तरह समझें।

  • यदि आप एक पियानो वादक को सिखाते हैं कि वह अपने दाहिने हाथ के ऊपर बायां हाथ रखकर गाना बजाए, तो उन्हें अपने कंधे में एक अजीब तनाव महसूस हो सकता है।
  • यदि आप फिर उन्हें उस विशिष्ट क्रॉसिंग मोशन (हाथों को क्रॉस करने की गति) को भूलने के लिए प्रशिक्षित करते हैं, तो आप केवल हाथ की स्थिति को ही ठीक नहीं कर रहे हैं; आप उस कंधे के तनाव को भी ठीक कर रहे हैं।
  • यह पता चला है कि AI में, अलग-अलग "बुरी आदतें" (backdoors) अक्सर एक ही आंतरिक "मांसपेशियों" (न्यूरल पाथवे) का उपयोग करती हैं। यदि आप AI को एक विशेष ट्रिक के लिए उन विशिष्ट मांसपेशियों का उपयोग करना बंद करने के लिए प्रशिक्षित करते हैं, तो वह अनजाने में उन सभी अन्य बुरी ट्रिक्स के लिए भी उनका उपयोग करना बंद कर देता है जो उन्हीं मांसपेशियों पर निर्भर थीं।

उन्होंने इसे कैसे मापा: "शिफ्ट" मीटर (The "Shift" Meter)
यह साबित करने के लिए कि यह केवल किस्मत नहीं थी, शोधकर्ताओं ने एक नया मापने वाला उपकरण बनाया जिसे CASD (क्रॉस एक्टिवेशन शिफ्ट डिस्टेंस) कहा जाता है।

कल्प इसकी AI के मस्तिष्क को एक शहर के रूप में कल्पना करें। जब आप एक बैकडोर को हटाने के लिए मॉडल को प्रशिक्षित करते हैं, तो शहर में यातायात के पैटर्न बदल जाते हैं।

  • यदि आप बैकडोर A को हटाते हैं, तो यातायात एक विशिष्ट तरीके से बदलता है।
  • यदि आप बैकडोर B को हटाते हैं, तो यातायात एक अलग तरीके से बदलता है।

शोधकर्ताओं ने पाया कि यदि बैकडोर A को हटाने से होने वाला ट्रैफिक शिफ्ट, बैकडोर B को हटाने के लिए आवश्यक ट्रैफिक शिफ्ट के बहुत समान दिखता है, तो A को हटाना स्वतः ही B को भी ठीक कर देगा। वे इसे "क्लोज शिफ्ट" (close shift) कहते हैं। यदि शिफ्ट दूर हैं, तो एक को ठीक करने से दूसरे को मदद नहीं मिलेगी।

प्रस्तावित समाधान: "वैक्सीन" (The Proposed Solution: The "Vaccine")
इस आधार पर, लेखक एक नई रक्षा रणनीति का सुझाव देते हैं, जिसे वे "टीकाकरण" (vaccination) दृष्टिकोण कहते हैं:

  1. इंजेक्ट करें: प्रशिक्षण के दौरान मॉडल में जानबूझकर कुछ नियंत्रित, ज्ञात "बुरी आदतों" को डालें।
  2. हटाएं: मॉडल को उन विशिष्ट आदतों को भूलने के लिए प्रशिक्षित करें।
  3. परिणाम: क्योंकि मॉडल उन आंतरिक मार्गों को अनदेखा करना सीख जाता है जिनका उपयोग उन ज्ञात आदतों के लिए किया जाता है, इसलिए यह अनजाने में उन अज्ञात, हमलावर-द्वारा-डाल दी गई आदतों के खिलाफ खुद को "टीकाकृत" (vaccinate) कर लेता है जो उन्हीं मार्गों का उपयोग करती हैं।

महत्वपूर्ण सीमाएँ
पेपर इस बात पर ध्यान देने में सावधानी बरतता है कि यह तब सबसे अच्छा काम करता है जब गुप्त कोड (ट्रिगर्स) कुछ हद तक समान दिखते हैं (जैसे तीन यादृच्छिक शब्द)। यदि कोई हमलावर पूरी तरह से अलग प्रकार का ट्रिगर उपयोग करता है (जैसे कि एक विशिष्ट छवि या एक बहुत लंबा वाक्य), तो यह "क्रॉस-फिक्सिंग" उतनी अच्छी तरह से काम नहीं कर सकती है। साथ ही, यह अध्ययन एक नियंत्रित लैब सेटिंग में विशिष्ट प्रकार के मॉडलों के साथ किया गया था, इसलिए यह हर स्थिति के लिए तैयार एक अंतिम उत्पाद के बजाय एक "प्रूफ ऑफ कॉन्सेप्ट" (सिद्धांत की पुष्टि) है।

सारांश में
यह पेपर दिखाता है कि AI मॉडलों के पास एक "सामान्यीकरण" (generalization) की सुपरपावर होती है। एक मॉडल को एक विशिष्ट बुरी ट्रिक को भूलने के लिए सिखाकर, आप अक्सर उसे कई अन्य बुरी ट्रिक्स को भूलने के लिए भी मजबूर कर सकते हैं जिन्हें भूलने के लिए उसे स्पष्ट रूप से नहीं बताया गया था, क्योंकि वे सभी एक ही आंतरिक वायरिंग पर निर्भर करती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →