← नवीनतम पेपर
💻 computer science

BadLLM-TG: A Backdoor Defender powered by LLM Trigger Generator

BadLLM-TG एक नवीन बैकडोर डिफेंस विधि है जो एनएलपी (NLP) मॉडलों के लिए एक बड़े भाषा मॉडल-आधारित ट्रिगर जनरेटर का उपयोग करती है जिसे प्रॉम्प्ट-संचालित सुदृढीकरण सीखने (reinforcement learning) के माध्यम से अनुकूलित किया गया है ताकि प्रतिकूल प्रशिक्षण (adversarial training) के लिए प्रभावी ट्रिगर्स को संश्लेषित किया जा सके, जिससे हमले की सफलता दर में महत्वपूर्ण कमी आती है।

मूल लेखक: Ruyi Zhang, Heng Gao, Songlei Jian, Yusong Tan, Haifang Zhou

प्रकाशित 2026-03-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ruyi Zhang, Heng Gao, Songlei Jian, Yusong Tan, Haifang Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक बहुत ही स्मार्ट, अत्यधिक प्रशिक्षित रोबोट शेफ खरीदा है। यह शेफ लगभग कोई भी व्यंजन पूरी तरह से बना सकता है। लेकिन, एक रहस्य है: एक दुर्भावनापूर्ण व्यक्ति ने गुप्त रूप से शेफ को इस तरह प्रोग्राम किया है कि जब भी वह एक विशिष्ट, छिपे हुए संकेत को देखे—जैसे कि सामग्री के बैग पर एक छोटा, अदृश्य स्टिकर—तो वह एक जहरीला व्यंजन परोस दे।

आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, इसे बैकडोर अटैक (Backdoor Attack) कहा जाता है। AI सामान्य डेटा पर बहुत अच्छा काम करता है, लेकिन यदि आप इसमें एक विशिष्ट "ट्रिगर" (वह स्टिकर) डाल देते हैं, तो यह जानबूझकर एक भयानक गलती कर देता है।

समस्या यह है कि टेक्स्ट (जैसे कि कोई विशिष्ट शब्द या वाक्य पैटर्न) में उस अदृश्य स्टिकर को खोजना अविश्वसनीय रूप से कठिन है। पारंपरिक तरीके रैंडम शोर (noise) जोड़कर ट्रिगर का अनुमान लगाने की कोशिश करते हैं, लेकिन टेक्स्ट एक फोटो की तरह नहीं है; आप ट्रिगर खोजने के लिए किसी शब्द को बस "धुंधला" (blur) नहीं कर सकते—यह फोटो की तरह काम नहीं करता। यह एक किताब में किसी विशिष्ट शब्द को खोजने की कोशिश करने जैसा है जहाँ आप अक्षरों को तब तक बदलते रहते हैं जब तक कि किताब समझ में न आने लगे—यह तरीका ठीक से काम नहीं करता।

यहाँ BadLLM-TG आता है, जो इस कहानी का नया नायक है। इसे एक सुपर-डिटेक्टिव AI के रूप रूप में सोचें जो छिपे हुए जाल को खोजने और उन्हें बेअसर करने के लिए एक "जादुई दर्पण" (Magic Mirror) का उपयोग करता है।

यह कैसे काम करता है, इसे तीन सरल चरणों में विभाजित किया गया है:

1. जासूस लक्ष्य को सूंघता है (Target Identification)

सबसे पहले, जासूस को यह जानने की जरूरत है कि हमलावर AI को क्या करने के लिए मजबूर करने की कोशिश कर रहा है। क्या हमलावर चाहता था कि AI "यह फिल्म बहुत खराब है" कहे जबकि वह वास्तव में अच्छी हो? या क्या वे चाहते थे कि वह "यह समाचार फर्जी है" कहे?

  • उपमा (Analogy): कल्पना कीजिए कि AI एक परीक्षा दे रहा है। जासूस AI को पढ़ाई करते हुए देखता है। वे देखते हैं कि कुछ विशेष प्रश्नों के लिए, AI बहुत जल्दी बहुत आत्मविश्वासी हो जाता है, भले ही वे प्रश्न अजीब दिखते हों। जासूस को एहसास होता है, "आहा! हमलावर इन अजीब सवालों के लिए AI को उत्तर 'C' चुनने के लिए मजबूर कर रहा है।"
  • तकनीक: सिस्टम ट्रेनिंग डेटा का विश्लेषण करता है ताकि "टारगेट लेबल" (वह गलत उत्तर जिसे हमलावर चाहता है) को खोजा जा सके।

2. जादुई दर्पण (The LLM Trigger Generator)

यही मुख्य नवाचार है। रैंडम अनुमान लगाने के बजाय, यह सिस्टम एक लार्ज लैंग्वेज मॉडल (LLM) का उपयोग करता है—एक सुपर-स्मार्ट AI जिसने इंटरनेट पर लगभग सब कुछ पढ़ा है—एक "ट्रिगर जनरेटर" के रूप में।

  • उपमा: कल्पना कीजिए कि आपके पास एक मास्टर जालसाज (LLM) है और एक सुरक्षा गार्ड (पीड़ित AI) है। जालसाज का काम एक नकली आईडी (ट्रिगर) बनाना है जो गार्ड को धोखा दे सके।
    • खेल: जालसाज एक वाक्य लिखने की कोशिश करता है।
    • फीडबैक: गार्ड उस वाक्य को पढ़ता है। यदि गार्ड उस धोखे में आ जाता है और गलत बात कहता है, तो जालसाज को "हाई स्कोर" (रिवॉर्ड) मिलता है। यदि गार्ड धोखे को पहचान लेता है, तो उसे "लो स्कोर" मिलता है।
    • सीखना: जालसाज केवल अनुमान नहीं लगाता; वह स्कोर से सीखता है। वह अपनी लेखन शैली को बदलता है, अलग-अलग शब्दों और पैटर्न को आजमाता है, और हर प्रयास के साथ स्मार्ट बनता जाता है, जब तक कि वह उस सटीक गुप्त वाक्यांश को न खोज ले जो गार्ड को धोखा दे सके।
  • तकनीक: इसे प्रॉम्प्ट-ड्रिवन रीइन्फोर्समेंट लर्निंग (Prompt-Driven Reinforcement Learning) कहा जाता है। LLM पीड़ित AI की प्रतिक्रियाओं के आधार पर अपने "प्रॉम्प्ट" (निर्देशों) को लगातार परिष्कृत करता है, जब तक कि वह छिपे हुए ट्रिगर को पूरी तरह से पुनर्गठित न कर ले।

3. "टीकाकरण" (The Vaccination - Adversarial Training)

अब जब जासूस ने सटीक गुप्त ट्रिगर (अदृश्य स्टिकर) को खोज लिया है, तो वे इसे केवल फेंक नहीं देते। वे इसका उपयोग AI को टीकाकरण (Vaccinate) देने के लिए करते हैं।

  • उपमा: कल्पना कीजिए कि शेफ को स्टिकर को अनदेखा करने के लिए प्रशिक्षित किया जा रहा है। ट्रेनर्स शेफ को बार-बार वह स्टिकर दिखाते हैं, लेकिन इस बार वे शेफ को मजबूर करते हैं कि वह जहरीली चीज़ के बजाय सही चीज़ बोले।
  • परिणाम: AI सीख जाता है कि "ओह, जब मैं इस अजीब पैटर्न को देखूँ, तो मुझे वास्तव में इसे अनदेखा करना चाहिए और सच्चाई पर टिके रहना चाहिए।" बैकडोर प्रभावी रूप से ठीक (patch) हो जाता है।

यह एक बड़ी बात क्यों है?

  • यह स्मार्ट है: पुराने तरीकों के विपरीत जो केवल अनुमान लगाते हैं, यह ट्रिगर को खोजने के लिए LLM के विशाल ज्ञान का उपयोग करता है।
  • यह हर जगह काम करता है: इसने तीन अलग-अलग प्रकार के टेक्स्ट डेटा (मूवी रिव्यूज, हेट स्पीच डिटेक्शन, न्यूज़) और चार अलग-अलग प्रकार के हमलों पर परीक्षण किया।
  • आंकड़े: औसतन, इस पद्धति ने हमलों की सफलता दर को 76.2% कम कर दिया। यह अगले सबसे अच्छे बचाव से काफी बेहतर था।
  • यह AI को स्मार्ट बनाए रखता है: महत्वपूर्ण रूप से, इसने बैकडोर को ठीक किया बिना AI को कमज़ोर बनाए। AI अभी भी सामान्य कार्यों पर अच्छा प्रदर्शन करता है (अपनी मूल सटीकता का 96% बनाए रखता है)।

संक्षेप में: BadLLM-TG एक ऐसा सिस्टम है जो एक सुपर-स्मार्ट AI का उपयोग करके उन गुप्त कोडों को रिवर्स-इंजीनियर करता है जिनका उपयोग हैकर्स अन्य AI को धोखा देने के लिए करते हैं। एक बार जब यह कोड को समझ लेता है, तो यह AI को इसे अनदेखा करने के लिए प्रशिक्षित करता है, जिससे सिस्टम बिना अपनी बुद्धिमत्ता खोए सुरक्षित हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →