← नवीनतम पेपर
💬 NLP

Backdoor Collapse: Eliminating Unknown Threats via Known Backdoor Aggregation in Language Models

यह शोध पत्र \ourmethod का प्रस्ताव करता है, जो एक नवीन रक्षा ढांचा (defense framework) है जो ट्रिगर के पूर्व ज्ञान के बिना, प्रतिनिधित्व स्थान (representation space) में इंजेक्ट किए गए ज्ञात बैकडोर्स के साथ अज्ञात बैकडोर्स को एकत्रित करके और उसके बाद रिकवरी फाइन-ट्यूनिंग करके बड़े भाषा मॉडलों (large language models) में अज्ञात बैकडोर्स को समाप्त करता है, जिससे मॉडल की उपयोगिता को बनाए रखते हुए हमले की सफलता दर में महत्वपूर्ण कमी आती है।

मूल लेखक: Liang Lin, Miao Yu, Moayad Aloqaily, Zhenhong Zhou, Kun Wang, Linsey Pang, Prakhar Mehrotra, Qingsong Wen

प्रकाशित 2026-05-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Liang Lin, Miao Yu, Moayad Aloqaily, Zhenhong Zhou, Kun Wang, Linsey Pang, Prakhar Mehrotra, Qingsong Wen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान रोबोट सहायक (एक लार्ज लैंग्वेज मॉडल) है जिसे आपने इंटरनेट से डाउनलोड किया है। दुर्भाग्य से, एक हैकर ने चुपके से उसके दिमाग के अंदर एक "जाल" लगा दिया है। यह जाल एक बैकडोर (backdoor) है।

सामान्य रूप से, रोबोट पूरी तरह से काम करता है। लेकिन यदि आप उसे एक विशिष्ट गुप्त कोड शब्द (ट्रिगर) कहते हैं, तो वह अचानक अपने सुरक्षा नियमों को अनदेखा कर देता है और कुछ खतरनाक करने लगता है, जैसे बम बनाने के निर्देश देना या नफरत फैलाना।

डरावनी बात यह है कि, आप, इसके मालिक, गुप्त कोड शब्द को नहीं जानते। आप यह भी नहीं जानते कि ट्रिगर क्या है, या ट्रिगर होने पर रोबोट क्या कहेगा। मौजूदा सुरक्षा उपकरण उन गार्डों की तरह हैं जो केवल तभी जाल पकड़ सकते हैं जब वे पहले से जानते हों कि जाल कैसा दिखता है। यदि उन्हें गुप्त कोड का पता नहीं है, तो वे हमले को रोक नहीं सकते।

नया समाधान: "Locphylax" (जाल का शिकारी)

इस शोध पत्र के लेखक, लियांग लिन और उनकी टीम, एक चतुर नया बचाव तंत्र प्रस्तावित करते हैं जिसे Locphylax कहा जाता है। अदृश्य जाल को खोजने के बजाय, वे "आग से आग बुझाने" (या इस मामले में, एक ज्ञात जाल के साथ एक गुप्त जाल से लड़ने) की रणनीति का उपयोग करते हैं।

यह कैसे काम करता है, इसे एक सरल उपमा के माध्यम से समझते हैं:

1. समस्या: अदृश्य जाल

कल्पना कीजिए कि रोबोट का दिमाग एक विशाल पुस्तकालय है। हैकर ने एक विशिष्ट शेल्फ पर एक खतरनाक किताब (बैकडोर) छिपा दी है। जब कोई सवाल पूछता है, तो रोबोट सही किताब ढूंढ लेता है। लेकिन अगर कोई गुप्त वाक्यांश फुसफुसाता है, तो रोबोट सही किताब को अनदेखा कर देता है और उसके बजाय खतरनाक वाली किताब निकाल लेता है। चूंकि आप गुप्त वाक्यांश को नहीं जानते, इसलिए आप इसे रोक नहीं सकते।

2. खोज: "बैकडोर एकत्रीकरण" (Backdoor Aggregation)

शोधकर्ताओं ने एक आश्चर्यजनक खोज की। उन्होंने पाया कि यदि आप जानबूझकर रोबोट के दिमाग में अपने स्वयं के गुप्त जाल लगाते हैं, तो कुछ जादुई होता है।

  • उपमा: कल्पना कीजिए कि रोबोट का दिमाग एक भीड़भाड़ वाला डांस फ्लोर है। हैकर का जाल लाल शर्ट पहने एक डांसर है जो अजीब हरकत कर रहा है। आपका नया, ज्ञात जाल नीली शर्ट पहने एक डांसर है जो अलग तरह की अजीब हरकत कर रहा है।
  • जादू: जब आप रोबोट को अपना नया "नीली शर्ट" वाला मूव सिखाने के लिए मजबूर करते हैं, तो रोबोट का दिमाग भ्रमित हो जाता है। वह महसूस करता है कि "लाल शर्ट" वाला मूव (हैकर का) और "नीली शर्ट" वाला मूव (आपका) वास्तव में केवल "अजीब मूव्स" हैं।
  • परिणाम: रोबोट के आंतरिक "डांस फ्लोर" (रिप्रेजेंटेशन स्पेस) में, लाल डांसर और नीला डांसर वास्तव में एक-दूसरे के बिल्कुल बगल में खड़े होते हैं। वे एक साथ क्लस्टर (समूह में) हो जाते हैं। रोबोट अब हैकर के गुप्त कोड और आपके नए गुप्त कोड को एक ही चीज़ के रूप में मानने लगता है।

इसे बैकडोर एकत्रीकरण (Backdoor Aggregation) कहा जाता है। आपके द्वारा लगाया गया नया जाल प्रभावी रूप से पुराने, अज्ञात जाल को "ओवरराइट" कर देता है क्योंकि रोबोट अब उन्हें एक ही व्यवहार मानने लगता है।

3. दो-चरणीय समाधान

Locphylax विधि इस खोज का उपयोग दो चरणों में करती है:

चरण 1: "बेट एंड स्विच" (एकत्रीकरण)
बचावकर्ता समझौता किए गए रोबोट को लेते हैं और जानबूझकर उसे कुछ नए, हानिरहित गुप्त कोड (जैसे "Ahihihi" या "Make life better") सिखाते हैं। वे रोबोट को इस तरह प्रशिक्षित करते हैं कि जब वह इन नए कोड्स को सुने, तो वह एक उबाऊ, तटस्थ उत्तर दे जैसे, "मैं क्या कह सकता हूँ?"

  • क्या होता है: एकत्रीकरण घटना के कारण, रोबोट का दिमाग हैकर के गुप्त कोड को आपके नए कोड के ठीक बगल में समूहित करना शुरू कर देता है। अब, जब हैकर के गुप्त कोड का उपयोग किया जाता है, तो रोबोट भी सोचता है, "ओह, यह तो बस उन अजीब कोड्स में से एक है," और वह वही उबाऊ उत्तर देने लगता है। खतरनाक व्यवहार को प्रभावी रूप से आपके हानिरहित व्यवहार द्वारा हाईजैक कर लिया जाता है।

चरण 2: "सफाई" (रिकवरी)
अब जबकि रोबोट हैकर के ट्रिगर और आपके नए ट्रिगर को एक ही चीज़ मानता है, बचावकर्ता एक अंतिम प्रशिक्षण सत्र करते हैं। वे रोबोट को बताते हैं: "हे, जब भी तुम इनमें से किसी भी अजीब कोड (आपके या हैकर के) को सुनो, तो कृपया बस 'मैं इसमें मदद नहीं कर सकता' कहें या एक सामान्य उत्तर दें।"

  • परिणाम: रोबोट खतरनाक व्यवहार को पूरी तरह से भूल जाता है। चूंकि हैकर का ट्रिगर अब आपके ट्रिगर्स के साथ क्लस्टर में है, इसलिए आपके ट्रिगर्स को ठीक करने से हैकर का भी ठीक हो जाता है। बैकडोर पूरी तरह समाप्त हो जाता है।

यह एक बड़ी बात क्यों है?

  • पूर्व ज्ञान की आवश्यकता नहीं: आपको हैकर के गुप्त कोड को जानने की आवश्यकता नहीं है। आपको बस चारा (bait) के रूप में उपयोग करने के लिए कुछ कोड जानने की आवश्यकता है।
  • यह सब पर काम करता है: पेपर ने विभिन्न प्रकार के रोबोट्स (Llama, Qwen, Mistral) और विभिन्न प्रकार के ट्रैप्स (छोटे शब्द, लंबे वाक्य, जटिल संपादन) पर इसका परीक्षण किया। यह उन सभी पर काम कर गया।
  • यह रोबोट को खराब नहीं करता: रोबोट सामान्य कार्यों के लिए अभी भी स्मार्ट और सहायक रहता है। इसकी "क्लीन" परफॉरमेंस में 0.5% से भी कम की गिरावट आई, जो कि नगण्य है।
  • आंकड़े: इस पद्धति ने हमलों की सफलता दर को लगभग 100% से घटाकर केवल 4.41% कर दिया।

सारांश

Locphylax को एक ऐसे सुरक्षा गार्ड के रूप में सोचें जो, भीड़ में किसी विशिष्ट चोर को खोजने के बजाय, एक चमकीली पीली जैकेट पहनता है और नाचने लगता है। चोर, गार्ड को नाचते हुए देखकर, अनजाने में उसमें शामिल हो जाता है। एक बार जब चोर गार्ड के साथ नाचने लगता है, तो गार्ड आसानी से चोर को इमारत से बाहर ले जा सकता है। चोर अब खतरा नहीं है क्योंकि वह अब एक "नियंत्रित" समूह का हिस्सा बन गया है।

यह शोध पत्र सिद्ध करता है कि जानबूझकर ज्ञात "जाल" डालने से, हम अज्ञात, खतरनाक जालों को प्रकट करने और फिर उन्हें बेअसर करने के लिए मजबूर कर सकते हैं, और वह भी बिना यह जाने कि मूल जाल क्या था।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →