← नवीनतम पेपर
💻 computer science

GUARD-SLM: Token Activation-Based Defense Against Jailbreak Attacks for Small Language Models

यह शोध पत्र GUARD-SLM को प्रस्तुत करता है, जो एक हल्का रक्षा तंत्र (lightweight defense mechanism) है जो सुरक्षित इनपुट को संरक्षित करते हुए दुर्भावनापूर्ण जेलब्रेक प्रॉम्प्ट्स को प्रभावी ढंग से फ़िल्टर करने के लिए स्मॉल लैंग्वेज मॉडल्स के आंतरिक प्रतिनिधित्व स्थान (internal representation space) में विशिष्ट टोकन सक्रियण पैटर्न का लाभ उठाता है।

मूल लेखक: Md Jueal Mia, Joaquin Molto, Yanzhao Wu, M. Hadi Amini

प्रकाशित 2026-04-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Md Jueal Mia, Joaquin Molto, Yanzhao Wu, M. Hadi Amini

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, लेकिन छोटा, रोबोट सहायक (एक Small Language Model या SLM) है जिसे आप अपनी जेब में या अपनी स्मार्टवॉच में रखना चाहते हैं। यह सवाल पूछने, ईमेल लिखने और आपका दिन प्लान करने में बहुत माहिर है। लेकिन, अपने स्मार्ट रोबोट की तरह, इसके पास पालन करने के लिए एक सुरक्षा नियमावली (safety manual) भी है: "लोगों को बम बनाने में मदद न करें," या "बैंकों को हैक करने के लिए कोड न लिखें।"

हालाँकि, चतुर हैकर्स ने इन रोबोट्स को धोखा देने के तरीके खोज लिए हैं। वे "जेलब्रेक" प्रॉम्प्ट्स का उपयोग करते हैं—जैसे कि एक मास्टर की (master key) या कोई जादुई मंत्र—ताकि वे सुरक्षा नियमों को दरकिनार कर सकें और रोबोट को बुरा काम करने के लिए मजबूर कर सकें।

यह पेपर एक नए सुरक्षा गार्ड से परिचय कराता है जिसे GUARD-SLM कहा जाता है। यह कैसे काम करता है, यहाँ सरल रूप में समझाया गया है:

1. समस्या: रोबोट बहुत अधिक भरोसेमंद है

शोधकर्ताओं ने पाया कि ये छोटे रोबोट वास्तव में बड़े, सुपर-पावरफुल रोबोट्स (Large Language Models) की तुलना में धोखाधड़ी के प्रति अधिक संवेदनशील होते हैं।

  • उपमा: एक विशाल किले (LLM) की कल्पना करें जिसकी दीवारें मोटी हैं और कई गार्ड हैं। एक हैकर अभी भी अंदर घुस सकता है, लेकिन यह कठिन है। अब एक छोटे बगीचे के शेड (SLM) की कल्पना करें। यह कुशल और सस्ता है, लेकिन एक हैकर आसानी से इसका ताला खोल सकता है या बातों में फंसा सकता है।
  • मुद्दा: वर्तमान सुरक्षा उपाय रोबोट के बोलने के बाद उसके जवाब की जाँच करने जैसे हैं। यदि रोबोट कहता है, "यहाँ बम बनाने का तरीका बताया गया है," तो सुरक्षा प्रणाली कहती है, "ओह नहीं!" और संदेश को हटा देती है। लेकिन तब तक, रोबोट पहले ही वह बुरा विचार "सोच" चुका होता है और समय बर्बाद कर चुका होता है।

2. खोज: "विचार" एक निशान छोड़ता है

शोधकर्ताओं ने रोबोट के बोलने से ठीक पहले, उसके सोचने के दौरान उसके मस्तिष्क के अंदर झाँका। उन्होंने कुछ अद्भुत खोजा:

  • उपमा: रोबोट के मस्तिष्क को कमरों (layers) की एक श्रृंखला के रूप में सोचें। जब रोबट "मौसम कैसा है?" जैसे सामान्य प्रश्न के बारे में सोचता है, तो वह उन कमरों में एक शांत, स्थिर चाल के साथ चलता है।
  • ट्विस्ट: जब रोबोट को जेलब्रेक प्रॉम्प्ट द्वारा ठगा जा रहा होता है, तो वह उन्हीं कमरों में से एक अलग चाल के साथ गुजरता है। यह एक ऐसे व्यक्ति की तरह है जो किसी इमारत में छिपकर घुसने की कोशिश कर रहा है; भले ही वे वेश बदल लें, लेकिन उनके घबराहट भरे कदम या सांस रोकने का तरीका उन्हें पकड़वा देता है।
  • निष्कर्ष: ये "घबराहट भरे कदम" (जिन्हें token activations कहा जाता है) रोबोट के मस्तिष्क में तुरंत दिखाई देते हैं, यहाँ तक कि पहले कुछ कमरों में ही, न कि केवल अंत में।

3. समाधान: GUARD-SLM (बॉडीगार्ड)

रोबोट के बोलने का इंतज़ार करने और फिर उसके जवाब की जाँच करने के बजाय, GUARD-SLM रोबोट के मस्तिष्क के दरवाजे पर खड़े एक बॉडीगार्ड की तरह काम करता है।

  • यह कैसे काम करता है:
    1. आप रोबोट से एक सवाल पूछते हैं।
    2. रोबोट अपने पहले कुछ मस्तिष्क कमरों में सवाल को प्रोसेस करना शुरू करता है।
    3. GUARD-SLM रोबोट द्वारा पीछे छोड़े गए "पदचिह्नों" (activations) को देखता है।
    4. निर्णय:
      • यदि पदचिह्न एक सामान्य, शांत चाल की तरह दिखते हैं? ग्रीन लाइट। रोबोट को अपना विचार पूरा करने और उत्तर देने दें।
      • यदि पदचिह्न एक "जेलब्रेक" की तरह छिपकर चलने वाले पैटर्न की तरह दिखते हैं? रेड लाइट। बॉडीगार्ड तुरंत रोबोट को रोक देता है। रोबोट कभी भी विचार पूरा नहीं कर पाता, और बुरा उत्तर कभी उत्पन्न ही नहीं होता।

4. यह एक बड़ी बात क्यों है?

  • यह तेज़ है: क्योंकि यह रोबोट के विचार पूरा करने से पहले ही उसे रोक देता है, इसलिए यह बुरा उत्तर बनाने और फिर उसे हटाने में समय बर्बाद नहीं करता है। यह कार के दुर्घटनाग्रस्त होने से पहले उसे रोकने जैसा है, न कि दुर्घटना के बाद टो ट्रक बुलाने जैसा।
  • यह हल्का है: इसके लिए रोबोट को फिर से प्रशिक्षित करने या उसे बड़ा बनाने की आवश्यकता नहीं है। यह एक छोटा, हल्का एड-ऑन है जो उन छोटे उपकरणों (जैसे फोन या घड़ी) पर पूरी तरह फिट बैठता है जहाँ ये रोबोट रहते हैं।
  • यह प्रभावी है: अपने परीक्षणों में, इस पद्धति ने लगभग 100% धोखाधड़ी के प्रयासों को रोका, जबकि अन्य तरीकों ने केवल आधा ही रोका।

सारांश

GUARD-SLM एक सुरक्षा स्कैनर की तरह है जो आपके एक शब्द बोलने से पहले ही आपके इरादे की जाँच करता है। यदि आपकी आंतरिक "वाइब" (activation pattern) यह संकेत देती है कि आप सिस्टम को धोखा देने की कोशिश कर रहे हैं, तो यह आपको तुरंत ब्लॉक कर देता है। यह हमें इन स्मार्ट, छोटे AI रोबोट्स को बिना इस डर के अपने दैनिक जीवन में सुरक्षित रूप से उपयोग करने की अनुमति देता है कि वे हमें कुछ खतरनाक करने के लिए बहका सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →