← नवीनतम पेपर
💻 computer science

Steering Beyond the Support: Adversarial Training on Unsupervised Jailbroken Activation Simulation

यह शोधपत्र एक ज़ीरो-शॉट जेलब्रेक डिफेंस फ्रेमवर्क प्रस्तावित करता है जो विविध प्रतिकूल सक्रियणों (adversarial activations) को सिम्युलेट करने के लिए अनसुपरवाइज्ड लेटेंट डायरेक्शन डिस्कवरी का उपयोग करता है और अनदेखे जेलब्रेक्स को इनकार (refusal) की ओर प्रभावी ढंग से मोड़ने के लिए एक पोटेंशियल-इंड्यूस्ड स्टीयरिंग फील्ड को प्रशिक्षित करता है, जबकि सौहार्दपूर्ण उपयोगिता (benign utility) को सुरक्षित रखता है।

मूल लेखक: Luoyu Chen, Weiqi Wang, Zhiyi Tian, Chenhan Zhang, Feng Wu, Jianhuan Huang, Ahmed Asiri, Shui Yu

प्रकाशित 2026-05-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Luoyu Chen, Weiqi Wang, Zhiyi Tian, Chenhan Zhang, Feng Wu, Jianhuan Huang, Ahmed Asiri, Shui Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Steering Beyond the Support" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ हिंदी अनुवाद दिया गया है।

बड़ी समस्या: "ट्रेनिंग सेट" का जाल

कल्पive कि आपने एक संग्रहालय की सुरक्षा के लिए एक बहुत ही बुद्धिमान सुरक्षा गार्ड (AI) को काम पर रखा है। आप इस गार्ड को 100 विशिष्ट प्रकार के चोरों की फोटो एल्बम दिखाकर प्रशिक्षित करते हैं: एक लाल टोपी पहने हुए, एक नकली मूंछ वाला, और एक लोहे की छड़ (crowbar) पकड़े हुए।

गार्ड इन 100 विशिष्ट चोरों को पहचानने में माहिर हो जाता है। हालाँकि, एक नया चोर आता है जिसने नीली टोपी पहनी है और हाथ में लेजर कटर लिया हुआ है। क्योंकि गार्ड को केवल "लाल टोपी" और "लोहे की छड़" वाली तस्वीरों पर प्रशिक्षित किया गया था, वह नए खतरे को नहीं पहचान पाता और उसे अंदर आने देता है।

AI की दुनिया में, इसे जेलब्रेक समस्या (jailbreak problem) कहा जाता है।

  • गार्ड: एक लार्ज लैंग्वेज मॉडल (AI) जिसे मददगार लेकिन सुरक्षित रहने के लिए प्रशिक्षित किया गया है।
  • चोर: "जेलब्रेक" प्रॉम्प्ट्स जो AI को हानिकारक बातें कहने के लिए बहलाते हैं।
  • जाल: पिछली सुरक्षा विधियाँ हमारे सुरक्षा गार्ड की तरह थीं। उन्हें ज्ञात जेलब्रेक्स की एक स्थिर, सीमित सूची पर प्रशिक्षित किया गया था। यदि किसी हैकर ने AI को धोखा देने का कोई नया तरीका खोज लिया (जो प्रशिक्षण सूची में नहीं था), तो पुराने सुरक्षा तरीके विफल हो गए।

पुराना समाधान बनाम नया विचार

पुराना तरीका (सुपरवाइज्ड स्टीयरिंग - Supervised Steering):
पिछले शोधकर्ताओं ने AI को एक एकल "रिफ्यूजल वेक्टर" (refusal vector) सिखाकर इसे ठीक करने की कोशिश की। इसे ऐसे समझें कि आप गार्ड को एक विशाल चुंबक दे रहे हैं जो हर चीज़ को "हानिकारक" क्षेत्र से दूर धकेलता है।

  • दोष: यह बहुत ही भद्दा (blunt) तरीका है। यदि आप सब कुछ दूर धकेलते हैं, तो आप अनजाने में मददगार अनुरोधों को भी दूर धकेल सकते हैं (जैसे सूप की रेसिपी पूछना)। इसके अलावा, यह केवल उन्हीं विशिष्ट चोरों पर अच्छा काम करता है जिन्हें देखने के लिए इसे प्रशिक्षित किया गया था।

नया तरीका (इस पेपर का समाधान):
लेखक एक अधिक स्मार्ट और लचीला दृष्टिकोण प्रस्तावित करते हैं जिसे एडवर्सरियल ट्रेनिंग ऑन अनसुपरवाइज्ड जेलब्रोकन एक्टिवेशन सिमुलेशन (Adversarial Training on Unsupervised Jailbroken Activation Simulation) कहा जाता है। यह सुनने में कठिन लग सकता है, आइए इसे एक रूपक (metaphor) से समझते हैं।

रूपक: "ड्रीम सिम्युलेटर" और "लचीला फोर्स फील्ड"

नए चोरों के आने का इंतज़ार करने के बजाय, लेखकों ने AI के मस्तिष्क के भीतर एक ड्रीम सिम्युलेटर (Dream Simulator) बनाया।

  1. ड्रीम सिम्युलेटर (अनसुपरवाइज्ड लेटेंट डायरेक्शन डिस्कवरी):
    AI जानता है कि "मना करना" (जैसे "मैं यह नहीं कर सकता") कैसा दिखता है। शोधकर्ताओं ने उस "मना करने" की स्थिति (refusal state) को गणितीय रूप से "खींचने" का एक तरीका खोजा। कल्पना कीजिए कि आप "मना करने" का प्रतिनिधित्व करने वाले एक रबर बैंड को लेते हैं और उसे यादृच्छिक दिशाओं में खींचते हैं।
  • आश्चर्यजनक रूप से, जब आप इसे पर्याप्त रूप से खींचते हैं, तो यह एक "जेलब्रेक" स्थिति में बदल जाता है (AI किसी बुरी चीज़ को करने के लिए सहमत हो जाता है)।
  • AI यह सब बिना किसी वास्तविक बुरे जेलब्रेक के उदाहरणों के करता है। यह अनिवार्य रूप से अपने स्वयं के आंतरिक तर्क को मोड़कर हजारों नए, नकली जेलब्रेक परिदृश्य सपनों में बुनता (dreams up) है जिन्हें उसने पहले कभी नहीं देखा।
  1. लचीला फोर्स फील्ड (द पोटेंशियल फंक्शन):
    एक अकेले चुंबक के बजाय, शोधकर्ता AI को एक गतिशील फोर्स फील्ड (dynamic force field) सिखाते हैं।
  • अच्छे अनुरोधों के लिए: फोर्स फील्ड अदृश्य है। यदि आप कविता या गणित की मदद मांगते हैं, तो AI बिना किसी प्रतिरोध के इस क्षेत्र से गुजर जाता है। (यह AI की उपयोगिता को बनाए रखता है)।
  • बुरे अनुरोधों के लिए: फोर्स फील्ड एक गाढ़ा, चिपचिपा कीचड़ बन जाता है। जैसे ही AI किसी हानिकारक उत्तर के बारे में सोचना शुरू करता है, फील्ड उसे ज़ोर से "मना करने" वाले क्षेत्र की ओर वापस धकेलता है।

उन्होंने इसे कैसे प्रशिक्षित किया: "इनर और आउटर" लूप

प्रशिक्षण प्रक्रिया एक वीडियो गेम की तरह है जिसमें दो स्तर एक साथ चलते हैं:

  • लेवल 1 (इनर स्टेप - हमलावर):
    AI अपने स्वयं के सुरक्षा नियमों को तोड़ने की कोशिश करता है। यह "ड्रीम सिम्युलेटर" का उपयोग करके जितने भी कठिन से कठिन नकली जेलब्रेक सोच सकता है, उन्हें बनाता है। यह एक हैकर की तरह है जो दीवार में छेद खोजने की कोशिश कर रहा है।
  • लेवल 2 (आउटर स्टेप - रक्षक):
    AI फिर उन विशिष्ट छेदों को भरने के लिए अपने "फोर्स फील्ड" को अपडेट करता है। यह उन नकली जेलब्रेक्स को "मना करने" की ओर धकेलने के लिए सीखता है, साथ ही यह भी सुनिश्चित करता है कि दीवार "अच्छे" अनुरोधों को न रोके।

वे इस लूप को हज़ारों बार दोहराते हैं। "हमलावर" नए छेद खोजने में स्मार्ट होता जा रहा है, और "रक्षक" उन छेदों को भरने में बेहतर होता जा रहा है। क्योंकि हमलावर मौके पर ही नए परिदृश्य बना रहा है, रक्षक किसी भी प्रकार के जेलब्रेक को संभालने के लिए तैयार हो जाता है, न कि केवल मूल प्रशिक्षण सूची वाले जेलब्रेक को।

परिणाम: एक मज़बूत, स्मार्ट गार्ड

पेपर का परीक्षण तीन अलग-अलग AI मॉडलों और छह अलग-अलग जेलब्रेक हमलों पर किया गया।

  • स्कोर: इस नए तरीके ने 95% से अधिक हमलों को रोका (अटैक सक्सेस रेट को 5% से नीचे रखा)।
  • बोनस: पुराने "बड़े चुंबक" वाले तरीके के विपरीत, इस नए फोर्स फील्ड ने AI को सामान्य प्रश्नों का उत्तर देने से नहीं रोका। इसने AI को मददगार और स्मार्ट बनाए रखा।
  • प्रमाण: शोधकर्ताओं ने दिखाया कि जैसे-जैसे प्रशिक्षण आगे बढ़ा, "ड्रीम सिम्युलेटर" ने अधिक से अधिक "जेलब्रेक क्षेत्र" को कवर किया, प्रभावी रूप से संभावित खतरों के पूरे परिदृश्य का मानचित्र तैयार किया, यहाँ तक कि उन खतरों का भी जो अभी अस्तित्व में नहीं थे।

सारांश

संक्षेप में, यह पेपर AI सुरक्षा की समस्या को इसलिए हल करता है क्योंकि यह AI को अपने स्वयं के सबसे बुरे परिदृश्यों की कल्पना करना सिखाता है और फिर उन्हें रोकने के लिए एक कस्टम, लचीला ढाल बनाता है। बुरे लोगों की सूची याद करने के बजाय, AI बुरे व्यवहार के आकार को सीखता है, जिससे यह नए, अनदेखे तरीकों को तुरंत पहचानने और रोकने में सक्षम होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →