Steering Beyond the Support: Adversarial Training on Unsupervised Jailbroken Activation Simulation
यह शोधपत्र एक ज़ीरो-शॉट जेलब्रेक डिफेंस फ्रेमवर्क प्रस्तावित करता है जो विविध प्रतिकूल सक्रियणों (adversarial activations) को सिम्युलेट करने के लिए अनसुपरवाइज्ड लेटेंट डायरेक्शन डिस्कवरी का उपयोग करता है और अनदेखे जेलब्रेक्स को इनकार (refusal) की ओर प्रभावी ढंग से मोड़ने के लिए एक पोटेंशियल-इंड्यूस्ड स्टीयरिंग फील्ड को प्रशिक्षित करता है, जबकि सौहार्दपूर्ण उपयोगिता (benign utility) को सुरक्षित रखता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "Steering Beyond the Support" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ हिंदी अनुवाद दिया गया है।
बड़ी समस्या: "ट्रेनिंग सेट" का जाल
कल्पive कि आपने एक संग्रहालय की सुरक्षा के लिए एक बहुत ही बुद्धिमान सुरक्षा गार्ड (AI) को काम पर रखा है। आप इस गार्ड को 100 विशिष्ट प्रकार के चोरों की फोटो एल्बम दिखाकर प्रशिक्षित करते हैं: एक लाल टोपी पहने हुए, एक नकली मूंछ वाला, और एक लोहे की छड़ (crowbar) पकड़े हुए।
गार्ड इन 100 विशिष्ट चोरों को पहचानने में माहिर हो जाता है। हालाँकि, एक नया चोर आता है जिसने नीली टोपी पहनी है और हाथ में लेजर कटर लिया हुआ है। क्योंकि गार्ड को केवल "लाल टोपी" और "लोहे की छड़" वाली तस्वीरों पर प्रशिक्षित किया गया था, वह नए खतरे को नहीं पहचान पाता और उसे अंदर आने देता है।
AI की दुनिया में, इसे जेलब्रेक समस्या (jailbreak problem) कहा जाता है।
- गार्ड: एक लार्ज लैंग्वेज मॉडल (AI) जिसे मददगार लेकिन सुरक्षित रहने के लिए प्रशिक्षित किया गया है।
- चोर: "जेलब्रेक" प्रॉम्प्ट्स जो AI को हानिकारक बातें कहने के लिए बहलाते हैं।
- जाल: पिछली सुरक्षा विधियाँ हमारे सुरक्षा गार्ड की तरह थीं। उन्हें ज्ञात जेलब्रेक्स की एक स्थिर, सीमित सूची पर प्रशिक्षित किया गया था। यदि किसी हैकर ने AI को धोखा देने का कोई नया तरीका खोज लिया (जो प्रशिक्षण सूची में नहीं था), तो पुराने सुरक्षा तरीके विफल हो गए।
पुराना समाधान बनाम नया विचार
पुराना तरीका (सुपरवाइज्ड स्टीयरिंग - Supervised Steering):
पिछले शोधकर्ताओं ने AI को एक एकल "रिफ्यूजल वेक्टर" (refusal vector) सिखाकर इसे ठीक करने की कोशिश की। इसे ऐसे समझें कि आप गार्ड को एक विशाल चुंबक दे रहे हैं जो हर चीज़ को "हानिकारक" क्षेत्र से दूर धकेलता है।
- दोष: यह बहुत ही भद्दा (blunt) तरीका है। यदि आप सब कुछ दूर धकेलते हैं, तो आप अनजाने में मददगार अनुरोधों को भी दूर धकेल सकते हैं (जैसे सूप की रेसिपी पूछना)। इसके अलावा, यह केवल उन्हीं विशिष्ट चोरों पर अच्छा काम करता है जिन्हें देखने के लिए इसे प्रशिक्षित किया गया था।
नया तरीका (इस पेपर का समाधान):
लेखक एक अधिक स्मार्ट और लचीला दृष्टिकोण प्रस्तावित करते हैं जिसे एडवर्सरियल ट्रेनिंग ऑन अनसुपरवाइज्ड जेलब्रोकन एक्टिवेशन सिमुलेशन (Adversarial Training on Unsupervised Jailbroken Activation Simulation) कहा जाता है। यह सुनने में कठिन लग सकता है, आइए इसे एक रूपक (metaphor) से समझते हैं।
रूपक: "ड्रीम सिम्युलेटर" और "लचीला फोर्स फील्ड"
नए चोरों के आने का इंतज़ार करने के बजाय, लेखकों ने AI के मस्तिष्क के भीतर एक ड्रीम सिम्युलेटर (Dream Simulator) बनाया।
- ड्रीम सिम्युलेटर (अनसुपरवाइज्ड लेटेंट डायरेक्शन डिस्कवरी):
AI जानता है कि "मना करना" (जैसे "मैं यह नहीं कर सकता") कैसा दिखता है। शोधकर्ताओं ने उस "मना करने" की स्थिति (refusal state) को गणितीय रूप से "खींचने" का एक तरीका खोजा। कल्पना कीजिए कि आप "मना करने" का प्रतिनिधित्व करने वाले एक रबर बैंड को लेते हैं और उसे यादृच्छिक दिशाओं में खींचते हैं।
- आश्चर्यजनक रूप से, जब आप इसे पर्याप्त रूप से खींचते हैं, तो यह एक "जेलब्रेक" स्थिति में बदल जाता है (AI किसी बुरी चीज़ को करने के लिए सहमत हो जाता है)।
- AI यह सब बिना किसी वास्तविक बुरे जेलब्रेक के उदाहरणों के करता है। यह अनिवार्य रूप से अपने स्वयं के आंतरिक तर्क को मोड़कर हजारों नए, नकली जेलब्रेक परिदृश्य सपनों में बुनता (dreams up) है जिन्हें उसने पहले कभी नहीं देखा।
- लचीला फोर्स फील्ड (द पोटेंशियल फंक्शन):
एक अकेले चुंबक के बजाय, शोधकर्ता AI को एक गतिशील फोर्स फील्ड (dynamic force field) सिखाते हैं।
- अच्छे अनुरोधों के लिए: फोर्स फील्ड अदृश्य है। यदि आप कविता या गणित की मदद मांगते हैं, तो AI बिना किसी प्रतिरोध के इस क्षेत्र से गुजर जाता है। (यह AI की उपयोगिता को बनाए रखता है)।
- बुरे अनुरोधों के लिए: फोर्स फील्ड एक गाढ़ा, चिपचिपा कीचड़ बन जाता है। जैसे ही AI किसी हानिकारक उत्तर के बारे में सोचना शुरू करता है, फील्ड उसे ज़ोर से "मना करने" वाले क्षेत्र की ओर वापस धकेलता है।
उन्होंने इसे कैसे प्रशिक्षित किया: "इनर और आउटर" लूप
प्रशिक्षण प्रक्रिया एक वीडियो गेम की तरह है जिसमें दो स्तर एक साथ चलते हैं:
- लेवल 1 (इनर स्टेप - हमलावर):
AI अपने स्वयं के सुरक्षा नियमों को तोड़ने की कोशिश करता है। यह "ड्रीम सिम्युलेटर" का उपयोग करके जितने भी कठिन से कठिन नकली जेलब्रेक सोच सकता है, उन्हें बनाता है। यह एक हैकर की तरह है जो दीवार में छेद खोजने की कोशिश कर रहा है। - लेवल 2 (आउटर स्टेप - रक्षक):
AI फिर उन विशिष्ट छेदों को भरने के लिए अपने "फोर्स फील्ड" को अपडेट करता है। यह उन नकली जेलब्रेक्स को "मना करने" की ओर धकेलने के लिए सीखता है, साथ ही यह भी सुनिश्चित करता है कि दीवार "अच्छे" अनुरोधों को न रोके।
वे इस लूप को हज़ारों बार दोहराते हैं। "हमलावर" नए छेद खोजने में स्मार्ट होता जा रहा है, और "रक्षक" उन छेदों को भरने में बेहतर होता जा रहा है। क्योंकि हमलावर मौके पर ही नए परिदृश्य बना रहा है, रक्षक किसी भी प्रकार के जेलब्रेक को संभालने के लिए तैयार हो जाता है, न कि केवल मूल प्रशिक्षण सूची वाले जेलब्रेक को।
परिणाम: एक मज़बूत, स्मार्ट गार्ड
पेपर का परीक्षण तीन अलग-अलग AI मॉडलों और छह अलग-अलग जेलब्रेक हमलों पर किया गया।
- स्कोर: इस नए तरीके ने 95% से अधिक हमलों को रोका (अटैक सक्सेस रेट को 5% से नीचे रखा)।
- बोनस: पुराने "बड़े चुंबक" वाले तरीके के विपरीत, इस नए फोर्स फील्ड ने AI को सामान्य प्रश्नों का उत्तर देने से नहीं रोका। इसने AI को मददगार और स्मार्ट बनाए रखा।
- प्रमाण: शोधकर्ताओं ने दिखाया कि जैसे-जैसे प्रशिक्षण आगे बढ़ा, "ड्रीम सिम्युलेटर" ने अधिक से अधिक "जेलब्रेक क्षेत्र" को कवर किया, प्रभावी रूप से संभावित खतरों के पूरे परिदृश्य का मानचित्र तैयार किया, यहाँ तक कि उन खतरों का भी जो अभी अस्तित्व में नहीं थे।
सारांश
संक्षेप में, यह पेपर AI सुरक्षा की समस्या को इसलिए हल करता है क्योंकि यह AI को अपने स्वयं के सबसे बुरे परिदृश्यों की कल्पना करना सिखाता है और फिर उन्हें रोकने के लिए एक कस्टम, लचीला ढाल बनाता है। बुरे लोगों की सूची याद करने के बजाय, AI बुरे व्यवहार के आकार को सीखता है, जिससे यह नए, अनदेखे तरीकों को तुरंत पहचानने और रोकने में सक्षम होता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।