Persona-Conditioned Adversarial Prompting: Multi-Identity Red-Teaming for Adversarial Discovery and Mitigation
यह शोध पत्र पर्सोना-कंडीशन्ड एडवरसैरियल प्रॉम्प्टिंग (PCAP) को प्रस्तुत करता है, जो एक रेड-टीमिंग फ्रेमवर्क है जो ट्रांसफर करने योग्य जेलब्रेक्स खोजने और समृद्ध, मेटाडेटा-युक्त डेटासेट उत्पन्न करने के लिए विविध हमलावर पर्सोना का लाभ उठाता है, जिससे प्रभावी स्वचालित संरेखण सक्षम होता है और लक्षित फाइन-ट्यूनिंग के माध्यम से मॉडल की मजबूती में महत्वपूर्ण सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन नादान रोबोट को खतरनाक चालों को पहचानना सिखाने की कोशिश कर रहे हैं। वह रोबोट एक लार्ज लैंग्वेज मॉडल (LLM) है, और इस समय, लोग उसे ठीक उसी तरह के सवाल पूछकर बेवकूफ बना रहे हैं जिससे वे उसकी सुरक्षा नियमों को दरकिनार कर सकें।
यह शोध पत्र एक नई विधि पेश करता है जिसे PCAP (पर्सोना-कंडीशन्ड एडवरसेरियल प्रॉम्प्टिंग) कहा जाता है। यह कैसे काम करता है, इसे सरल उपमाओं के माध्यम से यहाँ समझाया गया है:
समस्या: "वन-ट्रिक पोनी" हमलावर
पहले, इन सुरक्षा छिद्रों (जिन्हें रेड-टीमिंग कहा जाता है) को खोजने वाले स्वचालित सिस्टम ऐसे सुरक्षा गार्ड की तरह थे जो केवल एक विशिष्ट प्रकार के ताले खोलने वाले औजार (लॉकपिक) की जाँच करते थे। वे बार-बार एक ही तरह की चालें चलते थे।
- परिणाम: उन्होंने कुछ छेद तो खोज लिए, लेकिन वे उन चतुर, वास्तविक दुनिया की चालों को चूक गए जो असली बुरे तत्व इस्तेमाल करते हैं। यह एक किले की सुरक्षा की जांच करने जैसा है जहाँ आप केवल सामने की दीवार पर चढ़ने की कोशिश करते हैं, जबकि इस बात को नजरअंदाज कर देते हैं कि कोई एक बेकर (रोटी बनाने वाला) बनकर पीछे के दरवाजे से चुपके से अंदर आ सकता है।
समाधान: "मेथड एक्टर" दृष्टिकोण
PCAP खेल बदल देता है क्योंकि यह हमलावर रोबोट को एक पोशाक और एक स्क्रिप्ट देता है। केवल एक सामान्य "हैकर" होने के बजाय, रोबोट को विशिष्ट लोगों (पर्सोना) के रूप में अभिनय करने के लिए कहा जाता है जिनके विशिष्ट लक्ष्य होते हैं।
- पर्सोना (पात्र): कल्पना कीजिए कि रोबोट अलग-अलग मुखौटे पहनता है। कभी-कभी वह स्कूल प्रोजेक्ट के लिए सवाल पूछने वाले एक जिज्ञासु छात्र की तरह व्यवहार करता है। कभी-कभी वह एक चिड़चिड़े डॉक्टर की तरह व्यवहार करता है जो चिकित्सा रहस्य सुलझाने की कोशिश कर रहा है। अन्य समय में, वह परेशानी पैदा करने वाले दुर्भावनापूर्ण अभिनेता की तरह व्यवहार करता है।
- रणनीति कार्ड (स्ट्रेटेजी कार्ड्स): पोशाक के साथ-साथ, रोबोट को "रणनीति कार्डों" का एक डेक मिलता है। ये एक 'चीट शीट' की तरह हैं जो उसे बताते हैं कि कैसे बात करनी है। एक कार्ड कह सकता है, "अपने असली इरादे को छिपाने के लिए एक ऐतिहासिक कहानी का उपयोग करें।" दूसरा कह सकता है, "अपने प्रश्न को छोटे, हानिरहित टुकड़ों में विभाजित करें।"
यह कैसे काम करता है: समानांतर खेल के मैदान (पैरेलल प्लेग्राउंड्स)
सिस्टम को तोड़ने के लिए एक रोबोट के बजाय, PCAP कई समानांतर खेल के मैदान स्थापित करता है।
- सेटअप: यह मान लीजिए कि 6 अलग-अलग "अभिनेता" (एक छात्र, एक शिक्षक, एक हैकर, आदि) बनाता है।
- खोज: प्रत्येक अभिनेता अपनी अनूठी आवाज और विशिष्ट रणनीतियों के सेट का उपयोग करके लक्षित रोबोट को धोखा देने की कोशिश करता है।
- खोज (डिस्कवरी): क्योंकि वे सभी एक साथ अलग-अलग चीजें करने की कोशिश कर रहे हैं, वे सुरक्षा छिद्रों की एक बहुत विस्तृत विविधता पाते हैं।
- उपमा: यदि आप एक बांध में हर दरार को खोजना चाहते हैं, तो आप उस पर केवल एक पत्थर नहीं फेंकते। आप विभिन्न कोणों से पानी, रेत, बर्फ और बेलें (vines) फेंकते हैं। PCAP इन सभी अलग-अलग "सामग्रियों" को एक साथ रोबोट पर फेंकता है।
परिणाम: अधिक छेद, तेजी से ढूंढना
शोध पत्र ने एक बहुत ही मजबूत रोबोट (GPT-OSS 120B) पर इसका परीक्षण किया।
- PCAP से पहले: पुराने तरीके ने सुरक्षा नियमों को तोड़ने का तरीका 57% समय पाया।
- PCAP के साथ: नए तरीके ने 97% समय में सफलता पाई।
- विविधता: इसने केवल अधिक बार ही नहीं तोड़ा; इसने इसे तोड़ने के 2 से 6 गुना अधिक अद्वितीय तरीके खोजे। यह केवल 10 चाबियाँ खोजने के बजाय 100 अलग-अलग चाबियाँ खोजने जैसा है।
सबसे अच्छी बात: "स्व-उपचार" लूप (सेल्फ-हीलिंग लूप)
यह इस शोध पत्र का सबसे महत्वपूर्ण हिस्सा है। आमतौर पर, एक छेद खोजना केवल पहला कदम होता है। फिर आपको इसे ठीक करने के लिए इंसानों को लिखने के लिए काम पर लगाना पड़ता है, जिसमें बहुत समय लगता है।
PCAP इस सुधार को स्वचालित करता है:
- हमला: "अभिनेता" रोबोट को तोड़ते हैं और रिकॉर्ड करते हैं कि उन्होंने इसे ठीक कैसे किया।
- पाठ (लेसन): शोध पत्र दिखाता है कि आप इन रिकॉर्ड किए गए तरीकों को लेकर रोबोट को "फाइन-ट्यून" (पुनः प्रशिक्षित) कर सकते हैं।
- परिणाम: रोबोट ट्रिक के पैटर्न को पहचानना सीख जाता है, न कि केवल विशिष्ट शब्दों को।
- उपमा: रोबोट को यह सिखाने के बजाय कि "लाल टोपी पहनने वाले लोगों को अंदर न आने दें," आप उसे लाल टोपी, नीली टोपी और हरी टोपी पहने हुए लोगों की हजार तस्वीरें दिखाते हैं जो अंदर घुसने की कोशिश कर रहे हैं, और वह "छिपकर घुसने" की अवधारणा को सीख जाता है।
- प्रमाण: इस त्वरित पुन: प्रशिक्षण के बाद, रोबोट अविश्वसनीय रूप से मजबूत हो गया। इसने हमलों को 99% बार रोका, और लगभग कोई गलत अलार्म (False Alarm) नहीं दिया (यानी इसने सामान्य प्रश्नों के उत्तर देने से मना नहीं किया)।
सारांश
यह शोध पत्र एक पूर्ण चक्र प्रस्तुत करता है:
- खोजें (Discover): उन सुरक्षा छिद्रों को खोजने के लिए "मेथड एक्टर्स" का उपयोग करें जिन्हें सामान्य परीक्षण मिस कर देते हैं।
- जेनरेट करें (Generate): इन ट्रिक्स का एक विशाल डेटासेट स्वचालित रूप से बनाएं।
- रक्षा करें (Defend): उस डेटासेट का उपयोग करके रोबोट को तुरंत उन ट्रिक्स को पहचानने और ब्लॉक करने के लिए प्रशिक्षित करें।
यह कमजोरियों को खोजने और उन्हें ठीक करने की प्रक्रिया को एक तेज़, स्वचालित लूप में बदल देता है, जिससे AI को पहले की तुलना में बहुत तेज़ी से सुरक्षित बनाया जा सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।