← नवीनतम पेपर
🤖 machine learning

Persona-Conditioned Adversarial Prompting: Multi-Identity Red-Teaming for Adversarial Discovery and Mitigation

यह शोध पत्र पर्सोना-कंडीशन्ड एडवरसैरियल प्रॉम्प्टिंग (PCAP) को प्रस्तुत करता है, जो एक रेड-टीमिंग फ्रेमवर्क है जो ट्रांसफर करने योग्य जेलब्रेक्स खोजने और समृद्ध, मेटाडेटा-युक्त डेटासेट उत्पन्न करने के लिए विविध हमलावर पर्सोना का लाभ उठाता है, जिससे प्रभावी स्वचालित संरेखण सक्षम होता है और लक्षित फाइन-ट्यूनिंग के माध्यम से मॉडल की मजबूती में महत्वपूर्ण सुधार होता है।

मूल लेखक: Cristian Morasso, Anisa Halimi, Muhammad Zaid Hameed, Douglas Leith

प्रकाशित 2026-05-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Cristian Morasso, Anisa Halimi, Muhammad Zaid Hameed, Douglas Leith

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन नादान रोबोट को खतरनाक चालों को पहचानना सिखाने की कोशिश कर रहे हैं। वह रोबोट एक लार्ज लैंग्वेज मॉडल (LLM) है, और इस समय, लोग उसे ठीक उसी तरह के सवाल पूछकर बेवकूफ बना रहे हैं जिससे वे उसकी सुरक्षा नियमों को दरकिनार कर सकें।

यह शोध पत्र एक नई विधि पेश करता है जिसे PCAP (पर्सोना-कंडीशन्ड एडवरसेरियल प्रॉम्प्टिंग) कहा जाता है। यह कैसे काम करता है, इसे सरल उपमाओं के माध्यम से यहाँ समझाया गया है:

समस्या: "वन-ट्रिक पोनी" हमलावर

पहले, इन सुरक्षा छिद्रों (जिन्हें रेड-टीमिंग कहा जाता है) को खोजने वाले स्वचालित सिस्टम ऐसे सुरक्षा गार्ड की तरह थे जो केवल एक विशिष्ट प्रकार के ताले खोलने वाले औजार (लॉकपिक) की जाँच करते थे। वे बार-बार एक ही तरह की चालें चलते थे।

  • परिणाम: उन्होंने कुछ छेद तो खोज लिए, लेकिन वे उन चतुर, वास्तविक दुनिया की चालों को चूक गए जो असली बुरे तत्व इस्तेमाल करते हैं। यह एक किले की सुरक्षा की जांच करने जैसा है जहाँ आप केवल सामने की दीवार पर चढ़ने की कोशिश करते हैं, जबकि इस बात को नजरअंदाज कर देते हैं कि कोई एक बेकर (रोटी बनाने वाला) बनकर पीछे के दरवाजे से चुपके से अंदर आ सकता है।

समाधान: "मेथड एक्टर" दृष्टिकोण

PCAP खेल बदल देता है क्योंकि यह हमलावर रोबोट को एक पोशाक और एक स्क्रिप्ट देता है। केवल एक सामान्य "हैकर" होने के बजाय, रोबोट को विशिष्ट लोगों (पर्सोना) के रूप में अभिनय करने के लिए कहा जाता है जिनके विशिष्ट लक्ष्य होते हैं।

  • पर्सोना (पात्र): कल्पना कीजिए कि रोबोट अलग-अलग मुखौटे पहनता है। कभी-कभी वह स्कूल प्रोजेक्ट के लिए सवाल पूछने वाले एक जिज्ञासु छात्र की तरह व्यवहार करता है। कभी-कभी वह एक चिड़चिड़े डॉक्टर की तरह व्यवहार करता है जो चिकित्सा रहस्य सुलझाने की कोशिश कर रहा है। अन्य समय में, वह परेशानी पैदा करने वाले दुर्भावनापूर्ण अभिनेता की तरह व्यवहार करता है।
  • रणनीति कार्ड (स्ट्रेटेजी कार्ड्स): पोशाक के साथ-साथ, रोबोट को "रणनीति कार्डों" का एक डेक मिलता है। ये एक 'चीट शीट' की तरह हैं जो उसे बताते हैं कि कैसे बात करनी है। एक कार्ड कह सकता है, "अपने असली इरादे को छिपाने के लिए एक ऐतिहासिक कहानी का उपयोग करें।" दूसरा कह सकता है, "अपने प्रश्न को छोटे, हानिरहित टुकड़ों में विभाजित करें।"

यह कैसे काम करता है: समानांतर खेल के मैदान (पैरेलल प्लेग्राउंड्स)

सिस्टम को तोड़ने के लिए एक रोबोट के बजाय, PCAP कई समानांतर खेल के मैदान स्थापित करता है।

  1. सेटअप: यह मान लीजिए कि 6 अलग-अलग "अभिनेता" (एक छात्र, एक शिक्षक, एक हैकर, आदि) बनाता है।
  2. खोज: प्रत्येक अभिनेता अपनी अनूठी आवाज और विशिष्ट रणनीतियों के सेट का उपयोग करके लक्षित रोबोट को धोखा देने की कोशिश करता है।
  3. खोज (डिस्कवरी): क्योंकि वे सभी एक साथ अलग-अलग चीजें करने की कोशिश कर रहे हैं, वे सुरक्षा छिद्रों की एक बहुत विस्तृत विविधता पाते हैं।
    • उपमा: यदि आप एक बांध में हर दरार को खोजना चाहते हैं, तो आप उस पर केवल एक पत्थर नहीं फेंकते। आप विभिन्न कोणों से पानी, रेत, बर्फ और बेलें (vines) फेंकते हैं। PCAP इन सभी अलग-अलग "सामग्रियों" को एक साथ रोबोट पर फेंकता है।

परिणाम: अधिक छेद, तेजी से ढूंढना

शोध पत्र ने एक बहुत ही मजबूत रोबोट (GPT-OSS 120B) पर इसका परीक्षण किया।

  • PCAP से पहले: पुराने तरीके ने सुरक्षा नियमों को तोड़ने का तरीका 57% समय पाया।
  • PCAP के साथ: नए तरीके ने 97% समय में सफलता पाई।
  • विविधता: इसने केवल अधिक बार ही नहीं तोड़ा; इसने इसे तोड़ने के 2 से 6 गुना अधिक अद्वितीय तरीके खोजे। यह केवल 10 चाबियाँ खोजने के बजाय 100 अलग-अलग चाबियाँ खोजने जैसा है।

सबसे अच्छी बात: "स्व-उपचार" लूप (सेल्फ-हीलिंग लूप)

यह इस शोध पत्र का सबसे महत्वपूर्ण हिस्सा है। आमतौर पर, एक छेद खोजना केवल पहला कदम होता है। फिर आपको इसे ठीक करने के लिए इंसानों को लिखने के लिए काम पर लगाना पड़ता है, जिसमें बहुत समय लगता है।

PCAP इस सुधार को स्वचालित करता है:

  1. हमला: "अभिनेता" रोबोट को तोड़ते हैं और रिकॉर्ड करते हैं कि उन्होंने इसे ठीक कैसे किया।
  2. पाठ (लेसन): शोध पत्र दिखाता है कि आप इन रिकॉर्ड किए गए तरीकों को लेकर रोबोट को "फाइन-ट्यून" (पुनः प्रशिक्षित) कर सकते हैं।
  3. परिणाम: रोबोट ट्रिक के पैटर्न को पहचानना सीख जाता है, न कि केवल विशिष्ट शब्दों को।
    • उपमा: रोबोट को यह सिखाने के बजाय कि "लाल टोपी पहनने वाले लोगों को अंदर न आने दें," आप उसे लाल टोपी, नीली टोपी और हरी टोपी पहने हुए लोगों की हजार तस्वीरें दिखाते हैं जो अंदर घुसने की कोशिश कर रहे हैं, और वह "छिपकर घुसने" की अवधारणा को सीख जाता है।
  4. प्रमाण: इस त्वरित पुन: प्रशिक्षण के बाद, रोबोट अविश्वसनीय रूप से मजबूत हो गया। इसने हमलों को 99% बार रोका, और लगभग कोई गलत अलार्म (False Alarm) नहीं दिया (यानी इसने सामान्य प्रश्नों के उत्तर देने से मना नहीं किया)।

सारांश

यह शोध पत्र एक पूर्ण चक्र प्रस्तुत करता है:

  1. खोजें (Discover): उन सुरक्षा छिद्रों को खोजने के लिए "मेथड एक्टर्स" का उपयोग करें जिन्हें सामान्य परीक्षण मिस कर देते हैं।
  2. जेनरेट करें (Generate): इन ट्रिक्स का एक विशाल डेटासेट स्वचालित रूप से बनाएं।
  3. रक्षा करें (Defend): उस डेटासेट का उपयोग करके रोबोट को तुरंत उन ट्रिक्स को पहचानने और ब्लॉक करने के लिए प्रशिक्षित करें।

यह कमजोरियों को खोजने और उन्हें ठीक करने की प्रक्रिया को एक तेज़, स्वचालित लूप में बदल देता है, जिससे AI को पहले की तुलना में बहुत तेज़ी से सुरक्षित बनाया जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →