Single-Configuration Attack Success Rate Is Not Enough: Jailbreak Evaluations Should Report Distributional Attack Success
यह स्थिति पत्र तर्क देता है कि एकल-कॉन्फ़िगरेशन सफलता दरों पर निर्भर वर्तमान जेलब्रेक मूल्यांकन खतरों को चित्रित करने के लिए अपर्याप्त हैं और पैरामीटर विविधताओं के माध्यम से हमले के प्रदर्शन के पूर्ण दायरे को बेहतर ढंग से पकड़ने के लिए वेरिएंट सेंसिटिविटी मेजर (VSM) और यूनियन कवरेज (UC) जैसे वितरण संबंधी मेट्रिक्स को अपनाने का प्रस्ताव देता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक सुरक्षा गार्ड हैं जो यह समझने की कोशिश कर रहे हैं कि एक हाई-टेक इमारत में घुसपैठ करना कितना आसान है।
AI सुरक्षा की दुनिया में, शोधकर्ता अक्सर "जेलब्रेक" हमलों (jailbreak attacks) का परीक्षण करते—ऐसी विधियाँ जिन्हें AI मॉडल को वह कहने के लिए मजबूर करने के लिए डिज़ाइन किया गया है जो उन्हें नहीं कहना चाहिए। परीक्षणों को रिपोर्ट करने का वर्तमान मानक ऐसा है जैसे कोई चोर कहे: "मुझे एक विशिष्ट चाबी मिली जो सामने के दरवाजे को 80% बार खोल देती है। इसलिए, यह इमारत 80% असुरक्षित है।"
यह पेपर तर्क देता है कि रिपोर्ट करने का यह तरीका भ्रामक और अधूरा है। यह ऐसा ही है जैसे कोई चोर आपको एक चाबी दिखाए जो सामने का दरवाजा खोलती है और दावा करे, "इस तरह यह इमारत सुरक्षित है।" लेकिन क्या होगा यदि:
- वह चाबी केवल सामने के दरवाजे के लिए काम करती है, लेकिन 10 अन्य चाबियाँ हैं जो पीछे, बगल और बेसमेंट के दरवाजों को खोल सकती हैं?
- "80% सफलता" एक भाग्यशाली संयोग था जो केवल एक बहुत ही विशिष्ट सेटिंग के साथ होता है, जबकि अन्य 99 सेटिंग्स शायद ही कभी काम करती हैं?
यदि रक्षक (सुरक्षा गार्ड) केवल उस एक "सर्वश्रेष्ठ" नंबर को देखते हैं, तो वे सामने के दरवाजे को ठीक (patch) कर सकते हैं और सोच सकते हैं कि वे सुरक्षित हैं, जबकि पीछे और बगल के दरवाजे अभी भी खुले रह जाते हैं।
यहाँ सरल उपमाओं का उपयोग करके पेपर के तर्क का विवरण दिया गया है:
समस्या: "सर्वश्रेष्ठ कुंजी" का भ्रम (The "Best Key" Fallacy)
अधिकांश AI सुरक्षा पेपर एक एकल संख्या रिपोर्ट करते हैं, जिसे अटैक सक्सेस रेट (ASR) कहा जाता है। वे सेटिंग्स के सबसे अच्छे संयोजन (जैसे कि सबसे अच्छी "चाबी") को चुनते हैं और कहते हैं, "देखो, यह हमला 80% बार काम करता है!"
लेखक कहते हैं कि यह वैसा ही है जैसे कोई चोर आपको एक ऐसी चाबी दिखाए जो सामने का दरवाजा खोलती है और दावा करे, "इस तरह यह इमारत कितनी सुरक्षित है।" लेकिन क्या होगा यदि:
- वह चाबी केवल सामने के दरवाजे पर काम करती है, लेकिन 10 अन्य चाबियाँ हैं जो पीछे, बगल और बेसमेंट के दरवाजों को खोल सकती हैं?
- "80% सफलता" एक भाग्यशाली संयोग था जो केवल एक बहुत ही विशिष्ट सेटिंग के साथ होता है, जबकि अन्य 99 सेटिंग्स लगभग काम ही नहीं करती हैं?
यदि रक्षक (सुरक्षा गार्ड) केवल उस एक "सर्वश्रेष्ठ" नंबर को देखते हैं, तो वे सामने के दरवाजे को ठीक कर सकते हैं और सोच सकते हैं कि वे सुरक्षित हैं, जबकि पीछे और बगल के दरवाजे अभी भी खुले रह जाते हैं।
समाधान: दो नए मापने के पैमाने (Two New Measuring Cups)
लेखक खतरे को मापने के दो नए तरीके प्रस्तावित करते हैं, जिन्हें वे VSM और UC कहते हैं।
1. VSM (वेरिएंट सेंसिटिविटी मेजर): "वह चाबी कितनी भाग्यशाली थी?"
कल्पना कीजिए कि आपके पास 100 अलग-अलग चाबियों का एक बैग है।
- परिदृश्य A: 95 उनसे दरवाजा आसानी से खुल जाता है। एक बेकार है। यदि आप "सर्वश्रेष्ठ" चाबी की रिपोर्ट करते हैं, तो आप औसत अनुभव के बारे में सच बता रहे हैं।
- परिदृश्य B: केवल 1 चाबी पूरी तरह से काम करती है, और अन्य 99 बेकार हैं। यदि आप "सर्वश्रेष्ठ" चाबी की रिपोर्ट करते हैं, तो आप औसत अनुभव के बारे में झूठ बोल रहे हैं।
VSM "सर्वश्रेष्ठ" परिणाम और "औसत" परिणाम के बीच के अंतर को मापता है।
- कम VSM: हमला सुसंगत (consistent) है। हेडलाइन नंबर विश्वसनीय है।
- उच्च VSM: हेडलाइन नंबर एक इत्तेफाक है। हमला केवल तभी काम करता है जब आप सेटिंग्स के साथ अविश्वसनीय रूप से भाग्यशाली हों। पेपर ने पाया कि कुछ हमलों के लिए, "सर्वश्रेष्ठ" परिणाम औसत परिणाम से पाँच गुना बेहतर था, जिसका अर्थ है कि हेडलाइन नंबर बेहद आशावादी था।
2. UC (यूनियन कवरेज): "कितने दरवाजे खोले जा सकते हैं?"
यह सुरक्षा के लिए सबसे महत्वपूर्ण हिस्सा है।
कल्पना कीजिए कि आपके पास 36 अलग-अलग चाबियाँ हैं।
- चाबी A 60% दरवाजे खोलती है।
- चाबी B एक अलग 40% दरवाजे खोलती है।
- चाबी C शेष 20% को खोलती है।
यदि आप केवल सबसे अच्छी चाबी (चाबी A) को देखते हैं, तो आप सोचते हैं कि इमारत का 60% हिस्सा असुरक्षित है। लेकिन यदि आप सभी चाबियों को एक साथ आजमाते हैं, तो आप महसूस करते हैं कि 100% इमारत असुरक्षित है।
UC उस कुल प्रतिशत को मापता है जो दरवाजे खोले जा सकते हैं यदि एक हमलावर हमले के हर बदलाव को आज़माता है। पेपर ने पाया कि कुछ हमलों के लिए, "यूनियन कवरेज", "सर्वश्रेष्ठ एकल कॉन्फ़िगरेशन" से 33% अधिक था। इसका मतलब है कि जो रक्षक केवल सबसे अच्छे नंबर को देखते हैं, वे खतरे के एक बड़े हिस्से को मिस कर रहे हैं।
पेपर से वास्तविक दुनिया के उदाहरण
लेखकों ने इन विचारों का परीक्षण तीन अलग-अलग AI मॉडल का उपयोग करके दो प्रसिद्ध "अटैक फैमिलीज़" (PAIR और Bijection Learning) पर किया।
- PAIR हमला: उन्होंने विभिन्न "पर्सोना" (जैसे कि एक अधिकारिक व्यक्ति या एक तार्किक विचारक के रूप में व्यवहार करना) का परीक्षण किया।
- हेडलाइन: "अथॉरिटी एंडोर्समेंट" (Authority Endorsement) 69% बार काम करता है।
- वास्तविकता: जब उन्होंने तीनों पर्सोना को मिलाया, तो वे 88% मामलों में सेंध लगा सके। एकल संख्या ने 19% असुरक्षित प्रॉम्प्ट्स को मिस कर दिया।
- Bijection हमला: यह अलग-अलग "एनकोडिंग" ट्रिक्स (जैसे टेक्स्ट की भाषा या स्पेसिंग बदलना) का उपयोग करता है।
- हेडलाइन: सबसे अच्छा एकल सेटिंग 81% बार काम करता है।
- वास्तविकता: जब उन्होंने सभी 36 संभावित संयोजनों को आज़माया, तो 100% प्रॉम्प्ट्स टूट गए। "सर्वश्रेष्ठ" नंबर ने इस तथ्य को पूरी तरह से मिस कर दिया कि यदि आप पर्याप्त बदलावों को आज़माते हैं, तो हर एक टेस्ट केस असुरक्षित था।
यह क्यों मायने रखता है
पेपर यह नहीं कह रहा है कि वर्तमान नंबर गणितीय रूप से "गलत" हैं; वे बस अधूरे हैं।
- रक्षकों के लिए: यदि आप केवल "सर्वश्रेष्ठ" हमले को ठीक (patch) करते हैं, तो आप इमारत के अन्य 30% हिस्से को खुला छोड़ देते हैं। आपको यह जानने के लिए कि इमारत का कितना हिस्सा वास्तव में जोखिम में है, "यूनियन कवरेज" जानने की आवश्यकता है।
- शोधकर्ताओं के लिए: यदि आप दो हमलों की तुलना कर रहे हैं, जिसमें एक का "बेस्ट" स्कोर 80% (लेकिन बहुत असंगत) है और दूसरे का "बेस्ट" स्कोर 60% (लेकिन बहुत सुसंगत) है, तो आप केवल यह नहीं कह सकते कि पहला वाला "बेहतर" है। आपको यह जानने की आवश्यकता है कि क्या पहला केवल एक भाग्यशाली इत्तेफाक है।
मुख्य बात (The Bottom Line)
लेखक AI अनुसंधान समुदाय से केवल "बेस्ट केस" नंबर चिल्लाने के बजाय निम्नलिखित रिपोर्ट करने के लिए कह रहे हैं:
- बेस्ट केस (हेडलाइन)।
- औसत केस (वह सफलता कितनी सामान्य है?)।
- कुल कवरेज (सभी विविधताओं को आज़माने पर कितने अलग-अलग प्रॉम्प्ट्स को तोड़ा जा सकता है?)।
जब तक शोधकर्ता इस पूर्ण चित्र को रिपोर्ट करना शुरू नहीं करते, हम ऐसे ही रहेंगे जैसे सुरक्षा गार्ड जो केवल सामने का दरवाजा चेक करते हैं और मान लेते हैं कि बाकी इमारत सुरक्षित है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।