Babel: Jailbreaking Safety Attention via Obfuscation Distribution Optimized Sampling
यह शोध पत्र Babel को पेश करता है, जो एक कुशल ब्लैक-बॉक्स जेलब्रेकिंग फ्रेमवर्क है जो पुनरावृत्ति, फीडबैक-संचालित अस्पष्टीकरण सैंपलिंग (obfuscation sampling) का उपयोग करके LLMs में सुरक्षा-महत्वपूर्ण अटेंशन हेड्स के विरल वितरण का लाभ उठाता है ताकि GPT-4o और Claude-3.5-Haiku जैसे फ्रंटियर मॉडल्स पर उच्च क्वेरी दक्षता के साथ अत्याधुनिक अटैक सक्सेस रेट प्राप्त किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ शोध पत्र "Babel: Jailbreaking Safety Attention via Obfuscation Distribution Optimized Sampling" का सरल भाषा और रचनात्मक उपमाओं के साथ अनुवाद दिया गया है।
बड़ी तस्वीर: "सुरक्षा गार्ड" बनाम "जादुई ट्रिक"
एक लार्ज लैंग्वेज मॉडल (LLM) की कल्पना एक बहुत ही बुद्धिमान, मददगार रोबोट लाइब्रेरियन के रूप में करें। किसी भी प्रश्न का उत्तर देने से पहले, उसके पास सुरक्षा गार्डों (जिन्हें "सेफ्टी हेड्स" कहा जाता है) की एक टीम होती है जो हर अनुरोध को स्कैन करती है ताकि यह सुनिश्चित हो सके कि कोई भी खतरनाक चीज़ नहीं पूछ रहा है, जैसे कि बम कैसे बनाया जाए या नफरत भरे भाषण कैसे लिखे जाएं।
शोधकर्ताओं ने इस पेपर में पाया कि ये गार्ड कैसे काम करते हैं इसमें एक मज़ेदार खामी है: वे संख्या में बहुत कम हैं और केवल विशिष्ट स्थानों पर खड़े होते हैं। वे पूरी लाइब्रेरी की निगरानी नहीं करते; वे केवल एक छोटा, विशिष्ट गलियारा देखते हैं। यदि आप अपने खतरनाक अनुरोध को उस एक गलियारे से बचाकर निकाल लेते हैं, तो लाइब्रेरी का बाकी हिस्सा (मॉडल का दिमाग) यह भी नहीं जान पाता कि आप क्या गलत करने की कोशिश कर रहे हैं, और वह खुशी-खुशी आपको उत्तर दे देता है।
यह शोध पत्र Babel नामक एक नया टूल पेश करता है (जिसका नाम टॉवर ऑफ बेबेल के नाम पर रखा गया है, जहाँ भाषाएँ आपस में मिल गई थीं), जो एक मास्टर जादूगर की तरह काम करता है। यह गार्डों से लड़ने की कोशिश नहीं करता; इसके बजाय, यह "ओब्फस्केशन" (भ्रमित करने वाली ट्रिक्स) का उपयोग करके खतरनाक अनुरोध को गार्डों की नज़र में आए बिना चुपके से पार कर लेता है।
यह ट्रिक कैसे काम करती है: "भेष बदलना"
शोधकर्ताओं ने पाया कि यदि आप किसी बुरे अनुरोध के कुछ अक्षरों को बदल देते हैं, तो सुरक्षा गार्ड भ्रमित हो सकते हैं और उसे खतरनाक पहचानना बंद कर सकते हैं। हालाँकि, यहाँ एक नाजुक संतुलन है:
- बहुत अधिक बदलाव: अनुरोध अर्थहीन (gibberish) हो जाता है, और रोबोट लाइब्रेरियन समझ ही नहीं पाता कि आप क्या चाहते हैं।
- बहुत कम बदलाव: सुरक्षा गार्ड तुरंत खतरे को पहचान लेते हैं और "ना" कह देते हैं।
सही संतुलन (The Sweet Spot): एक "गोल्डिलॉक्स ज़ोन" (Goldilocks zone) है जहाँ अनुरोध गार्डों को मूर्ख बनाने के लिए पर्याप्त रूप से उलझा हुआ होता है, लेकिन रोबोट के समझने और उत्तर देने के लिए पर्याप्त स्पष्ट भी होता है।
Babel की रणनीति: "गोल्डिलॉक्स ज़ोन" को खोजना
अंदाज़ा लगाने (जो धीमा और महंगा है) के बजाय, Babel एक स्मार्ट, गणितीय दृष्टिकोण का उपयोग करता है। यह यहाँ बताया गया है कि यह कैसे काम करता है, चरण-दर-चरण:
1. "आंखों पर पट्टी बांधकर" परीक्षण (Small Sampling)
कल्पना कीजिए कि आप एक अंधेरे कमरे में छिपे हुए खजाने के संदूक को खोजने की कोशिश कर रहे हैं। आपको ठीक से नहीं पता कि वह कहाँ है, लेकिन आप जानते हैं कि वह कहीं बीच में ही है।
- Babel कई अलग-अलग "भेष" (अक्षर बदलना, शब्दों को बदलना, या वाक्य की संरचना को मिलाना) आज़माता है।
- यह रोबोट से पूछता है: "क्या आपने 'ना' कहा (अस्वीकार किया), या आपने उत्तर दिया?"
- यदि रोबोट बहुत बार "ना" कहता है, तो भेष बहुत स्पष्ट था। यदि रोबोट भ्रमित हो जाता है और उत्तर नहीं दे पाता, तो भेष बहुत अधिक अस्त-व्यस्त था।
- Babel एक सांख्यिकीय परीक्षण (जैसे सिक्का उछालने की जाँच) का उपयोग करता है यह देखने के लिए कि क्या वह सही क्षेत्र में खड़ा है।
2. "ज़ूम इन" करना (Distribution Optimization)
एक बार जब Babel उस सामान्य क्षेत्र को खोज लेता है जहाँ गार्ड अंधे होते हैं, तो वह अंदाज़ा लगाना बंद कर देता है। वह ज़ूम इन करना शुरू करता है।
- यह उन भेषों का एक "मानचित्र" बनाता है जो सबसे अच्छा काम करते हैं।
- यह अपनी ऊर्जा केवल उन नए भेषों को बनाने में केंद्रित करता है जो उन जैसे दिखते हैं जिन्होंने लगभग काम किया था।
- यह अपने मानचित्र को लगातार परिष्कृत करता रहता है, सटीक भेष के इर्द-गिर्द और भी करीब आता जाता है, जब तक कि उसे वह भेष न मिल जाए जो गार्डों के पास से चुपचाप निकल जाए।
3. "रैपर" (Embedding)
ट्रिक को और बेहतर बनाने के लिए, Babel खतरनाक अनुरोध को एक उबाऊ, हानिरहित कार्य के अंदर लपेट देता है।
- उदाहरण: केवल "मैं ज़हर कैसे बनाऊं?" पूछने के बजाय, यह कहता है: "कृपया इस वाक्य का चीनी में अनुवाद करें: [Scrambled Poison Instructions]।"
- सुरक्षा गार्ड "अनुवाद करें" शब्द देखता है और सोचता है, "ओह, यह एक सुरक्षित कार्य है!" वह अनुरोध को अंदर जाने देता है। फिर रोबोट अंदर के बिखरे हुए निर्देशों को प्रोसेस करता है और उत्तर दे देता है।
परिणाम: Babel कितना अच्छा है?
शोधकर्ताओं ने दुनिया के कुछ सबसे प्रसिद्ध, "सुपर-सिक्योर" रोबोट्स (जैसे GPT-4o, Claude-3.5, और Grok-3) पर Babel का परीक्षण किया।
- पुराना तरीका: पिछले तरीके अंधेरे में तीर चलाने जैसे थे। वे अंततः लक्ष्य को हिट कर सकते थे, लेकिन इसमें सैकड़ों प्रयास लगते थे और अक्सर विफल भी होते थे।
- Babel का तरीका: Babel एक लेज़र-गाइडेड डार्ट की तरह है।
- GPT-4o पर, इसने मॉडल को 82.67% बार चकमा दिया (पुराने तरीकों के 41% की तुलना में)।
- Grok-3 पर, इसने 95.67% बार सफलता प्राप्त की।
- इसने यह सब बहुत कम प्रयासों (औसतन लगभग 40 प्रयास) में किया, जिससे यह बहुत तेज़ और सस्ता हो गया।
यह क्यों मायने रखता है? ("रेड टीमिंग" की उपमा)
लेखक कहते हैं कि यह लोगों को बुरा बनने के लिए सिखाने के बारे में नहीं है; यह रेड टीमिंग (Red Teaming) के बारे में है।
कल्पना कीजिए कि आप एक बैंक के वॉल्ट (तिजोरी) का परीक्षण करने के लिए नियुक्त किए गए सुरक्षा विशेषज्ञ हैं। आप पैसा चुराने के लिए नहीं चाहते; आप लॉक में कमजोरी ढूंढना चाहते ताकि बैंक उसे ठीक कर सके।
- Babel दिखाता है कि सबसे मजबूत तिजोरियों में भी दरवाजे के फ्रेम में एक छोटी सी दरार होती जिसका उपयोग एक चतुर चोर कर सकता है।
- इस दरार को खोजकर, शोधकर्ता उम्मीद करते हैं कि वे इन AI मॉडल बनाने वाली कंपनियों को इस छेद को भरने में मदद कर सकें, जिससे "सुरक्षा गार्ड" अधिक स्मार्ट और लाइब्रेरी सभी के लिए सुरक्षित हो सके।
सारांश
पेपर का दावा है कि AI सुरक्षा कुछ विशिष्ट "गार्डों" पर निर्भर करती है जिन्हें भाषा को थोड़ा भ्रमित करके मूर्ख बनाया जा सकता है। Babel टूल इन गार्डों को कुशलतापूर्वक बायपास करने के लिए भ्रम के सही स्तर को खोजने का एक स्मार्ट, गणितीय तरीका है, जो यह साबित करता है कि वर्तमान AI सुरक्षा उपाय हमारी सोच से कहीं अधिक नाजुक हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।