STACK: Adversarial Attacks on LLM Safeguard Pipelines
यह शोध पत्र STACK एडवरसैरियल अटैक प्रक्रिया का परिचय देता है, जो एक नए फ्यू-शॉट-प्रॉम्प्टेड (few-shot-prompted) LLM सुरक्षा तंत्र को 71% अटैक सक्सेस रेट के साथ सफलतापूर्वक समझौता करता है, जिससे वर्तमान फ्रंटियर एआई रक्षा प्रणालियों में महत्वपूर्ण कमजोरियों को उजागर किया जा सके और विशिष्ट समाधान प्रस्तावित किए जा सकें।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही शक्तिशाली, सहायक रोबोट सहायक बना रहे हैं। आप चाहते हैं कि यह स्मार्ट हो, लेकिन आप इस बात से डरे हुए हैं कि यह गलती से (या जानबूझकर) किसी को बम बनाने या कोई खतरनाक वायरस बनाने के निर्देश दे सकता है।
इसे रोकने के लिए, रोबोट के निर्माता केवल एक "स्टॉप" साइन पर भरोसा नहीं करते हैं। इसके बजाय, वे एक सुरक्षा पाइपलाइन (security pipeline) बनाते हैं, जो एक बहु-स्तरीय किले की तरह है। यह शोध पत्र, जिसका शीर्षक STACK है, इस बात की जांच करता है कि ये किले वास्तव में चालाक हैकर्स के सामने कितनी अच्छी तरह टिक पाते हैं।
यहाँ इस पेपर की कहानी का विवरण, सरल उपमाओं (analogies) का उपयोग करके दिया गया है:
1. किला: "डेफेंस इन डेप्थ" (गहराई में सुरक्षा)
AI सुरक्षा प्रणाली को एक ऐसे महल के रूप में सोचें जिसमें तीन गार्ड एक पंक्ति में खड़े हैं:
- गार्ड 1 (इनपुट क्लासिफायर): रोबोट तक पहुँचने से पहले आपके द्वारा भेजे गए पत्र की जाँच करता है। यदि पत्र संदिग्ध दिखता है, तो वे उसे तुरंत रोक देते हैं।
- रोबोट (द मॉडल): यदि पत्र गार्ड 1 द्वारा पास कर दिया जाता है, तो रोबोट उसे पढ़ता है और जवाब लिखता है।
- गार्ड 2 (आउटपुट क्लासिफायर): रोबोट के जवाब को आपके पास पहुँचने से पहले जाँचता है। यदि जवाब में खतरनाक निर्देश शामिल हैं, तो यह गार्ड उस पत्र को छीन लेता है।
विचार यह है कि किसी बुरे व्यक्ति को सफल होने के लिए, उसे दोनों गार्ड्स और रोबोट को धोखा देना होगा। इसे "डेफेंस इन डेप्थ" (या "स्विस चीज़" मॉडल) कहा जाता है, जहाँ यदि एक परत में छेद है, तो अन्य परतें खतरे को पकड़ लेंगी।
2. समस्या: गार्ड सो रहे हैं
शोधकर्ताओं ने ओपन-सोर्स टूल्स (जैसे सार्वजनिक ब्लूप्रिंट) का उपयोग करके इस किले का एक परीक्षण संस्करण बनाया। उन्होंने पाया कि "गार्ड" (सुरक्षा क्लासिफायर) को धोखा देना अक्सर बहुत आसान था।
- उन्होंने मानक ट्रिक्स (जैसे सवाल को फिर से लिखना या रैंडम टाइपो जोड़ना) का परीक्षण किया और पाया कि कई मौजूदा सुरक्षा गार्ड उन्हें रोकने में विफल रहे, खासकर जब अनुरोध वास्तव में खतरनाक था (जैसे रासायनिक हथियार की रेसिपी मांगना)।
- हालाँकि, उन्होंने यह भी पाया कि एक सरल ट्रिक—गार्ड को देखने के लिए कुछ उदाहरण देना (जिसे "फ्यू-शॉट प्रॉम्प्टिंग" कहा जाता है)—गार्ड को बहुत अधिक तेज बना देता है। यह सरल गार्ड फैंसी, प्री-ट्रेन किए गए गार्ड्स की तुलना में बेहतर था।
3. नया हमला: STACK (स्टेज्ड अटैक)
यह मुख्य खोज है। शोधकर्ताओं ने महसूस किया कि हालांकि किला मजबूत है, लेकिन गार्ड चीजों को अलग-अलग देख रहे हैं। हमले के दौरान वे एक-दूसरे से बात नहीं करते हैं।
उन्होंने एक नया हैकिंग तरीका बनाया जिसे STACK (स्टेज्ड अटैक) कहा जाता है। पूरे महल को एक साथ तोड़ने के बजाय, उन्होंने इसे एक समय में एक परत के हिसाब से तोड़ा, जैसे कि एक चोर एक विशिष्ट क्रम में ताले खोल रहा हो:
- चरण 1: रोबोट को चकमा दें। पहले, उन्होंने एक प्रलोभन तकनीक (persuasion technique) का उपयोग करके रोबोट को खतरनाक सवाल का जवाब देने के लिए मनाया, जिससे वह अपने स्वयं के आंतरिक सुरक्षा नियमों को अनदेखा कर दे।
- चरण 2: गार्ड 1 को चकमा दें। उन्होंने एक "जादुई वाक्यांश" (यूनिवर्सल जेलब्रेक) खोजा जिसे संदेश के आगे जोड़ने पर, गार्ड 1 को लगा कि संदेश हानिरहित है।
- चरण 3: गार्ड 2 को चकमा दें। यह सबसे कठिन हिस्सा था। उन्हें ज़रूरत थी कि रोबोट एक ऐसा जवाब लिखे जिसमें अंत में एक "जादुई वाक्यांश" शामिल हो जो गार्ड 2 को यह विश्वास दिलाने के लिए कि जवाब सुरक्षित है, धोखा दे सके।
उपमा: कल्पना कीजिए कि आप स्कूल में एक प्रतिबंधित नोट चुराकर ले जाना चाहते हैं।
- आप पहले नोट को इस तरह लिखते हैं कि शिक्षक (रोबोट) उसे पढ़े और जवाब दे।
- फिर आप नोट को एक ऐसे रैपर में लपेटते हैं जिसे सुरक्षा कैमरा (गार्ड 1) एक लंचबॉक्स समझ ले।
- अंत में, आप नोट के पीछे एक विशिष्ट स्टैम्प लगाते हैं जो सुरक्षा कैमरा (गार्ड 2) को यह सोचने पर मजबूर कर दे कि यह एक अनुमति पत्र (permission slip) है।
इन तीन विशिष्ट ट्रिक्स को मिलाकर, शोधकर्ताओं ने सफलतापूर्वक पूरे किले को बायपास कर दिया।
4. परिणाम: यह कितनी अच्छी तरह काम करता है?
- किला टिका रहा (कुछ हद तक): जब उन्होंने मानक हमलों का उपयोग किया, तो किला बहुत अच्छा काम करता था। "फ्यू-शॉट" गार्ड ने सबसे खतरनाक डेटासेट पर 100% हमलों को रोका।
- STACK ने किले को तोड़ दिया: जब उन्होंने अपने नए STACK तरीके का उपयोग किया, तो उन्होंने 71% समय किले को बायपास कर दिया।
- "ब्लैक बॉक्स" का आश्चर्य: भले ही हैकर्स गार्ड के आंतरिक तर्क को नहीं देख पा रहे थे (एक "ब्लैक बॉक्स" परिदृश्य) और उन्हें अंदाज़ा लगाना पड़ रहा था कि किस गार्ड ने उन्हें रोका, फिर भी वे 33% समय सफल रहे। यह डरावना है क्योंकि इसका मतलब है कि आपको सिस्टम को तोड़ने के लिए अंदरूनी जानकारी की आवश्यकता नहीं है; आपको बस चतुर होने की आवश्यकता है।
5. वास्तविक दुनिया का परीक्षण
शोधकर्ताओं ने केवल अपने खिलौना मॉडल पर परीक्षण नहीं किया। उन्होंने अपने तरीके को बड़ी कंपनियों (जैसे एंथ्रोपिक के ओपस 4 और ओपनएआई के जीपीटी-5) के वास्तविक, शीर्ष-स्तरीय एआई मॉडल पर आजमाया।
- उन्होंने पाया कि ये वास्तविक दुनिया के सिस्टम भी जानकारी लीक करते हैं (जैसे कि अनुरोध को प्रोसेस करने में कितना समय लगता है या विशिष्ट त्रुटि संदेश) जो एक हैकर को बताता है कि किस गार्ड ने उन्हें रोका।
- इस जानकारी का उपयोग करके, वे इन उच्च-सुरक्षा प्रणालियों को बायपास करने में सफल रहे। कंपनियों ने इन मुद्दों को स्वीकार किया और उन्हें ठीक (patch) किया।
6. निष्कर्ष (Takeaway)
पेपर इन एआई किलों के निर्माताओं के लिए कुछ सरल सबक प्रदान करता है:
- अपने रहस्य प्रकट न करें: यदि आपका सिस्टम एक हैकर को बताता है कि "इनपुट गार्ड ने आपको रोका" बनाम "आउटपुट गार्ड ने आपको रोका," तो आप उन्हें एक नक्शा दे रहे हैं। सभी इनकार (refusals) एक जैसे दिखने चाहिए।
- हैकर्स को झाँकने न दें: यदि आप अपने सुरक्षा गार्ड का एक "सिबलिंग" मॉडल (आपका थोड़ा छोटा संस्करण) जनता के लिए जारी करते हैं, तो हैकर्स अपने हमलों को उस पर प्रशिक्षित कर सकते हैं और फिर अपने मुख्य सिस्टम के खिलाफ उनका उपयोग कर सकते हैं।
- डेफेंस इन डेप्थ अच्छा है, लेकिन पूर्ण नहीं है: कई परतें होना बिना किसी परत के होने से बेहतर है, लेकिन यदि परतें संवाद नहीं करती हैं या यदि गार्ड बहुत अधिक अनुमानित (predictable) हैं, तो एक चतुर, स्टेजड हमला पूरी प्रणाली को भेद सकता है।
संक्षेप में: यह पेपर दिखाता है कि हालांकि AI सुरक्षा परतें एक अच्छा विचार हैं, लेकिन वे वर्तमान में एक विशिष्ट प्रकार के "डिवाइड एंड कॉन्कर" (बाँटो और जीतो) हमले के प्रति असुरक्षित हैं। यदि आप परतों पर एक-एक करके हमला करते हैं, तो आप पूरी प्रणाली को हरा सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।