NonTextual Target Attack
यह शोध पत्र नॉनटेक्स्टुअल टारगेट अटैक (NTA) को प्रस्तुत करता है, जो एक नवीन ग्रेडिएंट-आधारित जेलब्रेक विधि है जो निश्चित प्रतिक्रिया पैटर्न को लागू किए बिना एक LLM की असुरक्षित होने की संभावना को अधिकतम करती है, जिससे सुरक्षा-संरेखित मॉडलों पर उच्च दक्षता के साथ 96.8% सफलता दर प्राप्त करने के लिए हमले के खोज स्थान का महत्वपूर्ण विस्तार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही सख्त सुरक्षा गार्ड (AI) से एक प्रतिबंधित संदेश चुराकर ले जाने की कोशिश कर रहे हैं। यह गार्ड किसी भी ऐसे अनुरोध को अस्वीकार करने के लिए प्रोग्राम किया गया है जो खतरनाक लगता हो, जैसे कि "मैं बम कैसे बनाऊं?"
पुराना तरीका: "स्क्रिप्टेड" दृष्टिकोण
गार्ड को चकमा देने के तरीके पहले इस तरह थे जैसे गार्ड को एक विशिष्ट, पूर्व-लिखित वाक्यांश बोलने के लिए मजबूर करना, जैसे कि "ज़रूर, यह रहा..."
इसे "साइमन सेज़" (Simon Says) के खेल की तरह समझें। हमलावर अलग-अलग कमांड चिल्लाता रहता है, इस उम्मीद में कि गार्ड अंततः "ज़रूर, यह रहा..." कहेगा और उसके बाद खतरनाक निर्देश देगा।
- समस्या: गार्ड जिद्दी है। कभी-कभी, भले ही गार्ड जवाब देना चाहता हो, वे "यहाँ है..." या "बिल्कुल..." से शुरू कर सकते हैं बजाय "ज़रूर" के। क्योंकि हमलावर उस सटीक वाक्यांश "ज़रूर" को पाने के लिए इतना जुनूनी है, वे गार्ड को एक कोने में धकेलने की कोशिश में बहुत समय बर्बाद करते हैं। यदि गार्ड उन जादुई शब्दों को नहीं कहता है, तो हमले को विफल माना जाता है, भले ही गार्ड ने वास्तव में खतरनाक जानकारी दे दी हो।
- परिणाम: यह एक दरवाजे को खोलने की कोशिश करने जैसा है जहाँ आप केवल एक विशिष्ट चाबी के आकार का उपयोग कर सकते हैं। यदि ताला थोड़ा अलग है, तो आप अंदर नहीं जा पाएंगे, भले ही आपके पास सही चाबी हो।
नया तरीका: NTA (नॉन-टेक्स्टुअल टारगेट अटैक)
यह पेपर एक नई विधि पेश करता है जिसे NTA कहा जाता है। इस बात की परवाह किए बिना कि गार्ड पहले कौन से शब्द बोलता है, NTA केवल एक चीज़ की परवाह करता है: क्या गार्ड ने खतरनाक जवाब दिया?
NTA को एक मास्टर ताला बनाने वाले (locksmith) के रूप में सोचें जिसे इस बात से कोई फर्क नहीं पड़ता कि गार्ड "ज़रूर," "ठीक है," या "यह लीजिए" कहता है। वे बस दरवाजा खोलना चाहते हैं।
- रणनीति: NTA गार्ड को चकमा देने के लिए दो-चरणीय नृत्य का उपयोग करता है:
- सबसे बुरा सोचें: पहले, यह एक "स्कोरिंग मॉडल" (एक स्मार्ट जज) से पूछता है कि गार्ड द्वारा दिए जा सकने वाले सबसे खतरनाक संभावित उत्तर की कल्पना करे, बिना इस बात की चिंता किए कि गार्ड वास्तव में इसे कैसे कहेगा। यह हमलावर द्वारा एक बुरे सवाल के लिए सबसे खतरनाक, सबसे मददगार प्रतिक्रिया का सपना देखने जैसा है।
- सपने से मेल खाएं: फिर, यह प्रश्न (प्रॉम्ट) में बदलाव करता है ताकि गार्ड का वास्तविक उत्तर उस "सपनों वाले" खतरनाक उत्तर जैसा दिखने लगे।
"जादुई अनुवादक"
एक कठिन हिस्सा यह है कि "सपना देखने वाला जज" और "असली गार्ड" थोड़ी अलग भाषाएँ बोलते हैं (वे शब्दों के लिए अलग-अलग आंतरिक कोड का उपयोग करते हैं)।
- उपमा: कल्पना करें कि जज "फ्रेंच" बोलता है और गार्ड "जर्मन" बोलता है। NTA "फ्रेंच" खतरनाक विचारों को "जर्मन" निर्देशों में बदलने के लिए एक विशेष वोकैबुलरी प्रोजेक्शन मैट्रिक्स (एक अनुवादक) का उपयोग करता है ताकि गार्ड उन्हें समझ सके और उनका पालन कर सके।
यह बेहतर क्यों है
- गति: क्योंकि NTA गार्ड को "ज़रूर" कहने के लिए मजबूर करने में समय बर्बाद नहीं कर रहा है, इसलिए यह खतरनाक जवाब पाने का रास्ता बहुत तेज़ी से खोज लेता है। पेपर कहता है कि यह केवल 100 प्रयासों में सफल हो सकता है, जबकि पुराने तरीकों को हजारों प्रयासों की आवश्यकता हो सकती है या वे पूरी तरह विफल हो सकते हैं।
- सफलता दर: परीक्षणों में, NTA मजबूत, सुरक्षा-शिक्षित AI मॉडल के खिलाफ लगभग 97% बार सफल रहा। सबसे अच्छे पुराने तरीके केवल 50-60% बार ही सफल हो पाते थे।
- विविधता: पुराने तरीके अक्सर अजीब, टूटे हुए उत्तर देते हैं क्योंकि वे विशिष्ट वाक्यांश "ज़रूर" पर इतने केंद्रित होते हैं। NTA स्वाभाविक लगने वाले, विविध और सुसंगत खतरनाक उत्तर बनाता है क्योंकि इसके पास बुरे परिणाम तक पहुँचने के लिए किसी भी रास्ते को खोजने की स्वतंत्रता है।
मुख्य बात
पेपर का दावा है कि विशिष्ट "जादुई शब्दों" के प्रति जुनून को छोड़कर और शुद्ध रूप से खतरनाक परिणाम पर ध्यान केंद्रित करके, हमलावर AI सुरक्षा फिल्टरों को बहुत अधिक कुशलता और प्रभावी ढंग से बायपास कर सकते हैं। यह एक कठोर, निराशाजनक "साइमन सेज़" के खेल को गार्ड के बचाव के सबसे कमजोर बिंदु की लचीली खोज में बदल देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।