Black-box, Adaptive, Efficient, Transferable, Harmful, Applicable... Attacks Are All You Need to Break LLMs
यह शोध पत्र इनडायरेक्ट हार्म ऑप्टिमाइज़ेशन (IHO) को प्रस्तुत करता है, जो एक ब्लैक-बॉक्स, एडेप्टिव और कुशल जेलब्रेक अटैक विधि है जो विभिन्न सुरक्षा प्रणालियों के विरुद्ध लार्ज लैंग्वेज मॉडल्स की एडवरसैरियल रोबस्टनेस का आकलन करने के लिए एक मानकीकृत मूल्यांकन बेसलाइन के रूप में कार्य करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन कभी-कभी बहुत अधिक भरोसेमंद लाइब्रेरियन (लार्ज लैंग्वेज मॉडल, या LLM) के सुरक्षा गार्ड हैं। आपका काम लोगों को लाइब्रेरियन से खतरनाक या अवैध काम करने के लिए कहने से रोकना है, जैसे कि फिशिंग ईमेल लिखना या बम बनाने का तरीका समझाना।
लंबे समय तक, यह परीक्षण करना कि लाइब्रेरियन सुरक्षित था या नहीं, "लुका-छिपी" के खेल की तरह था जहाँ छिपने वाले (हमलावर) अपनी रणनीतियाँ बदलते रहते थे, लेकिन खोजने वालों (रक्षकों) के पास यह जाँचने का कोई मानक तरीका नहीं था कि छिपने वाले वास्तव में कितने अच्छे हैं। कभी-कभी, एक कमजोर छिपने वाला मजबूत दिखाई देता था क्योंकि खोजने वाला पर्याप्त गहराई से नहीं देख रहा होता था।
यह पेपर लाइब्रेरियन की सुरक्षा का परीक्षण करने का एक नया, अत्यधिक कुशल तरीका पेश करता है, जिसे IHO (इनडायरेक्ट हार्म ऑप्टिमाइजेशन) कहा जाता है। यह कैसे काम करता है, इसे रोजमर्रा के उपमाओं के साथ समझाया गया है:
1. समस्या: "बुरा छात्र" बनाम "स्मार्ट ट्यूटर"
पहले, यह परीक्षण करने के लिए कि क्या लाइब्रेरियन को चकमा दिया जा सकता है, शोधकर्ता हर एक खतरनाक अनुरोध के लिए एक विशिष्ट, पेचीदा प्रश्न (एक "जेलब्रेक प्रॉम्प्ट") बनाने की कोशिश करते थे। यह एक छात्र को झूठ बोलना सिखाने के लिए हर विषय के लिए एक नया झूठ लिखने जैसा था। यह धीमा था, महंगा था, और यदि लाइब्रेरियन अपने नियम बदल देता, तो आपको फिर से शुरुआत करनी पड़ती।
2. समाधान: एक "मास्टर ट्रिकस्टर" बॉट को प्रशिक्षित करना
व्यक्तिगत पेचीदा प्रश्न लिखने के बजाय, लेखकों ने एक अलग AI बॉट को मास्टर ट्रिकस्टर (Master Trickster) बनने के लिए प्रशिक्षित किया।
- उपमा: मास्टर ट्रिकस्टर को एक पेशेवर अभिनेता के रूप में सोचें जो सुरक्षा जांच को दरकिनार करने में माहिर है। एक विशिष्ट चाल को याद करने के बजाय, यह अभिनेता धोखे की सामान्य कला सीखता है।
- यह कैसे बनता है: उन्होंने एक विशेष प्रकार के AI का उपयोग किया जिसे "डिफ्यूजन लैंग्वेज मॉडल" कहा जाता है। कल्पना कीजिए कि यह मॉडल एक 'पेंट-बाय-नंबर्स' किट की तरह है जहाँ कुछ नंबर पहले से भरे हुए हैं (खतरनाक अनुरोध, जैसे "स्कैम ईमेल लिखें"), और AI को उन खाली स्थानों को ऐसे शब्दों से भरना है जो लाइब्रेरियन को "हाँ" कहने के लिए मजबूर कर दें।
3. प्रशिक्षण विधि: "इनडायरेक्ट हार्म ऑप्टिमाइजेशन" (IHO)
मास्टर ट्रिकस्टर कैसे सीखता है? यह लाइब्रेरियन के दिमाग के अंदर झाँकने की कोशिश नहीं करता है (जो आमतौर पर क्लोज्ड-सोर्स मॉडल्स में लॉक रहता है)। इसके बजाय, यह एक जज (Judge) का उपयोग करता है।
- प्रक्रिया:
- ट्रिकस्टर अनुरोध को अलग-अलग तरीकों से कहने के कई प्रयास करता है।
- लाइब्रेरियन जवाब देता है।
- एक जज AI (एक अलग, सख्त मूल्यांकनकर्ता) लाइब्रेरियन के जवाब को स्कोर देता है। क्या लाइब्रेरियन ने वास्तव में खतरनाक सलाह दी, या उसने सिर्फ "मैं यह नहीं कर सकता" कहा?
- ट्रिकस्टर जज के स्कोर से सीखता है। यदि जज कहता है, "वह वास्तव में एक खतरनाक प्रतिक्रिया थी," तो ट्रिकस्टर नोट करता है, "यह शब्दावली काम कर गई!" यदि जज कहता है, "वह सुरक्षित था," तो ट्रिकस्टर नोट करता है, "यह शब्दावली विफल रही।"
- यह चक्रों में चलता है। ट्रिकस्टर बेहतर होता जाता है और उन सटीक शब्दों को खोजने में माहिर हो जाता है जो लाइब्रेरियन को गलती करने पर मजबूर कर देते हैं।
इसे "इनडायरेक्ट" (अप्रत्यक्ष) इसलिए कहा जाता है क्योंकि ट्रिकस्टर लाइब्रेरियन के आंतरिक गणित के लिए सीधे अनुकूलित (optimize) नहीं हो रहा है; यह एक बाहरी जज द्वारा तय किए गए परिणाम के लिए अनुकूलित हो रहा है।
4. यह बेहतर क्यों है: छह महाशक्तियाँ
लेखकों का दावा है कि उनकी विधि, IHO, विशेष है क्योंकि इसमें छह प्रमुख ताकतें हैं जो पुरानी विधियों में नहीं थीं:
- ब्लैक-बॉक्स फ्रेंडली: इसे लाइब्रेरियन के आंतरिक कोड या वेट्स (weights) को देखने की आवश्यकता नहीं है। यह केवल एक सामान्य उपयोगकर्ता की तरह लाइब्रेरियन से बात करता है। यह वास्तविक दुनिया के क्लोज्ड-सोर्स मॉडल्स (जैसे ChatGPT या Claude) का परीक्षण करने के लिए उपयोगी है जहाँ आप अंदर नहीं देख सकते।
- कुशल (Efficient): यह तेज़ और सस्ता है। एक बार जब ट्रिकस्टर प्रशिक्षित हो जाता है, तो इसका उपयोग बार-बार किया जा सकता है। यह हर बार एक नया परीक्षण करने के लिए भुगतान करने के बजाय एक बार पेशेवर सुरक्षा परीक्षक को काम पर रखने जैसा है।
- स्थानांतरणीय (Transferable): ट्रिकस्टर ने अनुरोधों के एक सेट (जैसे स्कैम) पर सीखा, लेकिन वह लाइब्रेरियन को नए खतरनाक अनुरोधों (जैसे नफरत भरे भाषण) पर भी चकमा दे सकता है। उसने धोखे के पैटर्न को सीखा, न कि केवल विशिष्ट पंक्तियों को।
- अनुकूलनशील (Adaptive): यह तब भी काम करता है जब लाइब्रेरियन के पास अतिरिक्त सुरक्षा परतें हों, जैसे दरवाजे पर मेटल डिटेक्टर (एक बाहरी सुरक्षा फ़िल्टर)। ट्रिकस्टर इन परतों से बचने के लिए अपनी शैली को अनुकूलित करता है।
- हानिकारक (परीक्षण के संदर्भ में): यह केवल लाइब्रेरियन को "हाँ" कहने के लिए नहीं कहता; यह लाइब्रेरियन को वास्तव में खतरनाक कुछ कहने के लिए प्रेरित करने की कोशिश करता है। पुरानी विधियाँ केवल "हाँ" प्राप्त कर सकती हैं लेकिन एक हानिरहित उत्तर के साथ। IHO यह सुनिश्चित करता है कि उत्तर वास्तव में जोखिम भरा हो, जो कि सुरक्षा परीक्षणों के दौरान हमें खोजना होता है।
- लागू करने योग्य (Applicable): इसके लिए बहुत कम मैनुअल काम की आवश्यकता होती है। आपको जटिल पाइपलाइन सेट करने या प्रॉम्प्ट को हाथ से तैयार करने की आवश्यकता नहीं है। यह स्वचालित है।
5. एक नया स्कोरकार्ड: EVUS
लेखक यह भी शिकायत करते हैं कि सफलता को मापने का पुराना तरीका—अटैक सक्सेस रेट (ASR)—दोषपूर्ण है। ASR यह कहने जैसा है कि, "क्या चोर अंदर आ गया? हाँ/नहीं।" यह यह नहीं बताता कि वह कितनी आसानी से अंदर आया, या उसने कितना नुकसान किया।
वे एक नया मीट्रिक पेश करते हैं जिसे EVUS (एक्सपेक्टेड वॉल्यूम अंडर द सरफेस) कहा जाता है।
- उपमा: केवल यह पूछने के बजाय कि "क्या चोर अंदर आ गया?", EVUS पूछता है: "कितने प्रयासों की आवश्यकता थी? नुकसान कितना बुरा था? और सफलता कितनी सुसंगत थी?" यह लाइब्रेरियन की भेद्यता (vulnerability) की अधिक पूर्ण तस्वीर देता है, जिसमें हमले की गंभीरता और दक्षता दोनों शामिल हैं।
सारांश में
यह पेपर IHO प्रस्तुत करता है, जो AI मॉडल्स को हानिकारक चीजें करने के लिए बहकाने के परीक्षण का एक नया, स्वचालित और कुशल तरीका है। यह एक "जज" AI से फीडबैक का उपयोग करके एक "मास्टर ट्रिकस्टर" AI को प्रशिक्षित करता है, बिना लक्षित मॉडल के अंदर झाँके। यह पिछली तकनीकों की तुलना में तेज़, सस्ता और अधिक विश्वसनीय है, जो AI सुरक्षा को मापने का एक मानकीकृत तरीका प्रदान करता है, ठीक वैसे ही जैसे शिक्षा में मानकीकृत परीक्षणों का उपयोग किया जाता है। इसका लक्ष्य डेवलपर्स को उनके द्वारा दुर्भावनापूर्ण अभिनेताओं द्वारा शोषण किए जाने से पहले कमजोरियों को खोजने और ठीक करने में मदद करना है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।