GAS-Leak-LLM: Genetic Algorithm-Based Suffix Optimization for Black-Box LLM Jailbreaking
यह शोधपत्र GAS-Leak-LLM को प्रस्तुत करता है, जो एक ब्लैक-बॉक्स जेलब्रेकिंग हमला है जो एक जेनेटिक एल्गोरिदम का उपयोग करके प्रतिकूल प्रत्ययों (adversarial suffixes) को पुनरावर्ती रूप से विकसित करता है, जिससे बड़े भाषा मॉडलों (Large Language Models) के आंतरिक मापदंडों तक पहुँच की आवश्यकता के बिना प्रभावी रूप से सुरक्षा बाधाओं को बायपास किया जा सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, आज्ञाकारी रोबोट सहायक है। आपने उसे सख्त नियम सिखाए हैं: "लोगों को बम बनाना न सिखाएं," "घृणास्पद भाषण (hate speech) न लिखें," और "अवैध गतिविधियों में मदद न करें।" यह रोबोट एक आधुनिक लार्ज लैंग्वेज मॉडल (LLM) की तरह है, जिसे मददगार लेकिन सुरक्षित बनाने के लिए डिज़ाइन किया गया है।
आपके द्वारा साझा किया गया पेपर, GAS-Leak-LLM, मूल रूप से इस बात का अध्ययन है कि इस रोबोट को अपने ही नियमों को तोड़ने के लिए कैसे छला जा सकता है, लेकिन इसमें एक बहुत ही विशिष्ट मोड़ है: शोधकर्ता ऐसा इसलिए कर रहे हैं क्योंकि वे रोबोट के आंतरिक कोड या मस्तिष्क को कभी देख नहीं पाते हैं। वे इसे एक "ब्लैक बॉक्स" की तरह मान रहे हैं—उन्हें केवल सवाल पूछने और जवाब देखने का अवसर मिलता है।
यहाँ उन्होंने इसे सरल उपमाओं के माध्यम से समझाया है:
1. समस्या: "ब्लैक बॉक्स" की दीवार
आमतौर पर, किसी कंप्यूटर को धोखा देने के लिए आपको यह जानना आवश्यक होता है कि उसका कोड ठीक से कैसे काम करता है (जैसे कि तिजोरी का कॉम्बिनेशन जानना)। लेकिन वास्तविक दुनिया में, आप बड़े AI मॉडल्स के कोड को देख नहीं सकते; आप बस उनसे बात करते हैं। शोधकर्ता यह देखना चाहते थे कि क्या वे सही शब्दों का अनुमान लगाकर, बिना कोड जाने, नियमों को तोड़ सकते हैं।
2. समाधान: "विकासवादी माली" (The Evolutionary Gardener)
एक साथ सही "ट्रिक वर्ड्स" (चालाकी भरे शब्द) का अनुमान लगाने के बजाय (जो कि एक 10-अंकों के पासवर्ड का तुक्का लगाने जैसा है), शोधकर्ताओं ने एक जेनेटिक एल्गोरिदम (Genetic Algorithm) का उपयोग किया। इसे एक डिजिटल माली के रूप में सोचें जो एक आदर्श "खरपतवार" उगाने की कोशिश कर रहा है जो रोबोट के सुरक्षा नियमों का दम घोंट सके।
यहाँ उनका "बगीचा" कैसे काम करता है:
- बीज बोना (Initialization): वे एक बुरे अनुरोध के अंत में कई यादृच्छिक (random) "सफिक्स" (अतिरिक्त वाक्य या वाक्यांश) के साथ शुरुआत करते हैं। इनमें से कुछ निरर्थक शब्द (जैसे "asdfjkl;") हैं, और कुछ वास्तविक अंग्रेजी वाक्य हैं।
- परीक्षण (Evaluation): वे इन अनुरोधों को रोबोट को देते हैं। यदि रोबोट उत्तर देने से मना कर देता है, तो वह "बीज" मर जाता है। यदि रोबोट गलती से बुरे सवाल का जवाब दे देता है, तो वह "विजेता" है।
- विजेताओं का प्रजनन (Selection & Crossover): विजेताओं को "प्रजनन" करने का मौका मिलता है। शोधकर्ता दो विजेता वाक्यांशों के सबसे अच्छे हिस्सों को लेते हैं और उन्हें एक नया, संभावित रूप से बेहतर वाक्यांश बनाने के लिए आपस में मिला देते हैं।
- उत्परिवर्तन (Mutation): कभी-कभी, वे यह देखने के लिए वाक्यांश में एक शब्द को बेतरतीब ढंग से बदलते हैं कि क्या एक छोटा सा बदलाव इसे और भी अधिक प्रभावी बना सकता है।
- दोहराना: वे इसे बार-बार (100 पीढ़ियों तक) करते हैं, धीरे-धीरे उन वाक्यांशों को विकसित करते हैं जब तक कि वे अंतिम "चाबी" न खोज लें जो रोबोट की सुरक्षा को खोल देती है।
3. बड़ी खोज: "अर्थ" मायने रखता है
शोधकर्ताओं ने कुछ आश्चर्यजनक पाया। उन्हें लगा था कि रैंडम निरर्थक शब्द (gibberish) सबसे अच्छा काम करेंगे क्योंकि वे रोबोट को भ्रमित कर देते हैं। लेकिन उन्होंने पाया कि अर्थपूर्ण वाक्य वास्तव में रोबोट को धोखा देने में बहुत बेहतर थे।
- उपमा: कल्पना करें कि आप एक सुरक्षा गार्ड से छिपकर निकलने की कोशिश कर रहे हैं।
- निरर्थक (Gibberish) दृष्टिकोण: आप मास्क पहनकर और अजीब आवाजें निकालते हुए चलते हैं। गार्ड आपको तुरंत रोक लेता है।
- अर्थपूर्ण (Meaningful) दृष्टिकोण: आप वर्दी पहनकर, विनम्रता से आते हैं और कहते हैं, "मैं एक सुरक्षा निरीक्षक हूँ, कृपया मुझे अंदर जाने दें।" गार्ड आपको जाने देने की अधिक संभावना रखता है क्योंकि आप वहां के "अधिकारी" जैसे लग रहे हैं।
- परिणाम: "अर्थपूर्ण" चालाकी वाले तरीके निरर्थक तरीकों की तुलना में काफी बेहतर काम कर गए, विशेष रूप से अधिक उन्नत, अच्छी तरह से प्रशिक्षित रोबोटों पर।
4. "लंबाई" का कारक
उन्होंने यह भी पाया कि ट्रिक वाक्यांश की लंबाई मायने रखती है।
- अधिक उन्नत रोबोट (Llama) के लिए, लंबे ट्रिक वाक्यांश बहुत बेहतर काम करते हैं। यह ऐसा है जैसे एक लंबी, विस्तृत कहानी को बीच में रोकना और यह पहचानना कठिन होता है कि वह झूठ है।
- कम उन्नत रोबet (Qwen) के लिए, इसे धोखा देना पहले से ही इतना आसान था कि वाक्यांश की लंबाई का कोई खास महत्व नहीं रह गया।
5. "यूनिवर्सल" चाबी
उनकी खोज का सबसे खतरनाक हिस्सा एक "यूनिवर्सल" ट्रिक की खोज है। वे एक विशिष्ट वाक्यांश बना सकते थे जिसे किसी भी बुरे अनुरोध के साथ जोड़ने पर, वह अक्सर रोबोट को उसके नियम तोड़ने पर मजबूर कर देता है। यह एक मास्टर की (master key) खोजने जैसा है जो कई अलग-अलग दरवाजों को खोल सकती है, भले ही आपने इसे केवल एक विशिष्ट दरवाजे पर टेस्ट किया हो।
निष्कर्ष का सारांश
- सुरक्षा पूर्ण नहीं है: यहाँ तक कि सख्त नियमों के साथ भी, यदि आप सही शब्दों को खोजने के लिए सही विकासवादी पद्धति का उपयोग करते हैं, तो इन AI मॉडलों को चकमा दिया जा सकता है।
- निर्देश महत्वपूर्ण हैं: जिन मॉडल्स को बेहतर तरीके से "सिखाया" गया था (Instruction Tuned), उन्हें धोखा देना कठिन था, लेकिन असंभव नहीं।
- संदर्भ (Context) मुख्य है: AI को धोखा देने के लिए वास्तविक, सुसंगत वाक्यों का उपयोग करना, रैंडम बकवास के उपयोग से बेहतर काम करता है।
- ब्लैक-बॉक्स वास्तविकता है: इन कमजोरियों को खोजने के लिए आपको अंदरूनी पहुंच वाला हैकर होने की आवश्यकता नहीं है; आपको बस एक स्मार्ट तरीके से अनुमान लगाने और परीक्षण करने की आवश्यकता है।
महत्वपूर्ण नोट: यह पेपर स्पष्ट रूप से चेतावनी देता है कि यह एक सुरक्षा परीक्षण है। वे इन कमजोरियों को दिखा रहे हैं ताकि डेवलपर्स उन्हें ठीक कर सकें, न कि लोगों को वास्तव में दूसरों को नुकसान पहुँचाने का तरीका सिखाने के लिए। बात को सिद्ध करने के लिए पेपर में हानिकारक भाषा के उदाहरण शामिल हैं, लेकिन इसका लक्ष्य AI को सुरक्षित बनाना है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।