LASH: Adaptive Semantic Hybridization for Black-Box Jailbreaking of Large Language Models
यह शोध पत्र LASH को पेश करता है, जो एक ब्लैक-बॉक्स फ्रेमवर्क है जो न्यूनतम क्वेरी बजट के साथ संरेखित (aligned) लार्ज लैंग्वेज मॉडल्स पर अत्याधुनिक अटैक सक्सेस रेट्स प्राप्त करने के लिए एक जेनेटिक ऑप्टिमाइज़र का उपयोग करके कई विषम जेलब्रेक रणनीतियों के आउटपुट को अनुकूल रूप से संयोजित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, बहुत ही सतर्क रोबोट को अनलॉक करने की कोशिश कर रहे हैं जिसे हानिकारक अनुरोधों को अस्वीकार करने के लिए प्रोग्राम किया गया है। यह रोबोट एक "लार्ज लैंग्वेज मॉडल" (LLM) है। वर्षों से, शोधकर्ताओं ने इस रोबोट को अपने नियमों को तोड़ने के लिए धोखा देने (जिसे "जेलब्रेकिंग" कहा जाता है) की कोशिश की है। कुछ तरकीबें अनुरोध को मज़ेदार तरीके से फिर से लिखने में शामिल हैं, कुछ पात्र (character) बनने का नाटक करने में हैं, और कुछ ऐसे पहेली सुलझाने में हैं जो बुरे अनुरोध को छिपा लेती है।
समस्या यह है कि कोई भी एक अकेली तरकीब हर रोबोट या हर प्रकार के बुरे अनुरोध पर काम नहीं करती है। कभी-कभी "मज़ेदार कहानी" वाली तरकीब काम करती है, लेकिन "रोल-प्लेइंग" वाली तरकीब विफल हो जाती है। कभी-कभी रोबोट कहानी को अनदेखा कर देता है लेकिन रोल-प्ले के झांसे में आ जाता है। यह एक ताले को एक ही चाबी से खोलने जैसा है: कभी-कभी चाबी फिट बैठती है, लेकिन अक्सर नहीं।
LASH का आगमन: "मास्टर की" बनाने वाला
यह पेपर एक नई विधि पेश करता है जिसे LASH (LLM Adaptive Semantic Hybridization) कहा जाता है। एक ही आदर्श तरकीब बनाने की कोशिश करने के बजाय, LASH एक मास्टर शेफ या म्यूजिक प्रोड्यूसर की तरह काम करता है।
यह कैसे काम करता है, इसके सरल उदाहरण यहाँ दिए गए हैं:
1. "सीड सलाद" (सामग्री इकट्ठा करना)
सबसे पहले, LASH शून्य से भोजन बनाने की कोशिश नहीं करता है। इसके बजाय, यह पाँच अलग-अलग "शेफ" (मौजूदा जेलब्रेक विधियों) से एक ही बुरे अनुरोध के आधार पर एक-एक व्यंजन बनाने के लिए कहता है।
- शेफ A एक तीखा संस्करण बनाता है।
- शेफ B एक मीठा संस्करण बनाता है।
- शेफ C एक नमकीन संस्करण बनाता है।
- शेफ D एक खट्टा संस्करण बनाता है।
- शेफ E एक कड़वा संस्करण बनाता है।
इनमें से कुछ व्यंजन बहुत खराब हो सकते हैं, और कुछ ठीक हो सकते हैं, लेकिन अकेले में कोई भी पूर्ण (perfect) नहीं है। LASH इन सभी "सीड डिशेज" को एक कटोरे में इकट्ठा करता है।
2. "ब्लेंडर" (सामग्री को मिलाना)
यही जादुई हिस्सा है। LASH केवल सबसे अच्छे व्यंजन को नहीं चुनता है। यह एक ब्लेंडर लेता है। यह सभी सीड डिशेज को ब्लेंडर में डालता है, लेकिन यह उन्हें समान रूप से नहीं मिलाता है।
- यह पूछता है: "हमें तीखे व्यंजन की कितनी मात्रा चाहिए? मीठे वाले की कितनी?"
- यह एक स्मार्ट कंप्यूटर एल्गोरिदम (एक "जेनेटिक ऑप्टिमाइज़र") का उपयोग करके परफेक्ट रेसिपी का पता लगाता है। यह कह सकता है, "80% तीखा वाला इस्तेमाल करें, 10% मीठा वाला और 10% खट्टा वाला।"
ब्लेंडर फिर इन सामग्रियों को एक साथ मिलाकर एक नया, अनूठा व्यंजन (एक नया प्रॉम्प्ट) बनाता है जो दूसरों के सबसे अच्छे हिस्सों को जोड़ता है।
3. "टेस्ट टेस्ट" (परिणाम की जाँच करना)
LASH इस नए मिश्रित व्यंजन को सतर्क रोबोट को खिलाता है।
- यदि रोबोट मना करता है: LASH कहता है, "ठीक है, वह रेसिपी काम नहीं आई।" वह वापस ब्लेंडर पर जाता है, मात्रा बदलता है (शायद अधिक तीखा, कम मीठा), और फिर से कोशिश करता है।
- यदि रोबोट सहमत होता है: LASH कहता है, "सफलता! हमें सही मिश्रण मिल गया।"
यह पहले से बेहतर क्यों है?
पेपर का दावा है कि पिछली विधियाँ एक व्यक्ति की तरह थीं जो एक विशिष्ट उपकरण (जैसे पेचकश) के साथ ताला खोलने की कोशिश कर रही थी। यदि ताले को चाबी की आवश्यकता है, तो पेचकश विफल हो जाता है।
LASH एक स्विस आर्मी नाइफ की तरह है जो तुरंत एक पेचकश, एक चाकू और एक बोतल ओपनर को एक एकल, कस्टम टूल में संयोजित कर सकता है जो उस विशिष्ट ताले के लिए फिट बैठता है जिसे आप खोलने की कोशिश कर रहे हैं।
उन्होंने क्या पाया?
शोधकर्ताओं ने LASH का परीक्षण छह अलग-अलग "रोबोट्स" (AI मॉडल्स) और दस अलग-अलग प्रकार के बुरे अनुरोधों (जैसे नफरत भरे भाषण, घोटाले, या खतरनाक निर्देश) पर किया।
- स्कोर: LASH ने रोबोटों को धोखा देने में 84.5% बार सफलता प्राप्त की (एक साधारण जांच का उपयोग करते हुए) और 74.5% बार (एक सख्त जांच जहाँ एक मानव जैसा AI जज यह सत्यापित करता है कि क्या उत्तर वास्तव में बुरे अनुरोध के लिए सहायक था) सफलता पाई।
- तुलना: यह अकेले काम करने वाले किसी भी एकल "शेफ" की तुलना में बहुत अधिक था।
- दक्षता: इसने रोबोट से औसतन केवल लगभग 30 बार मदद मांगकर यह किया, जो कि बहुत कुशल है।
- रक्षा: यहाँ तक कि जब रोबोटों के पास अतिरिक्त सुरक्षा गार्ड (रक्षा तंत्र) थे जो उन्हें रोकने की कोशिश कर रहे थे, तब भी LASH सबसे सफल तरीका बना रहा।
"सीक्रेट सॉस" (यह अंदर से कैसे काम करता है)
पेपर ने LASH के काम करने के दौरान रोबोट के मस्तिष्क (इसके आंतरिक स्तरों) के अंदर भी देखा। उन्होंने पाया कि LASH ने केवल सतह पर शब्दों को नहीं बदला। इसने वास्तव में रोबोट की आंतरिक सोच प्रक्रिया को एक ऐसी स्थिति में निर्देशित किया जो बुरे अनुरोधों के लिए "हाँ" कहने की अधिक संभावना रखती है। यह ऐसा है जैसे LASH ने केवल प्रश्न नहीं बदला; इसने रोबोट के मूड को अधिक आज्ञाकारी होने के लिए बदल दिया।
सारांश
LASH एक स्मार्ट सिस्टम है जो यह समझता है कि हर AI के लिए एक ही तरकीब काम नहीं करती है। इसके बजाय, यह कई अलग-अलग तरकीपों को इकट्ठा करता है, उन्हें प्रत्येक विशिष्ट स्थिति के लिए सही अनुपात में मिलाता है, और एक कस्टम "सुपर-प्रॉम्प्ट" बनाता है जो AI के लिए मना करना बहुत कठिन बना देता है। यह जेलब्रेकिंग को एक एकल लड़ाई के रूप में नहीं, बल्कि सही परिणाम पाने के लिए सामग्री मिलाने की एक रेसिपी के रूप में देखता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।