Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Models
यह शोध पत्र रिट्रीवल-ऑगमेंटेड डिफेंस (RAD) का प्रस्ताव करता है, जो एक ट्रेनिंग-मुक्त फ्रेमवर्क है जो ज्ञात हमले के उदाहरणों के डेटाबेस का लाभ उठाकर दुर्भावनापूर्ण जेलब्रेक रणनीतियों का पता लगाने और उनका अनुमान लगाने के लिए, बड़े भाषा मॉडलों (LLMs) के लिए अनुकूल सुरक्षा और एक नियंत्रणीय सुरक्षा-उपयोगिता संतुलन प्रदान करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
इंटरनेट की कल्पना एक विशाल, हलचल भरे पुस्तकालय के रूप में करें जहाँ नवीनतम और सबसे बुद्धिमान पुस्तकालयाध्यक्ष (लाइब्रेरियन) आर्टिफिशियल इंटेलिजेंस (AI) हैं। ये AI पुस्तकालयाध्यक्ष, जिन्हें लार्ज लैंग्वेज मॉडल्स (LLMs) के रूप में जाना जाता है, कविताएँ लिख सकते हैं, गणित की समस्याओं को हल कर सकते हैं, और आप जो कुछ भी कल्पना कर सकते हैं उसके बारे में बात कर सकते हैं। वे अविश्वसनीय रूप से सहायक हैं, लेकिन उनके पास एक सख्त नियम पुस्तिका है: उन्हें कभी भी खतरनाक निर्देश न देने के लिए प्रोग्राम किया गया है, जैसे कि बम कैसे बनाया जाए या किसी की पहचान कैसे चुराई जाए। हालाँकि, ठीक वैसे ही जैसे एक चतुर बच्चा एक सख्त शिक्षक को चालाकी से सवाल पूछकर चकमा दे सकता है, बुरे तत्वों ने इन AI पुस्तकालयाध्यक्षों को "जेलब्रेक" करने के तरीके खोज लिए हैं। वे अपने खतरनाक अनुरोधों को फैंसी वेशभूषा में लपेट देते हैं—जैसे कि एक मूवी स्क्रिप्ट लिखने का नाटक करना या रोल-प्लेइंग गेम खेलना—ताकि AI को अपने नियमों को भूलने और राज उगलने के लिए मजबूर किया जा सके। बड़ी समस्या उन लोगों के लिए है जो इन AI सिस्टम को बनाते हैं, क्योंकि ये "ट्रिक्स" उतनी तेज़ी से बदल रही हैं जितनी तेज़ी से वे AI को नए नियम सिखा सकते हैं। हर बार जब वे एक छेद को ठीक करते हैं, तो एक नया छेद दिखाई देता है, और AI को इन सभी नई ट्रिक्स को सीखने के लिए सिखाना आमतौर पर एक विशाल, महंगी और धीमी पुन: प्रशिक्षण (retraining) प्रक्रिया की मांग करता है।
यहीं पर एक नया विचार आता है जिसे रिट्रीवल-ऑगमेंटेड डिफेंस (RAD) कहा जाता है, जिसे कैम्ब्रिज विश्वविद्यालय के शोधकर्ताओं द्वारा प्रस्तावित किया गया है। RAD को एक ऐसे शिक्षक के रूप में न सोचें जो हर संभव ट्रिक को याद करने की कोशिश कर रहा है, बल्कि इसे एक सुपर-स्मार्ट सुरक्षा गार्ड के रूप में देखें जिसके पास एक अंतहीन, अपडेटेड "मोस्ट वांटेड" फोटो एल्बम है। AI को हर बार नया ट्रिक आने पर उसका पूरा व्यक्तित्व फिर से सिखाने के बजाय, RAD दरवाजे पर खड़े एक जासूस की तरह काम करता है। जब कोई उपयोगकर्ता कोई प्रश्न पूछता है, तो RAD केवल शब्दों को नहीं देखता; वह तुरंत अपने ज्ञात जेलब्रेक प्रयासों के फोटो एल्बम को पलटता है ताकि यह देख सके कि क्या वर्तमान प्रश्न ने कोई वेशभूषा पहनी है। यदि उसे कोई मिलान मिलता है, तो वह असली, खतरनाक इरादे को प्रकट करने के लिए उस वेशभूषा को हटा देता है। यदि इरादा बुरा है, तो गार्ड अनुरोध को रोक देता है। यदि यह एक हानिरहित प्रश्न है, तो गार्ड उसे जाने देता है ताकि AI पुस्तकालयाध्यक्ष अपना काम कर सके।
शोधकर्ताओं ने पाया कि यह "फोटो एल्बम" वाला दृष्टिकोण एक गेम-चेंजर है। अपने परीक्षणों में, उन्होंने दिखाया कि RAD शक्तिशाली नए जेलब्रेक हमलों—जैसे कि "PAIR" और "PAP" तरीके जो आमतौर पर AI मॉडल को धोखा देते हैं—को बिना AI को फिर से प्रशिक्षित किए रोक सकता है। यह ऐसा है जैसे सुरक्षा गार्ड के फोटो एल्बम में आज किसी अपराधी की नई तस्वीर जोड़ना, और गार्ड कल उन्हें पकड़ने के लिए तैयार है। इससे भी बेहतर, यह प्रणाली समायोज्य (adjustable) है। AI चलाने वाले लोग यह तय कर सकते हैं कि गार्ड को कितना सख्त होना चाहिए। वे गार्ड को बहुत सावधान (लगभग हर बुरे व्यक्ति को पकड़ना लेकिन कभी-कभी कुछ निर्दोष लोगों को रोकना) या अधिक उदार (अधिक लोगों को जाने देना लेकिन कम बुरे लोगों को पकड़ना) के रूप में सेट कर सकते हैं। यह संतुलन महत्वपूर्ण है क्योंकि आप एक ऐसा सुरक्षा तंत्र नहीं चाहते जो इतना सख्त हो कि "मौसम कैसा है?" जैसे सरल प्रश्नों का उत्तर देने से भी मना कर दे।
यह शोध पत्र सुझाव देता है कि यह तरीका AI को सुरक्षित रखने के साथ-साथ उसे उपयोगी बनाए रखने में अत्यधिक प्रभावी है। प्रयोगों में, RAD ने इन चालाकी भरे हमलों की सफलता दर को नाटकीय रूप से कम कर दिया, जिससे कई मामलों में यह लगभग शून्य तक पहुँच गई, जबकि इसने AI को सामान्य प्रश्नों का सही उत्तर देने भी दिया। शोधकर्ताओं ने यह भी दिखाया कि जैसे-जैसे वे फोटो एल्बम में नए हमलों के अधिक उदाहरण जोड़ते गए, सिस्टम उन विशिष्ट नई ट्रिक्स को पकड़ने में बेहतर होता गया बिना पुराने तरीकों को पकड़ना भूले। यह एक लचीला, "ट्रेनिंग-फ्री" कवच है जो केवल एल्बम में नई तस्वीरें जोड़कर स्मार्ट होता जाता है, जो हमारे AI सहायकों को सुरक्षित और उपयोगी रखने का एक आशाजनक तरीका प्रदान करता है, जहाँ बुरे तत्व लगातार नियमों से बचने के नए तरीके आविष्कार कर रहे हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।