← नवीनतम पेपर
💬 NLP

Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Models

यह शोध पत्र रिट्रीवल-ऑगमेंटेड डिफेंस (RAD) का प्रस्ताव करता है, जो एक ट्रेनिंग-मुक्त फ्रेमवर्क है जो ज्ञात हमले के उदाहरणों के डेटाबेस का लाभ उठाकर दुर्भावनापूर्ण जेलब्रेक रणनीतियों का पता लगाने और उनका अनुमान लगाने के लिए, बड़े भाषा मॉडलों (LLMs) के लिए अनुकूल सुरक्षा और एक नियंत्रणीय सुरक्षा-उपयोगिता संतुलन प्रदान करता है।

मूल लेखक: Guangyu Yang, Jinghong Chen, Jingbiao Mei, Weizhe Lin, Bill Byrne

प्रकाशित 2026-08-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Guangyu Yang, Jinghong Chen, Jingbiao Mei, Weizhe Lin, Bill Byrne

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

इंटरनेट की कल्पना एक विशाल, हलचल भरे पुस्तकालय के रूप में करें जहाँ नवीनतम और सबसे बुद्धिमान पुस्तकालयाध्यक्ष (लाइब्रेरियन) आर्टिफिशियल इंटेलिजेंस (AI) हैं। ये AI पुस्तकालयाध्यक्ष, जिन्हें लार्ज लैंग्वेज मॉडल्स (LLMs) के रूप में जाना जाता है, कविताएँ लिख सकते हैं, गणित की समस्याओं को हल कर सकते हैं, और आप जो कुछ भी कल्पना कर सकते हैं उसके बारे में बात कर सकते हैं। वे अविश्वसनीय रूप से सहायक हैं, लेकिन उनके पास एक सख्त नियम पुस्तिका है: उन्हें कभी भी खतरनाक निर्देश न देने के लिए प्रोग्राम किया गया है, जैसे कि बम कैसे बनाया जाए या किसी की पहचान कैसे चुराई जाए। हालाँकि, ठीक वैसे ही जैसे एक चतुर बच्चा एक सख्त शिक्षक को चालाकी से सवाल पूछकर चकमा दे सकता है, बुरे तत्वों ने इन AI पुस्तकालयाध्यक्षों को "जेलब्रेक" करने के तरीके खोज लिए हैं। वे अपने खतरनाक अनुरोधों को फैंसी वेशभूषा में लपेट देते हैं—जैसे कि एक मूवी स्क्रिप्ट लिखने का नाटक करना या रोल-प्लेइंग गेम खेलना—ताकि AI को अपने नियमों को भूलने और राज उगलने के लिए मजबूर किया जा सके। बड़ी समस्या उन लोगों के लिए है जो इन AI सिस्टम को बनाते हैं, क्योंकि ये "ट्रिक्स" उतनी तेज़ी से बदल रही हैं जितनी तेज़ी से वे AI को नए नियम सिखा सकते हैं। हर बार जब वे एक छेद को ठीक करते हैं, तो एक नया छेद दिखाई देता है, और AI को इन सभी नई ट्रिक्स को सीखने के लिए सिखाना आमतौर पर एक विशाल, महंगी और धीमी पुन: प्रशिक्षण (retraining) प्रक्रिया की मांग करता है।

यहीं पर एक नया विचार आता है जिसे रिट्रीवल-ऑगमेंटेड डिफेंस (RAD) कहा जाता है, जिसे कैम्ब्रिज विश्वविद्यालय के शोधकर्ताओं द्वारा प्रस्तावित किया गया है। RAD को एक ऐसे शिक्षक के रूप में न सोचें जो हर संभव ट्रिक को याद करने की कोशिश कर रहा है, बल्कि इसे एक सुपर-स्मार्ट सुरक्षा गार्ड के रूप में देखें जिसके पास एक अंतहीन, अपडेटेड "मोस्ट वांटेड" फोटो एल्बम है। AI को हर बार नया ट्रिक आने पर उसका पूरा व्यक्तित्व फिर से सिखाने के बजाय, RAD दरवाजे पर खड़े एक जासूस की तरह काम करता है। जब कोई उपयोगकर्ता कोई प्रश्न पूछता है, तो RAD केवल शब्दों को नहीं देखता; वह तुरंत अपने ज्ञात जेलब्रेक प्रयासों के फोटो एल्बम को पलटता है ताकि यह देख सके कि क्या वर्तमान प्रश्न ने कोई वेशभूषा पहनी है। यदि उसे कोई मिलान मिलता है, तो वह असली, खतरनाक इरादे को प्रकट करने के लिए उस वेशभूषा को हटा देता है। यदि इरादा बुरा है, तो गार्ड अनुरोध को रोक देता है। यदि यह एक हानिरहित प्रश्न है, तो गार्ड उसे जाने देता है ताकि AI पुस्तकालयाध्यक्ष अपना काम कर सके।

शोधकर्ताओं ने पाया कि यह "फोटो एल्बम" वाला दृष्टिकोण एक गेम-चेंजर है। अपने परीक्षणों में, उन्होंने दिखाया कि RAD शक्तिशाली नए जेलब्रेक हमलों—जैसे कि "PAIR" और "PAP" तरीके जो आमतौर पर AI मॉडल को धोखा देते हैं—को बिना AI को फिर से प्रशिक्षित किए रोक सकता है। यह ऐसा है जैसे सुरक्षा गार्ड के फोटो एल्बम में आज किसी अपराधी की नई तस्वीर जोड़ना, और गार्ड कल उन्हें पकड़ने के लिए तैयार है। इससे भी बेहतर, यह प्रणाली समायोज्य (adjustable) है। AI चलाने वाले लोग यह तय कर सकते हैं कि गार्ड को कितना सख्त होना चाहिए। वे गार्ड को बहुत सावधान (लगभग हर बुरे व्यक्ति को पकड़ना लेकिन कभी-कभी कुछ निर्दोष लोगों को रोकना) या अधिक उदार (अधिक लोगों को जाने देना लेकिन कम बुरे लोगों को पकड़ना) के रूप में सेट कर सकते हैं। यह संतुलन महत्वपूर्ण है क्योंकि आप एक ऐसा सुरक्षा तंत्र नहीं चाहते जो इतना सख्त हो कि "मौसम कैसा है?" जैसे सरल प्रश्नों का उत्तर देने से भी मना कर दे।

यह शोध पत्र सुझाव देता है कि यह तरीका AI को सुरक्षित रखने के साथ-साथ उसे उपयोगी बनाए रखने में अत्यधिक प्रभावी है। प्रयोगों में, RAD ने इन चालाकी भरे हमलों की सफलता दर को नाटकीय रूप से कम कर दिया, जिससे कई मामलों में यह लगभग शून्य तक पहुँच गई, जबकि इसने AI को सामान्य प्रश्नों का सही उत्तर देने भी दिया। शोधकर्ताओं ने यह भी दिखाया कि जैसे-जैसे वे फोटो एल्बम में नए हमलों के अधिक उदाहरण जोड़ते गए, सिस्टम उन विशिष्ट नई ट्रिक्स को पकड़ने में बेहतर होता गया बिना पुराने तरीकों को पकड़ना भूले। यह एक लचीला, "ट्रेनिंग-फ्री" कवच है जो केवल एल्बम में नई तस्वीरें जोड़कर स्मार्ट होता जाता है, जो हमारे AI सहायकों को सुरक्षित और उपयोगी रखने का एक आशाजनक तरीका प्रदान करता है, जहाँ बुरे तत्व लगातार नियमों से बचने के नए तरीके आविष्कार कर रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →