NeST: Neuron Selective Tuning for LLM Safety
NeST एक पैरामीटर-कुशल पोस्ट-हॉक सुरक्षा संरेखण ढांचा है जो केवल साधारण दुर्भावनापूर्ण प्रॉम्प्ट्स का उपयोग करके सुरक्षा-प्रासंगिक फीड-फॉरवर्ड न्यूरॉन्स के क्लस्टर्स की पहचान करता है और उन्हें चुनिंदा रूप से ट्यून करता है, जिससे टेक्स्ट और मल्टीमॉडल मॉडल्स में विविध जेलब्रेक्स के विरुद्ध न्यूनतम कम्प्यूटेशनल ओवरहेड के साथ एक मजबूत रक्षा प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक लार्ज लैंग्वेज मॉडल (LLM) की कल्पना एक विशाल, अविश्वसनीय रूप से बुद्धिमान पुस्तकालय के रूप में करें जिसमें अरबों पुस्तकें हैं। जब आप कोई प्रश्न पूछते हैं, तो पुस्तकालय केवल "सोचता" नहीं है; यह उत्तर खोजने के लिए विशिष्ट अलमारियों, पंक्तियों और व्यक्तिगत पुस्तकों को सक्रिय करता है।
समस्या यह है कि कुछ पुस्तकों में खतरनाक निर्देश (जैसे "बम कैसे बनाएं") हो सकते हैं। कभी-कभी, चतुर ठग (हैकर्स) ऐसे तरीके से प्रश्न पूछते हैं जिससे लाइब्रेरियन भ्रमित हो जाता है, जिससे वे उत्तर देने से मना करने के बजाय उन खतरनाक पुस्तकों को निकाल लेता है।
इसे ठीक करने के मौजूदा तरीके पूरे पुस्तकालय को फिर से व्यवस्थित करने जैसे हैं, हर बार जब एक नया छल खोजा जाता है। यह धीमा, महंगा है, और यदि आप इसे गलत करते हैं, तो आप अनजाने में अच्छी पुस्तकों को भी छिपा सकते हैं।
NeST (न्यूरोन सेलेक्टिव ट्यूनिंग) पुस्तकालय को सुरक्षित करने का एक नया, स्मार्ट तरीका है। यह यहाँ कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:
1. "बुलडोजर" के बजाय "स्पॉटलाइट"
अधिकांश सुरक्षा विधियाँ बुलडोजर की तरह हैं: वे एक ही बार में पूरी इमारत को ठीक करने की कोशिश करती हैं। NeST एक स्पॉटलाइट की तरह है।
- यह कैसे काम करता है: शोधकर्ता पुस्तकालय पर रोशनी डालते हैं जबकि हानिरहित प्रश्न ("एक बिल्ली क्या है?") और हानिकारक प्रश्न ("बम कैसे बनाएं?") दोनों पूछे जाते हैं।
- खोज: वे देखते हैं कि जब पुस्तकालय से कोई खतरनाक प्रश्न पूछा जाता है, तो केवल "पुस्तकों" (न्यूरॉन्स) का एक बहुत छोटा, विशिष्ट समूह ही चमकता है। ये हैं "सेफ्टी न्यूरॉन्स" (सुरक्षा न्यूरॉन्स)। बाकी पुस्तकालय अंधेरे में और इसमें शामिल नहीं रहता।
- समाधान: पूरे पुस्तकालय को फिर से लिखने के बजाय, NeST केवल इन विशिष्ट, चमकती हुई पुस्तकों को छूता है। यह उन्हें सिखाता है कि बुरी चीजों के लिए पूछे जाने पर दृढ़ता से "ना" कहें, जबकि अन्य लाखों पुस्तकों को वे वैसे ही रहने देता है जैसे वे हैं।
2. "टीम कैप्टन" प्रणाली
आप सोच सकते हैं, "ठीक है, तो हम उन विशिष्ट पुस्तकों को ठीक करते हैं। लेकिन अभी भी हजारों पुस्तकें बाकी हैं!"
- समस्या: यदि आप हर एक सुरक्षा पुस्तक को व्यक्तिगत रूप से प्रशिक्षित करने की कोशिश करते हैं, तो यह अभी भी बहुत अधिक काम है। साथ ही, कुछ पुस्तकें समान बातें कह सकती हैं, जबकि अन्य अलग बातें कह सकती हैं।
- NeST का समाधान: NeST इन सुरक्षा पुस्तकों को उनके व्यवहार के आधार पर टीमों में समूहबद्ध करता है।
- उपमा: एक स्पोर्ट्स टीम की कल्पना करें। हर खिलाड़ी को व्यक्तिगत रूप से कोचिंग देने के बजाय, आप उन खिलाड़ियों का समूह बनाते हैं जो एक ही पोजीशन खेलते हैं (जैसे, सभी गोलकीपर)। आप "गोलकीपर टीम" को एक साझा सेट निर्देश देते हैं।
- NeST ऐसा ही न्यूरॉन्स के साथ करता है। यह उन न्यूरॉन्स के समूहों को पाता है जो एक जैसा व्यवहार करते हैं और उन्हें एक साझा "अपडेट" देता है। यह प्रशिक्षण को अविश्वसनीय रूप से तेज़ और कुशल बनाता है।
3. "स्थायी टैटू" बनाम "अस्थायी पोशाक"
कुछ सुरक्षा विधियाँ पुस्तकालय पर एक अस्थायी पोशाक पहनाने जैसी हैं। हर बार जब आप अंदर जाते हैं, तो एक गार्ड को पोशाक की जांच करनी पड़ती है। यह सब कुछ धीमा कर देता है।
- NeST का दृष्टिकोण: NeST पुस्तकालय को एक स्थायी टैटू देने जैसा है।
- एक बार प्रशिक्षण पूरा हो जाने के बाद, नए निर्देश पुस्तकालय की मौजूदा संरचना में सीधे "फोल्ड" (समाहित) कर दिए जाते हैं।
- परिणाम: जब आप बाद में कोई प्रश्न पूछते हैं, तो पुस्तकालय पहले की तरह ही तेज़ी से उत्तर देता है। वहाँ कोई अतिरिक्त गार्ड नहीं है, कोई पोशाक नहीं है, और कोई सुस्ती नहीं है। सुरक्षा सीधे ईंटों में ही निर्मित है।
4. "पारिवारिक विरासत" (पुन: प्रयोज्यता)
यह शायद सबसे शानदार हिस्सा है। कल्पना करें कि पुस्तकालय का मालिक मूल पुस्तकालय के आधार पर एक "सुरक्षा नियमावली" (Safety Manual) बनाता है।
- बाद में, कोई उस पुस्तकालय को लेता है और उसे एक विशिष्ट कार्य (जैसे, "मेडिकल लाइब्रेरी" या "मैथ लाइब्रेरी") के लिए नाम देता है। आमतौर पर, यह नया कार्य सुरक्षा नियमों को अनजाने में तोड़ सकता है।
- NeST के साथ, आपको शुरुआत से शुरू करने की आवश्यकता नहीं है। आप मूल सुरक्षा नियमावली (विशिष्ट न्यूरॉन्स और टीमों जिन्हें पहले पहचाना गया था) को ले सकते हैं और उसे नई "मेडिकल लाइब्रेरी" पर लागू कर सकते हैं।
- यह तुरंत नई लाइब्रेरी को हमलों के खिलाफ मजबूत कर देता है, बिना उसे फिर से प्रशिक्षित किए। यह एक पारिवारिक विरासत को अगली पीढ़ी को सौंपने जैसा है जो उसकी रक्षा करती है।
उन्होंने क्या सिद्ध किया?
उन्होंने इस परीक्षण को 14 अलग-अलग "लाइब्रेरीज" (AI मॉडल) पर किया, जिनमें टेक्स्ट-ओनली और वे मॉडल भी शामिल थे जो चित्र देख सकते हैं।
- NeST से पहले: हैकर्स मॉडल्स को 44% से 55% बार धोखा दे सकते थे।
- NeST के बाद: हैकर्स उन्हें केवल 1% बार ही धोखा दे सकते थे।
- लागत: उन्होंने मॉडल में 0.4 मिलियन से भी कम नंबर बदलकर यह विशाल सुधार हासिल किया। पुराने तरीकों से ऐसा करने के लिए, आपको अरबों नंबर बदलने पड़ते।
संक्षेप में: NeST सुरक्षा संभालने वाले AI के छोटे, विशिष्ट हिस्सों को खोजता है, उन्हें टीमों में समूहबद्ध करता है, और उन्हें एक त्वरित, स्थायी अपग्रेड देता है। यह AI को सुरक्षित बनाता है बिना इसकी मदद करने की क्षमता को धीमा किए या तोड़े।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।