← नवीनतम पेपर
🤖 machine learning

NeST: Neuron Selective Tuning for LLM Safety

NeST एक पैरामीटर-कुशल पोस्ट-हॉक सुरक्षा संरेखण ढांचा है जो केवल साधारण दुर्भावनापूर्ण प्रॉम्प्ट्स का उपयोग करके सुरक्षा-प्रासंगिक फीड-फॉरवर्ड न्यूरॉन्स के क्लस्टर्स की पहचान करता है और उन्हें चुनिंदा रूप से ट्यून करता है, जिससे टेक्स्ट और मल्टीमॉडल मॉडल्स में विविध जेलब्रेक्स के विरुद्ध न्यूनतम कम्प्यूटेशनल ओवरहेड के साथ एक मजबूत रक्षा प्राप्त होती है।

मूल लेखक: Sasha Behrouzi, Lichao Wu, Mohamadreza Rostami, Ahmad-Reza Sadeghi

प्रकाशित 2026-06-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sasha Behrouzi, Lichao Wu, Mohamadreza Rostami, Ahmad-Reza Sadeghi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक लार्ज लैंग्वेज मॉडल (LLM) की कल्पना एक विशाल, अविश्वसनीय रूप से बुद्धिमान पुस्तकालय के रूप में करें जिसमें अरबों पुस्तकें हैं। जब आप कोई प्रश्न पूछते हैं, तो पुस्तकालय केवल "सोचता" नहीं है; यह उत्तर खोजने के लिए विशिष्ट अलमारियों, पंक्तियों और व्यक्तिगत पुस्तकों को सक्रिय करता है।

समस्या यह है कि कुछ पुस्तकों में खतरनाक निर्देश (जैसे "बम कैसे बनाएं") हो सकते हैं। कभी-कभी, चतुर ठग (हैकर्स) ऐसे तरीके से प्रश्न पूछते हैं जिससे लाइब्रेरियन भ्रमित हो जाता है, जिससे वे उत्तर देने से मना करने के बजाय उन खतरनाक पुस्तकों को निकाल लेता है।

इसे ठीक करने के मौजूदा तरीके पूरे पुस्तकालय को फिर से व्यवस्थित करने जैसे हैं, हर बार जब एक नया छल खोजा जाता है। यह धीमा, महंगा है, और यदि आप इसे गलत करते हैं, तो आप अनजाने में अच्छी पुस्तकों को भी छिपा सकते हैं।

NeST (न्यूरोन सेलेक्टिव ट्यूनिंग) पुस्तकालय को सुरक्षित करने का एक नया, स्मार्ट तरीका है। यह यहाँ कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. "बुलडोजर" के बजाय "स्पॉटलाइट"

अधिकांश सुरक्षा विधियाँ बुलडोजर की तरह हैं: वे एक ही बार में पूरी इमारत को ठीक करने की कोशिश करती हैं। NeST एक स्पॉटलाइट की तरह है।

  • यह कैसे काम करता है: शोधकर्ता पुस्तकालय पर रोशनी डालते हैं जबकि हानिरहित प्रश्न ("एक बिल्ली क्या है?") और हानिकारक प्रश्न ("बम कैसे बनाएं?") दोनों पूछे जाते हैं।
  • खोज: वे देखते हैं कि जब पुस्तकालय से कोई खतरनाक प्रश्न पूछा जाता है, तो केवल "पुस्तकों" (न्यूरॉन्स) का एक बहुत छोटा, विशिष्ट समूह ही चमकता है। ये हैं "सेफ्टी न्यूरॉन्स" (सुरक्षा न्यूरॉन्स)। बाकी पुस्तकालय अंधेरे में और इसमें शामिल नहीं रहता।
  • समाधान: पूरे पुस्तकालय को फिर से लिखने के बजाय, NeST केवल इन विशिष्ट, चमकती हुई पुस्तकों को छूता है। यह उन्हें सिखाता है कि बुरी चीजों के लिए पूछे जाने पर दृढ़ता से "ना" कहें, जबकि अन्य लाखों पुस्तकों को वे वैसे ही रहने देता है जैसे वे हैं।

2. "टीम कैप्टन" प्रणाली

आप सोच सकते हैं, "ठीक है, तो हम उन विशिष्ट पुस्तकों को ठीक करते हैं। लेकिन अभी भी हजारों पुस्तकें बाकी हैं!"

  • समस्या: यदि आप हर एक सुरक्षा पुस्तक को व्यक्तिगत रूप से प्रशिक्षित करने की कोशिश करते हैं, तो यह अभी भी बहुत अधिक काम है। साथ ही, कुछ पुस्तकें समान बातें कह सकती हैं, जबकि अन्य अलग बातें कह सकती हैं।
  • NeST का समाधान: NeST इन सुरक्षा पुस्तकों को उनके व्यवहार के आधार पर टीमों में समूहबद्ध करता है।
    • उपमा: एक स्पोर्ट्स टीम की कल्पना करें। हर खिलाड़ी को व्यक्तिगत रूप से कोचिंग देने के बजाय, आप उन खिलाड़ियों का समूह बनाते हैं जो एक ही पोजीशन खेलते हैं (जैसे, सभी गोलकीपर)। आप "गोलकीपर टीम" को एक साझा सेट निर्देश देते हैं।
    • NeST ऐसा ही न्यूरॉन्स के साथ करता है। यह उन न्यूरॉन्स के समूहों को पाता है जो एक जैसा व्यवहार करते हैं और उन्हें एक साझा "अपडेट" देता है। यह प्रशिक्षण को अविश्वसनीय रूप से तेज़ और कुशल बनाता है।

3. "स्थायी टैटू" बनाम "अस्थायी पोशाक"

कुछ सुरक्षा विधियाँ पुस्तकालय पर एक अस्थायी पोशाक पहनाने जैसी हैं। हर बार जब आप अंदर जाते हैं, तो एक गार्ड को पोशाक की जांच करनी पड़ती है। यह सब कुछ धीमा कर देता है।

  • NeST का दृष्टिकोण: NeST पुस्तकालय को एक स्थायी टैटू देने जैसा है।
  • एक बार प्रशिक्षण पूरा हो जाने के बाद, नए निर्देश पुस्तकालय की मौजूदा संरचना में सीधे "फोल्ड" (समाहित) कर दिए जाते हैं।
  • परिणाम: जब आप बाद में कोई प्रश्न पूछते हैं, तो पुस्तकालय पहले की तरह ही तेज़ी से उत्तर देता है। वहाँ कोई अतिरिक्त गार्ड नहीं है, कोई पोशाक नहीं है, और कोई सुस्ती नहीं है। सुरक्षा सीधे ईंटों में ही निर्मित है।

4. "पारिवारिक विरासत" (पुन: प्रयोज्यता)

यह शायद सबसे शानदार हिस्सा है। कल्पना करें कि पुस्तकालय का मालिक मूल पुस्तकालय के आधार पर एक "सुरक्षा नियमावली" (Safety Manual) बनाता है।

  • बाद में, कोई उस पुस्तकालय को लेता है और उसे एक विशिष्ट कार्य (जैसे, "मेडिकल लाइब्रेरी" या "मैथ लाइब्रेरी") के लिए नाम देता है। आमतौर पर, यह नया कार्य सुरक्षा नियमों को अनजाने में तोड़ सकता है।
  • NeST के साथ, आपको शुरुआत से शुरू करने की आवश्यकता नहीं है। आप मूल सुरक्षा नियमावली (विशिष्ट न्यूरॉन्स और टीमों जिन्हें पहले पहचाना गया था) को ले सकते हैं और उसे नई "मेडिकल लाइब्रेरी" पर लागू कर सकते हैं।
  • यह तुरंत नई लाइब्रेरी को हमलों के खिलाफ मजबूत कर देता है, बिना उसे फिर से प्रशिक्षित किए। यह एक पारिवारिक विरासत को अगली पीढ़ी को सौंपने जैसा है जो उसकी रक्षा करती है।

उन्होंने क्या सिद्ध किया?

उन्होंने इस परीक्षण को 14 अलग-अलग "लाइब्रेरीज" (AI मॉडल) पर किया, जिनमें टेक्स्ट-ओनली और वे मॉडल भी शामिल थे जो चित्र देख सकते हैं।

  • NeST से पहले: हैकर्स मॉडल्स को 44% से 55% बार धोखा दे सकते थे।
  • NeST के बाद: हैकर्स उन्हें केवल 1% बार ही धोखा दे सकते थे।
  • लागत: उन्होंने मॉडल में 0.4 मिलियन से भी कम नंबर बदलकर यह विशाल सुधार हासिल किया। पुराने तरीकों से ऐसा करने के लिए, आपको अरबों नंबर बदलने पड़ते।

संक्षेप में: NeST सुरक्षा संभालने वाले AI के छोटे, विशिष्ट हिस्सों को खोजता है, उन्हें टीमों में समूहबद्ध करता है, और उन्हें एक त्वरित, स्थायी अपग्रेड देता है। यह AI को सुरक्षित बनाता है बिना इसकी मदद करने की क्षमता को धीमा किए या तोड़े।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →