← नवीनतम पेपर
🤖 machine learning

Pruning Unsafe Tickets: A Resource-Efficient Framework for Safer and More Robust LLMs

यह शोध पत्र एक संसाधन-कुशल, ग्रेडिएंट-मुक्त प्रूनिंग फ्रेमवर्क पेश करता है जो बड़े भाषा मॉडलों से "असुरक्षित टिकटों" (हानिकारक व्यवहार उत्पन्न करने वाले पैरामीटर्स) की पहचान करता है और उन्हें हटाता है ताकि न्यूनतम कम्प्यूटेशनल लागत के साथ उपयोगिता को संरक्षित करते हुए सुरक्षा और जेलब्रेक के विरुद्ध मजबूती को बढ़ाया जा सके।

मूल लेखक: Wai Man Si, Mingjie Li, Michael Backes, Yang Zhang

प्रकाशित 2026-04-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wai Man Si, Mingjie Li, Michael Backes, Yang Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली, अत्यंत बुद्धिमान रोबोट सहायक है। आपने इसे मददगार, रचनात्मक और कहानियाँ लिखने में कुशल बनने के लिए प्रशिक्षित किया है। लेकिन एक समस्या है: क्योंकि इसने पूरे इंटरनेट से सीखा है, इसने कुछ "बुरी आदतें" भी अपना ली हैं। यदि आप इसे सही (या गलत) तरीके से पूछें, तो यह अनजाने में आपको बम बनाने का तरीका बता सकता है, नफरत भरे भाषण लिख सकता है, या खतरनाक चिकित्सा सलाह दे सकता है।

वर्तमान में, इसे ठीक करने का मानक तरीका रोबोट को फिर से प्रशिक्षित करना (re-training) है। आप उसे बिठाते हैं, उसे "अच्छे" बनाम "बुरे" उत्तरों के हजारों उदाहरण दिखाते हैं, और उम्मीद करते हैं कि वह विनम्र बनना सीख जाएगा। लेकिन यह महंगा है, इसमें बहुत समय लगता है, और कभी-कभी रोबंतु जब आप देख नहीं रहे होते हैं, तो वह अपनी पुरानी बुरी आदतें भूल जाता है (या फिर वह गलतियाँ करने से इतना डर जाता है कि वह किसी भी चीज़ का जवाब देने से मना कर देता है, यहाँ तक कि सुरक्षित सवालों का भी)।

यह शोध पत्र एक बहुत अधिक स्मार्ट, हल्का और तेज़ समाधान प्रस्तावित करता है। वे इसे "प्रूनिंग अनसेफ टिकट्स" (Pruning Unsafe Tickets) कहते हैं।

यह इस प्रकार काम करता है, कुछ सरल उपमाओं का उपयोग करते हुए:

1. "लॉटरी टिकट" की उपमा

कल्पना कीजिए कि रोबोट का मस्तिष्क एक विशाल लॉटरी हॉल है जो लाखों छोटे, छिपे हुए टिकटों से भरा हुआ है।

  • सुरक्षित टिकट (Safe Tickets): ये वे न्यूरॉन्स (मस्तिष्क में संबंध) हैं जो रोबोट को कविता लिखने, गणित की समस्या हल करने या यह कहने में मदद करते हैं कि "मैं इसमें आपकी मदद नहीं कर सकता।"
  • असुरक्षित टिकट (Unsafe Tickets): ये विशिष्ट, छिपे हुए संबंध हैं जो, यदि सक्रिय हो जाएं, तो रोबोट को कुछ खतरनाक बोलने के लिए प्रेरित करते हैं।

लेखकों का तर्क है कि भले ही हम रोबोट को "संरेखित" (align) करने की कोशिश करें, ये असुरक्षित टिकट अभी भी वहीं बैठे रहते हैं, सुप्त अवस्था में, लेकिन किसी को भी "जेलब्रेक" प्रॉम्प्ट के साथ रोबोट को चकमा देने पर सक्रिय होने के लिए तैयार।

2. "बगीचे की निराई" (Weeding) की रणनीति

पूरे बगीचे को फिर से लगाने (पुनः प्रशिक्षण) के बजाय, लेखक एक सर्जिकल निराई (surgical weeding) दृष्टिकोण का सुझाव देते हैं।

  • चरण 1: खरपतवारों को खोजें (व्यवहार प्रोफाइलिंग): वे रोबोट से कई पेचीदा सवाल पूछते हैं ताकि यह देख सकें कि वास्तव में कब और कैसे वह गलत व्यवहार करना शुरू करता है।
  • चरण 2: जड़ों का पता लगाएं (Attribution): वे एक विशेष उपकरण का उपयोग करते हैं जिससे यह पता चलता है कि कौन से छोटे संबंध (न्यूरॉन्स) जल रहे हैं जब रोबोट कुछ बुरा बोलने वाला होता है। वे मस्तिष्क के उन हिस्सों को अनदेखा कर देते हैं जिनका उपयोग सुरक्षित विषयों के बारे में सोचने के लिए किया जाता है।
  • चरण 3: जड़ों को काट दें (Pruning): वे उन विशिष्ट संबंधों को भौतिक रूप से काट (प्रून) देते हैं। वे केवल उन्हें बंद नहीं करते; वे उन्हें रोबोट के मस्तिष्क से पूरी तरह से हटा देते हैं।

3. परिणाम: एक "सेफ्टी टिकट" (Safety Ticket)

एक बार जब वे सभी "असुरक्षित टिकटों" को काट देते हैं, तो कुछ जादुई होता है। शेष मस्तिष्क संरचना—"सेफ्टी टिकट"—स्वाभाविक रूप से सुरक्षित होती है।

  • यह अभी भी कोड लिखना, चुटकुले सुनाना और सवालों के जवाब देना जानता है (इसने अपनी बुद्धिमत्ता नहीं खोई है)।
  • लेकिन अब, यदि आप इसे कुछ खतरनाक बोलने के लिए छलने की कोशिश करते हैं, तो उस बुरे उत्तर का "मार्ग" वास्तव में समाप्त हो चुका होता है। रोबोट बस वह बुरा वाक्य उत्पन्न करने में असमर्थ होता है।
  • एक खतरनाक उत्तर देने के बजाय, यह स्वाभाविक रूप से यह कहने पर वापस आ जाता है, "मैं यह नहीं कर सकता," क्योंकि उस बुरे उत्तर के लिए तंत्रिका पथ (neural pathway) को हटा दिया गया है।

यह पुराने तरीकों से बेहतर क्यों है?

पुराना तरीका (Re-training) नया तरीका (Pruning)
घर बनाने जैसा: आपको एक बड़ी टीम, बहुत सारा पैसा और महीनों के काम की आवश्यकता होती है। लीक ठीक करने जैसा: आप विशिष्ट पाइप को ढूंढते हैं और कुछ घंटों में उसे ठीक कर देते हैं।
भारी: इसके लिए विशाल कंप्यूटरों और बहुत अधिक मेमोरी की आवश्यकता होती है। हल्का: यह मानक कंप्यूटरों पर चल सकता है, यहाँ तक कि जगह भी बचाता है।
नाजुक: रोबोट नियम भूल सकता है या बहुत अधिक सतर्क (किसी भी चीज़ का उत्तर देने से मना करना) हो सकता है। मजबूत: रोबलेट स्मार्ट और मददगार बना रहता है लेकिन शारीरिक रूप से बुरा आउटपुट उत्पन्न करने में असमर्थ होता है।
धीमा: प्रशिक्षण में कई दिन लगते हैं। तेज़: शोध पत्र दिखाता है कि उन्होंने एक बड़े मॉडल के लिए इसे 10 मिनट से भी कम समय में किया!

"सर्किट ब्रेकर" की उपमा

रोबोट के मस्तिष्क को बिजली के तारों वाले घर के रूप में सोचें।

  • पुराना तरीका: आप फ्यूज बॉक्स को निर्देश देकर बिजली के प्रवाह को अलग तरह से चलाने की कोशिश करते हैं। कभी-कभी यह काम करता है, कभी-कभी नहीं।
  • इस शोध पत्र का तरीका: वे उस विशिष्ट तार को ढूंढते हैं जो "खतरनाक उपकरण" को शक्ति देता है और तार को काट देते हैं। अब, चाहे आप स्विच चालू करने की कितनी भी कोशिश करें, उपकरण चालू ही नहीं हो सकता। घर का बाकी हिस्सा (मददगार हिस्से) पूरी तरह से काम करता रहता है।

सारांश में

यह शोध पत्र AI को सुरक्षित बनाने का एक तरीका पेश करता है, जो नए नियम सिखाने के बजाय मस्तिष्क के उन विशिष्ट हिस्सों को हटाने पर आधारित है जो नुकसान पहुँचाते हैं। यह एक बच्चे के हाथ से चाकू छीनने जैसा है, बजाय इसके कि उसे केवल "खुद को चोट न पहुँचाने" के लिए कहें। यह तेज़ है, सस्ता है, और इसे AI को बेवकूफ बनाना बहुत कठिन बनाता है, जबकि इसकी बुद्धिमत्ता और उपयोगिता को बनाए रखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →