← नवीनतम पेपर
💬 NLP

Abliteration Mitigation via Refusal Aliases

यह शोध पत्र AMRA को प्रस्तुत करता है, जो एक वेट-एडिटिंग (weight-editing) रक्षा तंत्र है जो रैंक-kk अपडेट और एक्टिवेशन एलियासिंग (activation aliasing) के माध्यम से रिफ्यूज़ल दिशा (refusal direction) को अस्पष्ट करके "एब्लिटरेशन" (abliteration) हमलों को कम करता है, जिससे मॉडल की उपयोगिता पर न्यूनतम प्रभाव के साथ Llama-3-8B और Gemma-2-9B पर रिफ्यूज़ल रिटेंशन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Nathan Truong

प्रकाशित 2026-08-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nathan Truong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की तेजी से विकसित होती दुनिया में, लार्ज लैंग्वेज मॉडल्स (LLMs) शक्तिशाली उपकरण बन गए हैं जो तर्क करने, लिखने और जटिल समस्याओं को हल करने में सक्षम हैं। यह सुनिश्चित करने के लिए कि ये सिस्टम सुरक्षित और सहायक बने रहें, डेवलपर्स उन्हें उन अनुरोधों को अस्वीकार करने के लिए प्रशिक्षित करते हैं जो नुकसान पहुंचा सकते हैं, जैसे कि हथियार बनाने के निर्देश या घृणास्पद सामग्री (hate speech) उत्पन्न करना। यह सुरक्षा प्रशिक्षण, जिसे अक्सर 'अलाइनमेंट' कहा जाता है, मॉडल को खतरनाक विषयों को पहचानने और उन्हें विनम्रता से अस्वीकार करने की शिक्षा देता है। हालाँकि, शोधकर्ताओं ने एक आश्चर्यजनक भेद्यता (vulnerability) की खोज की है: इस इनकार (refusal) के पीछे का तंत्र कोई जटिल, छिपा हुआ किला नहीं है, बल्कि मॉडल के आंतरिक कामकाज के भीतर एक सरल, पहचानने योग्य पैटर्न है। इस विशिष्ट पैटर्न को खोजने से—जो मॉडल के गणितीय स्थान (mathematical space) में एक अलग दिशा है जो संकेत देती है कि "उत्तर न दें"—हमलावर गणितीय रूप से इसे मिटा सकते हैं, जिससे कुछ सरल समायोजनों के साथ मॉडल के सुरक्षा ब्रेक प्रभावी रूप से बंद हो जाते हैं। 'एब्लिटरेशन' (abliteration) के रूप में जानी जाने वाली यह प्रक्रिया मॉडल को पूरी तरह कार्यात्मक तो छोड़ देती है लेकिन खतरनाक रूप से असुरक्षित बना देती है, जिससे वह हानिकारक सामग्री उत्पन्न करने में सक्षम हो जाती है जिसे उसे पहले अस्वीकार करने के लिए डिज़ाइन किया गया था।

एक शोधकर्ता ने अब इस विशिष्ट प्रकार के हमले से बचने के लिए एक नया तरीका प्रस्तावित किया है, जो एक मजबूत दीवार बनाने के बजाय, लक्ष्य को ही अप्राप्य बनाने पर आधारित है। उनका दृष्टिकोण, जिसे 'एब्लिटरेशन मिटिगेशन वाया रिफ्यूज़ल एलियास' (Abliteration Mitigation via Refusal Aliases) कहा जाता है, इस सिद्धांत पर काम करता है कि यदि हमलावर सुरक्षा संकेत (safety signal) का पता नहीं लगा सकता, तो वह उसे हटा नहीं सकता। शोधकर्ता ने पहचाना कि इन मॉडल्स में इनकार करने का व्यवहार नेटवर्क की विशिष्ट परतों (layers) में केंद्रित है, जहाँ मॉडल जानकारी को आगे भेजने से पहले उसे प्रोसेस करता है। उन्होंने इन परतों के भार (weights) को सूक्ष्म रूप से बदलने की एक तकनीक विकसित की, जो प्रभावी रूप से सुरक्षा संकेत को बिखेर (scramble) देती है। इसके बजाय कि मॉडल किसी हानिकारक अनुरोध का सामना करने पर एक स्पष्ट, सुसंगत "नहीं" उत्पन्न करे, परिवर्तित प्रणाली उस विशिष्ट प्रतिक्रिया को एक यादृच्छिक (random), कम-विचलन वाले शोर (low-variance noise) से बदल देती है। मॉडल के अपने आंतरिक तर्क के लिए, इस शोर को बाद की परतों द्वारा सुधारा जाता है ताकि मॉडल सुरक्षित प्रश्नों के लिए सामान्य रूप से कार्य करना जारी रखे, लेकिन वह स्पष्ट, निष्कर्षण योग्य पैटर्न जिसे एक हमलावर खोजेगा, वह गायब हो जाता है।

शोधकर्ता ने इस पद्धति का परीक्षण दो लोकप्रिय ओपन-सोर्स मॉडल्स, Llama-3 और Gemma-2 पर किया, यह देखने के लिए कि क्या यह सुरक्षा विशेषताओं को हटाने के लिए उपयोग की जाने वाली मानक तकनीकों का सामना कर सकती है। अपने प्रयोगों में, उन्होंने पहले मॉडल्स पर इस अस्पष्टीकरण (obfuscation) तकनीक को लागू किया और फिर सामान्य "एब्लिटरेशन" हमले को करने का प्रयास किया। परिणामों ने मॉडल्स की इनकार करने की क्षमताओं को बनाए रखने की क्षमता में महत्वपूर्ण सुधार दिखाया। Llama-3 मॉडल के लिए, रक्षा ने हमले के प्रयास के बाद इनकार स्कोर में 2.16 अंकों का सुधार किया, जो बिना सुरक्षा वाले मॉडल्स की तुलना में एक बड़ा लाभ है। महत्वपूर्ण रूप से, यह सुरक्षा वृद्धि मॉडल की सामान्य बुद्धिमत्ता या हानिरहित प्रश्नों के उत्तर देने की क्षमता में लगभग बिना किसी नुकसान के आई। शोधकर्ता ने मानक ज्ञान और तर्क संबंधी बेंचमार्क पर मॉडल के प्रदर्शन को मापा और पाया कि उपयोगिता (utility) में गिरावट नगण्य थी, जो एक प्रमुख ज्ञान परीक्षण पर आधा प्रतिशत से भी कम थी।

Gemma-2 मॉडल पर लागू होने पर परिणाम और भी नाटकीय, हालांकि अधिक जटिल थे। यहाँ, रक्षा ने हमले के बाद इनकार स्कोर में 14.70 अंकों का सुधार किया, जो प्रभावी रूप से सुरक्षित बेसलाइन और संरक्षित मॉडल के बीच के अंतर को पाट देता है। हालाँकि हमले ने मॉडल के इनकार व्यवहार को कुछ हद तक कम करने में सफलता प्राप्त की, लेकिन अस्पष्टीकरण ने हमले को असुरक्षित संस्करणों की तुलना में बहुत कम प्रभावी बना दिया। हालाँकि, Gemma-2 पर इस मजबूत सुरक्षा के साथ एक उच्च लागत भी आई। शोधकर्ता ने गणित की समस्याओं को हल करने की मॉडल की क्षमता और इसकी समग्र ज्ञान प्रतिधारण (knowledge retention) में अधिक स्पष्ट गिरावट देखी। वे इसका श्रेय जेम्मा आर्किटेक्चर को सुरक्षित करने के लिए आवश्यक विशिष्ट सेटिंग्स को देते हैं, जिसमें मॉडल की आंतरिक संरचना में अधिक महत्वपूर्ण परिवर्तन शामिल थे। इस समझौते (trade-off) के बावजूद, यह विधि परीक्षण की गई एकमात्र रक्षा सिद्ध हुई जिसने मॉडल को दिशात्मक हमलों (directional attacks) के खिलाफ सफलतापूर्वक मजबूत किया और हानिकारक आउटपुट की दर को कम रखा।

इस कार्य का मूल तत्व स्वयं निष्कर्षण (extraction) प्रक्रिया पर ध्यान केंद्रित करना है। पिछले बचाव के तरीके अक्सर इनकार के संकेत को मजबूत करने या बातचीत के दौरान मॉडल को हानिकारक आउटपुट से दूर ले जाने का प्रयास करते थे। शोधकर्ता का तर्क है कि ये विधियाँ विफल रहती हैं क्योंकि वे मूल कारण को संबोधित नहीं करती हैं: वह आसानी जिससे इनकार की दिशा को खोजा और हटाया जा सकता है। इनकार के संकेत को एक रैंडम एलियास (alias) से बदलकर और फिर मॉडल के डाउनस्ट्रीम हिस्सों को उस शोर को अनदेखा करने के लिए पैच करके, शोधकर्ता सुरक्षा तंत्र को उन उपकरणों के लिए अदृश्य बना देते हैं जिनका उपयोग इसे नष्ट करने के लिए किया जाता है। यह दृष्टिकोण मॉडल के भार (weights) में एक बार के संशोधन के रूप में डिज़ाइन किया गया है, जिसका उद्देश्य डेवलपर्स द्वारा मॉडल को जनता के लिए जारी करने से पहले लागू किया जाना है। एक बार भार बदल जाने के बाद, मॉडल को अपनी सुरक्षा बनाए रखने के लिए अतिरिक्त कंप्यूटिंग शक्ति की आवश्यकता नहीं होती है, और न ही इसे पुन: प्रशिक्षित करने की आवश्यकता होती है।

यह अध्ययन सुरक्षा और उपयोगिता के बीच एक महत्वपूर्ण संतुलन को रेखांकित करता है। जबकि विधि सफलतापूर्वक इनकार की दिशा के निष्कर्षण को बाधित करती है, यह प्रत्येक मॉडल आर्किटेक्चर के लिए एक पूर्ण कवच नहीं है। शोधकर्ता ने पाया कि बचाव की प्रभावशीलता इस बात पर बहुत अधिक निर्भर करती है कि जिस मॉडल की रक्षा की जा रही है उसका विशिष्ट डिज़ाइन क्या है। कुछ मॉडल्स के लिए, सुरक्षा लगभग निर्बाध है, जबकि अन्य के लिए, यह एक समझौता आवश्यक है जहाँ मॉडल जटिल तर्क करने की अपनी क्षमता में थोड़ी कमी लाता है ताकि अपनी सुरक्षा बनाए रख सके। लेखक का सुझाव है कि भविष्य के कार्य इन सेटिंग्स को परिष्कृत कर सकते हैं ताकि उपयोगिता पर लगने वाली लागत को कम किया जा सके, या इस अस्पष्टीकरण को अन्य तरीकों के साथ जोड़ा जा सकता है जो इनकार के संकेत को स्वयं मजबूत करते हैं। अंततः, यह शोध प्रदर्शित करता है कि उस हस्ताक्षर (signature) को धुंधला करके, जिस पर हमलावर भरोसा करते हैं, यह संभव है कि लार्ज लैंग्वेज मॉडल्स को उन प्रयासों के प्रति काफी अधिक लचीला बनाया जाए जो अन्यथा उन्हें उनके सुरक्षा गार्डरेल्स से मुक्त कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →