Refusal geometry reflects refusal training: diverse refusal prefixes can raise stable rank and weaken refusal vector ablation attacks
यह शोध पत्र प्रकट करता है कि संरेखित (aligned) भाषा मॉडलों में इनकार तंत्र (refusal mechanisms) की निम्न-आयामी और भंगुर प्रकृति प्रशिक्षण के दौरान दोहराए जाने वाले इनकार उपसर्गों (refusal prefixes) से उत्पन्न होती है, और यह प्रदर्शित करता है कि विविध इनकार उपसर्गों का उपयोग सक्रियण अपडेट (activation updates) के स्थिर रैंक (stable rank) को बढ़ा सकता है, जिससे इनकार वेक्टर एब्लेशन हमलों (vector ablation attacks) के विरुद्ध अधिक सुदृढ़ हो जाते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आधुनिक आर्टिफिशियल इंटेलिजेंस सिस्टम तेजी से सक्षम होते जा रहे हैं, जो कोड लिख सकते हैं, चिकित्सा स्थितियों का निदान कर सकते हैं और रचनात्मक सामग्री उत्पन्न कर सकते हैं। इस शक्ति के साथ एक महत्वपूर्ण जिम्मेदारी भी आती है: यह सुनिश्चित करना कि ये मशीनें हानिकारक निर्देश बनाना न सीखें, जैसे कि हथियार बनाना या खतरनाक जैविक एजेंट बनाना। इसे रोकने के लिए, डेवलपर्स मॉडल्स को असुरक्षित अनुरोधों को पहचानने और उन्हें विनम्रतापूर्वक अस्वीकार करने के लिए प्रशिक्षित करते हैं, जिसे 'रिफ्यूजल ट्रेनिंग' (refusal training) कहा जाता है। हालांकि, एक परेशान करने वाली भेद्यता उभर कर आई है। शोधकर्ताओं ने पाया है कि कई उन्नत मॉडल्स में, यह इनकार करने का व्यवहार एक जटिल, वितरित रक्षा तंत्र नहीं है, बल्कि मॉडल के आंतरिक चिंतन स्थान (internal thinking space) में एक एकल, संकीर्ण पथ है। यदि कोई हमलावर इस विशिष्ट पथ की पहचान कर सकता है और इसे अवरुद्ध कर सकता है, तो मॉडल को उसके सुरक्षा नियमों को अनदेखा करने और खतरनाक अनुरोधों का अनुपालन करने के लिए बहकाया जा सकता है। यह कमजोरी यह सुझाव देती है कि सुरक्षा सिखाने का तरीका ही एक 'सिंगल पॉइंट ऑफ फेलियर' (single point of failure) बना रहा है।
यूसी सैन डिएगो के एक शोधकर्ता ने यह समझने के लिए प्रयास किया कि ऐसा नाजुक, एकल-पथ वाला ढांचा क्यों बनता है और क्या इसे अधिक मजबूत बनाया जा सकता है। उन्होंने एक विशिष्ट प्रकार के एआई मॉडल पर ध्यान केंद्रित किया ताकि उनके इनकार करने के व्यवहार के उद्गम को प्रशिक्षण प्रक्रिया से ही ट्रैक किया जा सके। उनकी जांच से पता चला कि इनकार करने के तंत्र की ज्यामिति (geometry) सीधे तौर पर इस बात का प्रतिबिंब है कि मॉडल को 'ना' कहना कैसे सिखाया गया था। विशेष रूप से, उन्होंने पाया कि जब एक मॉडल को हानिकारक अनुरोध को अस्वीकार करने के लिए प्रशिक्षित किया जाता है, तो उसके आंतरिक अवस्था (internal state) में किए गए परिवर्तन इस बात से अत्यधिक प्रभावित होते हैं कि वह अपने इनकार को शुरू करने के लिए पहले किस शब्द का उपयोग करता है। यदि प्रशिक्षण डेटा मॉडल को हर इनकार को एक ही वाक्यांश के साथ शुरू करने के लिए मजबूर करता है, जैसे कि "I am sorry" (मुझे खेद है), तो मॉडल के आंतरिक समायोजन अत्यधिक केंद्रित हो जाते हैं। यह एकाग्रता एक लो-डायमेंशनल स्ट्रक्चर (low-dimensional structure) बनाती है, जिसका अर्थ है कि इनकार करने का व्यवहार मॉडल के आंतरिक स्थान में बहुत कम दिशाओं पर निर्भर करता है। क्योंकि व्यवहार इतना केंद्रित है, इसलिए हमलावर के लिए उस एकल दिशा को ढूंढना और उसे निष्प्रभावी करना आसान है, जिससे मॉडल की इनकार करने की क्षमता को प्रभावी रूप से 'जेलब्रेक' किया जा सकता है।
शोधकर्ता ने इस सिद्धांत का परीक्षण करने के लिए जांचा कि विभिन्न प्रशिक्षण पैटर्न ने मॉडल की लचीलापन (resilience) को कैसे प्रभावित किया। उन्होंने देखा कि जब इनकार प्रशिक्षण डेटा दोहराव वाला था, जिसमें मॉडल हर इनकार को एक ही टोकन के साथ शुरू करना सीख रहा था, तो परिणामी सुरक्षा तंत्र वास्तव में भंगुर (brittle) था। आंतरिक परिवर्तन इतने केंद्रित थे कि एक एकल वेक्टर को हटाने से इनकार करने की क्षमता पूरी तरह से अक्षम हो सकती थी। हालांकि, जब उन्होंने प्रशिक्षण प्रक्रिया में विविधता पेश की, जिसमें मॉडल को उन इनकारों से सीखने के लिए मजबूर किया गया जो कई अलग-अलग शब्दों और वाक्यांशों से शुरू होते थे, तो परिणाम नाटकीय रूप से बदल गया। मॉडल को विविध शुरुआती बिंदुओं के माध्यम से सीखने के लिए मजबूर करके, उसके आंतरिक परिवर्तन अधिक फैले हुए हो गए। इसने मॉडल के आंतरिक समायोजनों के प्रभावी रैंक (effective rank) को बढ़ा दिया, जिससे इनकार करने का तंत्र किसी भी एकल दिशा पर कम निर्भर हो गया।
यह सत्यापित करने के लिए कि यह विविधता वास्तव में मॉडल को मजबूत बनाती है, शोधकर्ता ने नियंत्रित प्रयोग किए जहाँ उन्होंने मॉडल को विभिन्न स्तरों की 'रिफ्यूजल डाइवर्सिटी' (refusal diversity) वाले डेटासेट्स पर फाइन-ट्यून किया। उन्होंने एक स्पष्ट पैटर्न पाया: विविध 'रिफ्यूजल स्टार्ट्स' के साथ प्रशिक्षित मॉडल्स को तोड़ना काफी कठिन था। उसी प्रकार के हमले के संपर्क में आने पर, जो दोहराव वाले मॉडल्स को आसानी से बायपास कर देता था, विविध मॉडल्स ने अपने इनकार करने के व्यवहार को बहुत अधिक प्रभावी ढंग से बनाए रखा। हमला, जो एक एकल दिशा को प्रोजेक्ट करके (projecting out) काम करता था, इनकार करने की क्षमता को हटाने में विफल रहा क्योंकि सुरक्षा संकेत अब एक दिशा में केंद्रित होने के बजाय कई दिशाओं में फैला हुआ था। शोधकर्ता ने इसे 'स्टेबल रैंक' (stable rank) नामक अवधारणा का उपयोग करके मापा, जो अनिवार्य रूप से यह गिनता है कि मॉडल के व्यवहार का वर्णन करने के लिए कितने स्वतंत्र दिशाओं की आवश्यकता है। उन्होंने पाया कि उच्च विविधता से उच्च स्थिर रैंक प्राप्त हुई, और उच्च स्थिर रैंक का सीधा संबंध हमले के दौरान सुरक्षा प्रदर्शन में होने वाली कमी के कम होने से था।
अध्ययन ने यह भी पता लगाया कि ये परिवर्तन मॉडल की परतों (layers) के माध्यम से कैसे प्रसारित होते हैं। उन्होंने पाया कि प्रशिक्षण प्रक्रिया के बिल्कुल शुरुआत में पेश की गई विविधता, जो विविध प्रथम टोकन (first tokens) के रूप में थी, मॉडल की आंतरिक अवस्था को उसके सबसे गहरे स्तरों तक प्रभावित करती है। शुरुआती परतों में होने वाले परिवर्तन, जहाँ मॉडल पहले अनुरोध को प्रोसेस करता है, नेटवर्क के माध्यम से आगे बढ़ते समय प्रवर्धित (amplify) हो जाते हैं, जिसके परिणामस्वरूप अंतिम निर्णय बिंदु पर एक अधिक मजबूत इनकार तंत्र प्राप्त होता है। यह सुझाव देता है कि टोकन स्तर पर सुरक्षा डेटा को कैसे संरचित किया जाता है, उसका मॉडल के समग्र सुरक्षा आर्किटेक्चर पर गहरा और स्थायी प्रभाव पड़ता है। शोधकर्ता ने उल्लेख किया कि हालांकि यह दृष्टिकोण सभी संभावित हमलों के खिलाफ प्रतिरक्षा की गारंटी नहीं देता है, लेकिन यह मॉडल्स को एक विशिष्ट और खतरनाक वर्ग की कमजोरियों के खिलाफ मजबूत करने के लिए एक सरल और प्रभावी साधन प्रदान करता है।
निष्कर्ष एआई सुरक्षा पर एक नया दृष्टिकोण प्रदान करते हैं, जो ध्यान केवल इस बात से हटाकर कि मॉडल को क्या सिखाया जाता है, इस पर केंद्रित करता है कि उसे कैसे सिखाया जाता है। शोध का सुझाव है कि वर्तमान सुरक्षा संरेखण (safety alignments) की भंगुरता तकनीक की एक अपरिहार्य खामत नहीं है, बल्कि दोहराव वाले प्रशिक्षण पैटर्न का परिणाम है। मॉडल्स को इनकार करने के तरीके को विविध बनाकर, डेवलपर्स ऐसे सुरक्षा तंत्र बना सकते हैं जो अधिक वितरित और इसलिए विघटित करने में अधिक कठिन हों। यह कार्य एआई सिस्टम की मजबूती को बेहतर बनाने के लिए एक ठोस, मापने योग्य तरीका प्रदान करता है, यह दिखाते हुए कि सुरक्षित मॉडल्स की राह इनकार की शब्दावली को बदलने के सरल कार्य में निहित हो सकती है। अध्ययन निष्कर्ष निकालता है कि मॉडल व्यवहार और प्रशिक्षण डेटा के बीच ज्यामितीय संबंध को समझना उन रक्षा प्रणालियों के निर्माण के लिए आवश्यक है जो शक्तिशाली आर्टिफिशियल इंटेलिजेंस का दुरुपयोग करने वालों की विकसित होती रणनीतियों का सामना कर सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।