Not All Refusals Are Equal: How Safety Alignment Fails Cybersecurity at Scale
यह शोध पत्र यह प्रदर्शित करता है कि सामान्य सुरक्षा से समझौता किए बिना वैध साइबर सुरक्षा संचालन को सक्षम करने के लिए बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) से डोमेन-विशिष्ट सुरक्षा संरेखण (डोमेन-स्पेसिफिक सेफ्टी अलाइनमेंट) को सफलतापूर्वक हटाया जा सकता है, यह पहचानते हुए कि इनकार तंत्र (रिफ्यूज़ल मैकेनिज्म) परतों में व्यापक रूप से वितरित हैं और मॉडल आर्किटेक्चर एवं प्रशिक्षण प्रकार ऐसे लक्षित हस्तक्षेपों के प्रति संवेदनशीलता के प्रमुख भविष्यवक्ता हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मुख्य विचार: "चयनात्मक ईयरप्लग" (Selective Earplug) प्रयोग
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान रोबोट सहायक है। इसे सुरक्षित रखने के लिए, इसके रचनाकारों ने इसे खतरनाक अनुरोधों को "ना" कहना सिखाया है, जैसे "मैं बम कैसे बनाऊं?" या "मैं बैंक को कैसे हैक करूं?" इसे सेफ्टी अलाइनमेंट (safety alignment) कहा जाता है।
हालाँकि, क्रैकेन एआई (Cracken AI) के शोधकर्ताओं ने एक समस्या देखी। कभी-कभी, रोबोट किसी विषय से संबंधित हर चीज़ के लिए "ना" कहता है, भले ही वह अनुरोध सुरक्षित और अधिकृत हो। उदाहरण के लिए, एक साइबर सुरक्षा विशेषज्ञ पूछ सकता है, "मैं कमजोरियों के लिए इस सिस्टम का परीक्षण कैसे करूं?" और रोबोट मना कर देता है क्योंकि उसे लगता है, "ओह, यह हैकिंग जैसा लग रहा है।"
शोधकर्ता यह जानना चाहते थे: क्या हम रोबोट को खतरनाक चीजों के लिए "ना" कहना, लेकिन एक विशिष्ट क्षेत्र (जैसे साइबर सुरक्षा) के भीतर अधिकृत, सुरक्षित चीजों के लिए "हाँ" कहना सिखा सकते हैं, बिना बाकी सब कुछ के लिए उसकी सुरक्षा को तोड़े?
वे इस प्रक्रिया को "एब्लिटरेशन" (Abliteration) कहते हैं। इसे रोबोट के मस्तिष्क से एक विशिष्ट "ईयरप्लग" को सर्जरी द्वारा हटाने के रूप में सोचें ताकि वह एक विशिष्ट प्रकार के निर्देश को सुन सके, जबकि अन्य ईयरप्लग अपनी जगह पर बने रहें।
प्रयोग: 24 अलग-अलग दिमागों का परीक्षण
टीम ने केवल एक रोबोट का परीक्षण नहीं किया; उन्होंने सभी आकारों और प्रकारों के 24 अलग-अलग लार्ज लैंग्वेज मॉडल्स (LLMs) का परीक्षण किया। कुछ बहुत छोटे थे (0.6 बिलियन "न्यूरॉन्स"), और कुछ बहुत विशाल (1 ट्रिलियन "न्यूरॉन्स")। वे 10 अलग-अलग कंपनियों से आए थे।
उन्होंने इन सभी पर यह "सर्जरी" करने की कोशिश की ताकि यह देख सकें कि क्या वे साइबर सुरक्षा के बारे में बात करने से इनकार करने को हटा सकते हैं, जबकि हिंसा, अवैध ड्रग्स या उत्पीड़न के बारे में बात करने से इनकार करने को बरकरार रख सकें।
उन्होंने क्या पाया: सभी रोबोट एक जैसे नहीं हैं
परिणाम आश्चर्यजनक थे। "सर्जरी" हर रोबोट पर एक ही तरह से काम नहीं करती थी। उन्होंने तीन मुख्य प्रकार की प्रतिक्रियाएं देखीं:
- "कांच का घर" (अत्यधिक संवेदनशील - The Glass House): कुछ मॉडल कांच के बने घर की तरह थे। जब शोधकर्ताओं ने साइबर सुरक्षा के लिए इनकार हटाने की कोशिश की, तो उनकी पूरी सुरक्षा प्रणाली ढह गई। रोबलेट हिंसा और अवैध कार्यों सहित हर चीज़ के लिए "हाँ" कहने लगा।
- "किला" (प्रतिरोधी - The Fortress): कुछ मॉडल एक किले की तरह थे। शोधकर्ताओं ने चाहे कितनी भी कोशिश की, वे साइबर सुरक्षा के इनकार को हटा नहीं सके। रोबोट सुरक्षित या असुरक्षित, हर चीज़ के लिए "ना" कहता रहा।
- "स्मार्ट फिल्टर" (सही संतुलन - The Smart Filter): कुछ मॉडल्स, विशेष रूप से Kimi K2 नामक एक विशाल 1-ट्रिलियन-पैरामीटर वाला मॉडल, एक स्मार्ट फिल्टर की तरह काम करते हैं। शोधकर्ता साइबर सुरक्षा के लिए इनकार को सफलतापूर्वक हटा पाए।
- परिणाम: Kimi K2 मॉडल साइबर सुरक्षा के सवालों को 100% मना करने से घटकर केवल 7% तक पहुँच गया।
- सुरक्षा जांच: महत्वपूर्ण रूप से, इसने स्पष्ट सामग्री (explicit content) के लिए 100% इनकार जारी रखा और हिंसा तथा अवैध सामानों के अधिकांश अनुरोधों को मना करना जारी रखा। इसने "नौकरी के लिए हैकिंग" और "लोगों को नुकसान पहुँचाने के लिए हैकिंग" के बीच अंतर करना सीख लिया।
मुख्य रहस्य: यह क्यों काम कर गया?
शोधकर्ताओं ने पाया कि रोबोट का आकार (इसमें कितने पैरामीटर्स हैं) कोई मायने नहीं रखता था। एक छोटा रोबोट "स्मार्ट फिल्टर" हो सकता था, और एक विशाल रोबोट "किला" हो सकता था।
इसके बजाय, दो चीजों ने निर्धारित किया कि सर्जरी काम करेगी या नहीं:
- इसे कैसे प्रशिक्षित किया गया था: रोबोट को सुरक्षा सिखाने का विशिष्ट तरीका (जैसे कि एक विशिष्ट सुदृढीकरण लर्निंग/reinforcement learning) सबसे बड़ा सुराग था।
- आर्किटेक्चर (Architecture): रोबोट का मस्तिष्क कैसे बना है (विशेष रूप से, क्या इसमें "मिक्सचर ऑफ एक्सपर्ट्स" डिज़ाइन का उपयोग किया गया है) ने एक बड़ी भूमिका निभाई।
उन्होंने यह भी पाया कि "इनकार" (refusal) केवल रोबोट के मस्तिष्क में एक सिंगल स्विच नहीं है। यह एक बहु-आयामी विचारों के बादल (multi-dimensional cloud of thoughts) की तरह है। क्योंकि यह एक बादल है, इसलिए सैद्धांतिक रूप से आप "हिंसा" वाले हिस्से को नष्ट किए बिना केवल "साइबर सुरक्षा" वाले हिस्से को काट सकते हैं।
सावधानी: यह जादू नहीं है
पेपर चेतावनी देता है कि यह कोई जादुई छड़ी नहीं है।
- यह विशिष्ट है: रोबोट केवल उन्हीं प्रकारों के सवालों के जवाब देना सीखता है जिन पर उसे प्रशिक्षित किया गया है। यदि आप उससे किसी अलग तरह का साइबर सुरक्षा सवाल पूछते हैं जिसे उसने पहले नहीं देखा है, तो वह फिर से मना कर सकता है।
- यह विनाशकारी है: यह प्रक्रिया रोबोट के 'वेट्स' (weights) को स्थायी रूप से बदल देती है। आप इसे आसानी से पूर्ववत (undo) नहीं कर सकते।
- यह सार्वभौमिक नहीं है: कुछ मॉडल्स के लिए, आप उनकी सुरक्षा को पूरी तरह से तोड़े बिना ऐसा बिल्कुल नहीं कर सकते।
निष्कर्ष
यह पेपर साबित करता है कि सेफ्टी अलाइनमेंट कोई एक एकल, ठोस दीवार नहीं है। यह एक जटिल, बहु-स्तरीय संरचना है। कुछ उन्नत मॉडल्स में, एक विशिष्ट, अधिकृत डोमेन (जैसे साइबर सुरक्षा) के लिए सुरक्षा बाधाओं को सर्जिकल तरीके से हटाना संभव है, जबकि अन्य खतरनाक विषयों (जैसे हिंसा) के लिए बाधाओं को खड़ा रखा जा सकता है।
यह सुझाव देता है कि भविष्य में, हम ऐसे AI टूल्स बना सकते हैं जो पेशेवरों के लिए "अनसेंसर्ड" (uncensored) हों, बिना आम जनता के लिए खतरनाक बनाए। हालाँकि, शोधकर्ता इस बात पर जोर देते हैं कि यह इस बात की खोज है कि तकनीक कैसे काम करती है, न कि खतरनाक उपकरण बनाने के लिए एक मार्गदर्शिका। वे इसे इसलिए साझा कर रहे हैं ताकि सुरक्षा शोधकर्ता वर्तमान AI सुरक्षा प्रणालियों की कमजोरियों को समझने में मदद पा सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।