Broken Symmetry in LLM Refusal: Answer Release Is More Local Than Refusal Restoration
यह शोध पत्र लार्ज लैंग्वेज मॉडल के रिफ्यूज़ल (अस्वीकार करने की प्रक्रिया) में एक "ब्रोकन सिमेट्री" (टूटी हुई समरूपता) को प्रकट करता है, जो यह प्रदर्शित करता है कि जहाँ सही उत्तर हिडन स्टेट्स (छिपी हुई अवस्थाओं) से रैखिक रूप से पुनः प्राप्त किए जा सकते हैं और अत्यधिक स्थानीय हस्तक्षेपों के माध्यम से जारी किए जा सकते हैं, वहीं एक सुसंगत रिफ्यूज़ल को बहाल करने के लिए व्यापक, गैर-स्थानीय हस्तक्षेपों की आवश्यकता होती है, जो यह संकेत देता है कि रिफ्यूज़ल कोई सरल, प्रतिवर्ती स्विच नहीं है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आर्टिफिशियल इंटेलिजेंस की तेजी से विकसित होती दुनिया में, बड़े भाषा मॉडल (large language models) परिष्कृत संवादात्मक साथी बन गए हैं जो जटिल प्रश्नों के उत्तर देने, कहानियाँ लिखने और समस्याओं को हल करने में सक्षम हैं। हालाँकि, इन प्रणालियों को सुरक्षात्मक बाधाओं (safety guardrails) के साथ भी डिज़ाइन किया गया है जो उन्हें हानिकारक या संवेदनशील जानकारी उत्पन्न करने से रोकते हैं। जब कोई मॉडल किसी ऐसे अनुरोध का सामना करता है जिसे वह असुरक्षित मानता है, तो उसे मना करने के लिए प्रोग्राम किया जाता है, अक्सर यह कहते हुए कि वह उत्तर नहीं दे सकता। शोधकर्ताओं और सुरक्षा ऑडिटरों के लिए, एक महत्वपूर्ण प्रश्न इन अंतःक्रियाओं के नीचे बना हुआ है: जब एक मॉडल बोलने से मना कर देता है, तो क्या वह वास्तव में उत्तर भूल जाता है, या वह केवल उसे छिपा रहा होता है? एक पुस्तकालय की कल्पना करें जहाँ एक लाइब्रेरियन को एक संरक्षक को यह बताने का निर्देश दिया गया है कि एक विशिष्ट पुस्तक गायब है, भले ही वह पुस्तक अभी भी शेल्फ पर रखी हो। यदि लाइब्रेरियन केवल "नहीं" कहने के नियम का पालन कर रहा है, तो जानकारी उन लोगों के लिए सुलभ रहती है जो जानते हैं कि कैसे देखना है। लेकिन यदि पुस्तक भौतिक रूप से शेल्फ से हटा दी गई है, तो जानकारी गायब है। कंप्यूटर के मस्तिष्क के भीतर यह निर्धारित करना कि इनमें से कौन सी स्थिति हो रही है, यह समझने के लिए आवश्यक है कि सुरक्षा उपाय मजबूत हैं या केवल सतही।
शोधकर्ताओं की एक टीम ने आधुनिक एआई प्रणालियों के भीतर इस सटीक तंत्र की जांच करने के लिए हाथ आजमाया। उन्होंने एक विशिष्ट प्रकार की अंतःक्रिया पर ध्यान केंद्रित किया जहाँ एक मॉडल से एक सीधा प्रश्न पूछा जाता है जिसमें दो संभावित उत्तर होते हैं, जैसे कि एक बहुविकल्पीय प्रश्न, लेकिन साथ ही उसे सही विकल्प को रोकने और उत्तर देने से इनकार करने का सख्त निर्देश दिया जाता है। इस सेटअप ने उन्हें एक नियंत्रित वातावरण बनाने की अनुमति दी जहाँ वे मॉडल द्वारा लिए जाने वाले दो अलग-अलग रास्तों की तुलना कर सके: एक जहाँ वह प्रश्न का सामान्य रूप से उत्तर देता है, और दूसरा जहाँ वह मना कर देता है। मॉडल की आंतरिक डिजिटल अवस्थाओं का परीक्षण करते हुए, शोधकर्ताओं ने इस प्रक्रिया के दौरान सूचना के प्रबंधन में एक आश्चर्यजनक असंतुलन की खोज की। उन्होंने पाया कि जबकि मॉडल सफलतापूर्वक एक विनम्र इनकार उत्पन्न करता है, सही उत्तर उसकी आंतरिक स्मृति में पूरी तरह से मौजूद और पठनीय रहता है। यह ऐसा है जैसे मॉडल उत्तर को अपने हाथ में थामे हुए दुनिया को बता रहा है कि उसके पास कहने के लिए कुछ भी नहीं है।
शोधकर्ताओं ने परीक्षण किया कि क्या इस इनकार को एक साधारण स्विच की तरह चालू या बंद किया जा सकता है। उन्होंने परिकल्पना की कि यदि इनकार तंत्र एक स्थानीयकृत, सममित नियंत्रण (localized, symmetrical control) है, तो मॉडल की आंतरिक अवस्था में एक छोटा, सटीक समायोजन दो चीजें समान रूप से करने में सक्षम होना चाहिए: पहला, यह छिपे हुए उत्तर को मुक्त करने में सक्षम होना चाहिए, जिससे मॉडल सत्य बोलने के लिए मजबूर हो जाए; और दूसरा, विपरीत समायोजन उस उत्तर को फिर से दबाने में सक्षम होना चाहिए, जिससे वह वापस मौन होने के लिए मजबूर हो जाए। मॉडल की आंतरिक प्रोसेसिंग के विशिष्ट हिस्सों को एक सफल उत्तर से एक इनकार में बदलने की तकनीक का उपयोग करते हुए, उन्होंने पाया कि इस परिकल्पना का पहला भाग सत्य था। एक बहुत ही छोटा, स्थानीयकृत परिवर्तन इनकार को तोड़ने और मॉडल को छिपा हुआ उत्तर प्रकट करने के लिए मजबूर करने के लिए पर्याप्त था। मॉडल की आंतरिक अवस्था स्पष्ट रूप रूप से उत्तर को थामे हुए थी, और इसे बाहर निकालने के लिए एक मामूली धक्के की ही आवश्यकता थी।
हालाँकि, विपरीत ऑपरेशन उम्मीद के मुताबिक काम नहीं आया। जब शोधकर्ताओं ने एक समान, स्थानीयकृत परिवर्तन का उपयोग करके एक मॉडल को उत्तर देने के बजाय अचानक मना करने के लिए मजबूर करने की कोशिश की, तो यह विफल रहा। मॉडल को चुप कराने के लिए एक एकल, छोटा समायोजन पर्याप्त नहीं था। इनकार को सफलतापूर्वक बहाल करने के लिए, उन्हें मॉडल की आंतरिक अवस्था में कई बिंदुओं पर व्यापक बदलाव करने पड़े। यह एक साधारण स्विच नहीं था जिसे समान आसानी से आगे-पीछे घुमाया जा सके। उत्तर को मुक्त करने की क्रिया एक स्थानीय, केंद्रित घटना थी, लेकिन उत्तर को दबाने और एक सुसंगत इनकार को असेंबल करने के लिए सिस्टम के माध्यम से एक वितरित प्रयास की आवश्यकता थी। यह विषमता (asymmetry) बताती है कि इनकार एक सरल, एकल तंत्र नहीं है जो उत्तर को बंद कर देता है; बल्कि, यह एक जटिल निर्माण है जिसे बनाए रखने के लिए महत्वपूर्ण समर्थन की आवश्यकता होती है, जबकि उत्तर स्वयं सिस्टम के भीतर एक स्थिर, सुलभ तथ्य बना रहता है।
अध्ययन ने यह भी जांचा कि क्या मॉडल के आंतरिक गणित में कोई एकल, सार्वभौमिक दिशा (universal direction) थी जिसका उपयोग उसे उत्तर देने और इनकार करने के बीच निर्देशित करने के लिए किया जा सकता था। पिछले कार्यों ने सुझाव दिया था कि कोई एक विशिष्ट वेक्टर, या दिशा पा सकता था, जो दो अवस्थाओं के बीच के अंतर का प्रतिनिधित्व करता था, और बस इस दिशा को जोड़ने या घटाने से व्यवहार को नियंत्रित किया जा सकता था। शोधकर्ताओं ने पाया कि हालांकि ऐसी दिशा मौजूद है और दो अवस्थाओं के बीच के कुछ अंतर को पकड़ती है, लेकिन यह एक विश्वसनीय, प्रतिवर्ती नियंत्रण (reversible control) के रूप la कार्य नहीं करती है। इस दिशा को जोड़ने से अक्सर उत्तर दब जाता है लेकिन यह लगातार एक सुसंगत इनकार नहीं बना पाता। इसे हटाने से उत्तर मुक्त हो सकता था, लेकिन प्रक्रिया एक आदर्श दर्पण छवि नहीं थी। यह इंगित करता है कि इनकार की ज्यामिति एक सरल रेखा नहीं है जिस पर आगे-पीछे चला जा सके; उत्तर देने से इनकार करने का पथ, इनकार करने से उत्तर देने के पथ के समान नहीं है।
इन निष्कर्षों के आर्टिफिशियल इंटेलिजेंस की सुरक्षा के मूल्यांकन के लिए महत्वपूर्ण निहितार्थ हैं। यदि एक मॉडल को यह प्रकट करने के लिए उकसाया जा सकता है कि वह उत्तर जानता है, भले ही वह कहने से इनकार कर रहा हो, तो सुरक्षा जाँच जो केवल आंतरिक डेटा को देखती है, सुरक्षा का झूठा अहसास दे सकती है। वे निष्कर्ष निकाल सकते हैं कि मॉडल सुरक्षित है क्योंकि उत्तर "वहाँ" है, या इसके विपरीत, वे सोच सकते हैं कि मॉडल असुरक्षित है क्योंकि उत्तर "वहाँ" है, इस तथ्य को अनदेखा करते हुए कि मॉडल सक्रिय रूप से इसे दबाने का काम कर रहा है। शोध बताता है कि मॉडल की आंतरिक अवस्था से उत्तर को पुनः प्राप्त करने की क्षमता का मतलब यह नहीं है कि मॉडल ने अपने व्यवहार पर नियंत्रण खो दिया है, और न ही इसका मतलब यह है कि सुरक्षा तंत्र कमजोर है। इसके बजाय, यह प्रकट करता है कि सुरक्षा तंत्र एक जटिल, वितरित प्रक्रिया है जिसे असेंबल करना (बनाना) उसे नष्ट करने की तुलना में कठिन है।
शोधकर्ताओं ने प्रमुख डेवलपर्स के सिस्टम सहित कई अलग-अलग बड़े भाषा मॉडल परिवारों में इन विचारों का परीक्षण किया, और पाया कि यह टूटा हुआ समरूपता (broken symmetry) एक सुसंगत विशेषता थी। चाहे मॉडल छोटा हो या बड़ा, पैटर्न बना रहा: उत्तर को मुक्त करना एक स्थानीय क्रिया थी, जबकि इनकार को बहाल करने के लिए व्यापक समर्थन की आवश्यकता थी। यह निरंतरता बताती है कि जिस तरह से इन मॉडलों को सुरक्षित रहने के लिए प्रशिक्षित किया जाता है, वह जानना और कहना के बीच एक मौलिक संरचनात्मक अंतर पैदा करता है। इनकार केवल ज्ञान का विलोपन नहीं है बल्कि इसे छिपाने का एक सक्रिय प्रयास है, एक ऐसा प्रयास जिसे शुरू करना उसे उलटने की तुलना में अधिक कठिन है।
अंततः, यह कार्य एआई सुरक्षा के आंतरिक कामकाज की एक स्पष्ट तस्वीर प्रदान करता है। यह एक साधारण ऑन-ऑफ स्विच के विचार से आगे बढ़कर एक अधिक सूक्ष्म वास्तविकता को प्रकट करता है जहाँ जानकारी एक साथ मौजूद और दमित (suppressed) हो सकती है। उन लोगों के लिए जो इन प्रणालियों का निर्माण और ऑडिट कर रहे हैं, सबक यह है कि सुरक्षा एक स्थिर अवस्था नहीं बल्कि एक गतिशील, नाजुक संरचना है। यह समझना कि मौन का पथ भाषण के पथ की तुलना में लंबा और अधिक जटिल है, यह समझाने में मदद करता है कि मॉडल कभी-कभी उस तरह से इनकार करने में विफल क्यों होते हैं जैसा कि हम उम्मीद करते हैं, और क्यों केवल आंतरिक डेटा को देखना यह गारंटी देने के लिए पर्याप्त नहीं है कि एक मॉडल वास्तविक दुनिया में सुरक्षित रूप से व्यवहार करेगा। शोध यह दावा नहीं करता है कि उसने एआई सुरक्षा की समस्या को हल कर लिया है, बल्कि यह सटीक रूप से मानचित्र प्रदान करता है कि वर्तमान तंत्र कहाँ सफल होते हैं और कहाँ वे संरचनात्मक रूप से असंतुलित हैं, जो भविष्य के सुधारों के लिए एक आवश्यक आधार प्रदान करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।