The Linear Geometry of Interpretable Tokens: Jailbreaking Attacks and Defenses for Unlearned Diffusion Models
यह शोध पत्र प्रकट करता है कि अनलर्न्ड डिफ्यूजन मॉडल्स (unlearned diffusion models) में मिटाए गए कॉन्सेप्ट्स टोकन एम्बेडिंग्स के भीतर सुसंगत लीनियर सबस्पेस (linear subspaces) के रूप में बने रहते हैं, जिससे 'SubAttack' का विकास हुआ, जो इस संरचना का लाभ उठाने वाला एक शक्तिशाली जेलब्रेकिंग तरीका है, और 'SubDefense' का विकास हुआ, जो जनरेशन की गुणवत्ता को बनाए रखते हुए अवशिष्ट हानिकारक कॉन्सेप्ट्स को मजबूती से दबाने के लिए सबस्पेस को प्रोजेक्ट आउट करने वाला एक हल्का तंत्र है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक ऐसी दुनिया की कल्पना करें जहाँ कंप्यूटर आपके शब्दों को सुनकर चित्र बना सकते हैं। आप कहते हैं, "एक टोपी पहने हुए बिल्ली," और पफ, एक सटीक चित्र प्रकट हो जाता है। इन्हें डिफ्यूजन मॉडल्स (Diffusion Models) कहा जाता है, और ये डिजिटल कलाकारों की तरह हैं जिन्होंने लाखों तस्वीरों का अध्ययन करके रचना करना सीखा है। लेकिन कभी-कभी, ये कलाकार उन चीजों को याद रखने में बहुत अधिक कुशल हो जाते हैं जिन्हें उन्हें नहीं याद रखना चाहिए। यदि आप उन्हें कुछ खतरनाक या कॉपीराइट वाली चीज़ बनाने के लिए कहते हैं, तो वे इसे फिर भी कर सकते हैं। इसे ठीक करने के लिए, वैज्ञानिकों ने एक प्रक्रिया खोजी जिसे "अनलर्निंग" (Unlearning) कहा जाता है। इसे एक शिक्षक की तरह समझें जो एक छात्र को एक विशिष्ट तथ्य, जैसे किसी देश की राजधानी, भूलने के लिए कहने की कोशिश कर रहा है, बिना उसे गणित करने या पढ़ने की क्षमता भुलाए। लक्ष्य कंप्यूटर के मस्तिष्क से उस बुरे विचार को "मिटाना" है जबकि उसकी बाकी सब कुछ बनाने की क्षमता को बरकरार रखना है। लेकिन यहाँ पेचीदा हिस्सा यह है कि जब शिक्षक कहता है, "वह तथ्य भूल जाओ," तो छात्र के पास उसे याद रखने का एक गुप्त तरीका हो सकता है, जो एक ऐसे तरीके से छिपा होता है जिसे हम आसानी से देख नहीं सकते। यह शोध पत्र इसी रहस्य में उतरता है, यह पूछते हुए: यदि हमें लगता है कि हमने एक बुरे विचार को मिटा दिया है, तो वह वास्तव में कहाँ छिपा है, और हम अंततः उससे कैसे छुटकारा पा सकते हैं?
इस शोध पत्र के शोधकर्ताओं ने पाया कि जब एक डिफ्यूजन मॉडल किसी हानिकारक अवधारणा (जैसे नग्नता या किसी विशिष्ट कलाकार की शैली) को "अनलर्न" करने की कोशिश करता है, तो वह वास्तव में उसे हटाता नहीं है। इसके बजाय, वह अवधारणा कंप्यूटर की स्मृति के भीतर एक गुप्त, रैखिक उपस्थान (secret, linear subspace) में छिप जाती है। एक रूपक का उपयोग करने के लिए, कल्पना करें कि कंप्यूटर का मस्तिष्क शब्दों का एक विशाल पुस्तकालय है। जब हम "नग्नता" के बारे में किताब हटाने की कोशिश करते हैं, तो कंप्यूटर उस किताब को जलाता नहीं है। इसके बजाय, वह पन्नों को फाड़ देता है और उन टुकड़ों को पुस्तकालय में एक विशिष्ट, अदृश्य दराज के अंदर छिपा देता है। शोध पत्र दिखाता है कि ये टुकड़े अभी भी एक व्यवस्थित, अनुमानित रेखा में व्यवस्थित हैं। लेखक इस छिपे हुए दराज को "रेसिड्यूअल सबस्पेस" (residual subspace) कहते हैं।
इसे सिद्ध करने के लिए, टीम ने सबअटैक (SubAttack) नामक एक नया उपकरण बनाया। कंप्यूटर को धोखा देने के लिए यादृच्छिक शब्दों का अनुमान लगाने के बजाय (जो कि पिछले हैकर्स द्वारा किया जाता था), सबअटैक एक मास्टर लाइब्रेरियन की तरह कार्य करता है जिसे पता है कि वह अदृश्य दराज कहाँ है। यह "जादुई चाबियों" (जो सामान्य शब्दों के संयोजन हैं) का एक विशेष सेट सीखता है जो दराज को खोलती हैं। जब उन्होंने इन चाबियों का उपयोग किया, तो "अनलर्न" किया गया कंप्यूटर तुरंत हानिकारक चित्र बनाने लगा, जिससे सिद्ध हुआ कि अवधारणा वास्तव में कभी गई ही नहीं थी। दिलचस्प बात यह है कि ये चाबियाँ ऐसे शब्दों से बनी हैं जिन्हें हम समझ सकते हैं। उदाहरण के लिए, कंप्यूटर को फिर से "नग्न" व्यक्ति दिखाने के लिए, चाबियाँ "गुलाम," "कूल्हे," और "त्वचा" जैसे शब्दों का मिश्रण हो सकती हैं। यह दर्शाता है कि कंप्यूटर अभी भी उस बुरे विचार को इन संबंधित, छिपे हुए सुरागों से जोड़ रहा है।
शोध पत्र ने यह भी पाया कि यह गुप्त दराज केवल एक कंप्यूटर में नहीं है; यह कई अलग-अलग "अनलर्न" किए गए मॉडलों में है। यदि आप एक मॉडल के लिए कुंजी पा लेते हैं, तो यह अक्सर दूसरों पर भी काम करती है। यह सुझाव देता है कि जिस तरह से ये कंप्यूटर "भूलते" हैं, वह सभी में एक समान रूप से त्रुटिपूर्ण है। वे स्मृति को मिटा नहीं रहे हैं; वे बस इसे एक ऐसे तरीके से छिपा रहे हैं जो एक सीधी, अनुमानित रेखा का अनुसरण करता है।
लेकिन कहानी केवल हैक तक ही समाप्त नहीं होती। क्योंकि शोधकर्ताओं ने समझा कि अवधारणा कैसे छिप रही थी, उन्होंने सबडिफेंस (SubDefense) नामक एक ढाल बनाई। यदि सबअटैक वह चाबी है जो दराज को खोलती है, तो सबडिफेंस वह भारी धातु की प्लेट है जो उस दराज को वेल्ड करके बंद कर देती है। यह कंप्यूटर के शब्दों के पूरे पुस्तकालय को उस गुप्त दराज से गणितीय रूप से "प्रोजेक्ट" (project) करके काम करती है। यह एक लाइब्रेरियन को यह बताने जैसा है कि, "चाहे आप किसी भी शब्द का उपयोग करें, सुनिश्चित करें कि वह उस विशिष्ट छिपे हुए दराज की ओर इशारा न करे।"
परिणाम प्रभावशाली थे। जब उन्होंने सबडिफेंस का उपयोग किया, तो कंप्यूटर को धोखा देना बहुत कठिन हो गया। भले ही हैकर्स पुराने तरीकों या नए सबअटैक कुंजियों का उपयोग करने का प्रयास करें, कंप्यूटर ने हानिकारक चित्र बनाने से इनकार कर दिया। साथ ही, कंप्यूटर ने सुरक्षित, सुंदर चित्र बनाने की अपनी क्षमता नहीं खोई। वास्तव में, रक्षा के बाद जो चित्र उसने बनाए, वे पहले की तरह ही उच्च गुणवत्ता वाले थे। शोध पत्र सुझाव देता है कि हालांकि हम अभी तक अवधारणा को पूरी तरह से मिटा नहीं सकते, लेकिन हम कम से कम उस विशिष्ट पथ को रोक सकते हैं जिसका उपयोग वह वापस घुसपैठ करने के लिए करता है। यह हमें एक नया, स्पष्ट तरीका देता है कि "अनलर्निंग" इतना कठिन क्यों है और इन डिजिटल कलाकारों को सभी के लिए सुरक्षित बनाने के लिए एक व्यावहारिक, प्लग-एंड-प्ले समाधान प्रदान करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।