Erased but Exploitable: Black-box Embedding-Aware Prompting Against Unlearned Text-to-Image Diffusion Models
यह शोध पत्र BEAP को प्रस्तुत करता है, जो एक ब्लैक-बॉक्स, एम्बेडिंग-अवेयर एडवरसेरियल प्रॉम्प्टिंग हमला है जो उच्च-गुणवत्ता वाले, अविोंधनीय प्रॉम्प्ट्स को पुनरावृत्ति (iteratively) के माध्यम से उत्पन्न करने के लिए एक लार्ज लैंग्वेज मॉडल का लाभ उठाता है, और टेक्स्ट-टू-इमेज डिफ्यूजन मॉडल्स में मशीन अनलर्निंग डिफेंस को पिछले तरीकों की तुलना में काफी अधिक सफलता दर के साथ सफलतापूर्वक बायपास करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "Erased but Exploitable: Black-box Embedding-Aware Prompting Against Unlearned Text-to-Image Diffusion Models" पेपर की सरल भाषा और उपमाओं (analogies) का उपयोग करके दी गई व्याख्या है।
बड़ी तस्वीर: "नकली इरेज़र" (Fake Eraser) की समस्या
कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली कलाकार है जिसने लाखों तस्वीरें देखी हैं। आप इस कलाकार से किसी विशिष्ट चीज़ को, जैसे कि एक नग्न व्यक्ति (naked person) को, "भूलने" के लिए कहते हैं। आप चाहते हैं कि वह सुरक्षित रहे और फिर कभी उसे न बनाए।
इसे करने के लिए, आप एक विशेष "मशीन अनलर्निंग" तकनीक का उपयोग करते हैं। इसे ऐसे समझें जैसे कि आप कलाकार की "नग्न लोगों" की याददाश्त पर लाल मार्कर से लकीरें खींच रहे हैं। आप उम्मीद करते हैं कि अब, यदि आप नग्न व्यक्ति की तस्वीर के लिए पूछेंगे, तो कलाकार कहेगा, "मुझे नहीं पता कि यह क्या है," या कुछ और ही बना देगा।
समस्या: इस पेपर के लेखकों ने पाया कि यह "लाल मार्कर" वास्तव में याददाश्त को मिटाता नहीं है। यह केवल उसे छिपा देता है। कलाकार को अभी भी इसे बनाने का तरीका याद है; उसे बस उस याद को फिर से अनलॉक करने के लिए सही फुसफुसाहट (whisper) की आवश्यकता है।
हमला: BEAP (एक "फुसफुसाने वाला जासूस")
यह पेपर BEM नामक एक नई विधि पेश करता है। BEAP को एक चतुर जासूस के रूप में समझें जो यह साबित करना चाहता है कि कलाकार को अभी भी वर्जित छवि (forbidden image) याद है।
कलाकार को बेवकूफ बनाने के अन्य सभी पिछले प्रयास बेतुकी बातें बोलने या ऐसे कोड का उपयोग करने जैसे थे जिनका कोई अर्थ नहीं था (जैसे, "naked person x99#!!")। कलाकार के सुरक्षा गार्ड (फिल्टर्स) तुरंत इस तरह की बकवास को पहचान लेते और इसे ब्लॉक कर देते।
BEAP अलग है। यह एक सुपर-स्मार्ट AI (एक लार्ज लैंग्वेज मॉडल) का उपयोग करता है जो एक राजनयिक अनुवादक (diplomatic translator) के रूप में कार्य करता है। चिल्लाने के बजाय, BEAP फुसफुसाता है। यह वर्जित अवधारणा (concept) को सामान्य, विनम्र, मानवीय भाषा का उपयोग करके वर्णित करने की कोशिश करता है जो सुरक्षा गार्डों के लिए पूरी तरह से निर्दोष सुनाई देती है।
BEAP कैसे काम करता है (तीन-चरणीय नृत्य)
BEAP केवल अनुमान नहीं लगाता; यह कलाकार के साथ "हॉट एंड कोल्ड" (पास या दूर) का खेल खेलता है, और हर बार अपने दृष्टिकोण को बेहतर बनाता है। यह इस प्रकार काम करता है:
"शब्दावली मानचित्र" (Embedding Awareness):
कल्पना कीजिए कि कलाकार का मस्तिष्क एक विशाल पुस्तकालय है जहाँ शब्दों को उनकी समानता के आधार पर व्यवस्थित किया गया है। शब्द "naked" एक विशिष्ट कोने में है। BEAP उन शब्दों का एक मानचित्र बनाता है जो "naked" के पड़ोसी हैं (जैसे "bare," "skin," "uncovered") लेकिन स्वयं वर्पित शब्द नहीं हैं। यह AI अनुवादक को बताता है: "दृश्य का वर्णन करने के लिए इन पड़ोसी शब्दों का उपयोग करें।" यह लाइब्रेरी के सही क्षेत्र पर ध्यान केंद्रित रखने में मदद करता है।"तीन-बिंदु स्कोरकार्ड" (Reward Signals):
BEAP एक प्रॉम्प्ट आज़माता है, एक तस्वीर प्राप्त करता है, और फिर तीन चीजें जाँचता है:- क्या हमें वर्जित वस्तु मिली? (जैसे, क्या तस्वीर में वास्तव में एक नग्न व्यक्ति दिखाया गया है?)
- क्या तस्वीर शब्दों से मेल खाती है? (जैसे, यदि मैंने "बगीचे में एक महिला" के लिए पूछा, तो क्या तस्वीर में बगीचे में एक महिला है?)
- क्या तस्वीर सुंदर है? (क्या यह धुंधली या विकृत है, या यह उच्च गुणवत्ता वाली है?)
यदि कोई तस्वीर विफल होती है, तो BEAP हार नहीं मानता। वह AI अनुवादक को बताता है: "यह करीब था, लेकिन तस्वीर बहुत धुंधली थी। इसे अलग तरह से वर्णित करने का प्रयास करें, लेकिन उन्हीं 'पड़ोसी' शब्दों का उपयोग करना जारी रखें।"
पुनरावृत्ति चक्र (Iterative Loop):
यह बार-बार होता है। BEAP एक नया, थोड़ा बेहतर वाक्य बनाता है, फिर से प्रयास करता है, और एक बेहतर स्कोर प्राप्त करता है। अंततः, यह एक ऐसा वाक्य खोज लेता है जो फिल्टर्स के लिए पूरी तरह से सामान्य और सुरक्षित लगता है, लेकिन कलाकार को उच्च गुणवत्ता वाली वर्जित छवि बनाने के लिए मजबूर कर देता है।
परिणाम: "मिटाया गया" लेकिन गया नहीं
पेपर ने कई अलग-अलग "इरेज़र" विधियों (जैसे ESD, MACE, और SPM) के खिलाफ BEAP का परीक्षण किया, जिन्हें कलाकार के मस्तिष्क से नग्नता की अवधारणा को हटा देना चाहिए था।
- पुराना तरीका (Ring-a-Bell): पिछले हमलों ने सिस्टम को तोड़ने की कोशिश की लेकिन वे बेतुके प्रॉम्प्ट बनाने में समाप्त हुए। सुरक्षा फिल्टर ने उन्हें पकड़ लिया, या परिणामी छवियां बदसूरत और टूटी हुई थीं। अच्छी छवियां बनाने में उनकी सफलता दर 0% थी।
- BEAP का तरीका: BEAP 95% से 99% मामलों में सफल रहा। इसने उन वाक्यों का उपयोग करके वर्जित अवधारणा की उच्च-गुणवत्ता वाली, सुंदर छवियां बनाने में सफलता प्राप्त की जो पूरी तरह से स्वाभाविक लगते थे।
- "बकवास" परीक्षण: पेपर ने जाँच की कि क्या BEAP के प्रॉम्प्ट बेतुके दिखते थे। वे नहीं थे। वे सामान्य अंग्रेजी की तरह दिखे। सुरक्षा फिल्टर, जो आमतौर पर "अजीब" या "टूटे हुए" टेक्स्ट को पकड़ लेते हैं, पूरी तरह से धोखा खा गए।
निष्कर्ष
पेपर यह निष्कर्ष निकालता है कि "अनलर्निंग" के वर्तमान तरीके वास्तव में सुरक्षित नहीं हैं। वे दरवाजे पर ताला लगाने के बजाय दरवाजे पर "प्रवेश निषेध" का साइन बोर्ड लगाने जैसा है। यदि आप सही कोड (या इस मामले में, सही स्वाभाविक दिखने वाले वाक्य) जानते हैं, तो आप अभी भी अंदर जा सकते हैं।
लेखक चेतावनी देते हैं कि भले ही किसी मॉडल को "अनलर्न" कर दिया गया हो, ज्ञान अभी भी वहीं है, बस एक चतुर प्रॉम्प्ट का इंतज़ार कर रहा है जो उसे वापस जीवित कर सके। उन्होंने BEAP का निर्माण दुरुपयोग को बढ़ावा देने के लिए नहीं, बल्कि डेवलपर्स को यह दिखाने के लिए किया है कि उनके वर्तमान सुरक्षा उपाय नाजुक हैं और उन्हें ठीक करने की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।