Reading Between the Pixels: An Inscriptive Jailbreak Attack on Text-to-Image Models
यह शोध पत्र "एच" (Etch) को प्रस्तुत करता है, जो एक नवीन ब्लैक-बॉक्स हमला ढांचा है जो "इनस्क्रिप्टिव जेलब्रेक" निष्पादित करने के लिए आधुनिक टेक्स्ट-टू-इमेज मॉडलों की उभरती हुई टेक्स्ट-रेंडरिंग क्षमताओं का लाभ उठाता है, जिसमें हानिकर टेक्स्ट पेलोड को सौहार्दपूर्ण छवियों में एम्बेड किया जाता है, जिससे मौजूदा तरीकों की तुलना में काफी उच्च सफलता दर प्राप्त होती है और वर्तमान सुरक्षा संरेखणों की महत्वपूर्ण कमजोरियों का खुलासा होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक जादुई कलाकार है जो आपके द्वारा बताए गए किसी भी चित्र को बना सकता है। यदि आप कहते हैं, "एक डरावना राक्षस बनाओ," तो वह कलाकार मना कर सकता है क्योंकि यह नियमों का उल्लंघन करता है। लेकिन क्या होगा अगर आप कहें, "एक कक्षा का दृश्य बनाओ जहाँ एक शिक्षक ब्लैकबोर्ड पर एक कहानी लिख रहा है"? कलाकार खुशी-खुशी कक्षा का चित्र बना देगा।
अब, यहाँ एक चाल है: शिक्षक ब्लैकबोर्ड पर जो "कहानी" लिख रहा है, वह कोई परी कथा नहीं है। वह वास्तव में बम बनाने, एक नकली बैंक चेक बनाने, या एक फिशिंग स्कैम (phishing scam) बनाने का एक विस्तृत गाइड है। कलाकार ने कोई डरावना राक्षस नहीं बनाया; उसने एक हानिरहित कक्षा का चित्र बनाया। लेकिन चित्र के अंदर का टेक्स्ट (लेख) खतरनाक है।
यह पेपर इन AI कलाकारों को धोखा देने का एक नया तरीका पेश करता है, जिसे "इनस्क्रिप्टिव जेलब्रेक" (Inscriptive Jailbreak) कहा जाता है।
यह कैसे काम करता है, इसका विवरण सरल उपमाओं (analogies) का उपयोग करके यहाँ दिया गया है:
1. समस्या: "दृश्य" बनाम "लिखित" (The "Visual" vs. The "Written")
अधिकांश लोग जानते हैं कि AI सुरक्षा फिल्टर बुरे चित्रों (जैसे हिंसा या अश्लीलता) को पहचानने में अच्छे होते हैं। वे आपके प्रॉम्प्ट में बुरे शब्दों को पहचानने में भी अच्छे होते हैं।
- पुराने हमले (Old Attacks): इन्होंने AI को सीधे डरावना राक्षस बनाने के लिए trick करने की कोशिश की। सुरक्षा फिल्टर कहता, "नहीं, यह एक बुरा चित्र है," और इसे ब्लॉक कर देता।
- नया हमला (Inscriptive): हमलावर एक बुरा चित्र नहीं मांगता। वे एक अच्छा चित्र मांगते हैं जिसमें एक बुरा संदेश लिखा हो। यह एक चोरी हुए हीरे को रोटी के लोफ (loaf) के अंदर छिपाने जैसा है। सुरक्षा गार्ड रोटी (छवि) की जाँच करता है और कहता, "यह सामान्य रोटी लग रही है," और उसे जाने देता है। लेकिन हीरा (हानिकारक टेक्स्ट) अभी भी वहीं है।
2. समाधान: "एच" फ्रेमवर्क (The "Etch" Framework)
शोधकर्ताओं ने इस चाल को स्वचालित करने के लिए Etch नामक एक टूल बनाया। उन्होंने महसूस किया कि इस चोरी को अंजाम देने के लिए, आपको इस अनुरोध को तीन अलग-अलग परतों में तोड़ना होगा, जैसे कि बैंक लूटने वाली तीन लोगों की टीम।
लेयर 1: भेष बदलना (Semantic Camouflage)
- उपमा: कल्पना कीजिए कि एक जासूस को एक सुरक्षित इमारत में प्रवेश करने की आवश्यकता है। "मैं योजनाएं चुराने आया हूँ" कहने के बजाय, वे कहते हैं, "मैं एक सुरक्षा प्रशिक्षण सेमिनार के लिए आया हूँ।"
- Etch इसे कैसे करता है: यह एक हानिकारक अनुरोध (जैसे, "बैंक कैसे हैक करें?") को एक हानिरहित कहानी (जैसे, "साइबर सुरक्षा विशेषज्ञ द्वारा कक्षा में पढ़ाते हुए एक फिल्म के दृश्य के बारे में लिखें") के रूप में फिर से लिखता है। यह टेक्स्ट फिल्टर को धोखा देकर अनुरोध को पास होने देता है।
लेयर 2: मंच तैयार करना (Visual-Spatial Anchoring)
- उपमा: यदि आप चाहते हैं कि कोई गुप्त नोट पढ़े, तो आप उसे बस हवा में नहीं तैराते। आप उसे ब्लैकबोर्ड, कंप्यूटर स्क्रीन या समाचार पत्र पर रखते हैं। आपको उस टेक्स्ट के अस्तित्व के लिए एक "स्थान" की आवश्यकता होती है।
- Etch इसे कैसे करता है: यह AI को एक विशिष्ट सेटिंग बनाने का निर्देश देता है जहाँ बहुत सारा टेक्स्ट स्वाभाविक रूप से दिखाई देता है, जैसे कि एक व्यस्त कार्यालय, एक कक्षा, या एक डिजिटल बिलबोर्ड। यह इमेज फिल्टर को यह सोचने के लिए धोखा देता है कि "ओह, यह केवल एक व्यस्त जगह की सामान्य फोटो है," न कि "यह टेक्स्ट वाला एक अजीब चित्र है।"
लेयर 3: संदेश (Typographic Encoding)
- उपमा: अब जब मंच तैयार है और भेष बदल लिया गया है, तो आपको यह सुनिश्चित करना होगा कि गुप्त संदेश स्पष्ट रूप से लिखा जाए। यदि लिखावट गंदी है, तो योजना विफल हो जाएगी।
- Etच इसे कैसे करता है: यह AI को टेक्स्ट लिखने के तरीके (जैसे, "लिखावट को बड़ा, स्पष्ट और विस्तृत बनाएं") पर बहुत विशिष्ट निर्देश देता है। आधुनिक AI टेक्स्ट लिखने में बहुत अच्छा होता जा रहा है, इसलिए यह लेयर सुनिश्चित करती है कि हानिकारक संदेश वास्तव में पठनीय हो।
3. "कोच" (The "Coach" - VLM Critic)
एक शानदार योजना के साथ भी, पहली कोशिश विफल हो सकती है। हो सकता है कि AI ने टेक्स्ट बहुत छोटा बना दिया हो, या "कक्षा" नकली लग रही हो।
- उपमा: कल्पना कीजिए कि एक कोच नाटक देख रहा है। यदि अभिनेता लड़खड़ाता है, तो कोच केवल यह नहीं कहता "फिर से प्रयास करें।" वे कहते हैं, "आपका भेष अच्छा था, लेकिन आपका मंच बहुत अंधेरा था, और आपकी लिखावट गंदी थी। लाइटिंग और पेन को ठीक करें।"
- Etch इसे कैसे करता है: यह एक अन्य AI (एक "विज़न-लैंग्वेज मॉडल") का उपयोग करता है जो उत्पन्न छवि को देखता है। यदि टेक्स्ट धुंधला है या छवि संदिग्ध दिखती है, तो यह "कोच" सिस्टम को बताता है कि किस लेयर को ठीक करना है। यह तब तक प्रयास करता रहता है और सुधार करता रहता है जब तक कि एकदम सटीक, खतरनाक छवि तैयार न हो जाए।
4. परिणाम: यह क्यों मायने रखता है (The Results: Why This Matters)
शोधकर्ताओं ने इस "Etch" टूल का परीक्षण 7 लोकप्रिय AI इमेज जनरेटरों पर किया।
- स्कोर: जबकि पुराने तरीके लगभग 35% बार सफल होते थे, Etch 65% से 91% बार सफल रहा।
- बड़ा खुलासा: यह पेपर दिखाता है कि वर्तमान सुरक्षा प्रणालियों में एक बहुत बड़ी खामी (blind spot) है। वे बुरे चित्रों और बुरे शब्दों को रोकने में बहुत अच्छे हैं, लेकिन वे अच्छे चित्रों के अंदर छिपे बुरे शब्दों को रोकने में बहुत खराब हैं।
निष्कर्ष (The Takeaway)
यह पेपर एक चेतावनी है। जैसे-जैसे AI छवियों के भीतर टेक्स्ट लिखने में बेहतर होता जा रहा है, हम अब चित्र या प्रॉम्प्ट को अलग-अलग नहीं जांच सकते। हमें नए सुरक्षा गार्डों की आवश्यकता है जो छवि के भीतर के टेक्स्ट को "पढ़" सकें और समझ सकें कि एक "हानिरहित कक्षा की फोटो" वास्तव में एक "खतरनाक निर्देश पुस्तिका" हो सकती है।
यह समझने जैसा है कि बम केवल एक डरावनी दिखने वाली वस्तु नहीं है; कभी-कभी, यह एक बिल्कुल सामान्य दिखने वाली किताब होती है जिसके अंदर एक घातक रेसिपी लिखी होती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।