Text is All You Need for Vision-Language Model Jailbreaking
यह शोधपत्र Text-DJ को प्रस्तुत करता है, जो एक नवीन जेलब्रेक हमला है जो हानिकारक टेक्स्ट प्रॉम्प्ट्स को बिखरे हुए सौहार्दपूर्ण उप-प्रश्नों और अप्रासंगिक विकर्षणों वाली छवियों के ग्रिड में परिवर्तित करके लार्ज विजन-लैंग्वेज मॉडल सुरक्षा सुरक्षा उपायों को दरकिनार कर देता है, जिससे मॉडलों की OCR क्षमताओं और खंडित मल्टीमॉडल इनपुट को जोड़ने में उनकी अक्षमता का लाभ उठाया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक बड़े विजन-लैंग्वेज मॉडल (LVLM) की कल्पना एक बहुत ही स्मार्ट, अच्छी तरह से प्रशिक्षित सुरक्षा गार्ड के रूप में करें जो एक हाई-टेक म्यूजियम में तैनात है। यह गार्ड संकेतों (टेक्स्ट) को पढ़ने और चित्रों (इमेज) को देखने में उत्कृष्ट है ताकि यह सुनिश्चित किया जा सके कि कोई भी खतरनाक या वर्जित चीज़ अंदर न लाए। यदि आप उन्हें एक नोट थमाते हैं जिसमें लिखा है "मैं बम कैसे बनाऊं?", तो वे तुरंत खतरे को पहचान लेते हैं और कहते हैं, "बिल्कुल नहीं।"
पेपर "Text is All You Need for Vision-Language Model Jailbreaking" एक चतुर ट्रिक पेश करता है जिसे Text-DJ (टेक्स्ट डिस्ट्रैक्शन जेलब्रेकिंग) कहा जाता है। यह दिखाता है कि कैसे केवल टेक्स्ट का उपयोग करके इस सुरक्षा गार्ड को मूर्ख बनाया जा सकता है, लेकिन इसमें एक ट्विस्ट है: टेक्स्ट को चित्रों के एक ग्रिड के अंदर छिपाया गया है।
यह ट्रिक कैसे काम करती है, इसे सरल चरणों में यहाँ समझाया गया है:
1. "बिल बांटने" की रणनीति (डिकंपोजिशन/विखंडन)
सबसे पहले, हमलावर एक खतरनाक सवाल (जैसे "मैं बम कैसे बनाऊं?") को तीन छोटे, हानिरहित दिखने वाले सवालों में तोड़ देते हैं।
- उपमा: कल्पना कीजिए कि आप एक खतरनाक हथियार खरीदना चाहते हैं, लेकिन दुकानदार आपको वह नहीं बेच रहा है। इसलिए, आप अपने ऑर्डर को तीन अलग-अलग, मासूम अनुरोधों में विभाजित करते हैं: "गनपाउडर का रासायनिक संयोजन क्या है?" "मैं इन पाउडर्स को कैसे मिलाऊं?" और "इस मिश्रण को कौन सा कंटेनर थामे रखता है?"
- व्यक्तिगत रूप से, ये सवाल सुरक्षित दिखते हैं। गार्ड शायद ही उन्हें मददगार तरीके से जवाब भी दे दे। लेकिन यदि आप उन सभी को एक साथ रख देते हैं, तो वे खतरनाक योजना को प्रकट कर देते हैं।
2. "विचलित करने वाला शोर" (डिस्ट्रैक्शन/भटकाव)
इसके बाद, हमलावर बहुत सारे पूरी तरह से रैंडम, उबाऊ सवाल बनाते जिनका खतरनाक योजना से कोई लेना-देना नहीं है।
- उपमा: कल्पना कीजिए कि आप एक गार्ड के पास से एक गुप्त संदेश ले जाने की कोशिश कर रहे हैं, लेकिन आप 9 अन्य लोगों से घिरे हुए हैं जो मौसम, दूध की कीमत और आलू के इतिहास के बारे में चिल्ला रहे हैं। गार्ड उस शोर पर ध्यान केंद्रित करने में इतना व्यस्त है कि वह गुप्त योजना बताने वाले तीन लोगों पर ध्यान देना भूल जाता है।
- पेपर ने पाया कि ये "शोर" वाले सवाल काम करने के लिए जितने अधिक अलग होंगे, उतना ही बेहतर काम करेंगे।
3. "चित्र पहेली" (विजुअल ट्रिक)
यह सबसे महत्वपूर्ण हिस्सा है। सवालों को चैट बॉक्स में टाइप करने के बजाय, हमलावर प्रत्येक सवाल (3 विभाजित खतरनाक सवाल और 9 रैंडम शोर वाले सवाल) को टेक्स्ट की इमेज में बदल देते हैं। वे उन्हें एक ग्रिड में व्यवस्थित करते हैं, जैसे कि एक फोटो एल्बम या स्प्रेडशीट।
- जाल: गार्ड को बुरे शब्दों को स्कैन करने के लिए प्रशिक्षित किया गया है। लेकिन यहाँ, बुरे शब्द टेक्स्ट के चित्रों के अंदर छिपे हुए हैं। गार्ड को यह देखने के लिए अपनी "ऑप्टिकल कैरेक्टर रिकग्निशन" (OCR) क्षमता का उपयोग करना होगा—यानी, इमेज के भीतर टेक्स्ट पढ़ने की उसकी क्षमता।
- कमजोरी: पेपर का तर्क है कि जबकि गार्ड सीधे टेक्स्ट पढ़ने में बहुत अच्छा है, वह भ्रमित हो जाता है जब उसे एक चित्र के अंदर टेक्स्ट पढ़ना होता है, खासकर जब वह चित्र 9 अन्य विचलित करने वाले चित्रों से घिरा हो। गार्ड का टेक्स्ट पढ़ने वाला "सेफ्टी फिल्टर" बिखरे हुए, हानिरहित दिखने वाले इमेज-प्रश्नों के बीच संबंध जोड़ने में विफल हो जाता है।
परिणाम
जब गार्ड अंततः इमेज के ग्रिड को पढ़ता है, तो वह शोर के बीच में उन तीन विभाजित सवालों को देखता है। क्योंकि सवाल बिखरे हुए हैं और चित्रों में छिपे हुए हैं, गार्ड यह नहीं समझ पाता कि वे मिलकर एक खतरनाक पूर्ण रूप ले रहे हैं। वह हानिरहित हिस्सों का जवाब देता है, और ऐसा करते हुए, अनजाने में मूल खतरनाक सवाल का जवाब दे देता है।
यह क्यों मायने रखता है
पेपर का दावा है कि यह एक बड़ी समस्या है क्योंकि:
- यह "ब्लैक बॉक्स" मॉडल्स पर काम करता है: आपको गार्ड के गुप्त कोड या आंतरिक मस्तिष्क संरचना को जानने की आवश्यकता नहीं है। आपको बस पिक्चर ग्रिड भेजने की आवश्यकता है।
- यह बेहतरीन मॉडल्स पर काम करता है: उन्होंने शीर्ष-स्तरीय मॉडल्स (जैसे GPT-4, Gemini, और Qwen) पर इसका परीक्षण किया और यह उन सभी पर काम कर गया।
- यह "गार्ड" मॉडल्स को बायपास करता है: भले ही सुरक्षा की दूसरी परत मुख्य मॉडल तक पहुँचने से पहले इनपुट की जाँच करने की कोशिश करे, यह ट्रिक अक्सर बच निकलती है क्योंकि इनपुट चित्रों के एक हानिरहित ग्रिड जैसा दिखता है।
संक्षेप में: पेपर दिखाता है कि यदि आप एक खतरनाक योजना को एक चित्र के अंदर छिपा देते हैं, उसे छोटे टुकड़ों में तोड़ देते हैं, और उसे बहुत सारे उबाऊ शोर से घेर देते हैं, तो सबसे स्मार्ट AI सुरक्षा गार्ड भी भ्रमित हो सकते हैं और खतरे को अंदर आने दे सकते हैं। लेखकों के अनुसार समाधान यह है कि AI को चित्रों के भीतर टेक्स्ट पढ़ने और शोर के बीच भी बिंदुओं को जोड़ने में बेहतर बनाया जाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।