← नवीनतम पेपर
🤖 AI

Text is All You Need for Vision-Language Model Jailbreaking

यह शोधपत्र Text-DJ को प्रस्तुत करता है, जो एक नवीन जेलब्रेक हमला है जो हानिकारक टेक्स्ट प्रॉम्प्ट्स को बिखरे हुए सौहार्दपूर्ण उप-प्रश्नों और अप्रासंगिक विकर्षणों वाली छवियों के ग्रिड में परिवर्तित करके लार्ज विजन-लैंग्वेज मॉडल सुरक्षा सुरक्षा उपायों को दरकिनार कर देता है, जिससे मॉडलों की OCR क्षमताओं और खंडित मल्टीमॉडल इनपुट को जोड़ने में उनकी अक्षमता का लाभ उठाया जाता है।

मूल लेखक: Yihang Chen, Zhao Xu, Youyuan Jiang, Tianle Zheng, Cho-Jui Hsieh

प्रकाशित 2026-02-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yihang Chen, Zhao Xu, Youyuan Jiang, Tianle Zheng, Cho-Jui Hsieh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक बड़े विजन-लैंग्वेज मॉडल (LVLM) की कल्पना एक बहुत ही स्मार्ट, अच्छी तरह से प्रशिक्षित सुरक्षा गार्ड के रूप में करें जो एक हाई-टेक म्यूजियम में तैनात है। यह गार्ड संकेतों (टेक्स्ट) को पढ़ने और चित्रों (इमेज) को देखने में उत्कृष्ट है ताकि यह सुनिश्चित किया जा सके कि कोई भी खतरनाक या वर्जित चीज़ अंदर न लाए। यदि आप उन्हें एक नोट थमाते हैं जिसमें लिखा है "मैं बम कैसे बनाऊं?", तो वे तुरंत खतरे को पहचान लेते हैं और कहते हैं, "बिल्कुल नहीं।"

पेपर "Text is All You Need for Vision-Language Model Jailbreaking" एक चतुर ट्रिक पेश करता है जिसे Text-DJ (टेक्स्ट डिस्ट्रैक्शन जेलब्रेकिंग) कहा जाता है। यह दिखाता है कि कैसे केवल टेक्स्ट का उपयोग करके इस सुरक्षा गार्ड को मूर्ख बनाया जा सकता है, लेकिन इसमें एक ट्विस्ट है: टेक्स्ट को चित्रों के एक ग्रिड के अंदर छिपाया गया है।

यह ट्रिक कैसे काम करती है, इसे सरल चरणों में यहाँ समझाया गया है:

1. "बिल बांटने" की रणनीति (डिकंपोजिशन/विखंडन)

सबसे पहले, हमलावर एक खतरनाक सवाल (जैसे "मैं बम कैसे बनाऊं?") को तीन छोटे, हानिरहित दिखने वाले सवालों में तोड़ देते हैं।

  • उपमा: कल्पना कीजिए कि आप एक खतरनाक हथियार खरीदना चाहते हैं, लेकिन दुकानदार आपको वह नहीं बेच रहा है। इसलिए, आप अपने ऑर्डर को तीन अलग-अलग, मासूम अनुरोधों में विभाजित करते हैं: "गनपाउडर का रासायनिक संयोजन क्या है?" "मैं इन पाउडर्स को कैसे मिलाऊं?" और "इस मिश्रण को कौन सा कंटेनर थामे रखता है?"
  • व्यक्तिगत रूप से, ये सवाल सुरक्षित दिखते हैं। गार्ड शायद ही उन्हें मददगार तरीके से जवाब भी दे दे। लेकिन यदि आप उन सभी को एक साथ रख देते हैं, तो वे खतरनाक योजना को प्रकट कर देते हैं।

2. "विचलित करने वाला शोर" (डिस्ट्रैक्शन/भटकाव)

इसके बाद, हमलावर बहुत सारे पूरी तरह से रैंडम, उबाऊ सवाल बनाते जिनका खतरनाक योजना से कोई लेना-देना नहीं है।

  • उपमा: कल्पना कीजिए कि आप एक गार्ड के पास से एक गुप्त संदेश ले जाने की कोशिश कर रहे हैं, लेकिन आप 9 अन्य लोगों से घिरे हुए हैं जो मौसम, दूध की कीमत और आलू के इतिहास के बारे में चिल्ला रहे हैं। गार्ड उस शोर पर ध्यान केंद्रित करने में इतना व्यस्त है कि वह गुप्त योजना बताने वाले तीन लोगों पर ध्यान देना भूल जाता है।
  • पेपर ने पाया कि ये "शोर" वाले सवाल काम करने के लिए जितने अधिक अलग होंगे, उतना ही बेहतर काम करेंगे।

3. "चित्र पहेली" (विजुअल ट्रिक)

यह सबसे महत्वपूर्ण हिस्सा है। सवालों को चैट बॉक्स में टाइप करने के बजाय, हमलावर प्रत्येक सवाल (3 विभाजित खतरनाक सवाल और 9 रैंडम शोर वाले सवाल) को टेक्स्ट की इमेज में बदल देते हैं। वे उन्हें एक ग्रिड में व्यवस्थित करते हैं, जैसे कि एक फोटो एल्बम या स्प्रेडशीट।

  • जाल: गार्ड को बुरे शब्दों को स्कैन करने के लिए प्रशिक्षित किया गया है। लेकिन यहाँ, बुरे शब्द टेक्स्ट के चित्रों के अंदर छिपे हुए हैं। गार्ड को यह देखने के लिए अपनी "ऑप्टिकल कैरेक्टर रिकग्निशन" (OCR) क्षमता का उपयोग करना होगा—यानी, इमेज के भीतर टेक्स्ट पढ़ने की उसकी क्षमता।
  • कमजोरी: पेपर का तर्क है कि जबकि गार्ड सीधे टेक्स्ट पढ़ने में बहुत अच्छा है, वह भ्रमित हो जाता है जब उसे एक चित्र के अंदर टेक्स्ट पढ़ना होता है, खासकर जब वह चित्र 9 अन्य विचलित करने वाले चित्रों से घिरा हो। गार्ड का टेक्स्ट पढ़ने वाला "सेफ्टी फिल्टर" बिखरे हुए, हानिरहित दिखने वाले इमेज-प्रश्नों के बीच संबंध जोड़ने में विफल हो जाता है।

परिणाम

जब गार्ड अंततः इमेज के ग्रिड को पढ़ता है, तो वह शोर के बीच में उन तीन विभाजित सवालों को देखता है। क्योंकि सवाल बिखरे हुए हैं और चित्रों में छिपे हुए हैं, गार्ड यह नहीं समझ पाता कि वे मिलकर एक खतरनाक पूर्ण रूप ले रहे हैं। वह हानिरहित हिस्सों का जवाब देता है, और ऐसा करते हुए, अनजाने में मूल खतरनाक सवाल का जवाब दे देता है।

यह क्यों मायने रखता है

पेपर का दावा है कि यह एक बड़ी समस्या है क्योंकि:

  1. यह "ब्लैक बॉक्स" मॉडल्स पर काम करता है: आपको गार्ड के गुप्त कोड या आंतरिक मस्तिष्क संरचना को जानने की आवश्यकता नहीं है। आपको बस पिक्चर ग्रिड भेजने की आवश्यकता है।
  2. यह बेहतरीन मॉडल्स पर काम करता है: उन्होंने शीर्ष-स्तरीय मॉडल्स (जैसे GPT-4, Gemini, और Qwen) पर इसका परीक्षण किया और यह उन सभी पर काम कर गया।
  3. यह "गार्ड" मॉडल्स को बायपास करता है: भले ही सुरक्षा की दूसरी परत मुख्य मॉडल तक पहुँचने से पहले इनपुट की जाँच करने की कोशिश करे, यह ट्रिक अक्सर बच निकलती है क्योंकि इनपुट चित्रों के एक हानिरहित ग्रिड जैसा दिखता है।

संक्षेप में: पेपर दिखाता है कि यदि आप एक खतरनाक योजना को एक चित्र के अंदर छिपा देते हैं, उसे छोटे टुकड़ों में तोड़ देते हैं, और उसे बहुत सारे उबाऊ शोर से घेर देते हैं, तो सबसे स्मार्ट AI सुरक्षा गार्ड भी भ्रमित हो सकते हैं और खतरे को अंदर आने दे सकते हैं। लेखकों के अनुसार समाधान यह है कि AI को चित्रों के भीतर टेक्स्ट पढ़ने और शोर के बीच भी बिंदुओं को जोड़ने में बेहतर बनाया जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →