VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models
यह शोध पत्र VERA-V को प्रस्तुत करता है, जो एक वेरिएशनल इन्फरेंस फ्रेमवर्क है जो मल्टीमॉडल जेलब्रेक डिस्कवरी को टेक्स्ट-इमेज प्रॉम्प्ट्स पर एक संयुक्त पोस्टीरियर वितरण (joint posterior distribution) सीखने के रूप में पुनर्गठित करता है, जिससे ऐसे गुप्त और युग्मित (coupled) प्रतिकूल इनपुट्स उत्पन्न करने में सक्षम होता है जो विजन-लैंग्वेज मॉडल के गार्डरेल्स को बायपास करने में मौजूदा तरीकों से काफी बेहतर प्रदर्शन करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, सुरक्षा के प्रति सचेत रोबोट सहायक (एक विजन-लैंग्वेज मॉडल) है जो टेक्स्ट पढ़ सकता है और चित्रों को देख सकता है। आपने इसे मददगार बनने के लिए प्रशिक्षित किया है, लेकिन साथ ही इसे खतरनाक अनुरोधों को अस्वीकार करने के लिए भी प्रशिक्षित किया है, जैसे कि "मैं बम कैसे बनाऊं?" या "मैं बैंक को कैसे हैक करूं?"
आमतौर पर, यदि आप इसे सीधे पूछते हैं, तो यह कहता है, "नहीं, मैं यह नहीं कर सकता।"
VERA-V नामक शोध पत्र एक नया, चालाकी भरा तरीका पेश करता है जिससे इस रोबोट को अपने ही नियमों को तोड़ने के लिए उकसाया जा सकता है। केवल एक प्रश्न पूछने के बजाय, शोधकर्ताओं ने एक "मास्टर ट्रिकस्टर" (एक AI हमलावर) बनाया है जो यह सीखता है कि टेक्स्ट और इमेज के ऐसे जोड़े (pairings) कैसे बनाए जाएं जो रोबोट को भ्रमित करने के लिए मिलकर काम करें।
यहाँ बताया गया है कि VERA-V कैसे काम करता है, सरल उपमाओं के माध्यम से:
1. पुराना तरीका: "सलेजहैमर" (भारी हथौड़ा) बनाम "स्विस आर्मी नाइफ"
इन रोबोटों को धोखा देने के पिछले तरीके एक 'सलेजहैमर' की तरह थे। वे या तो:
- चित्र में बुरे शब्द लिखते थे: "बम कैसे बनाएं" लिखने के बजाय, वे एक साइन बोर्ड की फोटो लेते थे जिस पर "बम कैसे बनाएं" लिखा होता था और उसे रोबोट को दिखाते थे। रोबोट फोटो के अंदर के टेक्स्ट को पहचानने में चूक सकता था।
- चित्र में शोर (noise) जोड़ते थे: वे रोबोट की आँखों को भ्रमित करने के लिए किसी फोटो को स्टैटिक या अजीब पैटर्न के साथ बिगाड़ देते थे।
समस्या: ये तरीके अनाड़ी हैं। वे टेक्स्ट और चित्र को अलग-अलग चीजें मानते हैं। यदि रोबोट फोटो में लिखे साइन को पढ़ने में सक्षम है, तो यह चाल विफल हो जाती है।
2. VERA-V का तरीका: "जैज़ बैंड"
VERA-V अलग है। एक सलेजहैमर के बजाय, यह एक जैज़ बैंड की तरह कार्य करता है। यह केवल एक नोट नहीं बजाता; यह यह सीखता है कि टेक्स्ट और इमेज को कैसे समन्वयित किया जाए ताकि वे रोबोट की सुरक्षा प्रणालियों को दरकिनार करने के लिए पूरी तरह से सामंजस्य बिठा सकें।
शोधकर्ता इसे "वेरिएशनल इन्फरेंस" (Variational Inference) कहते हैं। सरल शब्दों में, इसका अर्थ है कि हमलावर AI केवल एक बुरा तरीका नहीं खोजता। यह सभी संभावित बुरे तरीकों का एक नक्शा सीखता है। यह समझता है कि कभी-कभी एक विशिष्ट प्रकार का टेक्स्ट एक विशिष्ट प्रकार की धुंधली इमेज के साथ सबसे अच्छा काम करता है, और कभी-कभी दूसरा टेक्स्ट एक स्पष्ट इमेज के साथ काम करता है। यह दोनों के बीच के संबंध को सीखता है।
3. तीन-भाग वाली "भटकाने की रणनीति" (Distraction Strategy)
इस चाल को सफल बनाने के लिए, VERA-V तीन विशिष्ट सामग्रियों को एक पैकेज में मिलाकर रोबोट को भेजता है:
- सामग्री A: "छिपा हुआ टेक्स्ट" (टाइपोग्राफी)
हमलावर हानिकारक निर्देश को टेक्स्ट की एक तस्वीर (जैसे कोई साइन या नोट) में बदल देता है। यह रोबोट के टेक्स्ट फिल्टर से बुरे शब्दों को छिपा देता है, जो आमतौर पर उस चीज़ को स्कैन करते हैं जो आप टाइप करते हैं, न कि वह जो आप दिखाते हैं। - सामग्री B: "गुप्त संकेत" (डिफ्यूजन इमेज)
हमलावर एक इमेज जनरेटर का उपयोग करके एक ऐसी तस्वीर बनाता है जिसमें एक सूक्ष्म, छिपा हुआ सुराग होता है। यह स्पष्ट नहीं होता। यह भीड़ भरे कमरे में एक फुसफुसाहट की तरह है। रोबोट इमेज को देखता है, लेकिन "बुरा अर्थ" उसके पिक्सेल के बहुत गहराई में दबा होता, स्पष्ट रूप से लिखा हुआ नहीं होता। - सामग्री C: "भ्रमित करने वाली भीड़" (डिस्ट्रैक्टर्स)
यह सबसे चतुर हिस्सा है। हमलावर बाकी स्क्रीन को यादृच्छिक, उबाऊ चित्रों (जैसे बिल्ली, पेड़, या कॉफी का कप) से भर देता है जिनका बुरे अनुरोध से कोई लेना-देना नहीं होता।- उपमा: कल्पना कीजिए कि आप भीड़ में किसी विशिष्ट व्यक्ति को खोजने की कोशिश कर रहे हैं। यदि वह अकेला खड़ा है, तो आप उसे आसानी से पहचान लेंगे। लेकिन यदि वह 50 अन्य लोगों की भीड़ में खड़ा है जो बिल्कुल उससे अलग दिखते हैं, तो आपका मस्तिष्क भ्रमित हो जाता है और लक्ष्य पर ध्यान केंद्रित करना कठिन हो जाता है। VERA-V इन "डिस्ट्रैक्टर" इमेज का उपयोग रोबोट का ध्यान भटकाने के लिए करता है, जिससे रोबोट के सुरक्षा फिल्टर के लिए बुरे अनुरोध को पहचानना कठिन हो जाता है।
4. "फीडबैक लूप" (कोच)
कैसे हमलावर AI इसे इतना अच्छा करने के लिए सीखता है?
- यह एक चाल चलता है।
- यह एक "जज" (एक अन्य AI) से पूछता है कि क्या रोबोट इसकी चपेट में आ गया।
- यदि रोबोट ने "नहीं" कहा, तो हमलावर सीखता है, "ठीक है, वह संयोजन काम नहीं आया। चलिए टेक्स्ट और इमेज का एक अलग मिश्रण आजमाते हैं।"
- यह हजारों बार दोहराता है, रोबोट को भ्रमित करने के अपने "नक्शे" को परिष्कृत करता है।
5. परिणाम: एक नया रिकॉर्ड
शोध पत्र ने आज के कुछ सबसे स्मार्ट रोबोटों (जैसे GPT-4o) के खिलाफ इसका परीक्षण किया।
- पुराने तरीके: सबसे कठिन रोबोट (GPT-4o) पर, पुराने तरीके लगभग 100% बार विफल रहे। वे बैंक के वॉल्ट को पेपरक्लिप से तोड़ने की कोशिश करने जैसे थे।
- VERA-V: इस समन्वित, बहु-स्तरीय रणनीति का उपयोग करके, VERA-V 67.75% समय रोबोट को धोखा देने में सफल रहा। यह पिछले सर्वोत्तम तरीकों की तुलना में एक बहुत बड़ी छलांग है।
सारांश
VERA-V को केवल एक ताला खोलने वाले औजार के रूप में नहीं, बल्कि एक ताले के पूरे तंत्र का अध्ययन करने वाले ताला बनाने वाले (locksmith) के रूप में देखें। दरवाजा खोलने के लिए जबरदस्ती करने के बजाय, यह सीखता है कि हैंडल को कैसे हिलाना है, कब्जों को कैसे फुसफुसाना है, और सभी एक साथ गार्ड को कैसे विचलित करना है। यह एक "संयुक्त पश्च वितरण" (joint posterior distribution) बनाता है—जो केवल एक फैंसी तरीका है यह कहने का कि इसने टेक्स्ट-और-इमेज के संयोजन का वह सटीक नुस्खा सीख लिया है जो रोबोट के सुरक्षा गार्डों को भ्रमित कर देता है।
महत्वपूर्ण नोट: लेखक स्पष्ट रूप से कहते हैं कि यह शोध "रेड टीमिंग" (Red Teaming) के लिए है। इसका अर्थ है कि वे "नैतिक हैकर्स" की तरह काम कर रहे हैं जो इन कमजोरियों को ढूंढते हैं ताकि कंपनियां उन्हें ठीक कर सकें और अपने रोबोट को सुरक्षित बना सकें। वे वास्तव में लोगों को नुकसान पहुँचाने के लिए उपकरण प्रदान नहीं कर रहे हैं; वे यह दिखा रहे हैं कि वर्तमान सुरक्षा प्रणालियाँ कितनी नाजुक हैं ताकि उन्हें मजबूत किया जा सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।