VLMGuard: Bootstrapping Malicious Prompt Detectors from Unlabeled Vision-Language Prompts in the Wild
VLMGuard एक नवीन फ्रेमवर्क है जो अनलेबल इन-द-वाइल्ड प्रॉम्प्ट्स और एक स्वचालित दुर्भावनापूर्णता अनुमान स्कोर का लाभ उठाकर विजन-लैंग्वेज मॉडल्स के लिए दुर्भावनापूर्ण प्रॉम्प्ट डिटेक्टरों को बूटस्ट्रैप करता है, जो मानव एनोटेशन की आवश्यकता को समाप्त करते हुए अत्याधुनिक तरीकों की तुलना में बेहतर डिटेक्शन प्रदर्शन प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, सहायक रोबोटिक असिस्टेंट (एक विजन-लैंग्वेज मॉडल) है जो तस्वीरों को देख सकता है और आपके सवालों के जवाब देने के लिए टेक्स्ट पढ़ सकता है। आप इस रोबोट को लोगों की मदद करने के लिए वास्तविक दुनिया में भेजना चाहते हैं। लेकिन एक समस्या है: कुछ लोग रोबोट को बुरा काम करने के लिए बहला-फुसला सकते हैं, जैसे कि हथियार बनाने के निर्देश देना या सुरक्षा नियमों को दरकिनार करना। इन चालाकी भरे प्रयासों को "मैलेशियस प्रॉम्प्ट्स" (malicious prompts) कहा जाता है।
यह पेपर एक नया सिस्टम पेश करता है जिसे VLMGuard कहा जाता है, जो धोखेबाजों को रोबोट के जवाब देने से पहले ही पकड़ लेता है। यह कैसे काम करता है, इसका सरल विवरण यहाँ दिया गया है:
बड़ी समस्या: "सुई और घास का ढेर" (Needle in a Haystack)
आमतौर पर, कंप्यूटर को यह पहचानने के लिए कि "बुरा" क्या है, आपको उदाहरणों की एक विशाल सूची की आवश्यकता होती है जो ठीक से दिखाए कि "बुरा" क्या दिखता है और "अच्छा" क्या दिखता है। आपको हजारों उदाहरणों को लेबल करने के लिए इंसानों की आवश्यकता होगी: "यह सुरक्षित है," "यह खतरनाक है।"
लेकिन वास्तविक दुनिया में, ऐसी लेबल की गई सूचियाँ प्राप्त करना कठिन, महंगा और धीमा है। हमलावर हमेशा नए तरीके निकालते रहते हैं, और जब तक आप पुराने तरीकों को लेबल कर लेते हैं, तब तक नए तरीके आ चुके होते हैं। इसके अलावा, रोबोट का उपयोग करने वाले अधिकांश लोग अच्छे होते हैं; बुरे लोग बहुत कम होते हैं। यह एक विशाल घास के ढेर में कुछ विशिष्ट सुइयों को खोजने जैसा है, बिना यह जाने कि कौन सी सुई है।
समाधान: VLMGuard (एक "अंतर्ज्ञान" डिटेक्टर)
VLMGuard इस समस्या को अनलेबल (unlabeled) डेटा का उपयोग करके हल करता है—वह लाखों सवाल और तस्वीरें जो जनता से हर दिन रोबोट को मिलती हैं। इसे यह जानने के लिए किसी इंसान की जरूरत नहीं है कि "यह बुरा है।" इसके बजाय, यह दो चरणों वाली प्रक्रिया का उपयोग करके खुद को सिखाता है।
चरण 1: "अजीब चीज़ को पहचानना" (सबस्पेस एक्सट्रैक्शन - Subspace Extraction)
कल्पना कीजिए कि रोबोट का मस्तिष्क करोड़ों मोतियों से भरा एक विशाल कमरा है। प्रत्येक मोती उपयोगकर्ता के एक प्रश्न का प्रतिनिधित्व करता है। अधिकांश मोती "अच्छे" (benign) हैं, और बहुत कम "बुरे" (malicious) हैं।
VLMGuard कमरे के आकार को देखता है। वह महसूस करता है कि "अच्छे" मोती ज्यादातर केंद्र में क्लस्टर में होते हैं, जबकि "बुरे" मोती, अलग और चालाक होने के कारण, केंद्र से एक विशिष्ट, असामान्य दिशा में दूर स्थित होते हैं।
सिस्टम एक गणितीय ट्रिक (जिसे सिंगुलर वैल्यू डिकंपोजिशन कहा जाता है) का उपयोग करके उस विशिष्ट "असामान्य दिशा" को खोजने के लिए करता है। फिर यह प्रत्येक मोती को एक स्कोर देता है कि वह उस दिशा में कितना फैला हुआ है।
- उपमा: इसे हवाई अड्डे पर मेटल डिटेक्टर की तरह समझें। अधिकांश लोग (अच्छे प्रॉम्प्ट्स) बिना किसी अलार्म के गुजर जाते हैं। लेकिन यदि कोई कुछ भारी और धातु जैसा (एक मैलेशियस प्रॉम्प्ट) लेकर आता है, तो डिटेक्टर बीप करता है। VLMGuard हर उस सवाल के लिए एक "बीप स्कोर" बनाता है जो रोबोट प्राप्त करता है, भले ही वह अभी यह न जानता हो कि वह वास्तव में एक बुरा सवाल है या नहीं।
चरण 2: "स्मार्ट फ़िल्टर" चरण (एक क्लासिफायर को प्रशिक्षित करना)
अब, VLMGuard के पास स्कोर की एक सूची है। यह मान लेता है कि उच्चतम "बीप स्कोर" वाले सवाल संभवतः बुरे हैं, और कम स्कोर वाले सवाल अच्छे हैं। यह इस सूची का उपयोग एक दूसरे, छोटे और स्मार्ट "सुरक्षा गार्ड" (एक क्लासिफायर) को प्रशिक्षित करने के लिए करता है।
यह सुरक्षा गार्ड यह सीखने के लिए तैयार होता है कि सवालों को कैसे देखना है और कहना है, "यह उस उच्च-स्कोरिंग वाले सवाल जैसा दिखता है जो मैंने पहले देखा था," या "यह कम-स्कोरिंग वाले सवाल जैसा दिखता है।"
यह दूसरा चरण क्यों महत्वपूर्ण है?
पेपर में पाया गया कि पहला चरण ("बीप स्कोर") एकदम सटीक नहीं है। कभी-कभी, एक सामान्य सवाल अजीब लग सकता है क्योंकि उसे बोलने का तरीका (जैसे कि फैंसी शब्दों या अजीब वाक्य संरचना का उपयोग करना) अलग है, जिससे गलत अलार्म बज सकता है। दूसरा चरण (सुरक्षा गार्ड) उन हानिरहित विचित्रताओं को अनदेखा करना सीखता है और केवल सवाल के इरादे (intent) पर ध्यान केंद्रित करता है। यह एक ऐसे गार्ड के बीच का अंतर है जो हर तेज़ आवाज़ पर घबरा जाता है बनाम एक ऐसा गार्ड जो जानता है कि बच्चे की हंसी और बम की टिक-टिक के बीच क्या अंतर है।
यह एक बड़ी बात क्यों है
- कोई अतिरिक्त होमवर्क नहीं: इस सिस्टम को हजारों उदाहरणों को लेबल करने के लिए इंसानों के बैठने की आवश्यकता नहीं है। यह उस अव्यवस्थित, अनलेबल डेटा से सीखता है जो पहले से ही दुनिया में मौजूद है।
- यह अनुकूलित होता है: क्योंकि यह वास्तविक दुनिया से सीखता है, यह उन नए प्रकार के धोखों को भी पहचान सकता है जिनके बारे में इंसानों ने अभी तक सोचा भी नहीं है।
- यह काम करता है: लेखकों ने कई अलग-अलग रोबोट मॉडल पर इसका परीक्षण किया और पाया कि यह मौजूदा अन्य तरीकों की तुलना में बुरे प्रॉम्प्ट्स को पकड़ने में बहुत बेहतर है। इसने डिटेक्शन सटीकता में काफी सुधार किया (मौजूदा सर्वोत्तम तरीकों से लगभग 5% बेहतर)।
निष्कर्ष
VLMGuard एक सुरक्षा प्रणाली की तरह है जो भीड़ को देखकर सीखती है। "बुरे लोगों" की किसी मैनुअल की तुलना करने के बजाय, यह सीखता है कि "सामान्य" क्या है, उन सांख्यिकीय विसंगतियों को पहचानता है जो किसी धोखे का संकेत देती हैं, और फिर वास्तविक खतरों को पकड़ने और हानिरहित शोर को अनदेखा करने के लिए एक स्मार्ट फ़िल्टर को प्रशिक्षित करता है। यह वास्तविक दुनिया में AI सहायकों को सुरक्षित रखने में इसे बहुत आसान और तेज़ बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।