← नवीनतम पेपर
🤖 machine learning

VLMGuard: Bootstrapping Malicious Prompt Detectors from Unlabeled Vision-Language Prompts in the Wild

VLMGuard एक नवीन फ्रेमवर्क है जो अनलेबल इन-द-वाइल्ड प्रॉम्प्ट्स और एक स्वचालित दुर्भावनापूर्णता अनुमान स्कोर का लाभ उठाकर विजन-लैंग्वेज मॉडल्स के लिए दुर्भावनापूर्ण प्रॉम्प्ट डिटेक्टरों को बूटस्ट्रैप करता है, जो मानव एनोटेशन की आवश्यकता को समाप्त करते हुए अत्याधुनिक तरीकों की तुलना में बेहतर डिटेक्शन प्रदर्शन प्राप्त करता है।

मूल लेखक: Junlin Fang, Wenyu Chen, Reshmi Ghosh, Robert Sim, Ahmed Salem, Vitor R. Carvalho, Emily Lawton, Sharon Li, Jack W. Stokes, Sean Du

प्रकाशित 2026-07-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junlin Fang, Wenyu Chen, Reshmi Ghosh, Robert Sim, Ahmed Salem, Vitor R. Carvalho, Emily Lawton, Sharon Li, Jack W. Stokes, Sean Du

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, सहायक रोबोटिक असिस्टेंट (एक विजन-लैंग्वेज मॉडल) है जो तस्वीरों को देख सकता है और आपके सवालों के जवाब देने के लिए टेक्स्ट पढ़ सकता है। आप इस रोबोट को लोगों की मदद करने के लिए वास्तविक दुनिया में भेजना चाहते हैं। लेकिन एक समस्या है: कुछ लोग रोबोट को बुरा काम करने के लिए बहला-फुसला सकते हैं, जैसे कि हथियार बनाने के निर्देश देना या सुरक्षा नियमों को दरकिनार करना। इन चालाकी भरे प्रयासों को "मैलेशियस प्रॉम्प्ट्स" (malicious prompts) कहा जाता है।

यह पेपर एक नया सिस्टम पेश करता है जिसे VLMGuard कहा जाता है, जो धोखेबाजों को रोबोट के जवाब देने से पहले ही पकड़ लेता है। यह कैसे काम करता है, इसका सरल विवरण यहाँ दिया गया है:

बड़ी समस्या: "सुई और घास का ढेर" (Needle in a Haystack)

आमतौर पर, कंप्यूटर को यह पहचानने के लिए कि "बुरा" क्या है, आपको उदाहरणों की एक विशाल सूची की आवश्यकता होती है जो ठीक से दिखाए कि "बुरा" क्या दिखता है और "अच्छा" क्या दिखता है। आपको हजारों उदाहरणों को लेबल करने के लिए इंसानों की आवश्यकता होगी: "यह सुरक्षित है," "यह खतरनाक है।"

लेकिन वास्तविक दुनिया में, ऐसी लेबल की गई सूचियाँ प्राप्त करना कठिन, महंगा और धीमा है। हमलावर हमेशा नए तरीके निकालते रहते हैं, और जब तक आप पुराने तरीकों को लेबल कर लेते हैं, तब तक नए तरीके आ चुके होते हैं। इसके अलावा, रोबोट का उपयोग करने वाले अधिकांश लोग अच्छे होते हैं; बुरे लोग बहुत कम होते हैं। यह एक विशाल घास के ढेर में कुछ विशिष्ट सुइयों को खोजने जैसा है, बिना यह जाने कि कौन सी सुई है।

समाधान: VLMGuard (एक "अंतर्ज्ञान" डिटेक्टर)

VLMGuard इस समस्या को अनलेबल (unlabeled) डेटा का उपयोग करके हल करता है—वह लाखों सवाल और तस्वीरें जो जनता से हर दिन रोबोट को मिलती हैं। इसे यह जानने के लिए किसी इंसान की जरूरत नहीं है कि "यह बुरा है।" इसके बजाय, यह दो चरणों वाली प्रक्रिया का उपयोग करके खुद को सिखाता है।

चरण 1: "अजीब चीज़ को पहचानना" (सबस्पेस एक्सट्रैक्शन - Subspace Extraction)

कल्पना कीजिए कि रोबोट का मस्तिष्क करोड़ों मोतियों से भरा एक विशाल कमरा है। प्रत्येक मोती उपयोगकर्ता के एक प्रश्न का प्रतिनिधित्व करता है। अधिकांश मोती "अच्छे" (benign) हैं, और बहुत कम "बुरे" (malicious) हैं।

VLMGuard कमरे के आकार को देखता है। वह महसूस करता है कि "अच्छे" मोती ज्यादातर केंद्र में क्लस्टर में होते हैं, जबकि "बुरे" मोती, अलग और चालाक होने के कारण, केंद्र से एक विशिष्ट, असामान्य दिशा में दूर स्थित होते हैं।

सिस्टम एक गणितीय ट्रिक (जिसे सिंगुलर वैल्यू डिकंपोजिशन कहा जाता है) का उपयोग करके उस विशिष्ट "असामान्य दिशा" को खोजने के लिए करता है। फिर यह प्रत्येक मोती को एक स्कोर देता है कि वह उस दिशा में कितना फैला हुआ है।

  • उपमा: इसे हवाई अड्डे पर मेटल डिटेक्टर की तरह समझें। अधिकांश लोग (अच्छे प्रॉम्प्ट्स) बिना किसी अलार्म के गुजर जाते हैं। लेकिन यदि कोई कुछ भारी और धातु जैसा (एक मैलेशियस प्रॉम्प्ट) लेकर आता है, तो डिटेक्टर बीप करता है। VLMGuard हर उस सवाल के लिए एक "बीप स्कोर" बनाता है जो रोबोट प्राप्त करता है, भले ही वह अभी यह न जानता हो कि वह वास्तव में एक बुरा सवाल है या नहीं।

चरण 2: "स्मार्ट फ़िल्टर" चरण (एक क्लासिफायर को प्रशिक्षित करना)

अब, VLMGuard के पास स्कोर की एक सूची है। यह मान लेता है कि उच्चतम "बीप स्कोर" वाले सवाल संभवतः बुरे हैं, और कम स्कोर वाले सवाल अच्छे हैं। यह इस सूची का उपयोग एक दूसरे, छोटे और स्मार्ट "सुरक्षा गार्ड" (एक क्लासिफायर) को प्रशिक्षित करने के लिए करता है।

यह सुरक्षा गार्ड यह सीखने के लिए तैयार होता है कि सवालों को कैसे देखना है और कहना है, "यह उस उच्च-स्कोरिंग वाले सवाल जैसा दिखता है जो मैंने पहले देखा था," या "यह कम-स्कोरिंग वाले सवाल जैसा दिखता है।"

यह दूसरा चरण क्यों महत्वपूर्ण है?
पेपर में पाया गया कि पहला चरण ("बीप स्कोर") एकदम सटीक नहीं है। कभी-कभी, एक सामान्य सवाल अजीब लग सकता है क्योंकि उसे बोलने का तरीका (जैसे कि फैंसी शब्दों या अजीब वाक्य संरचना का उपयोग करना) अलग है, जिससे गलत अलार्म बज सकता है। दूसरा चरण (सुरक्षा गार्ड) उन हानिरहित विचित्रताओं को अनदेखा करना सीखता है और केवल सवाल के इरादे (intent) पर ध्यान केंद्रित करता है। यह एक ऐसे गार्ड के बीच का अंतर है जो हर तेज़ आवाज़ पर घबरा जाता है बनाम एक ऐसा गार्ड जो जानता है कि बच्चे की हंसी और बम की टिक-टिक के बीच क्या अंतर है।

यह एक बड़ी बात क्यों है

  • कोई अतिरिक्त होमवर्क नहीं: इस सिस्टम को हजारों उदाहरणों को लेबल करने के लिए इंसानों के बैठने की आवश्यकता नहीं है। यह उस अव्यवस्थित, अनलेबल डेटा से सीखता है जो पहले से ही दुनिया में मौजूद है।
  • यह अनुकूलित होता है: क्योंकि यह वास्तविक दुनिया से सीखता है, यह उन नए प्रकार के धोखों को भी पहचान सकता है जिनके बारे में इंसानों ने अभी तक सोचा भी नहीं है।
  • यह काम करता है: लेखकों ने कई अलग-अलग रोबोट मॉडल पर इसका परीक्षण किया और पाया कि यह मौजूदा अन्य तरीकों की तुलना में बुरे प्रॉम्प्ट्स को पकड़ने में बहुत बेहतर है। इसने डिटेक्शन सटीकता में काफी सुधार किया (मौजूदा सर्वोत्तम तरीकों से लगभग 5% बेहतर)।

निष्कर्ष

VLMGuard एक सुरक्षा प्रणाली की तरह है जो भीड़ को देखकर सीखती है। "बुरे लोगों" की किसी मैनुअल की तुलना करने के बजाय, यह सीखता है कि "सामान्य" क्या है, उन सांख्यिकीय विसंगतियों को पहचानता है जो किसी धोखे का संकेत देती हैं, और फिर वास्तविक खतरों को पकड़ने और हानिरहित शोर को अनदेखा करने के लिए एक स्मार्ट फ़िल्टर को प्रशिक्षित करता है। यह वास्तविक दुनिया में AI सहायकों को सुरक्षित रखने में इसे बहुत आसान और तेज़ बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →