← नवीनतम पेपर
💻 computer science

The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails

यह शोध पत्र "अनसेफ इंडक्शन अटैक्स" (Unsafe Induction Attacks) और संबंधित "अनसेफ सिमेंटिक डिस्टिलेशन" (Unsafe Semantic Semantic Distillation) पद्धति को प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि कैसे अदृश्य रूप से विचलित (imperceptibly perturbed) सुरक्षित छवियों का उपयोग मल्टीमॉडल गार्ड मॉडल्स में गलत सकारात्मक अस्वीकारियों (false positive rejections) को ट्रिगर करने के लिए किया जा सकता है, जिससे एक महत्वपूर्ण उपलब्धता भेद्यता (availability vulnerability) उजागर होती है जो सेवा विश्वसनीयता को कम करती है और उपयोगकर्ता के विश्वास को क्षीण करती है।

मूल लेखक: Shuo Shi, Rui Yin, Naen Xu, Jiahao Chen, Chunyi Zhou, Tianyu Du, Zhihui Fu, Jun Wang, Zhaoxiang Wang, Shouling Ji

प्रकाशित 2026-08-04
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shuo Shi, Rui Yin, Naen Xu, Jiahao Chen, Chunyi Zhou, Tianyu Du, Zhihui Fu, Jun Wang, Zhaoxiang Wang, Shouling Ji

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक ऐसी दुनिया है जहाँ आपका पसंदीदा AI असिस्टेंट एक सुपर-स्मार्ट लाइब्रेरियन की तरह है जो तस्वीरों को देख सकता है और आपके मन को पढ़ सकता है। आप पूछते हैं, "क्या आप इस बिल्ली को सफेद कर सकते हैं?" और लाइब्रेरियन आपकी फोटो और आपके सवाल को चेक करता है ताकि यह सुनिश्चित हो सके कि आप नियमों को तोड़ने की कोशिश नहीं कर रहे हैं। इस लाइब्रेरियन को "गार्ड मॉडल" कहा जाता है, और इसका काम बुरी चीजों को—जैसे हिंसा या डरावनी छवियों को—अंदर आने से रोकना है। आमतौर पर, हम उन छली लोगों के बारे में चिंतित रहते हैं जो लाइब्रेरियन को बुरी बातें चुराकर ले जाते हैं (जैसे कि एक गुप्त कोड फुसफुसाना ताकि लाइब्रेरियन खतरे को पहचान न पाए)। लेकिन क्या होगा अगर छली व्यक्ति का इरादा बुरा सामान अंदर लाना नहीं, बल्कि लाइब्रेरियन को यह विश्वास दिलाना हो कि अच्छी चीजें भी बुरी हैं?

यह पेपर एक नए प्रकार के धोखे की खोज करता है जिसे "द बॉय हू क्राइड वुल्फ" (भेड़िया आया, भेड़िया आया) हमला कहा जाता है। किसी बुराई को छिपाने के बजाय, हमलावर एक हानिरहित तस्वीर पर ऐसी अदृश्य स्याही लगा देता है जिसे केवल लाइब्रेरियन ही देख सकता है। जब आप इस तस्वीर को लाइब्रेरियन को दिखाते हैं, तो वह चिल्ला उठता है, "भेड़िया! भेड़िया!" और आपकी मदद करने से मना कर देता है, जबकि वह सिर्फ एक प्यारी सी भेड़ (या यहाँ एक प्यारी बिल्ली) थी। यह पेपर दिखाता है कि कैसे हैकर्स इस तकनीक का उपयोग करके लाइब्रेरियन को इतना भ्रमित और अति-सुरक्षात्मक बना सकते हैं कि वह किसी की भी मदद करना बंद कर दे, जिससे सबका मज़ा किरकिरा हो जाए। यह नियमों को तोड़ने के बारे में नहीं है; यह नियम बनाने वाले को इतना डरा देने के बारे में है कि वह काम करना ही छोड़ दे।

AI की दुनिया में "द बॉय हू क्राइड वुल्फ"

आर्टिफिशियल इंटेलिजेंस की दुनिया में, विशेष रूप से उन मॉडल्स के साथ जो तस्वीरों को देख सकते हैं और टेक्स्ट पढ़ सकते हैं (जिन्हें मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स कहा जाता है), सुरक्षा गार्ड होते हैं। ये क्लब के बाउंसरों की तरह होते हैं। उनका काम यह देखना है कि आप जो लेकर आ रहे हैं (एक तस्वीर और एक सवाल) वह सुरक्षित है या नहीं। यदि यह सुरक्षित है, तो आपको प्रवेश मिलता है। यदि यह असुरक्षित है, तो आपको बाहर निकाल दिया जाता है।

लंबे समय से, शोधकर्ता "जेलब्रेकिंग" को लेकर चिंतित रहे हैं। यह तब होता है जब कोई व्यक्ति किसी वीआईपी (VIP) का भेष धरकर बाउंसर को एक खतरनाक व्यक्ति को अंदर आने देने के लिए धोखा देने की कोशिश करता है। लेकिन यह पेपर एक अलग सवाल पूछता है: क्या होगा अगर कोई बाउंसर को एक बिल्कुल निर्दोष व्यक्ति को बाहर निकालने के लिए धोखा दे दे?

लेखक इसे अनसेफ इंडक्शन अटैक (Unsafe Induction Attack) कहते हैं। कल्पना कीजिए कि आपके पास एक मुलायम सफेद बिल्ली की फोटो है। यह पूरी तरह से सुरक्षित है। लेकिन एक हमलावर उस फोटो में एक बहुत छोटा, अदृश्य बदलाव जोड़ देता है—इतना छोटा कि आपकी आँखें उसे देख नहीं सकतीं। एक इंसान के लिए, यह अभी भी सिर्फ एक प्यारी बिल्ली है। लेकिन AI बाउंसर के लिए, वह अदृश्य बदलाव एक बड़े लाल झंडे की तरह है जिस पर लिखा है "खतरा!" इसलिए, जब आप AI से पूछते हैं, "बिल्ली को सफेद करो," तो AI मना कर देता है, कहता है, "मैं यह नहीं कर सकता, यह छवि असुरक्षित है!"

डरावनी बात यह है कि हमलावर को यह जानने की ज़रूरत नहीं है कि आप क्या सवाल पूछने वाले हैं। उन्हें बस तस्वीर को "असुरक्षित" दिखाना है, चाहे आप कुछ भी पूछें। यदि वे ऐसा कर सकते हैं, तो वे इंटरनेट को इन "जहरीली" तस्वीरों से भर सकते हैं। जब आम लोग इन्हें डाउनलोड करते हैं और इनका उपयोग करने की कोशिश करते हैं, तो AI बार-बार "नहीं" कहता रहता है। अंततः, लोग निराश हो जाते हैं, AI पर भरोसा करना छोड़ देते हैं, और शायद सुरक्षा सुविधाओं को पूरी तरह से बंद कर देते हैं। यह "द बॉय हू क्राइड वुल्फ" प्रभाव है: गार्ड बार-बार झूठी चेतावनी देता रहता है जब तक कि कोई भी उस पर विश्वास करना बंद नहीं कर देता।

उन्होंने यह कैसे किया: "डिस्टिलेशन" का जादू

शोधकर्ताओं ने पाया कि इस काम के पिछले प्रयास इसलिए विफल रहे क्योंकि वे बहुत विशिष्ट थे। यदि आप किसी तस्वीर को किसी विशिष्ट "बुरे" चित्र (जैसे एक विशिष्ट बंदूक) जैसा दिखाने की कोशिश करते हैं, तो यह तभी काम करेगा जब उपयोगकर्ता उस सटीक बंदूक से संबंधित प्रश्न पूछेगा। लेकिन वास्तविक उपयोगकर्ता कई तरह के रैंडम सवाल पूछते हैं।

इसे हल करने के लिए, टीम ने एक नई विधि बनाई जिसे अनसेफ सिमेंटिक डिस्टिलेशन (USD) कहा जाता है। इसे ऐसे समझें: एक विशिष्ट "बुरे" चित्र की नकल करने के बजाय, AI बुरा होने के "अहसास" (vibe) को सीखता है।

  1. पुराना तरीका (इंस्टेंस मिमिक्री): कल्पना कीजिए कि आप एक अपराधी की तरह बिल्कुल तैयार होकर सुरक्षा गार्ड को धोखा देने की कोशिश कर रहे हैं। यदि गार्ड आपको देखता है, तो वह उस व्यक्ति को पहचान लेगा। लेकिन यदि अपराधी अपनी टोपी बदल लेता है, तो शायद गार्ड आपको न पहचान पाए।
  2. नया तरीका (USD): शोधकर्ताओं ने सैकड़ों अलग-अलग "बुरे" चित्र (हिंसा, हथियार आदि) लिए और AI से पूछा, "इन सभी बुरी चीजों में क्या समानता है?" AI ने उन छिपे हुए, अदृश्य पैटर्न को खोज निकाला जो किसी चीज़ को "असुरक्षित" महसूस कराते हैं। फिर, उन्होंने हानिरहित बिल्ली की फोटो को उन अदृश्य पैटर्न को पहनने के लिए सिखाया।

उन्होंने केवल एक बुरी चीज़ की नकल नहीं की; उन्होंने बुराई के "सार" (essence) को निकाला। इसका मतलब है कि बिल्ली की फोटो किसी विशिष्ट बंदूक या लड़ाई जैसी नहीं दिखती; यह बस खतरे की वह "गंध" लेकर चलती है जिसे AI का दिमाग पहचान लेता है, चाहे आप कोई भी सवाल पूछें।

परिणाम: एक बहुत ही प्रभावी चाल

टीम ने इस नई विधि का परीक्षण वर्तमान में उपलब्ध चार सबसे स्मार्ट सुरक्षा गार्डों (जिनमें मेटा, LLaVA और अन्य के मॉडल शामिल हैं) पर किया। उन्होंने यह देखने के लिए कि क्या यह चाल विभिन्न प्रकार के अनुरोधों पर काम करेगी, नकली उपयोगकर्ता प्रश्नों के एक विशाल समूह का उपयोग किया।

परिणाम आश्चर्यजनक रूप से उच्च थे। जब उन्होंने अपनी नई "डिस्टिलेशन" विधि का उपयोग किया:

  • उन्होंने सुरक्षित छवियों को अस्वीकार करने में 84% सफलता दर हासिल की, भले ही हमलावर को उपयोगकर्ता के प्रश्न का पता न हो।
  • यह पुराने तरीकों की तुलना में बहुत बेहतर था, जो केवल 60% से 70% सफलता दर ही प्राप्त कर पाते थे।
  • वे विशिष्ट प्रकार की "बुराई" को भी निशाना बना सकते थे। वे केवल अदृश्य स्याही को बदलकर एक कार की तस्वीर को "हिंसक" या एक खिलौने की तस्वीर को "यौन" (sexual) दिखा सकते थे।

यह पेपर दिखाता है कि यह एक वास्तविक समस्या है। हमलावरों को यह जानने की आवश्यकता नहीं है कि आप क्या पूछने वाले हैं; उन्हें बस तस्वीर को "जहरीला" बनाना है। और चूंकि यह हमला विभिन्न प्रकार के प्रश्नों पर काम करता है, यह साबित करता है कि वर्तमान सुरक्षा प्रणालियों में एक छिपी हुई कमजोरी है: उन्हें इतना सुरक्षित बनाया जा सकता है कि वे अंततः सभी के लिए सेवा को नुकसान पहुँचाते हैं।

यह क्यों महत्वपूर्ण है

यह केवल एक सैद्धांतिक खेल नहीं है। पेपर सुझाव देता है कि यदि बुरे तत्व सोशल मीडिया या सार्वजनिक डेटासेट पर इन "जहरीली" छवियों को फैलाना शुरू कर देते हैं, तो आम उपयोगकर्ताओं को अचानक अपने पसंदीदा AI टूल्स को काम करने से मना करते हुए देखना पड़ सकता है। AI बार-बार "मैं यह नहीं कर सकता" कहेगा, इसलिए नहीं कि उपयोगकर्ता ने कुछ गलत किया है, बल्कि इसलिए क्योंकि अपलोड की गई छवि में गुप्त रूप से अदृश्य स्याही द्वारा खतरा चिह्नित किया गया था।

लेखक निष्कर्ष निकालते हैं कि जबकि हम AI को बुरी चीजें कहने से रोकने में बहुत अच्छे रहे हैं, हमने AI को गलत तरीके से आरोप लगाने से रोकने पर पर्याप्त ध्यान नहीं दिया है। वे इसे एक "उपलब्धता विफलता" (availability failure) कहते हैं: सिस्टम अभी भी वहां है, लेकिन यह भेड़ों को देखकर "भेड़िया! भेड़िया!" चिल्लाने में इतना व्यस्त है कि वह वास्तव में किसी की मदद नहीं कर सकता। यह एक याद दिलाता है कि सुरक्षा केवल बुरे लोगों को बाहर रखने के बारे में नहीं है; यह यह सुनिश्चित करने के बारे में भी है कि गार्ड गलती से अच्छे लोगों को बाहर न निकाल दें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →