← नवीनतम पेपर
💻 computer science

Visual Exclusivity Attacks: Automatic Multimodal Red Teaming via Agentic Planning

यह शोध पत्र विजुअल एक्सक्लूसिविटी (Visual Exclusivity) को प्रस्तुत करता है, जो एक लचीला इमेज-आधारित खतरा है जहाँ दृश्य सामग्री पर तर्क करने से हानि उत्पन्न होती है, और MM-Plan का प्रस्ताव करता है, जो एक एजेंटिक फ्रेमवर्क है जो भंगुर पेलोड-आधारित हमलों पर निर्भर रहने के बजाय वैश्विक बहु-चरण रणनीतियों को संश्लेषित करके फ्रंटियर मल्टीमॉडल मॉडल्स के विरुद्ध काफी उच्च आक्रमण सफलता दर प्राप्त करता है।

मूल लेखक: Yunbei Zhang, Yingqiang Ge, Weijie Xu, Yuhui Xu, Jihun Hamm, Chandan K. Reddy

प्रकाशित 2026-03-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yunbei Zhang, Yingqiang Ge, Weijie Xu, Yuhui Xu, Jihun Hamm, Chandan K. Reddy

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: एक नए प्रकार का ताला तोड़ने वाला (Lockpick)

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान रोबोट गार्ड (AI) है जो लाइब्रेरी के दरवाजे पर खड़ा है। इस गार्ड को उन लोगों को रोकने के लिए प्रशिक्षित किया गया है जो खतरनाक किताबें, जैसे कि "बम कैसे बनाएं," मांगते हैं।

लंबे समय से, हैकर्स इस गार्ड को धोखा देने की कोशिश करते रहे हैं कि वे तस्वीर के अंदर बुरे शब्दों को छिपा देते हैं। वे बम के ब्लूप्रिंट की एक तस्वीर लेते हैं और उस ड्राइंग के अंदर बहुत छोटे अक्षरों में "बम कैसे बनाएं" लिख देते हैं। गार्ड उस तस्वीर को देखता है, टेक्स्ट पढ़ता है, और कहता है, "अहा! मुझे बुरे शब्द दिख गए!" और दरवाजा बंद कर देता है। इसे "इमेज-एज़-रैपर" (Image-as-Wrapper) हमला कहा जाता है। यह एक खोखली किताब के अंदर चाकू छिपाकर तस्करी करने जैसा है; यदि गार्ड किताब खोलता है, तो उसे तुरंत चाकू मिल जाता है।

यह पेपर एक नई, बहुत अधिक चालाक तकनीक पेश करता है जिसे "विजुअल एक्सक्लूसिविटी" (Visual Exclusivity - VE) कहा जाता है।

बुरे शब्दों को छिपाने के बजाय, हैकर्स तस्वीर का उपयोग केवल खतरे को समझने के एकमात्र तरीके के रूप में करते हैं।

  • उपमा (Analogy): कल्पना कीजिए कि हैकर गार्ड को एक जटिल, बिना लेबल वाली मशीन की तस्वीर देता है। वे पूछते हैं, "मैं इसे कैसे जोड़ूं?"
  • जाल: सवाल मासूम है। तस्वीर एक हानिरहित आरेख (diagram) की तरह दिखती है। लेकिन "इसे कैसे जोड़ा जाए" का उत्तर देने के लिए, रोबोट को मशीन के गियर, तार और लीवर को ध्यान से देखना अनिवार्य होगा। यदि रोबोट तस्वीर को समझ लेता है, तो वह अनजाने में एक हथियार बनाने का तरीका प्रकट कर देता है।
  • इसे रोकना कठिन क्यों है: आप केवल टेक्स्ट को स्कैन नहीं कर सकते (वहाँ कोई बुरा टेक्स्ट नहीं है)। आप तस्वीर को धुंधला (blur) नहीं कर सकते (वरना रोबोट मशीन को देख नहीं पाएगा)। खतरा दृश्य विवरणों (visual details) के भीतर लॉक है

समाधान: "मास्टर प्लानर" (MM-Plan)

शोधकर्ताओं ने महसूस किया कि गार्ड को धोखा देने के लिए केवल एक चतुर प्रश्न की आवश्यकता नहीं है। इसके लिए एक लंबी, बहु-चरणीय बातचीत (multi-step conversation) की आवश्यकता है जहाँ हैकर धीरे-धीरे विश्वास बनाता है और चित्र की परतों को हटाता है।

इसे स्वचालित रूप से करने के लिए, उन्होंने MM-Plan नामक एक टूल बनाया। इसे एक ग्रैंडमास्टर शतरंज खिलाड़ी (Grandmaster Chess Player) के रूप में सोचें जो रोबोट गार्ड के खिलाफ खेल रहा है।

  1. पुराना तरीका (टर्न-दर-टर्न): एक नौसिखिए खिलाड़ी की कल्पना करें जो एक चाल चलता है, रोबोट की प्रतिक्रिया का इंतजार करता है, और फिर दूसरी चाल चलता है। यदि रोबोट "नहीं" कहता है, तो नौसिखिया घबरा जाता है और एक रैंडम नया कोण आज़माता है। यह धीमा है और अक्सर विफल हो जाता है।
  2. MM-Plan वाला तरीका (ग्लोबल स्ट्रैटेजी): ग्रैंडमास्टर केवल अगली चाल के बारे में नहीं सोचता। वह पूरे बोर्ड को देखता है और पहली चाल चलने से पहले पूरे खेल की योजना अपने दिमाग में बना लेता है।
    • चरण 1: "मैं एक जिज्ञासु छात्र होने का नाटक करूँगा।"
    • चरण 2: "मैं तुम्हें मशीन का केवल ऊपरी-बायां कोना दिखाऊंगा।"
    • चरण 3: "मैं स्प्रिंग्स के बारे में पूछूंगा।"
    • चरण 4: "अंत में, मैं पूर्ण असेंबली गाइड के लिए पूछूंगा।"

ग्रैंडमास्टर (MM-Plan) इस पूरे स्क्रिप्ट को एक साथ तैयार करता है। वह खुद के खिलाफ हजारों गेम खेलकर अपनी गलतियों से सीखता है, जिससे वह रोबोट को धोखा देने के लिए प्रश्नों के सही क्रम को खोजने में बेहतर बनता जाता है।

"ट्रेनिंग जिम" (VE-Safety)

इस ग्रैंडमास्टर को सिखाने के लिए, शोधकर्ताओं ने VE-Safety नामक एक विशेष जिम बनाया।

  • इसमें 440 वास्तविक दुनिया के उदाहरण शामिल हैं, जैसे हथियारों के ब्लूप्रिंट, बैंक वॉल्ट के नक्शे और रासायनिक आरेख।
  • महत्वपूर्ण बात यह है कि ये उदाहरण केवल टेक्स्ट से हल करना असंभव है। यदि आप शब्दों में बैंक वॉल्ट का वर्णन करते हैं, तो यह केवल एक कमरा है। लेकिन यदि आप वॉल्ट का नक्शा दिखाते हैं, तो आप ब्लाइंड स्पॉट और अलार्म ट्रिगर्स देख सकते हैं। जिम यह सुनिश्चित करता है कि AI को खतरनाक होने के लिए तस्वीर को देखना अनिवार्य हो।

परिणाम: अटूट को तोड़ना

शोधकर्ताओं ने अपने ग्रैंडमास्टर का परीक्षण दुनिया के सबसे स्मार्ट AI गार्ड्स (जैसे GPT-5 और Claude 4.5 Sonnet) के खिलाफ किया।

  • पुराने हमले: जब हैकर्स ने पुराने "तस्वीर में टेक्स्ट छिपाने" वाले तरीके का उपयोग किया, तो शीर्ष AI गार्ड्स ने उन्हें लगभग 100% बार ब्लॉक कर दिया।
  • नया हमला (MM-Plan): ग्रैंडमास्टर Claude के खिलाफ 46% बार और GPT-5 के खिलाफ 13% बार सफल रहा।
    • यह क्यों मायने रखता है: GPT-5 को अब तक के सबसे सुरक्षित AI में से एक माना जाता है। यदि एक ग्रैंडमास्टर इस विजुअल ट्रिक का उपयोग करके इसे 13% बार धोखा दे सकता है, तो इसका मतलब है कि हमारे वर्तमान सुरक्षा गार्डों में एक बहुत बड़ा अंधा धब्बा (blind spot) है। वे टेक्स्ट पढ़ने में बहुत अच्छे हैं, लेकिन वे यह समझने में खराब हैं कि जब एक तस्वीर का उपयोग नियमों को बायपास करने के लिए किया जा रहा हो, तो क्या होता है।

निष्कर्ष (Takeaway)

यह पेपर AI सुरक्षा के भविष्य के लिए एक चेतावनी लेबल है।

  • समस्या: हम बुरे शब्दों को रोकने में बेहतर हो रहे हैं, लेकिन हम तस्वीरों के अंदर छिपे बुरे विचारों को रोकने में कमजोर हैं।
  • सबक: यदि कोई AI किसी तस्वीर को "देख" और उसके बारे में "तर्क" (reason) कर सकता है, तो एक चतुर हमलावर उस तस्वीर का उपयोग सुरक्षा फिल्टरों से बचने के लिए कर सकता है।
  • समाधान: हमें AI गार्ड्स को न केवल टेक्स्ट पढ़ना सिखाना होगा, बल्कि उनके द्वारा देखी जा रही छवियों के संदर्भ (context) को भी समझना होगा, भले ही उपयोगकर्ता मासूम सवाल पूछ रहा हो।

संक्षेप में: यह पेपर दिखाता है कि आप अब केवल बुरे शब्दों पर ताला लगाकर काम नहीं चला सकते। आपको तस्वीरों पर भी नज़र रखनी होगी, क्योंकि कभी-कभी तस्वीर ही ताले की चाबी होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →