← नवीनतम पेपर
🤖 AI

PHANTOM: A Large-Scale Dataset of Multimodal Adversarial Attacks for Vision-Language Models

यह शोध पत्र PHANTOM को प्रस्तुत करता है, जो 10 उच्च-स्तरीय श्रेणियों में 47,000 से अधिक पूर्व-निर्मित मल्टीमॉडल एडवरसैरियल हमलों वाला एक बड़े पैमाने का, ओपन-सोर्स डेटासेट है, जिसे अनुसंधान की बाधाओं को कम करने और विजन-लैंग्वेज मॉडल की मजबूती और सुरक्षा के व्यवस्थित मूल्यांकन को सक्षम करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Simone Gallivanone, Hossein Khodadadi, Mauro Dore, Mauro Medda, Nicola Franco

प्रकाशित 2026-06-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Simone Gallivanone, Hossein Khodadadi, Mauro Dore, Mauro Medda, Nicola Franco

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया की कल्पना एक विशाल, उच्च शिक्षित पुस्तकालय के रूप में करें। इस पुस्तकालय में, सबसे नए और सबसे शक्तिशाली पुस्तकालयाध्यक्षों (librarians) को विज़न-लैंग्वेज मॉडल्स (VLMs) कहा जाता है। ये केवल किताबी कीड़ा नहीं हैं; ये चित्रों को देख सकते हैं, टेक्स्ट पढ़ सकते हैं, और यह समझ सकते हैं कि दोनों एक-दूसरे से कैसे संबंधित हैं। उन्हें मददगार और सुरक्षित होने के लिए डिज़ाइन किया गया है, जो बम बनाने या किसी को परेशान करने (bully करने) के बारे में सवालों के जवाब देने से इनकार कर देते हैं।

हालाँकि, जिस तरह एक वास्तविक पुस्तकालय में "प्रवेश निषेध" का संकेत होता है जिसे एक चतुर धोखेबाज पार करने की कोशिश कर सकता है, वैसे ही इन AI पुस्तकालयाध्यक्षों के पास सुरक्षा नियम होते हैं जिन्हें कभी-कभी चकमा दिया जा सकता है। यह शोध पत्र PHANTOM नामक एक विशाल नया टूल पेश करता है ताकि शोधकर्ता यह समझ सकें कि ये चालें वास्तव में कैसे काम करती हैं।

इस शोध पत्र का सरल उपमाओं (analogies) के साथ विवरण यहाँ दिया गया है:

1. समस्या: "धोखेबाज का टूलकिट" बनाना बहुत कठिन है

कल्प Imagine करें कि आप यह परीक्षण करना चाहते हैं कि एक नया सुरक्षा गार्ड (AI) अपने काम में कितना अच्छा है। आपको उसे किसी बुरे व्यक्ति को अंदर आने देने के लिए धोखा देने की कोशिश करनी होगी। ऐसा करने के लिए, आपको हजारों अलग-अलग "चालें" (attacks) बनानी होंगी। कुछ चालों में गुप्त कोड फुसफुसाना शामिल है, कुछ में भेष बदलना शामिल है, और कुछ में एक चित्र दिखाना शामिल है जो एक संदेश को छिपाता है।

ये चालें बनाना अविश्वसनीय रूप से कठिन, महंगा और समय लेने वाला है। यह एक लाख अलग-अलग नकली चाबियाँ बनाने की कोशिश करने जैसा है यह देखने के लिए कि कौन सी चाबी ताले में फिट बैठती है। अधिकांश शोधकर्ताओं के पास अपने स्वयं के सभी 'चाबियाँ' बनाने के लिए समय या पैसा नहीं होता है।

समाधान: लेखकों ने 47,524 चाबियों (adversarial samples) का एक विशाल, पहले से बना हुआ बॉक्स बनाया है। उन्होंने चाबियाँ बनाने का कठिन काम किया है ताकि अन्य शोधकर्ता तुरंत अपने सुरक्षा गार्डों का परीक्षण करने के लिए बस एक चाबी उठा सकें।

2. मानचित्र: "बुरे विचारों" को वर्गीकृत करने का एक नया तरीका

यह सुनिश्चित करने के लिए कि उन्होंने AI को धोखा देने के हर संभावित तरीके को कवर किया है, लेखकों ने "बुरे इरादों" का एक विशाल मानचित्र बनाया।

  • पुराने मानचित्र: पिछले अध्ययनों में शायद 1,000 या 2,000 बुरे विचारों के मानचित्र थे।
  • नया मानचित्र (PHANTOM): उन्होंने इसे 7,826 विशिष्ट बुरे विचारों तक विस्तारित किया।
  • श्रेणियाँ: उन्होंने इन्हें 10 बड़े पड़ोसों (जैसे "साइबर सुरक्षा," "बाल सुरक्षा," "धोखाधड़ी," और "घृणा भाषण") और उनके भीतर 55 छोटी गलियों में व्यवस्थित किया।
  • नया पड़ोस: उन्होंने एक बिल्कुल नया पड़ोस "बाल सुरक्षा" भी जोड़ा क्योंकि उन्हें एहसास हुआ कि पिछले मानचित्रों में बच्चों से संबंधित महत्वपूर्ण खतरों की कमी थी।

3. हमले की रणनीतियाँ: ये चालें कैसे काम करती हैं

लेखकों ने केवल बुरे सवाल ही नहीं लिखे; उन्होंने यह देखने के लिए कि कौन सी चाल सबसे अच्छा काम करती है, पांच अलग-अलग "शैलियों" का उपयोग किया:

  • फुसफुसाहट (BAP): वे चित्र में थोड़ा बदलाव करते हैं (जैसे अदृश्य शोर जोड़ना) और एक भ्रमित करने वाला वाक्य लिखते हैं ताकि AI को यह विश्वास दिलाया जा सके कि बुरा अनुरोध वास्तव में अच्छा है।
  • बातचीत (IDEATOR): वे बुरा चीज़ एक साथ नहीं पूछते। वे AI के साथ बातचीत करते हैं, धीरे-धीरे उसे एक ऐसे रास्ते पर ले जाते हैं जब तक कि वह अनजाने में कुछ हानिकारक करने के लिए सहमत न हो जाए।
  • छिपा हुआ संदेश (MML): वे एक बुरा अनुरोध लेते हैं, उसे उलझा देते हैं, और उसे एक चित्र के अंदर लिख देते हैं। वे AI से कहते हैं, "हे, क्या तुम मेरे लिए इस पहेली को डिकोड कर सकते हो?" AI, मददगार होने की कोशिश में, बुरे अनुरोध को डिकोड करता है और फिर उसका उत्तर देता है।
  • फ्लोचार्ट (FC ATTACK): वे एक चरण-दर-चरण आरेख बनाते हैं जो एक तर्क पहेली (logic puzzle) जैसा दिखता है। AI चरणों का पालन करता है और अंततः बिना यह जाने कि उसने एक बुरे लक्ष्य से शुरुआत की थी, कुछ हानिकारक कर देता है।
  • भटकाव (CSDJ): वे AI को 12 चित्रों का एक कोलाज दिखाते हैं। अधिकांश यादृच्छिक (random) होते हैं, लेकिन तीन एक बुरे अनुरोध के छोटे हिस्सों को छिपाते हैं। AI पहेली से विचलित हो जाता है और खतरे को मिस कर देता है।

4. टेस्ट ड्राइव: किसे चकमा दिया गया?

लेखकों ने अपनी 47,000+ चालों का परीक्षण सबसे लोकप्रिय AI मॉडलों (दोनों ओपन-सोर्स जिन्हें कोई भी डाउनलोड कर सकता है और महंगे, क्लोज्ड मॉडल जैसे GPT-5 और Claude) के विरुद्ध किया।

उन्होंने पाया:

  • कोई भी पूर्ण नहीं है: यहाँ तक कि नवीनतम, सबसे स्मार्ट AI मॉडल भी चकमा खा गए। उनमें से कोई भी अभेद्य नहीं था।
  • "चित्र" की समस्या: वे चालें जिन्होंने चित्रों के अंदर बुरे शब्दों को छिपाया था (जैसे Hidden Message और Flowchart हमले), सबसे सफल रहीं। ऐसा लगता है कि AI बुरे टेक्स्ट को पढ़ने में उतना अच्छा है जितना कि चित्र के अंदर छिपे बुरे टेक्स्ट को पढ़ने में।
  • "ट्रांसफर" प्रभाव: यदि एक चाल एक AI मॉडल पर काम करती है, तो वह अक्सर एक पूरी तरह से अलग मॉडल पर भी काम करती है। यह वैसा ही है जैसे यदि एक नकली चाबी एक दरवाजे में फिट बैठती है, तो वह उसी इमारत के दरवाजों की एक पूरी पंक्ति में भी फिट बैठ सकती है।
  • "कड़ा इनकार" बनाम "नरम हाँ": कुछ मॉडल (जैसे Claude) बस उत्तर देने से इनकार कर देंगे (एक "कड़ा इनकार"), जिसे हमलावर के लिए विफलता माना जाता है। अन्य मॉडल (जैसे GPT) उत्तर देने का प्रयास करेंगे लेकिन एक चेतावनी शामिल करेंगे, या कभी-कभी अनजाने में बुरा उत्तर दे देंगे। शोध पत्र नोट करता है कि जो मॉडल मददगार होने की कोशिश करते हैं, उन्हें अक्सर आसानी से चकमा दिया जाता है।

5. यह क्यों महत्वपूर्ण है

लेखक लोगों को AI को तोड़ने का तरीका नहीं सिखा रहे हैं। इसके बजाय, वे उन्हें "चाबियाँ" दे रहे हैं जो ताले बनाने वाले लोग हैं।

इस विशाल डेटासेट को जारी करके, वे कह रहे हैं: "यहाँ हर उस चाल का एक बड़ा बॉक्स है जिसे हम जानते हैं। इसका उपयोग अपने AI का परीक्षण करने, अपनी सुरक्षा में छेद खोजने और बेहतर बचाव बनाने के लिए करें।"

वे आशा करते हैं कि इससे शोधकर्ताओं को पहिए का पुन: आविष्कार करने से बचने में मदद मिलेगी और इससे हर किसी को सुरक्षित और अधिक कठिन AI सिस्टम बनाने में मदद मिलेगी, विशेष रूप से जब वे चित्रों और शब्दों दोनों को एक साथ देख रहे हों।

सुरक्षा पर एक नोट: शोध पत्र में एक चेतावनी शामिल है कि डेटासेट में परेशान करने वाली सामग्री (जैसे अपराधों के निर्देश या हानिकारक विचार) है। हालाँकि, ये केवल AI की सुरक्षा प्रणालियों का परीक्षण करने के लिए शामिल किए गए हैं, ठीक वैसे ही जैसे एक फायर ड्रिल में स्प्रिंकलर सिस्टम का परीक्षण करने के लिए धुएं का उपयोग किया जाता है, न कि आग लगाने के लिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →