Adversarial Diffusion Across Modalities: A Fusion Survey of Attacks, Defenses, and Evaluation for Text, Vision, and Vision-Language Models
यह सर्वेक्षण टेक्स्ट/LLMs, इमेज क्लासिफायर, विजन-लैंग्वेज मॉडल्स और प्यूरिफिकेशन डिफेसेज़ पर डिफ्यूजन-आधारित हमलों के चार पूर्व में असंबद्ध शोध पथों को एक एकल वैचारिक ढांचे में एकीकृत करता है, जिसमें एक एकीकृत वर्गीकरण, मूल्यांकन मानदंड और LLM डोमेन पर केंद्रित एक महत्वपूर्ण अनुसंधान एजेंडा शामिल है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया एक विशाल, हलचल भरे शहर की तरह है। इस शहर में, दो मुख्य समूह के लोग हैं: निर्माता (जो चैटबॉट्स और इमेज जनरेटर जैसे AI मॉडल बनाते हैं) और सुरक्षा निरीक्षक (जो उन प्रणालियों में सेंध लगाने की कोशिश करते हैं ताकि उनकी कमजोरियों का पता लगाया जा सके)।
लंबे समय से, ये दोनों समूह अलग-अलग मोहल्लों में काम कर रहे हैं। "टेक्स्ट मोहल्ला" (जहाँ चैटबॉट्स रहते हैं) और "इमेज मोहल्ला" (जहाँ चित्र बनाने वाले यंत्र रहते हैं) अलग-अलग उपकरणों का उपयोग कर रहे हैं, अलग भाषाएँ बोल रहे हैं, और अपनी खुद की बाड़ बना रहे हैं।
यह शोध पत्र एक सिटी प्लानर के मास्टर मैप की तरह है जो अंततः इन मोहल्लों को जोड़ता है। यह 50 अलग-अलग शोध पत्रों को एक साथ लाता है ताकि यह दिखाया जा सके कि कैसे एक विशिष्ट उपकरण जिसे "डिफ्यूजन मॉडल" (Diffusion Model) कहा जाता है, का उपयोग सुरक्षा निरीक्षकों द्वारा AI सिस्टम में घुसपैठ करने के लिए किया जा रहा है।
यहाँ इस शोध पत्र की कहानी का विवरण दिया गया, जिसमें सरल उपमाओं (analogies) का उपयोग किया गया है:
1. उपकरण: "डिफ्यूजन मॉडल" (The Diffusion Model)
डिफ्यूजन मॉडल को एक ऐसे स्मार्ट कलाकार के रूप में सोचें जो एक खाली कैनवास से शुरुआत करता है जो स्टैटिक नॉइज़ (जैसे टीवी पर दिखने वाली बर्फ/झिलमिलाहट) से ढका होता है।
- यह कैसे काम करता है: कलाकार धीरे-धीरे शोर (noise) को हटाता है, चरण-दर-चरण, जब तक कि एक स्पष्ट चित्र (या टेक्स्ट का स्पष्ट वाक्य) दिखाई न देने लगे।
- ट्विस्ट: आमतौर पर, इस कलाकार का उपयोग सुंदर कला या सहायक टेक्स्ट बनाने के लिए किया जाता है। लेकिन इस पेपर में, शोधकर्ता दिखाते हैं कि कैसे "रेड टीमर्स" (नैतिक हैकर्स) इस कलाकार का उपयोग नकली, चालाकी भरे इनपुट बनाने के लिए कर रहे हैं, जिन्हें AI सिस्टम को ऐसी चीजें बोलने के लिए मजबूर करने के लिए डिज़ाइन किया गया है जो उन्हें नहीं बोलनी चाहिए।
2. चार मोहल्ले (क्षेत्राधिकार)
यह पेपर शोध को चार अलग-अलग क्षेत्रों में व्यवस्थित करता है, जैसे शहर के चार अलग-अलग जिले:
डिस्ट्रिक्ट A: टेक्स्ट चैटबॉट्स (LLMs)
- स्थिति: यह सबसे नया और छोटा जिला है। यहाँ अब तक केवल 4 पेपर लिखे गए हैं।
- उपमा: कल्पना कीजिए कि एक चैटबॉट को बम बनाने की रेसिपी देने के लिए उसे चकमा देने की कोशिश करना। शोधकर्ता यह परीक्षण कर रहे हैं कि "शोर हटाने वाले कलाकार" का उपयोग करके सही 'ट्रिक क्वेश्चन' लिखने के विभिन्न तरीके क्या हैं। कुछ कलाकार विशेष रूप से बुरे प्रॉम्प्ट लिखने के लिए प्रशिक्षित किए गए हैं; अन्य बस "ऑफ-द-शेल्फ" कलाकार हैं जो बिना किसी अतिरिक्त प्रशिक्षण के इसमें कुशल हैं।
- समस्या: इनमें से अधिकांश चालें तभी काम करती हैं जब हमलावर को चैटबॉट के आंतरिक रहस्यों (जैसे इमारत के ब्लूप्रिंट) का पता हो। जब चैटबॉट एक "ब्लैक बॉक्स" (बंद प्रणाली) बन जाता है, तो ये चालें अक्सर विफल हो जाती हैं।
डिस्ट्रिक्ट B: इमेज क्लासिफायर (चित्र पुलिस)
- स्थिति: यह सबसे पुराना, भीड़भाड़ वाला जिला है जिसमें 18 पेपर हैं।
- उपमा: कल्पना कीजिए कि एक सुरक्षा गार्ड जो एक फोटो को देखता है और कहता है, "यह एक बिल्ली है।" हैकर्स यहाँ डिफ्यूजन कलाकार का उपयोग करके बिल्ली की तस्वीर में अदृश्य "शोर" जोड़ देते हैं ताकि गार्ड को लगे कि वह एक कुत्ता है।
- सबक: टेक्स्ट डिस्ट्रिक्ट, इमेज डिस्ट्रिक्ट की चालों की नकल करने की कोशिश कर रहा है, लेकिन उन्होंने अभी तक पिक्सेल (बिंदुओं) से शब्दों तक "शोर" को अनुवादित करना पूरी तरह से नहीं सीखा है।
डिस्ट्रिक्ट C: विजन-लैंग्वेज मॉडल्स (बहुभाषी कलाकार)
- स्थिति: इस जिले में 10 पेपर हैं। ये वे AI सिस्टम हैं जो चित्र भी देख सकते हैं और टेक्स्ट भी पढ़ सकते हैं।
- उपमा: कल्पना कीजिए कि एक रोबोट जो "Do Not Enter" के साइन को देखता है और उसका टेक्स्ट पढ़ता है। यहाँ हैकर्स अक्सर डिफ्यूजन कलाकार का उपयोग केवल चित्र बनाने के लिए करते हैं, लेकिन फिर वे रोबोट को धोखा देने के लिए टेक्स्ट लिखने हेतु एक अलग, पुराने टूल का उपयोग करते हैं। वे धोखेबाजी के लिए कलाकार के "दिमाग" का उपयोग नहीं कर रहे हैं; वे केवल इसे एक पेंटब्रश की तरह उपयोग कर रहे हैं।
डिस्ट्रिक्ट D: रक्षक (ढाल बनाने वाले)
- स्थिति: यह एक छोटा समूह है जिसमें केवल 4 पेपर हैं।
- उपमा: जबकि हैकर्स घुसपैठ करने के नए तरीके गढ़ने में व्यस्त हैं, रक्षक ढालें बना रहे हैं। कुछ ढालें उसी "शोर हटाने" वाली तकनीक का उपयोग करती हैं ताकि AI के देखने से पहले ही एक चालाकी भरे इनपुट को साफ किया जा सके।
- कमी: पेपर एक बड़ा असंतुलन बताता है: हैकर्स के पास कई नए खिलौने हैं, लेकिन रक्षकों की ढालों का अभी तक नए हैकर खिलौनों के खिलाफ परीक्षण नहीं किया गया है।
3. बड़ी समस्याएँ (कमजोरियाँ)
लेखक वर्तमान सुरक्षा प्रणाली में पांच प्रमुख छिद्रों की ओर इशारा करने वाले जासूसों की भूमिका निभाते हैं:
- "ग्लास हाउस" की समस्या: अधिकांश हैकर केवल इसलिए सफल होते हैं क्योंकि वे लक्षित AI के दिमाग के अंदर देख सकते हैं (White-Box)। जब लक्ष्य एक बंद, गुप्त AI (जैसे कोई कमर्शियल चैटबॉट) होता है, तो हमले अक्सर विफल हो जाते हैं।
- "शब्द बनाम पिक्सेल" का अंतर: हैकर्स अच्छे चित्र बनाने में माहिर हैं, लेकिन वे उसी उन्नत तकनीक का उपयोग करके बुरे शब्द बनाने में संघर्ष कर रहे हैं। वे अभी भी टेक्स्ट के लिए पुराने, धीमे टूल्स का उपयोग कर रहे हैं।
- "फिल्टर" की अनदेखी: हैकर्स दावा करते हैं कि उनकी चालें "गुप्त" (low perplexity) हैं, लेकिन उन्होंने वास्तव में आधुनिक सुरक्षा फिल्टरों के खिलाफ इनका परीक्षण नहीं किया है जो वास्तविक कंपनियाँ उपयोग करती हैं। यह दावा करने जैसा है कि एक चाबी "अदृश्य" है बिना दरवाजा खोलने की कोशिश किए।
- "वन-शॉट" की सीमा: सभी वर्तमान हमले एकल संदेश हैं। उन्होंने डिफ्यूजन कलाकार का उपयोग करके एक लंबी, आगे-पीछे की बातचीत (back-and-forth conversation) करने का तरीका नहीं निकाला है जो धीरे-धीरे AI को धोखा दे सके।
- "क्लोज्ड डोर" का अंतर: अधिकांश परीक्षण खुले, मुफ्त AI मॉडल पर किए जाते हैं। उन महंगे, बंद कमर्शियल मॉडल्स पर बहुत कम परीक्षण किए गए हैं जिनका लोग वास्तव में वास्तविक दुनिया में उपयोग करते हैं।
4. रोडमैप (आगे क्या?)
पेपर भविष्य के शोधकर्ताओं के लिए एक 'टू-डू लिस्ट' के साथ समाप्त होता है:
- ढालों का परीक्षण करें: नए "शोर हटाने वाले" ढालों को लें और उन्हें नवीनतम "शोर बनाने वाले" हमलों के साथ तोड़ने की कोशिश करें।
- बेहतर शब्द-कलाकार बनाएँ: ऐसे उपकरण बनाएँ जो केवल छवियों के लिए नहीं, बल्कि विशेष रूप से टेक्स्ट के लिए उन्नत "डिफ्यूजन" पद्धति का उपयोग करते हों।
- वास्तविक दुनिया से जुड़ें: केवल मुफ्त मॉडल पर परीक्षण करना बंद करें और बड़े, बंद कमर्शियल मॉडल्स पर परीक्षण करना शुरू करें ताकि यह देखा जा सके कि क्या ये चालें वास्तव में वास्तविक दुनिया में काम करती हैं।
सारांश
यह पेपर एक एकीकृत मार्गदर्शिका (unified guidebook) है। यह हमें बताता है कि जहाँ "इमेज" की दुनिया ने AI को हैक करने के लिए डिफ्यूजन मॉडल का उपयोग करने की कला में महारत हासिल कर ली है, वहीं "टेक्स्ट" की दुनिया अभी भी पीछे रहने की कोशिश कर रही है। यह रेखांकित करता है कि हमारे पास कई नए, शक्तिशाली उपकरण हैं, लेकिन हमने अभी तक उन्हें सबसे मजबूत सुरक्षा या सबसे महत्वपूर्ण लक्ष्यों के खिलाफ पूरी तरह से परखा नहीं है। लेखक मूल रूप से कह रहे हैं: "हमारे पास नक्शा है, हम जानते हैं कि छेद कहाँ हैं, और यहाँ बताया गया है कि हमें आगे कहाँ खुदाई करने की आवश्यकता है।"
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।