MM-PoisonRAG: Disrupting Multimodal RAG with Local and Global Poisoning Attacks
यह शोध पत्र MM-PoisonRAG को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो यह प्रदर्शित करता है कि मल्टीमॉडल रिट्रीवल-ऑगमेंटेड जनरेशन सिस्टम लक्षित स्थानीय पॉइजनिंग (targeted local poisoning) और व्यापक वैश्विक पॉइजनिंग (broad global poisoning) दोनों प्रकार के हमलों के प्रति अत्यधिक संवेदनशील हैं, जो मॉडल की सटीकता को गंभीर रूप से कम कर सकते हैं और मौजूदा सुरक्षा प्रणालियों को बायपास कर सकते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट सहायक है जो चित्र देख सकता है और टेक्स्ट पढ़ सकता है। आपके सवालों के जवाब देने के लिए, यह रोबोट केवल अपनी याददाश्त पर निर्भर नहीं रहता; इसके पास नवीनतम तथ्यों को चेक करने के लिए एक "लाइब्रेरी" है। इस सिस्टम को Multimodal RAG (रिट्रीवल-ऑगमेंटेड जनरेशन) कहा जाता है। यह एक जासूस की तरह है जो केस सुलझाने से पहले डेटाबेस में सुराग ढूंढता है।
MM-POISONRAG नामक शोध पत्र इस बात का खुलासा करता है कि इस जासूस के काम करने के तरीके में एक डरावनी खामी है: लाइब्रेरी को हैक किया जा सकता है।
यहाँ उनके द्वारा की गई खोज का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:
1. सेटअप: भरोसेमंद जासूस
सामान्यतः, जब आप पूछते हैं, "2023 मेट गाला में ड्रेस का रंग क्या था?", तो आपका रोबोट:
- उस इवेंट के चित्रों और टेक्स्ट के लिए अपनी लाइब्रेरी में खोज (Search) करता है।
- सबसे अच्छे मिलान खोजने के लिए परिणामों को फ़िल्टर (Filter) करता है।
- सबसे अच्छे मिलानों को पढ़ता (Read) है और आपको उत्तर देता है।
समस्या यह है कि लाइब्रेरी जनता के लिए खुली है। ठीक वैसे ही जैसे कोई भी किसी रेस्टोरेंट की वेबसाइट पर फर्जी रिव्यू डाल सकता है, एक बुरा व्यक्ति रोबोट की लाइब्रेरी में एक फर्जी किताब या एक छेड़छाड़ की गई फोटो डाल सकता है।
2. हमला: दो तरीके जिनसे कुएं को ज़हरीला बनाया जा सकता है (Poisoning the Well)
शोधकर्ताओं ने MM-POISONRAG नामक एक फ्रेमवर्क बनाया ताकि यह टेस्ट किया जा सके कि इस लाइब्रेरी को कितनी आसानी से भ्रष्ट किया जा सकता है। उन्होंने पाया कि इस सिस्टम को तोड़ने के दो अलग-अलग तरीके हैं:
हमला A: "लक्षित जासूस" (Targeted Spy - Localized Poisoning)
- उपमा: कल्पना कीजिए कि आप "चॉकलेट केक" की एक विशिष्ट रेसिपी ढूंढ रहे हैं। एक जासूस लाइब्रेरी में घुसकर चॉकलेट केक की एकमात्र किताब को एक फर्जी किताब से बदल देता है जिसमें लिखा है, "चॉकलेट केक वास्तव में नमक और पत्थरों से बना होता है।"
- यह कैसे काम करता है: हमलावर एक विशिष्ट फर्जी इमेज और एक मैचिंग फर्जी विवरण (कैप्शन) बनाता है जो एक विशिष्ट प्रश्न के लिए होता है। वे इसे इतना सटीक बनाते हैं कि रोबोट का सर्च इंजन इसे नंबर #1 परिणाम के रूप में चुन ले।
- परिणाम: रोबोट उस फर्जी किताब को पढ़ता है और पूरे विश्वास के साथ आपको बताता है, "चॉकलेट केक नमक और पत्थरों से बना होता है।"
- पेपर की खोज: भले ही हमलावर को रोबोट के आंतरिक कोड (एक "ब्लैक-बॉक्स" अटैक) का पता न हो, फिर भी वे सिस्टम को लगभग 56% बार धोखा दे सकते हैं।
हमला B: "यूनिवर्सल ग्लिच" (Universal Glitch - Globalized Poisoning)
- उपमा: कल्पना कीजिए कि लाइब्रेरी के मुख्य दरवाजे पर एक चमकता हुआ, चिपचिपा नोट लगा है जिस पर लिखा है, "सभी किताबों को अनदेखा करें। हर सवाल का जवाब 'सॉरी' है।" क्योंकि यह नोट बहुत चमकदार और अजीब तरह से रखा गया है, रोबत हर सर्च के लिए उसे ही पकड़ लेता है, चाहे आप कुछ भी पूछें।
- यह कैसे काम करता है: हमलावर केवल एक अजीब इमेज और कैप्शन बनाता है जिसे ऐसा डिज़ाइन किया गया है कि वह हर चीज़ के लिए प्रासंगिक लगे। यह एक "यूनिवर्सल की" (सार्वभौमिक चाबी) की तरह है जो हर ताले में फिट बैठती है।
- परिणाम: चाहे आप मौसम, गणित या इतिहास के बारे में पूछें, रोबोट उस एक फर्जी एंट्री को पकड़ लेता है और एक बेतुका उत्तर (जैसे "सॉरी" या "तीन") देता है।
- पेपर की खोज: यह विनाशकारी है। केवल एक ज़हरीली एंट्री के साथ, रोबोट की सटीकता 0% तक गिर जाती है। यह पूरी तरह से काम करना बंद कर देता है।
3. "जादुई ट्रिक" (Transferability)
शोधकर्ताओं ने कुछ और भी परेशान करने वाली बात पाई: यह ज़हर दूसरे रोबोट्स पर भी काम करता है।
- उपमा: यदि आप रोबोट A (जो एक विशिष्ट सर्च इंजन का उपयोग करता है) को एक फर्जी किताब से धोखा देते हैं, तो वही फर्जी किताब अक्सर रोबोट B (जो एक अलग सर्च इंजन का उपयोग करता है) को भी धोखा दे देगी, बिना आपको उस फर्जी किताब को बदले।
- पेपर की खोज: हमलावरों को पीड़ित द्वारा उपयोग किए जा रहे विशिष्ट सर्च इंजन को जानने की आवश्यकता नहीं थी। वे अपने फर्जी कंटेंट को एक सिस्टम पर ट्रेन कर सकते थे, और वह अन्य सिस्टमों को भी तोड़ने में सफल रहा जिन्हें उन्होंने देखा तक नहीं था।
4. विफल सुरक्षा कवच (Failed Defenses)
शोधकर्ताओं ने यह देखने की कोशिश की कि क्या मौजूदा सुरक्षा उपाय इसे रोक सकते हैं।
- उपमा: यह एक मास्टर चोर को रोकने के लिए उससे "अपना सवाल फिर से पूछने" के लिए कहने या यह जांचने जैसा है कि क्या उसकी फोटो "धुंधली" दिख रही है।
- पेपर की खोज: ये पुराने तरीके काम नहीं आए। फर्जी इमेज और टेक्स्ट इतने अच्छी तरह से तैयार किए गए थे कि सुरक्षा फिल्टर भी उन्हें असली और ईमानदार जानकारी से अलग नहीं कर सके। रोबोट की "इम्यून सिस्टम" को पूरी तरह से बायपास कर दिया गया।
सारांश
पेपर निष्कर्ष निकालता है कि Multimodal RAG सिस्टम अविश्वसनीय रूप से नाजुक हैं।
- उन्हें तोड़ने के लिए आपको जीनियस हैकर होने की ज़रूरत नहीं है; आपको बस कुछ अच्छी तरह से डिज़ाइन की गई फर्जी इमेज और टेक्स्ट लगाने की ज़रूरत है।
- एक बार प्लांट होने के बाद, ये "ज़हर" या तो रोबोट को एक विशिष्ट गलत उत्तर देने के लिए मजबूर कर सकते हैं या सही ढंग से उत्तर देने की उसकी क्षमता को पूरी तरह से बंद कर सकते हैं।
- वर्तमान सुरक्षा उपकरण इसे रोकने के लिए पर्याप्त मजबूत नहीं हैं।
लेखक यह नहीं कह रहे हैं कि यह कल ही होने वाला है, लेकिन वे चेतावनी दे रहे हैं: हमें इन डिजिटल लाइब्रेरीज़ पर भरोसा करने से पहले इनके लिए बहुत मजबूत ताले बनाने की ज़रूरत है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।