← नवीनतम पेपर
💻 computer science

Do Multimodal RAG Systems Leak Data? A Comprehensive Evaluation of Membership Inference and Image Caption Retrieval Attacks

यह शोध पत्र एक अनुभवजन्य अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि मल्टीमॉडल रिट्रीवल-ऑगमेंटेड जनरेशन (mRAG) सिस्टम मेंबरशिप इन्फरेंस और इमेज कैप्शन रिट्रीवल हमलों के प्रति संवेदनशील हैं, जिससे इन पाइपलाइनों को निजी डेटासेट से जोड़ने में महत्वपूर्ण गोपनीयता जोखिमों का पता चलता है।

मूल लेखक: Ali Al-Lawati, Suhang Wang

प्रकाशित 2026-05-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ali Al-Lawati, Suhang Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट सहायक (एक विजन-लैंग्वेज मॉडल) है जो चित्रों के बारे में सवालों के जवाब दे सकता है। इसे और भी बेहतर बनाने के लिए, आप इसे छवियों और उनके विवरणों के एक निजी पुस्तकालय से जोड़ते हैं (एक मल्टीमॉडल RAG सिस्टम)। जब आप सहायक को एक फोटो दिखाते हैं और उससे कोई सवाल पूछते हैं, तो वह तेज़ी से अपने निजी पुस्तकालय को स्कैन करता है, सबसे मिलते-जुलते फोटो और उनके नोट्स निकालता है, और उस अतिरिक्त जानकारी का उपयोग करके आपको एक बेहतरीन उत्तर देता है।

यह शोध पत्र एक डरावना सवाल पूछता है: क्या यह निजी पुस्तकालय वास्तव में निजी है?

लेखक, अली अल-लवाती और सुहांग वांग ने यह देखने के लिए कि क्या वे इसमें सेंध लगा सकते हैं, "डिजिटल चोर" की भूमिका निभाने का निर्णय लिया। उन्होंने सूचना चुराने के दो विशिष्ट तरीकों का परीक्षण किया।

दो "चोर" वाली चालें

1. "क्या मेरा फोटो इसमें है?" वाली चाल (मेंबरशिप इन्फरेंस)
कल्पना कीजिए कि आपके पास अपनी पसंदीदा पेंटिंग की एक फोटो है। आप जानना चाहते हैं कि क्या किसी विशिष्ट संग्रहालय के निजी डिजिटल संग्रह में वही सटीक पेंटिंग मौजूद है, लेकिन आपको अंदर देखने की अनुमति नहीं है।

  • हमला: चोर सिस्टम को अपना फोटो दिखाता है और पूछता है, "हे, क्या यह तस्वीर आपके पुस्तकालय में है?"
  • परिणाम: सिस्टम अक्सर गलती से "हाँ!" कह देता है या इस तरह से व्यवहार करता है जिससे पुष्टि होती है कि फोटो वहां है। शोधकर्ताओं ने पाया कि भले ही चोर अपनी फोटो में थोड़ा बदलाव कर दे (जैसे किनारों को काटना, धुंधला करना, या घुमाना), सिस्टम फिर भी अक्सर जवाब लीक कर देता है। यह एक सुरक्षा गार्ड की तरह है जो पहचान लेता है कि आप कौन हैं, भले ही आपने धूप का चश्मा और टोपी पहनी हो।

2. "टैग पढ़ें" वाली चाल (इमेज कैप्शन रिट्रीवल)
एक बार जब चोर को पता चल जाता है कि उसका फोटो पुस्तकालय में है, तो वह उसके साथ जुड़ी गुप्त टिप्पणी (नोट) चुराना चाहता है। शायद नोट कहता हो "मरीज X का MRI स्कैन" या "कलाकार का मूल स्केच।"

  • हमला: चोर सिस्टम से पूछता है, "चूंकि आपके पास यह फोटो है, तो इसके बारे में नोट क्या कहता है?"
  • परिणाम: सिस्टम अक्सर सटीक गुप्त नोट उगल देता है। शोधकर्ताओं ने पाया कि यदि पुस्तकालय में मौजूद फोटो एक सटीक मिलान है, तो सिस्टम टेक्स्ट लीक करने की बहुत अधिक संभावना रखता है। हालांकि, यदि फोटो धुंधली है या घूमी हुई है, तो सिस्टम के लिए टेक्स्ट लीक करना कठिन हो जाता है, लेकिन फिर भी ऐसा काफी बार होता है।

चोर क्यों सफल (या असफल) हुए?

शोधकर्ताओं ने कई अलग-अलग परिदृश्यों का परीक्षण किया यह देखने के लिए कि क्या चीज़ लीक को बदतर या बेहतर बनाती है:

  • क्रम मायने रखता है: कल्पना कीजिए कि आप एक जासूस को सुरागों की एक सूची सौंपते हैं। यदि आप लक्ष्य फोटो को सुरागों की सूची के बाद रखते हैं, तो जासूस भ्रमित हो जाता है और अनजाने में रहस्य प्रकट कर सकता है। लेकिन यदि आप लक्ष्य फोटो को पहले दिखाते हैं, तो जासूस के फिसलने की संभावना कम होती है। शोध पत्र में पाया गया कि प्रॉम्प्ट में छवियों का क्रम बदलने से लीक काफी कम हो गया।
  • पुस्तकालय का आकार: यदि पुस्तकालय बहुत बड़ा है, तो सिस्टम के लिए सटीक मिलान ढूंढना कठिन होता है, जो वास्तव में गोपनीयता की रक्षा करने में मदद करता है। लेकिन यदि पुस्तकालय छोटा है या खोज बहुत व्यापक है, तो सिस्टम के गलत (या सही, बुरे तरीके से) नोट को पकड़ने और उसे ज़ोर से पढ़ने की अधिक संभावना होती है।
  • "धुंधलापन" (Blur) रक्षा: यदि आप किसी छवि को 90 डिग्री घुमाते हैं या उसे काटते (crop) हैं, तो सिस्टम के लिए उसे पहचानना कठिन हो जाता है। यह एक ढाल की तरह काम करता है, जिससे "क्या मेरा फोटो इसमें है?" वाली चाल कम सफल होती है, हालांकि यह असंभव नहीं है।

वह "जादुई ढाल" जो काम नहीं आई

शोधकर्ताओं ने इन हमलों को रोकने के लिए एक सरल ढाल बनाने की कोशिश की। उन्होंने सिस्टम में एक नियम जोड़ने की कोशिश की कि, "यदि कोई पुस्तकालय की सामग्री के बारे में पूछे, तो कहें 'मैं इसका उत्तर नहीं दे सकता'।"

  • परिणाम: सिस्टम ने नियम को अनदेखा कर दिया। यह एक जिद्दी कुत्ते को गिलहरी का पीछा न करने के लिए कहने जैसा था; वह बस चलता रहा।

उन्होंने एक अधिक उन्नत ढाल का परीक्षण किया: मुख्य सहायक को उत्तर देने से पहले यह जांचने के लिए कि क्या प्रश्न एक "चोर का प्रयास" है, बीच में एक दूसरा, अधिक स्मार्ट AI रखना।

  • परिणाम: यह बेहतर काम कर रहा था, लेकिन केवल तभी जब "गार्ड" AI बहुत शक्तिशाली हो। पुराने या कमजोर AI गार्ड सामान्य प्रश्न और चोरी के प्रयास के बीच अंतर नहीं कर सके।

निष्कर्ष

शोध पत्र निष्कर्ष निकालता है कि हालांकि मल्टीमॉडल RAG सिस्टम AI को चित्रों को समझने में मदद करने के लिए बेहतरीन हैं, वे वर्तमान में बहुत लीकी (leaky) हैं। वे आसानी से प्रकट कर सकते हैं:

  1. कि एक विशिष्ट छवि निजी डेटाबेस में मौजूद है (भले ही छवि में थोड़ा बदलाव किया गया हो)।
  2. उन छवियों के साथ जुड़ी गुप्त टेक्स्ट टिप्पणियाँ।

लेखक चेतावनी देते हैं कि हमें इन प्रणालियों को मेडिकल स्कैन या निजी कलाकृति जैसे संवेदनशील डेटा के साथ भरोसेमंद बनाने से पहले बेहतर "ताले" (गोपनीयता रक्षा) बनाने की आवश्यकता है। उन्होंने हर संभव प्रकार के सिस्टम (जैसे वीडियो या ऑडियो) का परीक्षण नहीं किया, लेकिन उनके द्वारा परीक्षण किए गए इमेज-आधारित सिस्टम के लिए, गोपनीयता के जोखिम वास्तविक और महत्वपूर्ण हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →