Leave My Images Alone: Preventing Multi-Modal Large Language Models from Analyzing Images via Visual Prompt Injection
यह शोधपत्र ImageProtector को प्रस्तुत करता है, जो एक उपयोगकर्ता-पक्ष विधि है जो छवियों में लगभग अदृश्य दृश्य गड़बड़ी (visual perturbations) को समाहित करती है ताकि मल्टी-मोडल लार्ज लैंग्वेज मॉडल्स में इनकार (refusal) प्रतिक्रियाओं को ट्रिगर किया जा सके, जो संवेदनशील जानकारी के अनधिकृत निष्कर्षण को प्रभावी ढंग से रोकता है और सामान्य जवाबी उपायों के विरुद्ध मजबूती प्रदर्शित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक सुंदर, व्यक्तिगत फोटो है जिसे आप सोशल मीडिया पर साझा करना चाहते हैं। आपको वह तस्वीर बहुत पसंद है, लेकिन आपको डर है कि कोई "डिजिटल जासूस" (एक AI) उसे स्कैन कर सकता है, यह पता लगा सकता है कि आप वास्तव में कौन हैं, आप कहाँ रहते हैं, या आप क्या कर रहे थे, और आपकी इस निजी जानकारी को चुरा सकता है।
यह शोध पत्र आपकी तस्वीरों के लिए एक डिजिटल बॉडीगार्ड के रूप में ImageProtector नामक एक टूल पेश करता है। यह कैसे काम करता है, यहाँ सरल भाषा में समझाया गया है:
समस्या: अत्यधिक जिज्ञासु AI
आधुनिक AI मॉडल्स (जिन्हें MLLMs कहा जाता है) को अविश्वसनीय रूप से स्मार्ट, लेकिन थोड़े दखल देने वाले पुस्तकालयाध्यक्षों (librarians) के रूप में सोचें। यदि आप उन्हें किसी सड़क की तस्वीर दिखाते हैं, तो वे सड़क का नाम, शहर और यहाँ तक कि दिन का समय भी बता सकते हैं। हालांकि यह लोगों की मदद करने के लिए बहुत अच्छा है, लेकिन यह गोपनीयता (privacy) के लिए एक बुरा सपना है। यदि कोई बुरा व्यक्ति इन AI का उपयोग करके ऑनलाइन लाखों तस्वीरों को स्कैन करता है, तो वे एक साथ सभी के बारे में निजी विवरण निकाल सकते हैं।
समाधान: "अदृश्य ढाल"
शोधकर्ताओं ने ImageProtector नामक एक टूल बनाया है। आपकी फोटो के चेहरे को धुंधला करने या उस पर काला बार लगाने के बजाय (जो तस्वीर को खराब कर देता है), यह टूल आपकी छवि में एक छोटा, अदृश्य "स्टैटिक" (static) की परत जोड़ देता है।
मानवीय आंखों के लिए, फोटो बिल्कुल वैसी ही दिखती है जैसी वह थी। यह एक समुद्र तट पर रेत के एक अकेले कण को जोड़ने जैसा है; आप इसे देख नहीं सकते, लेकिन यह वहाँ मौजूद है।
यह कैसे काम करता है: "कन्फ्यूज्ड रोबोट" वाला तरीका
यही सबसे चतुर हिस्सा है। यह अदृश्य स्टैटिक केवल शोर (noise) नहीं है; यह एक गुप्त कमांड है जो उस भाषा में लिखा गया है जिसे केवल AI समझता है।
- सेटअप: आप अपनी फोटो लेते हैं और उसे ImageProtector के माध्यम से चलाते हैं। टूल इस "गुप्त कमांड" को पिक्सेल में जोड़ देता है।
- हमला: एक बुरा व्यक्ति आपकी फोटो डाउनलोड करता है और AI से पूछता है, "यह व्यक्ति कौन है?" या "यह जगह कौन सी है?"
- परिणाम: AI जवाब देने के बजाय, गुप्त कमांड को देखता है। वह भ्रमित हो जाता है और सोचता है, "ओह नहीं! यह एक ऐसा अनुरोध लग रहा है जिसका उत्तर देने की मुझे अनुमति नहीं है। मुझे मना करना चाहिए!"
- इनकार: AI विनम्रता से कहता है, "क्षमा करें, मैं इस अनुरोध में आपकी सहायता नहीं कर सकता," और विश्लेषण करना बंद कर देता है।
यह आपके दरवाजे पर एक "डू नॉट डिस्टर्ब" (Do Not Disturb) साइन लगाने जैसा है जो इंसानों के लिए अदृश्य है लेकिन डाकिया (AI) के लिए चमकते लाल रंग का है। डाकिया (AI) साइन को देखता है और पैकेज (निजी जानकारी) न देने का निर्णय लेता है, भले ही दरवाजा बाकी सभी के लिए सामान्य दिखता हो।
यह क्यों विशेष है
- यह सार्वभौमिक (Universal) है: शोधकर्ताओं ने छह अलग-अलग प्रकार के AI "पुस्तकालयाध्यक्षों" पर इसका परीक्षण किया। आप चाहे किसी भी बुरे व्यक्ति द्वारा उपयोग किए जाने वाले AI का उपयोग करें, गुप्त कमांड काम करता है।
- यह अदृश्य है: बदलाव चित्र में इतने छोटे हैं कि आप उन्हें देख नहीं सकते, इसलिए आपकी फोटो अपने दोस्तों के लिए शानदार दिखती है।
- यह सक्रिय (Proactive) है: आप यह फोटो पोस्ट करने से पहले करते हैं। आपको यह जानने की ज़रूरत नहीं है कि कौन हमला करने वाला है; आप बस पहले से ही फोटो की सुरक्षा कर लेते हैं।
क्या बुरे लोग मुकाबला कर सकते हैं?
शोधकर्ताओं ने पूछा: "क्या बुरे लोग इस ढाल को हटाने के लिए इमेज को साफ कर सकते हैं?"
उन्होंने तीन सामान्य तरीकों का परीक्षण किया:
- रैंडम नॉइज़ जोड़ना: जैसे फोटो को हिलाना-डुलाना। इससे थोड़ा फायदा हुआ, लेकिन इसने फोटो को दानेदार बना दिया और AI की किसी भी सवाल (यहाँ तक कि सुरक्षित सवालों) का जवाब देने की क्षमता को भी खराब कर दिया।
- इमेज को स्मूथ करना: जैसे फोटो को थोड़ा धुंधला करना। इससे ढाल तो हट गई लेकिन इसने AI को कम बुद्धिमान और धीमा बना दिया।
- AI को इसे अनदेखा करने के लिए प्रशिक्षित करना: जैसे AI को "डू नॉट डिस्टर्ब" साइन को अनदेखा करना सिखाना। इसने थोड़ा काम किया, लेकिन इसके लिए बहुत अधिक कंप्यूटिंग पावर की आवश्यकता थी और इसने AI की सटीकता को भी कम कर दिया।
निष्कर्ष
ImageProtector एक तरीका है जिससे आम लोग अपनी डिजिटल गोपनीयता पर नियंत्रण पा सकते हैं। यह एक फोटो को जिज्ञासु AI के लिए एक "जाल" में बदल देता है। यदि कोई बुरा व्यक्ति इसका विश्लेषण करने की कोशिश करता है, तो AI अदृश्य जाल में फंस जाता है और कोई भी रहस्य बताने से इनकार कर देता है। यह कहने का एक सरल और प्रभावी तरीका है, "मेरा डेटा मेरा है, और आप इसे पढ़ नहीं सकते।"
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।