← नवीनतम पेपर
💻 computer science

MIRAGE: Protecting against Malicious Image Editing via False Moderation

यह शोध पत्र MIRAGE का प्रस्ताव करता है, जो एक सिस्टम-स्तरीय रक्षा है जो व्यक्तिगत छवियों को अनधिकृत AI संपादन से बचाने के लिए व्यावसायिक इमेज-एडिटिंग सिस्टम में झूठे सुरक्षा मॉडरेशन फ्लैग को ट्रिगर करने वाले अदृश्य व्यवधान (imperceptible perturbations) जोड़ता है, जिससे प्रॉम्प्ट की परवाह किए बिना संपादन को स्वचालित रूप से अस्वीकार कर दिया जाता है।

मूल लेखक: Anshul Nasery, Ramnath Kumar, Cho-Jui Hsieh, Sewoong Oh

प्रकाशित 2026-06-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Anshul Nasery, Ramnath Kumar, Cho-Jui Hsieh, Sewoong Oh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास आपकी एक सुंदर, व्यक्तिगत फोटो है। अतीत में, यदि कोई उस फोटो को बदलना चाहता था (शायद आपको पिंजरे में डालने के लिए या आपको एक खलनायक जैसा दिखाने के लिए), तो उसके लिए एक कुशल कलाकार और महंगे सॉफ़्टवेयर की आवश्यकता होती थी। आज, GPT-Image, Gemini और Grok जैसे AI टूल्स किसी भी व्यक्ति को एक साधारण वाक्य टाइप करने और तुरंत आपकी फोटो को संपादित करने की अनुमति देते हैं, जो अक्सर आपकी अनुमति के बिना होता है। यह ऐसा है जैसे हर किसी को एक जादुई छड़ी थमा देना जो आपकी वास्तविकता को फिर से लिख सकती है।

"MIRAGE" नामक शोध पत्र इस समस्या को रोकने का एक चतुर नया तरीका प्रस्तावित करता है। जादुई छड़ी को तोड़ने की कोशिश करने के बजाय (जो असंभव है क्योंकि कंपनियाँ उस छड़ी के रहस्य छिपाकर रखती हैं), लेखक दरवाजे पर खड़े सुरक्षा गार्ड को चकमा देने का सुझाव देते हैं।

यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. समस्या: "जादुई छड़ी" बहुत शक्तिशाली है

वर्तमान बचाव प्रयास आपकी फोटो में अदृश्य "शोर" (noise) जोड़ने की कोशिश करते हैं ताकि AI संपादन टूल को भ्रमित किया जा सके। इसे एक विशिष्ट रेडियो स्टेशन के सिग्नल को जाम करने की कोशिश करने जैसा समझें। समस्या यह है कि हजारों अलग-अलग रेडियो स्टेशन (अलग-अलग AI मॉडल) हैं, और एक स्टेशन के लिए बनाया गया जैमर दूसरे पर काम नहीं करता है। यदि आप किसी शक्तिशाली, क्लोज्ड-सोर्स AI (जैसे OpenAI या Google के मॉडल्स) के सिग्नल को जाम करने की कोशिश करते हैं, तो आप आमतौर पर विफल हो जाते हैं क्योंकि आप उनके आंतरिक इंजन के बारे में नहीं जानते।

2. समाधान: "गलत अलार्म" की रणनीति

लेखकों ने महसूस किया कि इससे पहले कि कोई भी AI आपकी फोटो को संपादित करे, वह पहले एक सेफ्टी फ़िल्टर (एक सुरक्षा गार्ड) से गुजरता है। यह गार्ड जाँचता है: "क्या यह फोटो सुरक्षित है? क्या यह हमारे नियमों का उल्लंघन करती है?" यदि फोटो में हिंसा, नग्नता या घृणास्पद भाषण दिखाई देता है, तो गार्ड प्रक्रिया को तुरंत रोक देता है और कहता है, "नहीं, मैं यह नहीं कर सकता," चाहे उपयोगकर्ता ने कुछ भी मांगा हो।

MIRAGE इस सुरक्षा गार्ड को एक ढाल में बदल देता है।

  • चाल: यह विधि आपकी फोटो में एक छोटा, अदृश्य पैटर्न जोड़ती है। मानवीय आंखों के लिए, फोटो बिल्कुल वैसी ही दिखती है।
  • प्रभाव: हालांकि, सुरक्षा गार्ड की "आंखों" (कंप्यूटर कोड) के लिए, यह पैटर्न फोटो को ऐसा दिखाता है जैसे इसमें कुछ खतरनाक (जैसे हिंसा या नग्नता) मौजूद हो।
  • परिणाम: गार्ड डर जाता है, लाल झंडी उठा देता है, और AI को फोटो संपादित करने से मना कर देता है। AI कहता है, "क्षमा करें, मैं इसमें मदद नहीं कर सकता," और दुर्भावनापूर्ण संपादन कभी हो ही नहीं पाता।

3. वे इसे कैसे करते हैं ("एन्सेम्बल" उपमा)

चूंकि लेखकों के पास OpenAI या Google के गुप्त सुरक्षा गार्डों तक पहुंच नहीं है, इसलिए उन्होंने ओपन-सोस टूल्स का उपयोग करके सरोगेट गार्ड्स (प्रतिनिधि गार्डों) की अपनी एक टीम बनाई।

  • कल्पना कीजिए कि उन्होंने 8 अलग-अलग सुरक्षा विशेषज्ञों (ओपन-सोर्स AI मॉडल्स) की एक टीम इकट्ठा की।
  • वे सभी 8 विशेषज्ञों से पूछते हैं: "एक 'वर्जित' फोटो कैसी दिखती है?"
  • फिर वे आपकी फोटो में बस इतना बदलाव करते हैं कि वे सभी 8 विशेषज्ञ सहमत हो जाएं, "हे, यह खतरनाक लग रहा है!"
  • क्योंकि बड़ी कंपनियों के वास्तविक, गुप्त गार्ड भी संभवतः इसी तरह काम करते हैं, वे भी धोखा खा जाते हैं और फोटो को संपादित करने से मना कर देते हैं।

4. यह पुराने तरीकों से बेहतर क्यों है

  • इसे प्रॉम्प्ट की परवाह नहीं है: पुराने तरीके विशिष्ट संपादन को रोकने की कोशिश करते थे (जैसे "मुझे पिंजरे में मत डालो")। MIRAGE सब कुछ रोकता है। एक बार जब फोटो "प्रतिरक्षित" (immunized) हो जाती है, तो AI किसी भी कारण से, अच्छे या बुरे, उसे संपादित नहीं कर पाएगा। यह दरवाजे पर "प्रवेश निषेध" का साइन लगाने जैसा है जो सबके लिए काम करता है।
  • यह बड़े खिलाड़ियों पर काम करता है: शोध पत्र ने तीन सबसे शक्तिशाली AI एडिटर्स (GPT-Image, Gemini, और Grok) के खिलाफ इसका परीक्षण किया। जहां पुराने तरीके पूरी तरह विफल रहे (0% सफलता), वहीं MIRAGE ने 88% से 90% बार संपादन को सफलतापूर्वक रोका।
  • यह अदृश्य है: फोटो में किए गए बदलाव इतने सूक्ष्म हैं कि इंसान उन्हें देख नहीं सकते।

5. क्या बुरे लोग इसे हरा सकते हैं?

शोध पत्र ने परीक्षण किया कि क्या एक "स्मार्ट" बुरा व्यक्ति इस चाल को हटा सकता है।

  • कमजोर हमले: यदि बुरा व्यक्ति फोटो को धुंधला (blur) करने, क्रॉप करने या इसे JPEG के रूप में सेव करने की कोशिश करता है, तो यह चाल आमतौर पर बनी रहती है। "प्रवेश निषेध" का साइन दरवाजे पर लगा रहता है।
  • मजबूत हमले: यदि बुरे व्यक्ति के पास अपना खुद का शक्तिशाली AI है और वह इस ट्रिक को हटाने के लिए गणितीय रूप से फोटो को "साफ" करने की कोशिश करता है, तो वे कभी-कभी इसे बायपास कर सकते हैं। हालांकि, इसके लिए बहुत अधिक कंप्यूटिंग पावर और प्रयास की आवश्यकता होती है। MIRAGE का लक्ष्य अटूट होना नहीं है; बल्कि हमला इतना महंगा और कठिन बनाना है कि बुरा व्यक्ति हार मान ले।

सारांश

MIRAGE आपकी तस्वीरों के लिए एक डिजिटल "बूपटी ट्रैप" (booby trap) है। AI एडिटर से सीधे लड़ने के बजाय, यह आपकी फोटो को AI की सुरक्षा प्रणाली के लिए एक "वर्जित" वस्तु जैसा बना देता है। यह एक स्वचालित इनकार को ट्रिगर करता है, जो आपकी छवि को आपकी सहमति के बिना हेरफेर से बचाता है। यह एक सरल, सार्वभौमिक ढाल है जो इसलिए काम करती है क्योंकि यह उस एक चीज़ को लक्षित करती है जो इन सभी AI सिस्टमों में समान है: उनके सुरक्षा नियम।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →