← नवीनतम पेपर
💻 computer science

Universal Image Immunization against Diffusion-based Image Editing via Semantic Injection

यह शोध पत्र इमेज इम्यूनाइजेशन (image immunization) के लिए पहले यूनिवर्सल एडवर्सरियल परटर्बेशन फ्रेमवर्क का प्रस्ताव करता है जो एक एकल, इमेज-अग्नोस्टिक परटर्बेशन उत्पन्न करता है ताकि मूल सिमेंटिक्स को एक लक्षित सिमेंटिक के साथ ओवरराइट करके अनधिकृत डिफ्यूजन-आधारित इमेज एडिटिंग को प्रभावी ढंग से रोका जा सके, जो मौजूदा इमेज-विशिष्ट विधियों की तुलना में बेहतर प्रदर्शन और ब्लैक-बॉक्स ट्रांसफरेबिलिटी प्राप्त करता है।

मूल लेखक: Chanhui Lee, Donggyu Choi, Seunghyun Shin, Hae-Gon Jeon, Jeany Son

प्रकाशित 2026-07-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chanhui Lee, Donggyu Choi, Seunghyun Shin, Hae-Gon Jeon, Jeany Son

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास अपने कुत्ते की एक अनमोल फोटो है, और आप इसे एक शरारती AI एडिटर से सुरक्षित रखना चाहते हैं जो केवल एक वाक्य टाइप करके तस्वीर में कुछ भी बदल सकता है, जैसे "इस कुत्ते को बिल्ली जैसा बना दो।"

वर्तमान में, अपनी फोटो को सुरक्षित रखने के तरीके एक तरह से हर एक फोटो के लिए एक व्यक्तिगत बॉडीगार्ड नियुक्त करने जैसे हैं। यदि आपके पास 1,000 फोटो हैं, तो आपको 1,000 अलग-अलग बॉडीगार्डों को प्रशिक्षित करना होगा। यह धीमा, महंगा है, और हर बार फोटो साझा करने के लिए बहुत अधिक कंप्यूटर पावर की आवश्यकता होती है।

यह पेपर एक नया, स्मार्ट समाधान पेश करता है: एक एकल, सार्वभौमिक "जादुई ढाल" जो किसी भी फोटो पर काम करती है।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. समस्या: "डीपफेक" एडिटर

डिफ्यूजन मॉडल (DALL-E या Stable Diffusion जैसे टूल्स के पीछे का AI) इमेज एडिटिंग करने में अद्भुत हैं। लेकिन इनका उपयोग डीपफेक बनाने या बिना अनुमति के कॉपीराइट वाली कला को बदलने के लिए भी किया जा सकता है। इसे रोकने के लिए, शोधकर्ताओं ने छवियों को "प्रतिरक्षित" (immunize) करने की कोशिश की है, जिसमें एक सूक्ष्म, अदृश्य शोर (एडवर्सरियल परटर्बेशन) जोड़ा जाता है जो AI को भ्रमित कर देता है।

  • पुराना तरीका (इमेज-विशिष्ट): एक कुत्ते की फोटो को सुरक्षित करने के लिए, आप उस कुत्ते के लिए विशेष रूप से एक अद्वितीय "शोर पैटर्न" (noise pattern) बनाने के लिए एक जटिल गणना चलाते हैं। कार की फोटो को सुरक्षित करने के लिए, आपको यह सब फिर से करना पड़ता है। यह दीवार की हर एक ईंट पर एक अनूठा ढाल हाथ से पेंट करने जैसा है।
  • पेपर का तरीका (सार्वभौमिक): उन्होंने एक ही एकल शोर पैटर्न बनाया जिसे आप किसी भी फोटो (एक कुत्ता, एक कार, एक व्यक्ति) पर चिपका सकते हैं ताकि AI भ्रमित हो जाए। यह एक ही स्टिकर होने जैसा है जिसे आप किसी भी ईंट पर लगा सकते हैं ताकि दीवार AI को अलग दिखाई दे।

2. गुप्त मंत्र: "सिमेंटिक इंजेक्शन" (Semantic Injection)

एक छोटा सा स्टिकर हर अलग इमेज के लिए AI को कैसे भ्रमित कर सकता है? लेखक "सिमेंटिक इंजेक्शन" नामक एक ट्रिक का उपयोग करते हैं।

कल्पना कीजिए कि AI एडिटर एक शेफ (रसोइया) है जो एक व्यंजन (संपादित छवि) पकाने के लिए एक रेसिपी (टेक्स्ट प्रॉम्प्ट) का पालन करता है।

  • हमला (The Attack): लेखक चाहते हैं कि शेफ मेज पर मौजूद वास्तविक सामग्रियों (आपकी मूल फोटो) को अनदेखा कर दे और इसके बजाय एक "भूतिया सामग्री" (ghost ingredient) के आधार पर कुछ पूरी तरह से अलग पकाए जिसे उन्होंने चुपके से वहां डाला है।
  • ट्रिक: वे अपने सार्वभौमिक स्टिकर को इस तरह प्रशिक्षित करते हैं कि वह AI को एक विशिष्ट लक्ष्य अवधारणा (target concept) का "भ्रम" (hallucinate) दिखाए। उदाहरण के लिए, वे स्टिकर को इस तरह प्रशिक्षित कर सकते हैं कि जब AI एक गाय की तस्वीर देखे, तो उसे लगे कि वह रोनाल्डो (प्रसिद्ध फुटबॉलर) को देख रहा है।
  • परिणाम: जब आप AI से कहते हैं "गाय पर टोपी पहनाओ," तो AI, स्टिकर के कारण भ्रमित होकर, सोचता है कि वह वास्तव में रोनाल्डो को एडिट कर रहा है। वह या तो फुटबॉलर पर टोपी पहना देगा या एक अजीब, विफल इमेज बना देगा। मूल गाय प्रभावी रूप से AI के दिमाग से मिटा दी जाती है।

3. सफलता के दो चरण

इसे काम करने के लिए, शोधकर्ताओं ने दो "लॉस फंक्शन्स" (जो केवल कंप्यूटर के लिए गणितीय लक्ष्य हैं) का उपयोग किया:

  1. लक्ष्य को इंजेक्ट करें: AI को वास्तविक चीज़ के बजाय "भूतिया सामग्री" (जैसे, रोनाल्डो) देखने के लिए मजबूर करें।
  2. मूल को दबा दें: AI को वास्तविक सामग्री (गाय) को पूरी तरह से भूल जाने के लिए कहें।

यह एक गाय पर "रोनाल्डो" की तेज़ गंध लगाने जैसा है ताकि शेफ केवल रोनाल्डो को सूंघे और गाय को अनदेखा कर दे, और साथ ही गाय की गंध को शून्य कर दे।

4. यह एक बड़ी बात क्यों है

  • अंत में शून्य लागत: एक बार जब आप इस "जादुई ढाल" को बना लेते हैं (जिसमें कंप्यूटर पर कुछ समय लगता है), तो आप इसे किसी भी नई फोटो पर तुरंत लागू कर सकते हैं। यह बस एक साधारण जोड़ है, जैसे कोई फ़िल्टर जोड़ना। आपको शक्तिशाली कंप्यूटर की आवश्यकता नहीं है; आप इसे एक सामान्य फोन पर भी कर सकते हैं।
  • हर जगह काम करता है: पेपर दिखाता है कि यह एकल ढाल विभिन्न प्रकार के AI मॉडल (केवल उसी पर नहीं जिस पर इसे प्रशिक्षित किया गया था) पर काम करती है और तब भी काम करती है जब AI इमेज से शोर को "साफ" करने की कोशिश कर रहा हो।
  • वास्तविक फोटो की आवश्यकता नहीं: आश्चर्यजनक रूप से, उन्होंने दिखाया कि आप वास्तविक फोटो (जैसे गाय या लोग) का उपयोग किए बिना भी इस ढाल को बना सकते हैं। आप इसे रैंडम, बिखरे हुए पहेली के टुकड़ों का उपयोग करके प्रशिक्षित कर सकते हैं, और यह वास्तविक छवियों पर भी काम करता है।

सारांश

इस पेपर को एक सार्वभौमिक "ग्लिच" स्प्रे का आविष्कार करने के रूप में सोचें। संग्रहालय की हर एक पेंटिंग को व्यक्तिगत रूप से ठीक करने के बजाय, आप पूरी गैलरी पर एक ऐसा स्प्रे छिड़कते हैं जो सुरक्षा कैमरों (AI) को वास्तव में वहां मौजूद दृश्य के बजाय पूरी तरह से अलग दृश्य दिखाता है। यदि कोई चोर कला को संपादित करने के लिए कैमरों का उपयोग करने की कोशिश करता है, तो कैमरे भ्रमित हो जाते हैं और विफल हो जाते हैं, जिससे मूल कला सुरक्षित रहती है।

लेखक दावा करते हैं कि यह डिफ्यूजन-आधारित इमेज एडिटिंग के लिए बनाया गया पहला ऐसा सार्वभौमिक, एक-सा-सबके-लिए (one-size-fits-all) रक्षा तंत्र है, जो उपयोगकर्ता के लिए लगभग बिना किसी अतिरिक्त प्रयास के मजबूत सुरक्षा प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →