← नवीनतम पेपर
💻 computer science

SLICE: Semantic Latent Injection via Compartmentalized Embedding for Image Watermarking

यह शोध पत्र SLICE का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त (training-free) इमेज वॉटरमार्किंग फ्रेमवर्क है जो छवि अर्थशास्त्र (image semantics) को चार विशिष्ट कारकों में अलग करके और उन्हें प्रारंभिक डिफ्यूजन नॉइज़ के विशिष्ट क्षेत्रों से जोड़कर, सिमेंटिक एडिटिंग हमलों के विरुद्ध मजबूती को बढ़ाता है ताकि सूक्ष्म छेड़छाड़ का पता लगाया जा सके और उसे स्थानीयकृत किया जा सके।

मूल लेखक: Zheng Gao, Yifan Yang, Xiaoyu Li, Xiaoyan Feng, Haoran Fan, Yang Song, Jiaojiao Jiang

प्रकाशित 2026-03-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zheng Gao, Yifan Yang, Xiaoyu Li, Xiaoyan Feng, Haoran Fan, Yang Song, Jiaojiao Jiang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रसिद्ध कलाकार हैं जो सुंदर परिदृश्य (landscapes) पेंट करते हैं। आप यह सुनिश्चित करना चाहते हैं कि यदि कोई आपकी पेंटिंग की नकल करता है और उसके विवरण बदल देता है—जैसे कि कुत्ते की जगह बिल्ली रख देना या सुहावने मौसम को तूफानी मौसम में बदल देना—तो वे यह दावा न कर सकें कि यह आपका मूल, अपरिवर्तित कार्य है।

AI की दुनिया में, "पेंटिंग" डिफ्यूजन मॉडल्स (वे इंजन जो शून्य से चित्र बनाते हैं) द्वारा की जाती है। लंबे समय तक, वैज्ञानिकों ने उस शुरुआती शोर (noise) में एक गुप्त "फिंगरप्रिंट" छिपाने की कोशिश की जिससे AI की रचना शुरू होती है।

पुराने वॉटरमार्क की समस्या:
पुराने वॉटरमार्क को पूरी पेंटिंग पर रखे गए एक एकल, विशाल स्टैम्प की तरह समझें।

  • यदि कोई हमलावर पेंटिंग लेकर उसमें कुत्ते को बदलकर बिल्ली कर देता है, तो स्टैम्प अभी भी वहीं रहता है। सिस्टम कहता है, "यह प्रामाणिक है!" क्योंकि स्टैम्प नष्ट नहीं हुआ है।
  • हमलावर जीत जाता है क्योंकि उसने चित्र के अर्थ (कहानी) को बदल दिया है लेकिन स्टैम्प (प्रमाण) को नहीं तोड़ा है।
  • हाल के "स्मार्ट" वॉटरमार्क्स ने पूरी कहानी को देखने की कोशिश करके इसे ठीक करने का प्रयास किया, लेकिन उन्होंने अभी भी कहानी को एक बड़े, अटूट ब्लॉक के रूप में माना। यदि उन्होंने कुत्ते को बदल दिया, तो पूरी कहानी अभी भी "काफी हद तक समान" थी, इसलिए वॉटरमार्क वैध बना रहा।

समाधान: SLICE (एक "चार-खंड वाला" सिस्टम)
इस शोध पत्र के लेखकों ने महसूस किया कि एक चित्र केवल एक बड़ी चीज़ नहीं है; यह विभिन्न भागों का एक संग्रह है। वे एक नया तरीका लेकर आए जिसे "सेमेंटिक लेटेंट इंजेक्शन वाया कंपार्टमेंटलाइज़्ड एम्बेडिंग" कहा जाता है।

यह सुनने में कठिन लग सकता है, लेकिन आइए इसे एक सरल उपमा से समझते हैं: "चार-दराज वाली मेज" (The Four-Drawer Desk)।

1. चार दराज (Decomposition)

पूरी छवि पर एक विशाल स्टैम्प लगाने के बजाय, SLICE चित्र के अर्थ को चार विशिष्ट श्रेणियों में विभाजित करता है:

  1. विषय (Subject): मुख्य पात्र कौन या क्या है? (जैसे, एक छोटा लड़का)।
  2. वातावरण (Environment): वे कहाँ हैं? (जैसे, एक घास वाला पार्क)।
  3. क्रिया (Action): वे क्या कर रहे हैं? (जैसे, दौड़ना)।
  4. विवरण (Detail): कौन सी विशिष्ट विशेषताएं उभर कर आती हैं? (जैसे, एक लाल शर्ट)।

2. गुप्त लॉकर (Compartmentalized Embedding)

SLICE उस "शोर" (raw ingredients) को लेता है जिसका उपयोग AI चित्र बनाने के लिए करता है और उसे चार अलग-अलग, गैर-अतिव्यापी क्षेत्रों (non-overlapping zones) में विभाजित करता है।

  • "विषय" की जानकारी क्षेत्र A में लॉक की जाती है।
  • "वातावरण" क्षेत्र B में जाता है।
  • "क्रिया" क्षेत्र C में जाती है।
  • "विवरण" क्षेत्र D में जाता है।

यह एक ऐसी डेस्क की तरह है जिसमें चार दराज हैं, जिनमें से प्रत्येक का अपना अनूठा, गुप्त ताला है। आप क्षेत्र A की कुंजी के बिना क्षेत्र A को नहीं खोल सकते।

3. सत्यापन प्रक्रिया (जासूस)

जब कोई आपको एक चित्र दिखाता है और आपसे पूछता है, "क्या यह आपका मूल है, या इसमें कोई बदलाव किया गया है?", तो SLICE एक चेकलिस्ट के साथ एक जासूस की तरह काम करता है:

  • चरण 1: यह चित्र को देखता है और एक AI "जासूस" (एक विज़न-लैंग्वेज मॉडल) से उन चार भागों का फिर से वर्णन करने के लिए कहता है: "यह कौन है? वे कहाँ हैं? वे क्या कर रहे हैं? विवरण क्या हैं?"
  • चरण 2: यह इन नए विवरणों के आधार पर प्रत्येक के चार क्षेत्रों के लिए गुप्त "ताले" को फिर से बनाने की कोशिश करता है।
  • चरण 3: यह चित्र में छिपे मूल तालों के साथ पुनर्गठित तालों की तुलना करता है।

जादुई परिणाम: स्थानीयकृत पहचान (Localized Detection)

यहाँ SLICE पुराने तरीकों की तुलना में चमकता है:

  • परिदृश्य A (यदि पूरी छवि नकली है): यदि चित्र पूरी तरह से अलग है (जैसे, लड़के के बजाय कार की तस्वीर), तो चारों दराज विफल हो जाएंगे। सिस्टम कहता है: "यह आपकी छवि नहीं है।"
  • परिदृश्य B (एक "स्मार्ट" हमला): कल्पना कीजिए कि एक हमलावर लड़के को लड़की में बदल देता है, लेकिन पार्क और दौड़ने की क्रिया को समान रखता है।
    • पुराना वॉटरमार्क: कहेगा, "यह काफी हद तक समान है, इसलिए यह प्रामाणिक है!" (गलत सकारात्मक/False Positive)।
    • SLICE: दराजों की जाँच करता है।
      • विषय दराज: FAIL (लड़का बनाम लड़की)।
      • क्रिया दराज: PASS (अभी भी दौड़ रहा है)।
      • वातावरण दराज: PASS (अभी भी एक पार्क है)।
      • विवरण दराज: FAIL (लाल शर्ट शायद गायब हो गई हो)।
    • फैसला: SLICE कहता है, "यह आपकी छवि है, लेकिन विषय और विवरण के साथ छेड़छाड़ की गई है!" यह केवल "नकली" नहीं कहता; यह सटीक रूप से बताता है कि क्या बदला गया है।

यह क्यों महत्वपूर्ण है

  • यह ट्रेनिंग-मुक्त है (Training-Free): आपको विशाल AI मॉडलों को फिर से प्रशिक्षित करने की आवश्यकता नहीं है। यह हमारे पास मौजूद मॉडलों के साथ काम करता है।
  • यह मजबूत है (Robust): भले ही हमलावर वॉटरमार्क को छिपाने के लिए अन्य AI उपकरणों का उपयोग करके चित्र को "पुनर्जीवित" (regenerate) करने का प्रयास करें, वे एक साथ सभी चार विशिष्ट "तालों" को आसानी से ठीक नहीं कर सकते बिना चित्र को खराब किए।
  • यह गुणवत्ता बनाए रखता है: क्योंकि वॉटरमार्क "शोर" के विशिष्ट, छोटे क्षेत्रों में छिपा होता है, अंतिम चित्र मूल के बिल्कुल समान दिखता है। कोई धुंधले धब्बे या अजीब निशान नहीं आते।

एक कमजोरी (और उसका समाधान)

शोध पत्र स्वीकार करता है कि यदि कोई व्यक्ति कैंची लेकर चित्र को आक्रामक रूप से काटता और आकार बदलता है (क्रॉपिंग और स्केलिंग), तो "दराज" अस्त-व्यस्त हो सकते हैं, और सिस्टम भ्रमित हो सकता है।

हालाँकि, लेखक एक सरल समाधान का सुझाव देते हैं: एक निष्क्रिय जासूस (passive detective) के साथ टीम बनाएं।

  • SLICE सक्रिय जासूस है जो गुप्त तालों की जाँच करता है।
  • पैसिव फॉरेंसिक्स (Passive Forensics) एक फोरेंसिक विशेषज्ञ है जो "कैंची के निशान" (क्रॉपिंग से छोड़े गए डिजिटल आर्टिफैक्ट्स) की तलाश करता है।
  • मिलकर, वे एक अटूट रक्षा बनाते: SLICE सेमेंटिक परिवर्तनों को पकड़ता है, और फोरेंसिक विशेषज्ञ भौतिक कटाई को पकड़ता है।

सारांश

SLICE एक पुस्तक के हर अध्याय पर एक अद्वितीय, छेड़छाड़-रोधी सील लगाने जैसा है, न कि केवल कवर पर एक सील लगाने जैसा। यदि कोई अध्याय बदल देता है (कहानी बदल देता है), तो आप जानते हैं कि कौन सा अध्याय बदला गया है, और आप जानते हैं कि पुस्तक में बदलाव किया गया है, भले ही कवर बिल्कुल सही दिख रहा हो। यह AI-जनित छवियों को बहुत अधिक कठिन बनाता है और उन्हें सत्यापित करना बहुत आसान बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →