← नवीनतम पेपर
💻 computer science

NullEdit: Stealthy Image Protection via VLM Condition Redirection

यह शोध पत्र NullEdit का प्रस्ताव करता है, जो एक गुप्त रक्षा तंत्र है जो मूल छवि की पहचान और प्राकृतिक स्वरूप को बिना किसी स्पष्ट विसंगति के सुरक्षित रखते हुए, हानिकारक निर्देशों को दबाने के लिए संयुक्त विजन-लैंग्वेज मॉडल प्रतिनिधित्व को पुनर्निर्देशित करके छवियों को अनधिकृत संपादन से बचाता है।

मूल लेखक: Weiyao Huang, Liqin Wang, Ziqi Sheng, Wei Lu

प्रकाशित 2026-08-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Weiyao Huang, Liqin Wang, Ziqi Sheng, Wei Lu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट कलाकार है जो आपके दोस्त की फोटो देख सकता है और, "उन्हें मुस्कुराने के लिए कहें" या "उन्हें स्पेस सूट पहना दें" जैसे एक सरल टेक्स्ट कमांड के आधार पर, तुरंत तस्वीर को फिर से बना सकता है। यह कोई जादू नहीं है; यह एक प्रकार का नया आर्टिफिशियल इंटेलिजेंस है जिसे "विज़न-लैंग्वेज मॉडल" (Vision-Language Model) कहा जाता है जो एक "डिफ्यूजन ट्रांसफॉर्मर" (Diffusion Transformer) के साथ जुड़ा हुआ है। विज़न-लैंग्वेज मॉडल को रोबोट के मस्तिष्क के रूप में समझें जो चित्र और आपके शब्दों दोनों को समझता है, और डिफ्यूजन ट्रांसफॉर्मर को रोबोट के हाथ के रूप में समझें जो वास्तव में नया चित्र पेंट करता है। ये उपकरण अद्भुत हैं क्योंकि उन्हें हर नए व्यक्ति के लिए फिर से प्रशिक्षित करने की आवश्यकता नहीं होती है; उन्हें बस फोटो और निर्देश की आवश्यकता होती है। लेकिन यहाँ एक पेंच है: यदि कोई आपकी फोटो चुरा लेता है और रोबोट को आपको कुछ शर्मनाक, हिंसक या बस अजीब काम करते हुए दिखाने के लिए कहता है, तो आपके पास इसे रोकने का कोई तरीका नहीं है। रोबोट आदेशों का पालन करने के लिए बहुत उत्सुक है।

कुछ समय के लिए, लोगों ने फोटो को बचाने के लिए उसमें अदृश्य "ज़हर" (poison) या "शोर" (noise) जोड़ने की कोशिश की जिससे रोबोट का दिमाग काम करना बंद कर दे यदि वह उस चित्र को संपादित करने की कोशिश करे। लेकिन पुराने तरीके ऐसे थे जैसे आपकी फोटो पर एक बड़ा, चमकता हुआ "छूना मना है" (DO NOT TOUCH) का साइन लगा देना। वे या तो चित्र को ग्लिच वाला बनाकर खराब कर देते थे, या वे आपके चेहरे को किसी और के चेहरे में बदल देते थे, जो वास्तव में रोबोट को बुरा काम करने से नहीं रोकता था—यह केवल एक गड़बड़ी पैदा करता था। बड़ा सवाल यह था: क्या हम तस्वीर को खराब किए बिना या व्यक्ति को बदले बिना रोबोट को उस बुरे आदेश को अनदेखा करने के लिए मजबूर कर सकते हैं?

यहीं पर सन यत-सेन विश्वविद्यालय के शोधकर्ताओं की एक टीम एक चतुर नई तकनीक के साथ सामने आती है जिसे NullEdit कहा जाता है। रोबोट के दिमाग को तोड़ने या फोटो को बर्बाद करने के बजाय, उन्होंने रोबोट के मस्तिष्क को धीरे से बुरे विचार से दूर ले जाने का तरीका खोज निकाला। कल्पना कीजिए कि रोबोट का मस्तिष्क एक दिशा-सूचक यंत्र (कम्पास) है। जब आप "इस व्यक्ति को क्रोधित बनाओ" जैसा कमांड देते हैं, तो कम्पास की सुई "क्रोध" की ओर तेजी से घूम जाती है। पुराने तरीकों ने कम्पास को तोड़ने या उसे वहीं चिपकाने की कोशिश की, जिससे पूरा सिस्टम ही टूट गया। NullEdit, हालांकि, एक सूक्ष्म चुंबकीय क्षेत्र की तरह कार्य करता है जो बिना रोबोट को पता चले, कम्पास की सुई को वापस "न्यूट्रल" या "शांत" की ओर धकेलता है।

शोधकर्ताओं ने पाया कि ये स्मार्ट रोबोट निर्देशों को दो तरीकों से प्रोसेस करते हैं: एक हिस्सा फोटो को देखता है ताकि व्यक्ति कैसा दिखता है उसे याद रख सके, और दूसरा हिस्सा टेक्स्ट को पढ़ता है ताकि निर्णय लिया जा सके कि क्या करना है। उन्होंने पाया कि यदि आप मूल फोटो में एक छोटा, लगभग अदृश्य शोर (noise) जोड़ते हैं (इतना छोटा जिसे मानवीय आँख न देख सके), तो यह रोबोट के टेक्स्ट निर्देश को पढ़ने के तरीके को बदल देता है। सावधानीपूर्वक इस शोर की गणना करके, वे रोबोट को यह सोचने पर मजबूर कर सकते हैं कि "इस व्यक्ति को क्रोधित बनाओ" निर्देश का वास्तव में अर्थ है "इस व्यक्ति को बिल्कुल वैसा ही रहने दें जैसा वह है।"

इसका परिणाम एक "स्टील्थी नो-ऑप" (stealthy no-op) है। जब कोई बुरा व्यक्ति आपके दोस्त की हिंसक या यौनिक छवि बनाने के लिए रोबोट का उपयोग करने की कोशिश करता है, तो रोबोट अपनी पूरी कोशिश करता है, लेकिन एक डरावने राक्षस के बजाय, वह केवल आपके दोस्त की वैसी ही तस्वीर निकालता है जैसा वह पहले था। फोटो खराब नहीं होती है, चेहरा नहीं बदलता है, और कोई अजीब ग्लिच भी नहीं आता। यह ऐसा है जैसे रोबोट विनम्रता से कह रहा हो, "मैंने सुना, लेकिन मैं चीजों को वैसा ही रहने दूँगा जैसा वे हैं।"

टीम ने दो शक्तिशाली रोबोट कलाकारों और हजारों फोटो पर इसका परीक्षण किया। उन्होंने पाया कि NullEdit पिछले तरीकों की तुलना में बुरे संपादन को रोकने में बहुत बेहतर था। जबकि अन्य तरीके शायद संपादन को रोक देते थे लेकिन चित्र को खराब कर देते थे या व्यक्ति की पहचान बदल देते थे, NullEdit ने हानिकारक निर्देशों को पिछले सर्वोत्तम प्रयासों की तुलना में 81% अधिक प्रभावी ढंग से सफलतापूर्वक रोका, जबकि फोटो को प्राकृतिक और मूल व्यक्ति के प्रति सच्चा रखा। उन्होंने यह भी दिखाया कि यदि उन्होंने रोबोट को कुछ विशिष्ट बुरे कमांड्स को अनदेखा करना सिखाया, तो उसने उन नए बुरे कमांड्स को भी अनदेखा करना सीख लिया जिन्हें उसने पहले कभी नहीं देखा था, जिससे यह साबित हुआ कि यह ट्रिक व्यापक रूप से काम करती है।

संक्षेप में, NullEdit आपकी डिजिटल पहचान को सुरक्षित रखने का एक तरीका प्रदान करता है बिना आपकी तस्वीरों को टूटे हुए, अपरिचित मलबे में बदले। यह एक संभावित आपदा को एक हानिरहित क्षण में बदल देता है जहाँ रोबोट बस कुछ न करने का निर्णय लेता है, जिससे आपकी छवि सुरक्षित रहती है और आपकी गोपनीयता बनी रहती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →