← नवीनतम पेपर
🤖 AI

FARI: Robust One-Step Inversion for Watermarking in Diffusion Models

FARI एक सुदृढ़ वन-स्टेप (one-step) इन्वर्जन फ्रेमवर्क है जो पारंपरिक हाई-स्टेप इन्वर्जन विधियों की तुलना में डिफ्यूजन मॉडल्स में काफी तेज़ और अधिक सुदृढ़ वॉटरमार्क सत्यापन प्राप्त करने के लिए इन्वर्जन ट्रैजेक्टरीज के लो कर्वेचर (low curvature) और एडवरसैरियल LoRA फाइन-ट्यूनिंग का लाभ उठाता है।

मूल लेखक: Jindong Yang, Han Fang, Weiming Zhang, Nenghai Yu, Kejiang Chen

प्रकाशित 2026-07-30
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jindong Yang, Han Fang, Weiming Zhang, Nenghai Yu, Kejiang Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ कंप्यूटर केवल आपके द्वारा लिखे गए एक वाक्य को पढ़कर चित्र बना सकते हैं, गाने लिख सकते हैं और फिल्में डिजाइन कर सकते हैं। यह "डिफ्यूजन मॉडल्स" (diffusion models) का जादू है, जो एक प्रकार का आर्टिफिशियल इंटेलिजेंस है जो अराजक शोर (static noise) के एक बादल से शुरू होता है और धीरे-धीरे, चरण-दर-चरण, इसे तब तक साफ करता है जब तक कि एक स्पष्ट छवि उभर न आए। इसे एक मूर्तिकार की तरह समझें जो संगमरमर के एक ब्लॉक को तराश कर आकार देता है, लेकिन इसके विपरीत: एआई (AI) यादृच्छिक शोर के एक ब्लॉक से शुरू होता है और उस "शोर" को हटाता जाता है ताकि एक आदर्श मूर्ति प्रकट हो सके। क्योंकि ये मशीनें कला बनाने में इतनी कुशल हैं, इसलिए एक बढ़ती हुई चिंता है: हम कैसे जानेंगे कि कोई चित्र इंसान ने बनाया है या रोबोट ने? इसे हल करने के लिए, वैज्ञानिकों ने एक डिजिटल "वॉटरमार्क" विकसित किया है। यह रेत के पहले कण (प्रारंभिक शोर) में एक गुप्त कोड छिपाने जैसा है, इससे पहले कि मूर्तिकार तराशना शुरू भी करे। यदि आप यह साबित करना चाहते हैं कि वह मूर्ति आपकी है, तो आपको मूर्तिके की प्रक्रिया को उलटना होगा, यानी तैयार मूर्ति को वापस उसी मूल रेत के कण में बदलना होगा ताकि कोड को पढ़ा जा सके।

समस्या यह है कि इस प्रक्रिया को उलटना बेहद कठिन और धीमा है। यह एक केक को अन-बेक (un-bake) करने या स्मूदी को अन-मिक्स (un-mix) करने जैसा है; आप प्रक्रिया को उलटने के लिए जितने अधिक कदम उठाएंगे, आपके गलती करने या सामग्री बिखेर देने की संभावना उतनी ही अधिक होगी। यदि केक को एक बैग में कुचल दिया गया है (JPEG कंप्रेशन या क्रॉपिंग द्वारा विकृत किया गया है), तो उसे अन-बेक करने की कोशिश करना एक दुःस्वप्न बन जाता है। मौजूदा तरीके बहुत सटीक होने की कोशिश करते हैं, प्रक्रिया को उलटने के लिए सैकड़ों छोटे कदम उठाते हैं, लेकिन इसमें बहुत समय लगता है और क्षतिग्रस्त होने पर यह विफल भी हो जाता है। यह शोध पत्र इस "अन-बेकिंग" का एक नया तरीका पेश करता है जो न केवल बिजली की तरह तेज है बल्कि आश्चर्यजनक रूप से नुकसान के प्रति भी मजबूत है।

इस कार्य के पीछे के शोधकर्ताओं, जिंदोंग यांग और उनकी टीम ने एआई द्वारा अपनाए जाने वाले मार्ग के बारे में कुछ अजीब देखा। जब एआई एक चित्र बनाता है, तो यह एक ऐसे हाइकर (पदमयात्री) की तरह होता है जो घने, कोहरे से भरे जंगल में भटक रहा है, बाधाओं से बचने के लिए लगातार अपनी दिशा बदल रहा है; रास्ता घुमावदार और अप्रत्याशित है। हालाँकि, जब आप मूल शोर को खोजने के लिए प्रक्रिया को उलटने की कोशिश करते हैं, तो रास्ता बहुत सीधा होता है, जैसे एक हाइकर एक अच्छी तरह से बने राजमार्ग पर चल रहा हो। क्योंकि यह "विपरीत मार्ग" इतना सीधा है, आपको इसका अनुसरण करने के लिए सैकड़ों कदमों की आवश्यकता नहीं है; आप एक बड़ी छलांग लगा सकते हैं और सीधे वहीं पहुँच सकते जहाँ आपको होना चाहिए।

टीम अपने नए तरीके को FARI (फास्ट एसिमेट्रिक रोबस्ट इनवर्जन) कहती है। एक छवि को उलटने के लिए पारंपरिक तरीकों के 50 धीमे, सावधानीपूर्ण कदमों के बजाय, FARI इसे केवल एक एकल चरण में करता है। यह यह समझने जैसा है कि आपको घर के हर कमरे से होकर वापस मुख्य दरवाजे तक जाने की जरूरत नहीं है; आप बस खिड़की से कूद सकते हैं और बरामदे पर उतर सकते हैं। लेकिन यहाँ चालाकी यह है: क्योंकि छलांग इतनी तेज है, कंप्यूटर बहुत बेहतर तरीके से अव्यवस्थित, क्षतिग्रस्त छवियों को संभालना "सीख" सकता है। उन्होंने इस एक-चरणीय छलांग में माहिर होने के लिए एक शक्तिशाली ग्राफिक्स कार्ड (NVIDIA RTX A6000) पर लगभग 20 मिनट तक सिस्टम को प्रशिक्षित किया, भले ही छवि को कुचला गया हो, धुंधला किया गया हो या क्रॉप किया गया हो।

परिणाम प्रभावशाली हैं। अपने परीक्षणों में, FARI ने क्षतिग्रस्त छवियों से छिपे हुए वॉटरमार्क को निकालने में पुराने, 50-चरणीय तरीकों को मात दी। उदाहरण के लिए, "ट्री-रिंग" (Tree-Ring) नामक एक विशिष्ट वॉटरमार्क की जाँच करते समय, FARI ने छिपे हुए कोड को लगभग 100% बार सही ढंग से पहचाना, भले ही छवियां अत्यधिक विकृत रही हों, जबकि पुराने तरीके संघर्ष कर रहे थे। शोध पत्र सुझाव देता है कि अनावश्यक चरणों को छोड़कर, सिस्टम अधिक मजबूत बनता है, कम नहीं। यह एक मार्शल आर्टिस्ट की तरह है जो सीखता है कि एक त्वरित, सीधा प्रहार अक्सर धीमी, जटिल चालों के नृत्य की तुलना में अधिक प्रभावी होता है।

लेखक यह भी बताते हैं कि जबकि अन्य तरीके साफ छवियों को उलटने में पूर्ण होने की कोशिश करते हैं, वे अव्यवस्थित छवियों के मामले में विफल हो जाते हैं। FARI स्वीकार करता है कि एक-चरणीय छलांग एक शुद्ध छवि के लिए एकदम सटीक नहीं हो सकती है, लेकिन यह उन छवियों के लिए कहीं अधिक श्रेष्ठ है जो कठिन दौर से गुजरी हैं। उन्होंने एआई को यह नया तरीका सिखाने के लिए LoRA (लो-रैंक अडैप्टेशन) नामक तकनीक का उपयोग किया। LoRA को एआई के मस्तिष्क में एक छोटे, हटाने योग्य 'एड-ऑन' के रूप में समझें। जब एआई एक चित्र बना रहा होता है, तो एड-ऑन बंद रहता है ताकि कला सुंदर बनी रहे। लेकिन जब कोई वॉटरमार्क की जाँच करने की कोशिश करता है, तो एड-ऑन चालू हो जाता है ताकि एआई तेजी से और सटीकता से शुरुआत तक कूद सके।

संक्षेप में, यह शोध पत्र तर्क देता है कि हमें सटीक होने के लिए धीमा और सावधान होने की आवश्यकता नहीं है। यह समझकर कि शुरुआत तक वापस जाने का मार्ग अंत तक जाने के मार्ग से सरल है, हम एक ऐसा सिस्टम बना सकते हैं जो तेज भी है और मजबूत भी। टीम ने पाया कि यह दृष्टिकोण वॉटरमार्क को सत्यापित करने के लिए वर्तमान अत्याधुनिक तरीकों की तुलना में बेहतर काम करता है, विशेष रूप से तब जब छवियों को बदला गया हो। यह एक अनुस्मारक है कि कभी-कभी, समस्या को हल करने का सबसे तेज़ तरीका चरणों के बारे में बहुत अधिक सोचना बंद करना और बस एक साहसी, सुशिक्षित छलांग लगाना होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →