RandMark: On Random Watermarking of Visual Foundation Models
यह शोध पत्र RandMark का प्रस्ताव करता है, जो एक रैंडम वॉटरमार्किंग विधि है जो कम गलत पहचान और गलत पता लगाने की दरों के साथ मजबूत स्वामित्व सत्यापन सक्षम करने के लिए एक छोटे एनकोडर-डिकोडर नेटवर्क का उपयोग करके विजुअल फाउंडेशन मॉडल्स के आंतरिक निरूपणों (internal representations) में डिजिटल वॉटरमार्क को एम्बेड करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने अभी-अभी एक शानदार, कस्टम-मेड रोबोट शेफ बनाया है। आपने वर्षों तक बेहतरीन रेसिपी इकट्ठा करने, इसे लाखों व्यंजनों पर प्रशिक्षित करने और इसके एल्गोरिदम को तब तक सुधारने में बिताया है जब तक कि यह किसी भी अन्य व्यक्ति से बेहतर सब्जियां काटने और पैनकेक पलटने में सक्षम न हो गया। यह रोबोट आपका विजुअल फाउंडेशन मॉडल (VFM) है। यह अविश्वसनीय रूप से मूल्यवान है।
अब, कल्पना कीजिए कि आप इस रोबोट के "दिमाग" (सॉफ्टवेयर) को अन्य रेस्तरांओं को बेचना चाहते हैं। लेकिन, आप चिंतित हैं: क्या होगा यदि कोई रेस्तरां आपके रोबोट को खरीद लेता है, उसके दिमाग की नकल कर लेता है, और आपकी अनुमति के बिना उस नकल को किसी तीसरे पक्ष को बेच देता है? या क्या होगा यदि वे इसे तेज़ बनाने के लिए इसके दिमाग में थोड़ा बदलाव करते हैं, और दावा करते हैं कि यह एक नया आविष्कार है?
आपको एक ऐसे तरीके की आवश्यकता है जिससे आप साबित कर सकें, "हे, यह रोबोट का दिमाग मेरा है!" भले ही कोई इसे छिपाने की कोशिश करे। यहीं पर RandMark नामक पेपर काम आता है।
समस्या: अदृश्य चोरी का माल
वर्तमान में, यदि कोई आपके रोबोट का दिमाग चुरा लेता है, तो यह साबित करना कठिन होता है कि वह आपका है। मानक "फिंगरप्रिंट्स" (जैसे सीरियल नंबर की जांच करना) अक्सर मिट जाते हैं यदि चोर कोड में थोड़ा सा बदलाव (fine-tuning) करता है या कोड के हिस्सों को छोटा करने के लिए उन्हें हटा देता है (pruning)।
समाधान: "जादुई स्याही" वाला वॉटरमार्क
लेखक एक नया तरीका प्रस्तावित करते हैं जिसे RandMark कहा जाता है। इसे अपने रोबोट की त्वचा पर एक स्थायी टैटू के रूप में नहीं, बल्कि उसके विचारों के भीतर छिपी एक जादुई स्याही के रूप में समझें।
यह इस प्रकार काम करता है, चरण-दर-चरण:
1. गुप्त रेसिपी (वॉटरमार्क)
रोबोट के पूरे दिमाग को बदलने के बजाय, लेखक एक विशेष "एनकोडर" (एक छोटा सहायक प्रोग्राम) का उपयोग करके एक गुप्त बाइनरी संदेश (0 और 1 की एक स्ट्रिंग, जैसे एक गुप्त कोड) को रोबोट की आंतरिक प्रोसेसिंग में इंजेक्ट करते हैं।
- उपमा: कल्पना कीजिए कि आप अपने रोबोट शेफ को टमाटर की एक विशिष्ट, थोड़ी धुंधली फोटो देते हैं। आप रोबोट को बताते हैं, "जब तुम इस विशिष्ट धुंधली टमाटर की फोटो को देखोगे, तो गुप्त कोड '10101' के बारे में सोचना।"
- रोबोट उस विशिष्ट छवि को उस गुप्त कोड के साथ जोड़ना सीख जाता है। यह रोबोट के विचार के छिपे हुए स्तरों (hidden layers) के भीतर होता है।
2. रैंडम ट्विस्ट (RandMark में "Random")
चतुर हिस्सा यह है कि वे केवल एक फोटो का उपयोग नहीं करते हैं। वे उस फोटो के रैंडमली विकृत (randomly distorted) संस्करणों का उपयोग करते हैं।
- उपमा: आप रोबोट को टमाटर की फोटो दिखाते हैं, लेकिन कभी वह फोटो उलटी होती है, कभी ज़ूम इन होती है, तो कभी थोड़ी धुंधली होती है। चाहे आप फोटो को कितनी भी तरह से घुमा दें, रोबोट को अभी भी अपने मन में गुप्त कोड "10101" फुसफुसाने के लिए प्रशिक्षित किया गया है।
- क्योंकि रोबोट को इन सभी रैंडम ट्विस्ट के माध्यम से कोड को पहचानने के लिए कड़ी मेहनत करनी पड़ती है, इसलिए कोड की "याददाश्त" उसके न्यूरल पाथवे में गहराई से समा जाती है।
3. परीक्षण (डिकोडर)
बाद में, यदि आपको संदेह है कि किसी ने आपका रोबोट चुरा लिया है, तो आप एक परीक्षण चलाते हैं।
- आप संदिग्ध रोबोट को उन्हीं ट्विस्ट की गई टमाटर की तस्वीरों का सेट दिखाते हैं।
- आप एक "डिकोडर" (एक जासूसी प्रोग्राम) का उपयोग करते हैं जो रोबता द्वारा फुसफुसाए जाने वाले शब्दों को सुनता है।
- यदि यह आपका रोबोट है: भले ही चोर ने रोबोट के दिमाग को तेज़ करने के लिए उसमें बदलाव किया हो या उसे टमाटर के बजाय प्याज काटने जैसा अलग काम करने के लिए बदला हो, रोबोट अभी भी अधिकांश समय गुप्त कोड "10101" फुसफुसाएगा।
- यदि यह किसी दूसरे का रोबोट है: एक रोबोट जिसे आपके गुप्त कोड के साथ प्रशिक्षित नहीं किया गया था, वह भ्रमित हो जाएगा। वह रैंडम कोड का अनुमान लगा सकता है, या कुछ भी नहीं कहेगा। वह लगातार "10101" नहीं फुसफुसाएगा।
यह पुराने तरीकों से बेहतर क्यों है?
शोधकर्ता कुछ प्रमुख उपमाओं का उपयोग करके अन्य "फिंगरप्रिंटिंग" विधियों के साथ RandMark की तुलना करते हैं:
- "भारी हाथ" बनाम "कोमल स्पर्श": पुराने तरीकों में अक्सर रोबोट के दिमाग को इतना व्यापक रूप रूप से बदलने की कोशिश की जाती थी कि रोबोट गलतियाँ करने लगता था (जैसे टोस्ट जला देना)। RandMark एक कोमल स्पर्श की तरह है; यह कोड को इतनी अच्छी तरह से छिपाता है कि आपका रोबोट अभी भी पूरी तरह से काम करता है।
- "इरेज़र" (मिटाने वाला) टेस्ट: चोर अक्सर फिंगरप्रिंट को हटाने के लिए कोड के हिस्सों को "प्रून" (काट देना) करने की कोशिश करते हैं।
- पुराना तरीका: यदि आप रोबोट के दिमाग का 20% हिस्सा काट देते हैं, तो फिंगरप्रिंट गायब हो जाता है।
- RandMark: चूंकि कोड रैंडम छवियों के बारे में रोबोट के सोचने के तरीके में बुना हुआ है, इसलिए भले ही आप रोबोट के दिमाग का 40% हिस्सा काट दें, रोबोट फिर भी गुप्त कोड को याद रखेगा। यह किसी व्यक्ति की याददाश्त से कुछ न्यूरॉन्स हटाकर उसके दिमाग से गाना मिटाने की कोशिश करने जैसा है; धुन अभी भी वहीं रहती है।
परिणाम
शोधकर्ताओं ने दो बहुत प्रसिद्ध, शक्तिशाली AI मॉडलों (CLIP और DINOv2) पर इसका परीक्षण किया।
- सफलता दर: जब उन्होंने अपने वॉटरमार्क किए गए मॉडलों को नए कार्यों (जैसे भोजन या उत्पादों की पहचान करना) पर प्रशिक्षित किया, तो गुप्त कोड 100% समय मौजूद था।
- कोई गलत अलार्म नहीं: जब उन्होंने पूरी तरह से अलग, निर्दोष मॉडलों का परीक्षण किया जिनका उनके रोबोट से कोई लेना-देना नहीं था, तो सिस्टम ने सही ढंग से कहा, "नहीं, यह आपका नहीं है।" यह भ्रमित नहीं हुआ।
निचोड़
RandMark एक ऐसा तरीका है जिससे AI निर्माता सीधे मॉडल के सोचने के तरीके में अपना "कॉपीराइट" अंकित कर सकते हैं। यह मॉडल को एक गुप्त हैंडशेक (हाथ मिलाने का तरीका) सिखाने जैसा है जिसे वह भूल नहीं सकता, भले ही कोई उसके काम को बदलने, उसके आकार को छोटा करने या उसे फिर से प्रशिक्षित करने की कोशिश करे। यदि मॉडल अभी भी वह गुप्त हैंडशेक कर सकता है, तो आप जानते हैं कि वह आपका है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।