← नवीनतम पेपर
💻 computer science

Why Neural Structural Obfuscation Can't Kill White-Box Watermarks for Good!

यह शोध पत्र \textsc{Canon} को प्रस्तुत करता है, जो मॉडल उपयोगिता को संरक्षित करते हुए इंजेक्ट किए गए डमी न्यूरॉन्स को समाप्त करने के लिए नेटवर्क लेआउट को वैश्विक रूप से कैनोनिकल बनाने के माध्यम से न्यूरल स्ट्रक्चरल ऑबफस्केशन हमलों के विरुद्ध व्हाइट-बॉक्स वॉटरमार्क सत्यापन क्षमता को बहाल करने में 100% सफलता प्राप्त करने वाला एक रिकवरी फ्रेमवर्क है।

मूल लेखक: Yanna Jiang, Guangsheng Yu, Qingyuan Yu, Yi Chen, Qin Wang

प्रकाशित 2026-03-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yanna Jiang, Guangsheng Yu, Qingyuan Yu, Yi Chen, Qin Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ इस शोध पत्र का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

बड़ी तस्वीर: "जादुई ट्रिक" बनाम "जासूस"

कल्पना कीजिए कि आपके पास दुनिया के सबसे बेहतरीन चॉकलेट केक की एक गुप्त रेसिपी है। यह साबित करने के लिए कि यह आपकी है, आप रेसिपी बुक में एक छोटा सा, अदृश्य वॉटरमार्क छिपा देते हैं—शायद आटा मिलाने का एक खास तरीका या हाशिए (margin) में एक छिपा हुआ नोट।

समस्या:
एक चोर आपकी रेसिपी बुक चुरा लेता है। आपके नोट को मिटाने (जो कि बहुत स्पष्ट होगा) के बजाय, वह एक "जादुई ट्रिक" करता है। वह पूरी किताब की फोटोकॉपी करता है, लेकिन इस प्रक्रिया में, वह:

  1. बहुत सारे खाली पन्ने जोड़ देता है जिनमें कुछ भी नहीं लिखा है।
  2. अध्यायों (chapters) का क्रम बदल देता है।
  3. एक पैराग्राफ को तीन छोटे पैराग्राफों में विभाजित कर देता है जो बिल्कुल एक ही बात कहते हैं।

परिणाम: केक का स्वाद बिल्कुल वैसा ही रहता है (फंक्शन काम करता है), लेकिन यदि आप "अध्याय 3, पृष्ठ 5" को देखकर अपना छिपा हुआ नोट खोजने की कोशिश करेंगे, तो वह गायब मिलेगा। चोर ने सफलतापूर्वक दावा कर लिया है कि रेसिपी उसकी है क्योंकि किताब का "इंडेक्स" (अनुक्रमणिका) अस्त-व्यस्त हो गया है। इसे ही पेपर में न्यूरल स्ट्रक्चरल ऑबफस्केशन (NSO) कहा गया है। यह एक "जीरो-कॉस्ट" हमला है क्योंकि यह मॉडल के प्रदर्शन को खराब नहीं करता, यह बस हमारे स्वामित्व की जांच करने के तरीके को तोड़ देता है।

समाधान (CANON):
इस पेपर के लेखक उन मास्टर जासूसों की तरह हैं जिन्होंने महसूस किया कि चोर ने एक गलती की है। उन्होंने CANON नामक एक टूल बनाया है जो उस जादुगत ट्रिक को उलट सकता है, मूल पृष्ठ क्रम को बहाल कर सकता है और आपके छिपे हुए नोट को फिर से खोज सकता है।


मुख्य अवधारणा: "प्रोड्यूसर-कंज्यूमर" श्रृंखला

यह समझने के लिए कि CANON कैसे काम करता है, कल्पना कीजिए कि एक फैक्ट्री की असेंबली लाइन है।

  • प्रोड्यूसर (Producer): एक कार्यकर्ता जो पुर्जों (डेटा) को पैक करता है और उन्हें कन्वेयर बेल्ट पर रखता है।
  • कंज्यूमर (Consumer): लाइन के अंत में एक कार्यकर्ता जो उन पुर्जों को लेता है और उनसे एक कार बनाता है।

चोर की चाल (NSO):
चोर फैक्ट्री में घुस जाता है। वह प्रोड्यूसर से कहता है: "सुनो, 10 पुर्जे भेजने के बजाय 12 भेज दो। उनमें से दो खाली डिब्बे (dummy channels) हैं, और एक दूसरे का डुप्लिकेट है।"
प्रोड्यूसर ऐसा ही करता है। पुर्जे कंज्यूमर तक पहुँचते हैं और कार भी बिल्कुल सही बनती है। लेकिन अब, कंज्यूमर भ्रमित है। उसे "पुर्जा #1" लेने की आदत थी, लेकिन अब "पुर्जा #1" वास्तव में पहले वाला "पुर्जा #3" है, और "पुर्जा #2" एक खाली डिब्बा है। वॉटरमार्क (आपका गुप्त नोट) "पुर्जा #1" से जुड़ा था, इसलिए कंज्यूमर उसे ढूंढ नहीं पाता।

जासूस की चाल (CANON):
जासूस (CANON) फैक्ट्री में आता है और वहां काम करने वालों को देखता है। वह कुछ अजीब नोटिस करता है:

  1. पैटर्न: खाली डिब्बे और डुप्लिकेट पुर्जे हमेशा एक विशिष्ट, सिंक्रोनाइज्ड तरीके से चलते हैं। यदि प्रोड्यूसर एक खाली डिब्बा जोड़ता है, तो कंज्यूमर को कार बनाने के सही ढंग से जारी रखने के लिए उसे एक विशिष्ट तरीके से अनदेखा करना ही होगा।
  2. सुराग: क्योंकि फैक्ट्री को पूरी तरह से काम करना होता है, इसलिए "डमी" पुर्जे और "असली" पुर्जों को भौतिकी (गणित) के सख्त नियमों का पालन करना पड़ता है। वे रैंडम नहीं हो सकते; उन्हें एक-दूसरे को संतुलित करना होगा या पूरी तरह से जुड़ना होगा।

समाधान:
CANON इन नियमों का उपयोग करके यह पता लगाता है कि कौन से पुर्जे नकली हैं और कौन से असली। इसके बाद यह कंज्यूमर के लिए निर्देशों को फिर से लिखता है: "खाली डिब्बों को अनदेखा करें, और डुप्लिकेट्स को वापस एक में मिला दें।"

ऐसा करके, CANON केवल अनुमान नहीं लगाता; यह मूल असेंबली लाइन के लेआउट को पुनर्गठित (reconstruct) करता है। यह फैक्ट्री को उसके "कैनोनिकल" (मानक) रूप में वापस लाता है। एक बार लेआउट ठीक हो जाने के बाद, छिपा हुआ वॉटरमार्क अपनी मूल जगह पर वापस आ जाता है, और मालिक यह साबित कर सकता है कि रेसिपी उसकी है।


यह इतना महत्वपूर्ण क्यों है?

1. यह "जीरो-कॉस्ट" के मिथक को तोड़ता है
हमलावरों ने सोचा कि वे मॉडल के प्रदर्शन को नुकसान पहुँचाए बिना वॉटरमार्क को नष्ट कर सकते हैं। वे प्रदर्शन के बारे में सही थे, लेकिन वॉटरमार्क के बारे में गलत। CANON साबित करता है कि आप बिना किसी सटीकता (accuracy) को खोए वॉटरमार्क को रिकवर कर सकते हैं। यह कहने जैसा है कि, "आप ताश की गड्डी को फेंट सकते हैं, लेकिन मैं फिर भी आपको बता सकता हूँ कि मूल क्रम क्या था।"

2. यह जटिल फैक्ट्रियों को संभालता है
इसे ठीक करने के पिछले प्रयास केवल सरल, सीधी असेंबली लाइनों (जैसे पुराने न्यूरल नेटवर्क) पर काम करते थे। लेकिन आधुनिक AI मॉडल विशाल, जटिल फैक्ट्रियों की तरह हैं जिनमें लूप, शाखाएं (branches) और जुड़ने वाली कन्वेयर बेल्ट होती हैं (जैसे ResNets, Inception, आदि)।

  • चुनौती: यदि आप फैक्ट्री की एक शाखा को ठीक करते हैं, तो आप दूसरी शाखा को तोड़ सकते हैं जहाँ वे आपस में मिलती हैं।
  • CANON समाधान: CANON एक ही समय में पूरी फैक्ट्री के मानचित्र को देखता है। यह सुनिश्चित करता है कि यदि यह एक शाखा के लेआउट को ठीक करता है, तो यह स्वचालित रूप से उन सभी शाखाओं के निर्देशों को अपडेट कर देता है जो उससे जुड़ी हुई हैं। यह पूरे सिस्टम को तालमेल में रखता है।

3. यह सुरक्षित और तेज़ है
पेपर दिखाता है कि CANON AI मॉडल्स के लिए एक "स्पेल-चेकर" की तरह है।

  • यदि मॉडल साफ है: CANON इसकी जांच करता है, देखता है कि सब कुछ सामान्य है, और कुछ नहीं करता। यह गलती से किसी अच्छे मॉडल को खराब नहीं करता।
  • यदि मॉडल पर हमला हुआ है: यह तुरंत "डमी" हिस्सों की पहचान करता है, उन्हें हटा देता है, और मूल संरचना को बहाल कर देता है।
  • गति: इस चेक को चलाने में केवल कुछ सेकंड लगते हैं, जो अपने AI के स्वामित्व को साबित करने के लिए एक बहुत ही मामूली कीमत है।

निष्कर्ष (The Takeaway)

यह पेपर तर्क देता है कि न्यूरल स्ट्रक्चरल ऑबफस्केशन (NSO) AI वॉटरमार्क्स के लिए "किल स्विच" नहीं है।

NSO को ऐसे समझें जैसे कोई अदृश्य स्याही में हस्ताक्षर लिखकर और फिर पन्नों को इधर-उधर करके अपनी पहचान छिपाने की कोशिश कर रहा हो। इस पेपर के लेखकों ने एक "UV लाइट" (CANON) बनाई है जो अदृश्य स्याही को प्रकट करती है और पन्नों को पुनः व्यवस्थित करती है, जिससे यह साबित होता है कि हस्ताक्षर वहां मौजूद थे।

संक्षेप में: आप स्वामित्व छिपाने के लिए AI मॉडल की संरचना को बिखेर सकते हैं, लेकिन आप उन गणितीय नियमों को नहीं तोड़ सकते जो मॉडल को काम करने में मदद करते हैं। CANON उन नियमों का उपयोग करके उस बिखराव को उलट देता है और सच्चाई को सामने लाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →