← नवीनतम पेपर
🤖 AI

Neural Honeytrace: Plug&Play Watermarking Framework against Model Extraction Attacks

न्यूरल हनीट्रेस (Neural Honeytrace) एक प्लग-एंड-प्ले, प्रशिक्षण-मुक्त वॉटरमार्किंग फ्रेमवर्क है जो मॉडल एक्सट्रैक्शन हमलों के विरुद्ध कुशल और सुदृढ़ स्वामित्व सत्यापन को सक्षम करने के लिए बैकडोर लर्निंग के लॉन्ग-टेल्ड प्रभाव (long-tailed effect) पर आधारित एक बहु-चरणीय ट्रांसमिशन रणनीति का लाभ उठाता है, जिसमें न्यूनतम क्वेरी लागत लगती है।

मूल लेखक: Yixiao Xu, Binxing Fang, Rui Wang, Yinghai Zhou, Yuan Liu, Mohan Li, Zhihong Tian

प्रकाशित 2026-01-22
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yixiao Xu, Binxing Fang, Rui Wang, Yinghai Zhou, Yuan Liu, Mohan Li, Zhihong Tian

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Neural Honeytrace" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

समस्या: "गुप्त रेसिपी" की चोरी

कल्पना कीजिए कि आपका एक प्रसिद्ध रेस्टोरेंट है जिसकी दुनिया की सबसे बेहतरीन बर्गर की गुप्त रेसिपी (secret recipe) है। आप रेसिपी नहीं बेचते; आप केवल बर्गर खिलाते हैं (यह तकनीकी दुनिया में "Model as a Service" की तरह है)।

हालाँकि, एक चोर आता है। वे रेसिपी बुक नहीं चुराते; इसके बजाय, वे 10,000 बर्गर ऑर्डर करते हैं, हर एक को चखते हैं, और लिखते हैं कि अलग-अलग सामग्रियों पर शेफ कैसे प्रतिक्रिया देता है। अंततः, वे रेसिपी को इतनी अच्छी तरह समझ लेते हैं कि वे अपना खुद का बर्गर जॉइंट खोल सकें जो लगभग आपके जैसा ही स्वाद देता है। इसे "मॉडल एक्सट्रैक्शन अटैक" (Model Extraction Attack) कहा जाता है।

इसे रोकने के लिए, रेस्टोरेंट मालिकों ने अपने बर्गर में अदृश्य "वॉटरमार्क" छोड़ने की कोशिश की है। यदि चोर एक प्रतिद्वंद्वी दुकान खोलता है, तो मालिक एक बर्गर ऑर्डर कर सकता है, छिपे हुए वॉटरमार्क को ढूंढ सकता है, और साबित कर सकता है, "हे, यह मेरी रेसिपी है!"

पुराने वॉटरमार्क के साथ समस्या:

  1. उनके लिए नया किचन चाहिए: अधिकांश मौजूदा वॉटरमार्क के लिए शेफ को पूरी रेसिपी फिर से प्रशिक्षित (retrain) करने की आवश्यकता होती है, जो महंगा और समय लेने वाला है।
  2. वे नाजुक हैं: यदि चोर स्मार्ट है और "बर्गर को धोने" (adaptive attacks का उपयोग करना) की कोशिश करता है, तो वॉटरमार्क गायब हो जाता है।
  3. उन्हें साबित करना कठिन है: स्वामित्व सिद्ध करने के लिए, मालिक को अक्सर वॉटरमार्क के साथ कुछ बर्गर खोजने के लिए हजारों बर्गर ऑर्डर करने पड़ते हैं। यह घास के ढेर में सुई खोजने जैसा है।

समाधान: Neural Honeytrace

लेखक Neural Honeytrace नामक एक नया सिस्टम प्रस्तावित करते हैं। इसे एक "प्लग-एंड-प्ले" हनी ट्रैप (शहद का जाल) समझें। आपको रसोई बनाने या शेफ को फिर से प्रशिक्षित करने की आवश्यकता नहीं है। आपको बस परोसने की प्रक्रिया में शहद की एक विशेष परत जोड़नी है।

यह कैसे काम करता है, यहाँ तीन सरल अवधारणाओं में दिया गया है:

1. "लॉन्ग-टेल्ड" प्रभाव (शहद का रास्ता - The Honey Trail)

पुराने दिनों में, वॉटरमार्क एक विशिष्ट, कठिन-से-ढूंढने वाले ट्रिगर की तरह थे (जैसे, "यदि बर्गर में बाईं ओर तिल का बीज है, तो यह मेरा है")। चोर इन ट्रिगर्स से आसानी से बच सकते थे।

Neural Honeytrace एक अलग विचार का उपयोग करता है जिसे "लॉन्ग-टेल्ड प्रभाव" (Long-Tailed Effect) कहा जाता है।

  • उपमा: कल्पना कीजिए कि शेफ का दिमाग इतना अच्छा है कि भले ही आप उन्हें एक ऐसा बर्गर दें जो किसी विशिष्ट "वॉटरमार्क बर्गर" जैसा लगता हो, वे फिर भी वैसे ही प्रतिक्रिया देंगे जैसे कि वह वही बर्गर है
  • यह कैसे काम करता है: एक सख्त ट्रिगर थोपने के बजाय, सिस्टम एक सहज "शहद का रास्ता" (honey trail) बनाता है। यदि चोर का बर्गर वॉटरमार्क के 90% समान है, तो सिस्टम आउटपुट को वॉटरमार्क के सिग्नल के 90% समान बना देगा। यदि यह 50% समान है, तो सिग्नल 50% मौजूद होगा।
  • यह क्यों मदद करता है: चोर को मॉडल चुराने के लिए सटीक ट्रिगर जानने की आवश्यकता नहीं है। क्योंकि "समानता" गणित में रची-बसी है, चोर अनजाने में रेसिपी के साथ "शहद के रास्ते" को भी चुरा लेता है, भले ही उसने मूल ट्रिगर को कभी न देखा हो।

2. सूचना सिद्धांत (बैंडविड्थ की समस्या - The Bandwidth Problem)

लेखकों ने महसूस किया कि पिछले वॉटरमार्क विफल रहे क्योंकि उन्होंने शोर के ऊपर बहुत ज़ोर से चिल्लाने की कोशिश की।

  • उपमा: कल्पना कीजिए कि आप एक शोर भरे रेडियो चैनल (चोर के चोरी किए गए मॉडल) के माध्यम से एक गुप्त संदेश (वॉटरमार्क) भेजने की कोशिश कर रहे हैं। यदि संदेश बहुत तेज़ या जटिल है, तो शोर उसे दबा देगा, या चोर के "क्लीनिंग" फिल्टर उसे हटा देंगे।
  • सुधार: Neural Honeytrace यह समझता है कि चोर का मॉडल मुख्य रेसिपी (बर्गर का स्वाद) की नकल करने में अच्छा है, लेकिन वह सूक्ष्म "शहद के रास्ते" जैसी समानता की सटीक नकल करने में संघर्ष करता है। एक बड़े चिल्लाहट के बजाय कई छोटे इंटरैक्शन में वॉटरमार्क संदेश को फैलाकर, सिस्टम यह सुनिश्चित करता है कि संदेश पहुँच जाए, भले ही चोर इसे फ़िल्टर करने की कोशिश करे।

3. "मल्टी-स्टेप" ट्रांसमिशन (मधुमक्खी का छत्ता - The Honeycomb)

एक या दो बर्गर के साथ स्वामित्व सिद्ध करने के बजाय, Neural Honeytrace प्रमाण को पूरे छत्ते में फैला देता है।

  • उपमा: यदि आप यह साबित करना चाहते हैं कि मधुमक्खी का छत्ता आपका है, तो आप केवल एक मधुमक्खी को नहीं देखते। आप पूरे छत्ते के पैटर्न को देखते हैं।
  • यह कैसे काम करता है: सिस्टम वॉटरमार्क को उत्तरों की संभावना (probability) में एम्बेड करता है। जब चोर हजारों बार मॉडल से सवाल पूछता है, तो उनके उत्तरों का पैटर्न सांख्यिकीय रूप से शहद के रास्ते को प्रकट कर देगा।
  • परिणाम: लेखक दावा करते हैं कि यह अविश्वसनीय रूप से कुशल है। जबकि पुराने तरीकों को स्वामित्व साबित करने के लिए सबसे खराब स्थिति में 6 मिलियन बर्गर ऑर्डर करने की आवश्यकता हो सकती है, Neural Honeytrace को केवल 590 की आवश्यकता होती है। यह अन्य तरीकों की तुलना में प्रयास को केवल 2% तक कम कर देता है।

यह क्यों विशेष है ("प्लग-एंड-प्ले" फीचर)

सबसे बड़ी खासियत यह है कि आपको मॉडल को फिर से प्रशिक्षित करने की आवश्यकता नहीं है।

  • पुराना तरीका: वॉटरमार्क जोड़ने के लिए, आपको लैब में वापस जाना पड़ता था, नए रसायन मिलाने पड़ते थे, और पूरे बैच के मॉडल्स को फिर से बनाना पड़ता था।
  • Neural Honeytrace: यह एक प्लगइन की तरह काम करता है। आप एक मॉडल जिसे पहले से तैनात (डेप्लॉय) किया जा चुका है (जो पहले से ही व्यवसाय के लिए खुला है), उसे ले सकते हैं, और सिस्टम प्रश्नों को रोकता है, "समानता के शहद" की गणना करता है, और वास्तविक समय में उत्तर को समायोजित करता है। यदि आप बाद में वॉटरमार्क हटाना चाहते हैं, तो आप बस इसे अनप्लग कर सकते हैं। पुन: प्रशिक्षण की कोई आवश्यकता नहीं है।

परिणाम

पेपर ने विभिन्न "चोरों" (हमलावरों) के खिलाफ इसका परीक्षण किया, जिसमें वे बहुत स्मार्ट चोर भी शामिल थे जो जानते हैं कि रक्षा मौजूद है और डेटा को साफ करने की कोशिश करते हैं।

  • मजबूती (Robustness): भले ही चोर डेटा को स्मूथ करने या उन्नत ट्रिक्स का उपयोग करने की कोशिश करे, "शहद का रास्ता" पता लगाने योग्य रहता है।
  • दक्षता (Efficiency): यह स्वामित्व सिद्ध करने के लिए आवश्यक प्रश्नों की संख्या को नाटकीय रूप से कम करता है।
  • लागत (Cost): इसे लागू करने के लिए शून्य प्रशिक्षण समय और पैसा खर्च होता है।

सारांश

Neural Honeytrace AI मॉडलों को चोरी होने से बचाने का एक नया तरीका है। एक कठिन-से-ढूंढने वाले ट्रिगर को थोपने के बजाय, यह मॉडल के उत्तरों में समानता का एक सूक्ष्म, गणितीय रूप से सहज "शहद का रास्ता" छोड़ देता है। यह रास्ता इतना प्रभावी है कि मॉडल का मालिक बहुत कम सवालों के साथ यह साबित कर सकता है कि चोरी किया गया मॉडल उनका है, और वे ऐसा बिना मॉडल को फिर से प्रशिक्षित किए कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →