← नवीनतम पेपर
💻 computer science

Can Watermarking Techniques Help Prevent LLM Model Stealing?

यह शोधपत्र एक वॉटरमार्किंग-आधारित रक्षा का प्रस्ताव करता है जो ब्लैक-बॉक्स मॉडल चोरी के हमलों को रोकने के लिए मॉडल लॉजिट्स (logits) को विचलित करता है, जिसमें छिपे हुए लेयर आयामों (hidden layer dimensions) का निष्कर्षण भी शामिल है, और यह अनुभवजन्य प्रयोगों के माध्यम से प्रदर्शित करता है कि यह दृष्टिकोण मॉडल की उपयोगिता को महत्वपूर्ण रूप से कम किए बिना ऐसे हमलों को प्रभावी ढंग से विफल करता है।

मूल लेखक: Elette Boyle, MohammadTaghi Hajiaghayi, Keivan Rezaei, Suho Shin, Amos Stern

प्रकाशित 2026-07-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Elette Boyle, MohammadTaghi Hajiaghayi, Keivan Rezaei, Suho Shin, Amos Stern

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक शानदार, गुप्त रेसिपी वाला केक बनाया है जिसे बनाने में लाखों का खर्च आता है। आप केक बेचते नहीं हैं; आप बस एक खिड़की के माध्यम से लोगों को स्लाइस (टुकड़े) ऑर्डर करने देते हैं। उन्हें स्वाद तो मिलता है, लेकिन वे सामग्री की सूची या मिक्सिंग बाउल (मिश्रण करने का बर्तन) का आकार नहीं देख सकते।

हाल ही में, चालाक शेफों के एक समूह ने आपकी रसोई के अंदर झांकने की एक तरकीब खोज ली है। वे विशिष्ट स्लाइस के हजारों ऑर्डर देकर और पीछे छूटे हुए सूक्ष्म कणों (जिन्हें "लॉगिट्स" कहा जाता है) का विश्लेषण करके, आपके मिक्सिंग बाउल के सटीक आकार (जिसे "हिडन डायमेंशन" कहते हैं) का पता लगा सकते हैं। एक बार जब उन्हें बाउल का आकार पता चल जाता है, तो वे आपकी पूरी गुप्त रेसिपी को रिवर्स-इंजीनियर कर सकते हैं और एक प्रतिस्पर्धी केक शॉप बना सकते हैं।

यह पेपर आपकी रसोई की रक्षा करने का एक नया तरीका प्रस्तावित करता है: डिजिटल वॉटरमार्क्स। केवल बाउल को छिपाने के बजाय, लेखक सुझाव देते हैं कि खिड़की से बाहर निकलने वाले हर स्लाइस पर एक विशेष, अदृश्य "शोर" (noise) छिड़क दिया जाए। यह शोर इस तरह डिज़ाइन किया गया है कि वह चालाक शेफ के गणित को भ्रमित कर दे, जिससे बाउल का आकार गिनना असंभव हो जाए, जबकि केक का स्वाद लाजवाब बना रहे।

"शोर" की समस्या: साधारण तरकीबें क्यों विफल होती हैं

लेखकों ने इस शोर को जोड़ने के कई तरीकों का परीक्षण किया, और उन्होंने पाया कि कुछ स्पष्ट विचार पूरी तरह से फ्लॉप रहे।

  • "स्टैटिक" की गलती: यदि आप हर स्लाइस में शोर की बिल्कुल समान मात्रा जोड़ते हैं, तो शेफ उसे आसानी से घटाकर निकाल सकते हैं। यह वैसा ही है जैसे यदि आप हर कुकी पर नमक की समान मात्रा डालें; एक समझदार शेफ नमक का स्वाद चख सकता है और उसे अनदेखा कर सकता है।
  • "सॉर्टेड" की गलती: उन्होंने सामग्री के क्रम के अनुसार शोर को व्यवस्थित (sort) करने की कोशिश की। आश्चर्यजनक रूप से, यह भी काम नहीं आया। शोर में खुद एक छिपा हुआ पैटर्न था जिसे शेफ अभी भी देख सकते थे, जैसे कांच पर छोड़ी गई उंगलियों के निशान।
  • "मल्टीप्लिकेशन" की गलती: उन्होंने सामग्रियों को एक यादृच्छिक (random) संख्या से गुणा करने की कोशिश की। इसने केक के स्वाद को खराब कर दिया (मॉडल की गुणवत्ता कम कर दी) लेकिन फिर भी शेफ को बाउल गिनने से नहीं रोक सका।

यह पेपर स्पष्ट रूप से स्वतंत्र शोर (ऐसे यादृच्छिक छिड़काव जो हर बार बदलते हैं) का उपयोग करने के खिलाफ तर्क देता है क्योंकि शेफ एक ही स्लाइस को 40 बार ऑर्डर कर सकते हैं और परिणामों का औसत निकालकर शोर को खत्म कर सकते हैं।

जीतने वाली रणनीति: "सीक्रेट सीड" और "सॉफ्टप्लस" शील्ड

लेखकों ने एक ऐसा समाधान खोजा जो वास्तव में काम करता है, जो डिजिटल छवियों को वॉटरमार्क करने के तरीके से प्रेरित है। उनकी विधि के दो मुख्य घटक हैं:

  1. सीक्रेट सीड (गुप्त बीज): यादृच्छिक शोर का उपयोग करने के बजाय, रसोई एक गुप्त कोड (एक क्रिप्टोग्राफिक फंक्शन) का उपयोग करती है जो ओवन के अंदर केक के घोल की सटीक स्थिति पर आधारित होता है। इसका मतलब है कि हर एक स्लाइस को एक अद्वितीय शोर पैटर्न मिलता है जो उसके भीतर मौजूद सामग्री पर निर्भर करता है। भले ही शेफ एक ही प्रॉम्प्ट को दो बार ऑर्डर करें, शोर समान रहता है (ताဖြင့် वे इसे औसत निकालकर खत्म न कर सकें), लेकिन यदि वे प्रॉम्प्ट में थोड़ा सा भी बदलाव करते हैं, तो शोर पूरी तरह बदल जाता है।
  2. सॉफ्टप्लस शील्ड: यह सुनिश्चित करने के लिए कि शोर केक के स्वाद को खराब न करे, वे "सॉफ्टप्लस" नामक एक विशेष गणितीय ट्रिक का उपयोग करते हैं। इसे एक सौम्य फिल्टर के रूप में सोचें जो सामग्रियों को इतना मोड़ देता है कि बाउल का आकार छिप जाए, लेकिन मुख्य स्वादिष्ट सामग्रियों के क्रम को बिल्कुल वैसा ही रखता है।

जब उन्होंने इस "सीक्रेट सीड" को "सॉफ्टप्लस" के साथ मिलाया और इसमें रैंडम गॉसियन नॉइज़ (जैसे चीनी की महीन धुंध) जोड़ा, तो परिणाम प्रभावशाली रहे। Mistral-7B (जिसका हिडन डायमेंशन 4,096 है) मॉडल पर उनके परीक्षणों में, चालाक शेफ पूरी तरह से विफल रहे। गणित ने डेटा में कोई स्पष्ट "जंप" नहीं दिखाया जो बाउल के आकार को प्रकट कर सके। हमला विफल रहा, भले ही शेफ ने "रोबस्ट PCA" जैसे उन्नत तरीकों का उपयोग किया हो या सॉफ्टप्लस फिल्टर को उलटने की कोशिश की हो।

क्या केक का स्वाद अभी भी अच्छा है?

सबसे बड़ी चिंता यह थी: "यदि आप सामग्रियों के साथ छेड़छाड़ करते हैं, तो क्या केक का स्वाद खराब हो जाएगा?"

लेखकों ने इसका सावधानीपूर्वक मापन किया। उन्होंने MMLU (ज्ञान और तर्क का एक परीक्षण) नामक बेंचमार्क का उपयोग किया और पाया कि:

  • साधारण, अस्त-व्यस्त शोर ने मॉडल के स्कोर को काफी कम कर दिया (कुछ मामलों में लगभग 44.75% या 49.52% तक)।
  • हालांकि, सॉफ्टप्लस-आधारित विधि ने स्कोर को अविश्वसनीय रूप से ऊंचा रखा, जो 56.55% से 57.78% के आसपास रहा। यह मूल, बिना संशोधित मॉडल के लगभग बराबर है!

उन्होंने परप्लेक्सिटी (Perplexity) नामक एक मीट्रिक का उपयोग करके यह भी जांचा कि "फ्लेवर प्रोफाइल" में कितना बदलाव आया। सबसे अच्छे कॉन्फ़िगरेशन ने केवल 3.37 की परप्लेक्सिटी दिखाई, जो मूल मॉडल के 3.40 के बहुत करीब है।

निष्कर्ष

यह पेपर यह दावा नहीं करता कि उसने ब्रह्मांड की हर संभावित चोरी को हल कर दिया है, लेकिन यह दृढ़ता से सुझाव देता है कि यह विशिष्ट विधि एक मजबूत रक्षा है। एक गुप्त, प्रॉम्प्ट-आधारित सीड और एक सौम्य "सॉफ्टप्लस" फिल्टर का उपयोग करके, वे मॉडल के आकार को चुराने के लिए चोरों द्वारा आवश्यक गणितीय सुरागों को सफलतापूर्वक उलझा पाए, जबकि मॉडल को स्मार्ट और उपयोगी बनाए रखा।

संक्षेप में: अब आप चोरों को आपके किचन को मापने से रोकने के लिए अपने AI के उत्तरों पर थोड़ा "भ्रम का धूल" (confusion dust) छिड़क सकते हैं, बिना केक का स्वाद बिगाड़े।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →