MirrorMark: A Distortion-Free Multi-Bit Watermark for Large Language Models
मिररमार्क (MirrorMark) लार्ज लैंग्वेज मॉडल्स के लिए एक नवीन मल्टी-बिट वॉटरमार्किंग तकनीक है जो टोकन संभाव्यता वितरण (token probability distribution) को विकृत किए बिना सुदृढ़, पता लगाने योग्य संदेशों को समाहित करती है, जिससे टेक्स्ट की गुणवत्ता सुरक्षित रहती है और साथ ही सटीकता एवं डिटेक्शन दरों में मौजूदा विधियों से काफी बेहतर प्रदर्शन करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बेकर हैं जिसने अभी-अभी ब्रेड की एक नई, उत्तम रेसिपी बनाई है। आप यह सुनिश्चित करना चाहते हैं कि यदि कोई आपके ब्रेड को अपने नाम से बेचता है, तो आप यह साबित कर सकें कि यह आपका है। लेकिन यहाँ एक पेंच है—आप ब्रेड पर बड़े अक्षरों में "मेरा है" (MINE) का स्टैम्प नहीं लगा सकते, क्योंकि इससे उसका रूप और स्वाद बिगड़ जाएगा। और आप आटे में कोई गुप्त कोड भी नहीं फुसफुसा सकते, क्योंकि यदि कोई उसका एक टुकड़ा काट देता है या उसमें कुछ मिला देता है, तो वह फुसफुसाहट खो जाएगी।
यह समस्या MirrorMark द्वारा LLMs (Large Language Models)—उन AI सिस्टमों के लिए हल की जाती है जो हमारे लिए टेक्स्ट लिखते हैं।
यहाँ बताया गया है कि MirrorMark कैसे काम करता है, जिसे सरल अवधारणाओं में विभाजित किया गया है:
1. वर्तमान "वॉटरमार्क" के साथ समस्या
वर्तमान वॉटरमार्किंग विधियों को दो दोषपूर्ण स्टैम्प के रूप में सोचें:
- "विकृत करने वाला" (Distorting) स्टैम्प: कुछ विधियाँ एक गुप्त संदेश छिपाने के लिए रेसिपी को थोड़ा बदलने की कोशिश करती हैं। उदाहरण के लिए, वे AI को सामान्य से थोड़े अलग शब्द चुनने के लिए मजबूर कर सकती हैं। यह ब्रेड में एक अजीब मसाला डालने जैसा है। यह काम तो करता है, लेकिन बकी ब्रेड का स्वाद बदल जाता है (टेक्स्ट की गुणवत्ता कम हो जाती है)।
- "नाजुक" (Fragile) स्टैम्प: अन्य विधियाँ स्वाद बदले बिना गुप्त संदेश छिपाने की कोशिश करती हैं। लेकिन वे भीड़ भरे कमरे में एक फुसफुसाहट की तरह होती हैं। यदि कोई टेक्स्ट को एडिट करता है (एक वाक्य जोड़ता है, एक शब्द हटाता है, या फिर से लिखता है), तो वह फुसफुसाहट खो जाती है, और आप यह साबित नहीं कर पाते कि वह ब्रेड आपकी है।
2. MirrorMark का समाधान: "परफेक्ट रिफ्लेक्शन" (पूर्ण प्रतिबिंब)
MirrorMark एक गुप्त संदेश छिपाने का एक नया तरीका है जो डिस्टॉर्शन-फ्री (इसमें स्वाद नहीं बदलता) और रोबस्ट (संपादन के बावजूद सुरक्षित रहता है) है।
यह Mod-1 Mirroring नामक एक चतुर ट्रिक का उपयोग करता है।
- उपमा (Analogy): कल्पना करें कि AI एक पासे (dice) के आधार पर एक शब्द चुन रहा है जिसका परिणाम 0 और 1 के बीच कहीं भी गिर सकता है।
- ट्रिक: मिरर मार्क उस नंबर को बदलता नहीं है, बल्कि उस नंबर को एक विशिष्ट रेखा (दर्पण/शीशे) के ऊपर "फोल्ड" (मोड़) देता है, जो उस गुप्त संदेश पर निर्भर करता है जिसे वह भेजना चाहता है।
- जादू: यदि आप कागज के एक टुकड़े को पूरी तरह से मोड़ते हैं, तो कागज का आकार नहीं बदलता; वह दूसरी तरफ से बस अलग दिखता है। इसी तरह, MirrorMark उन रैंडम नंबर्स को पुनर्व्यवस्थित करता है जिनका AI उपयोग करता है, लेकिन उन नंबर्स का समग्र पैटर्न बिल्कुल वैसा ही रहता है।
- परिणाम: AI ऐसा टेक्स्ट लिखता है जो 100% प्राकृतिक और उच्च गुणवत्ता वाला लगता है, ठीक वैसे ही जैसे बिना किसी वॉटरमार्क के होता। लेकिन शब्दों के चयन के भीतर एक मल्टी-बिट कोड (जैसे एक डिजिटल फिंगरप्रिंट) छिपा होता है जिसे बाद में रिकवर किया जा सकता है।
3. "कॉन्टेक्स्ट-एंकरड बैलेंस्ड शेड्यूलर" (CABS)
एक परफेक्ट मिरर के साथ भी एक जोखिम बना रहता है: क्या होगा अगर कोई टेक्स्ट का एक हिस्सा काट देता है? यदि गुप्त संदेश पूरे टेक्स्ट में समान रूप से फैला हुआ था, तो एक हिस्सा काटने से पूरा संदेश मिट सकता है।
MirrorMark एक स्मार्ट मैनेजर पेश करता है जिसे CABS (Context-Anchored Balanced Scheduler) कहा जाता है।
- उपमा: कल्पना करें कि आप एक लंबी किताब में 100 छोटे नोट्स छिपा रहे हैं। यदि आप उन सभी को पहले अध्याय में छिपा देते हैं, और कोई वह अध्याय फाड़ देता है, तो आप सब कुछ खो देंगे। यदि आप उन्हें रैंडमली छिपाते हैं, तो नोट्स एक जगह जमा हो सकते हैं, जिससे अन्य पृष्ठ खाली रह जाएंगे।
- CABS कैसे काम करता है: CABS एक सावधान लाइब्रेरियन की तरह कार्य करता है। यह लिखे जा रहे टेक्स्ट को देखता है और यह सुनिश्चित करता है कि गुप्त नोट्स पूरी किताब में समान रूप से फैले हों।
- सुरक्षा जाल (Safety Net): यह "फ्रेम" या अध्याय भी बनाता है। यदि कोई एक पेज फाड़ देता है, तो CABS यह सुनिश्चित करता है कि नुकसान केवल उसी एक फ्रेम तक सीमित रहे। बाकी का हिस्सा सिंक्रोनाइज़ (तालमेल में) रहता है, जिससे शेष नोट्स से पूरे संदेश को फिर से जोड़ा जा सकता है। यह वॉटरमार्क को कॉपी-पेस्ट या डिलीशन हमलों से बहुत कठिन बनाता है।
4. प्रयोगों ने क्या दिखाया
शोधकर्ताओं ने LLaMA-2 जैसे AI मॉडल का उपयोग करके अन्य शीर्ष विधियों के विरुद्ध MirrorMark का परीक्षण किया।
- गुणवत्ता (Quality): MirrorMark द्वारा जनरेट किया गया टेक्स्ट सामान्य AI टेक्स्ट से अलग नहीं था। यह रोबोटिक या अजीब नहीं लगा।
- डिटेक्शन (Detection): MirrorMark को अन्य तरीकों की तुलना में पहचानना बहुत आसान था। थोड़े से टेक्स्ट (300 शब्द) के साथ भी, यह उच्च सटीकता के साथ वॉटरमार्क्ड कंटेंट की पहचान कर सका।
- मजबूती (Robustness): जब हमलावरों ने शब्दों को हटाने, नए शब्द जोड़ने या टेक्स्ट के हिस्सों को कॉपी और पेस्ट करके वॉटरमार्क को "तोड़ने" की कोशिश की, तो MirrorMark प्रतिस्पर्धा की तुलना में बहुत बेहतर तरीके से बचा रहा।
- क्षमता (Capacity): यह बहुत सारी जानकारी (मल्टी-बिट) छिपा सकता है, न कि केवल एक साधारण "हाँ/ना" सिग्नल। इसका मतलब है कि यह विवरण ले जा सकता है जैसे कि "इसे किसने बनाया?" या "यह कब बनाया गया था?"
सारांश
MirrorMark एक घोस्ट सिग्नेचर (भूतिया हस्ताक्षर) की तरह है। यह टेक्स्ट पर कोई दृश्य निशान नहीं छोड़ता, यह शब्दों के स्वाद को नहीं बदलता, और यदि आप किताब का एक पन्ना फाड़ देते हैं तो यह टूटता नहीं है। यह इस बात के पीछे के प्राकृतिक रैंडमनेस के भीतर एक जटिल कोड छिपाने के लिए एक गणितीय "मिरर" का उपयोग करता है, जिससे यह सुनिश्चित होता है कि AI का आउटपुट उच्च-गुणवत्ता बना रहे और साथ ही इसे उसके स्रोत तक ट्रैक किया जा सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।