ChainMark: Model-Free LLM Watermarking with Closed-Form Calibration
ChainMark एक मॉडल-मुक्त, सक्रिय वॉटरमार्किंग योजना पेश करता है जो हार्ड मार्कोव ट्रांज़िशन को लागू करने के लिए शब्दावली को की-आधारित अवस्थाओं (keyed states) में विभाजित करता है, जिससे डिटेक्शन मापदंडों का क्लोज्ड-फॉर्म कैलिब्रेशन सक्षम होता है और जनरेटिंग लैंग्वेज मॉडल तक पहुंच की आवश्यकता के बिना ट्रांसलेशन और सब्स्टीट्यूशन हमलों के विरुद्ध प्रमाणित मजबूती प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल पुस्तकालय में घूम रहे हैं जहाँ रोबोट कहानियाँ लिख रहे हैं। कभी-कभी, ये रोबोट इतने अच्छे होते हैं कि आप यह नहीं बता पाते कि कहानी किसी इंसान ने लिखी है या मशीन ने। यह भविष्य के लिए एक बड़ी समस्या है: यदि रोबोट कुछ भी लिख सकते हैं, तो हम कैसे जानेंगे कि क्या वास्तविक है? वैज्ञानिक इसे हल करने की कोशिश कर रहे हैं, इसके लिए वे रोबोट को अपना काम चिह्नित करने का एक गुप्त तरीका दे रहे हैं, जैसे कि एक छिपा हुआ हस्ताक्षर जिसे केवल एक विशेष डिटेक्टर ही देख सके। इसे "वॉटरमार्किंग" कहा जाता है। इसे एक वाक्य के डीएनए में छिपे एक गुप्त कोड की तरह समझें।
हालाँकि, इन कोडों की जाँच करना पेचीदा रहा है। अधिकांश पुराने तरीके "पासवर्ड अनुमान लगाने" के खेल की तरह हैं जिसके लिए काम की जाँच करने के लिए स्वयं रोबोट का उपस्थित होना आवश्यक है। यदि रोबोट चला गया हो, या यदि कोई कहानी को थोड़ा बदल देता है (जैसे कि उसे दूसरी भाषा में अनुवाद करना), तो पुराने कोड अक्सर टूट जाते हैं या गायब हो जाते हैं। इसके अलावा, नियामक (वे लोग जो नियम बनाते हैं) एक सरल तरीका चाहते हैं जिससे वे कह सकें, "मुझे एक ऐसा कोड चाहिए जो 1% से कम बार गलत हो, छोटे टेक्स्ट पर काम करे, और संपादन (edits) के बाद भी बना रहे," लेकिन उनके पास इंजीनियरों को यह बताने के लिए कोई स्पष्ट सूत्र नहीं था कि उस कोड को ठीक से कैसे बनाया जाए।
यह शोध पत्र एक नया समाधान पेश करता है जिसे ChainMark कहा जाता है। यह एक चतुर, "मॉडल-फ्री" वॉटरमार्क है, जिसका अर्थ है कि आपको काम की जाँच करने के लिए रोबगर की आवश्यकता नहीं है—आपको बस एक गुप्त कुंजी (secret key) की आवश्यकता है। लेखकों ने एक ऐसा कोड बनाने का तरीका खोजा है जो एक गुप्त नृत्य की तरह कार्य करता है। वे दिखाते हैं कि यह नृत्य विशिष्ट प्रकार के हमलों के खिलाफ तोड़ना बहुत कठिन है, और वे एक स्पष्ट, गणितीय रेसिपी प्रदान करते हैं जिससे नियामक इंजीनियरों को यह बता सकें कि इसे बिल्कुल कैसे सेट किया जाए।
गुप्त नृत्य: ChainMark कैसे काम करता है
कल्पना कीजिए कि रोबोट की शब्दावली (उसके द्वारा उपयोग किए जाने वाले सभी शब्द) रंगीन टाइलों का एक विशाल डिब्बा है। ChainMark एक गुप्त कुंजी लेता है और हर एक टाइल को पाँच रंगीन डिब्बों में से एक में वर्गीकृत करता है (मान लीजिए लाल, नीला, हरा, पीला और बैंगनी)। ये डिब्बे एक घेरे में व्यवस्थित हैं, जैसे कि एक घड़ी का चेहरा: लाल → नीला → हरा → पीला → बैंगनी → लाल।
जब रोबोट कहानी लिख रहा होता है, तो ChainMark उसे कोई भी शब्द चुनने नहीं देता। कहानी के कुछ खास स्थानों पर (लगभग आधे समय), रोबोट को एक ऐसा शब्द चुनने के लिए मजबूर किया जाता है जो घेरे में अगले रंग का हो। यदि पिछला शब्द लाल था, तो अगला शब्द अनिवार्य रूप से नीला होना चाहिए। यदि पिछला नीला था, तो अगला अनिवार्य रूप से हरा होना चाहिए। रोबोट अभी भी अपने लिए सबसे अच्छा शब्द चुनता है, लेकिन उसे केवल "नीले" डिब्बे से ही चुनने की अनुमति है।
यह पाठ (text) के माध्यम से एक छिपा हुआ मार्ग, या एक "श्रृंखला" (chain) बनाता है। कहानी अनिवार्य रूप से इस रंगीन घड़ी के चारों ओर घूम रही है।
बिना रोबोट के जासूस
यही जादू वाला हिस्सा है: आपको यह जाँचने के लिए कि क्या कोई कहानी वॉटरमार्क की गई है, रोबोट की आवश्यकता नहीं है। आपको बस गुप्त कुंजी और टेक्स्ट की आवश्यकता है। एक सत्यापनकर्ता (जासूस) टेक्स्ट लेता है, गुप्त कुंजी का पता लगाता है, और प्रत्येक शब्द को उनके रंगीन डिब्बों में फिर से वर्गीकृत करता है। फिर, वे बस यह गिनते हैं कि कितनी बार रंग सही क्रम (लाल से नीला, नीला से हरा, आदि) का पालन करते हैं।
यदि कहानी किसी इंसान या बिना गुप्त कोड वाले रोबोट द्वारा लिखी गई थी, तो रंग बेतरतीब ढंग से उछलेंगे। गलती से सही क्रम प्राप्त करने की संभावना बहुत कम है (केवल 5 में से 1, या 20%)। लेकिन यदि कहानी ChainMark के साथ लिखी गई थी, तो रंग लगभग पूरी तरह से श्रृंखला का पालन करेंगे। जासूस यह गणित पलक झपकते ही कर लेता है, बिना रोबोट से मदद मांगे।
यह एक बड़ी बात क्यों है
शोध पत्र दिखाता है कि ChainMark ने उन तीन बड़ी समस्याओं को हल किया है जो अन्य तरीकों के पास थीं:
- रोबोट की आवश्यकता नहीं: पुराने तरीकों में अक्सर काम की जाँच करने के लिए रोबोट के "मस्तिष्क" की आवश्यकता होती थी। ChainMark को केवल टेक्स्ट और कुंजी की आवश्यकता होती है। इसका मतलब है कि एक तीसरा पक्ष, जैसे कि नियामक या समाचार संपादक, बिना किसी कंपनी के गुप्त AI मॉडल तक पहुँच के यह जाँच सकता है कि कहानी AI-जनित है या नहीं।
- परफेक्ट रेसिपी: लेखकों ने एक "क्लोज्ड-फॉर्म" (closed-form) सूत्र निकाला है। यह एक फैंसी तरीका है कहने का कि उन्होंने एक सीधा गणितीय समीकरण खोज लिया है। यदि एक नियामक कहता है, "मुझे 200 शब्दों के टेक्स्ट के लिए 1% की गलत सूचना दर (false alarm rate) चाहिए," तो इंजीनियर उन नंबरों को सूत्र में डाल सकता है और तुरंत जान सकता है कि उसे कितने रंगीन डिब्बे उपयोग करने चाहिए। अब कोई अनुमान या परीक्षण-और-त्रुटि (trial-and-error) की आवश्यकता नहीं है।
- यह "अनुवाद हमले" (Translation Attack) से बच जाता है: पुराने वॉटरमार्क को तोड़ने का एक बड़ा तरीका टेक्स्ट को दूसरी भाषा (जैसे चीनी) में अनुवाद करना और फिर उसे वापस अनुवाद करना है। यह आमतौर पर गुप्त कोड को अस्त-व्यस्त कर देता है। शोध पत्र ने इसी स्थिति में ChainMark का परीक्षण किया और पाया कि यह अविश्वसनीय रूप से मजबूत है। यहाँ तक कि टेक्स्ट को चीनी में अनुवाद करने और वापस लाने के बाद भी, ChainMark ने वॉटरमार्क किए गए टेक्स्ट को 72.8% बार सही ढंग से पहचाना। इसके विपरीत, अन्य लोकप्रिय तरीकों (जिन्हें KGW और SWEET कहा जाता है) की सफलता दर समान परिस्थितियों में 20% से नीचे गिर गई।
ट्रेड-ऑफ (समझौता)
शोध पत्र ईमानदार है। इस गुप्त नृत्य को काम करने के लिए, रोबोट को शब्द चुनते समय थोड़ा अधिक प्रतिबंधित होना पड़ता है। यह टेक्स्ट को पूरी तरह से स्वतंत्र रोबोट की तुलना में थोड़ा कम "प्रवाहपूर्ण" (fluent) या स्वाभाविक बनाता है। लेखकों ने इसे "परप्लेक्सिटी" (perplexity) नामक स्कोर का उपयोग करके मापा है। ChainMark का स्कोर लगभग 3.66 था, जबकि अन्य तरीकों का स्कोर लगभग 1.80 से 1.93 के बीच था। इसका मतलब है कि ChainMark अन्य तरीकों की तुलना में लगभग दोगुना "कठोर" है, लेकिन बदले में, यह तोड़ने में बहुत कठिन और बिना रोबोट के सत्यापित करने में बहुत आसान है।
"यूनिवर्सल" सुरक्षा जाल
शोध पत्र ने यह भी खोजा कि एक "ब्लाइंड" हमलावर (वह जिसके पास गुप्त कुंजी नहीं है) के खिलाफ कोड कितना संपादन झेल सकता है। उन्होंने गणितीय रूप से सिद्ध किया कि यदि कोई शब्दों को बेतरतीब ढंग से बदल देता है (जैसे "कट और पेस्ट" हमला), तो कोड तब तक जीवित रहता है जब तक कि संपादन टेक्स्ट के 29.3% से कम हो। यह एक "यूनिवर्सल कांस्टेंट" है, जिसका अर्थ है कि इससे कोई फर्क नहीं पड़ता कि आप कितने रंगीन डिब्बे उपयोग करते हैं या टेक्स्ट कितना लंबा है; कोड उस विशिष्ट 29.3% की दीवार तक टिका रहता है।
हालाँकि, लेखक यह ध्यान दिलाते हैं कि इस सुरक्षा जाल की सीमाएँ हैं। यह यादृच्छिक बदलावों (random swaps) और अनुवाद पर लागू होता है, लेकिन यह एक "सुपर-स्मार्ट हैकर" के खिलाफ सुरक्षा की गारंटी नहीं देता जो गुप्त कुंजी जानता हो या पैटर्न को समझने के लिए डिटेक्टर से बार-बार सवाल पूछता हो। इसके अतिरिक्त, शोध पत्र ने अभी तक जटिल व्याकरण-संरक्षण वाले पुनर्लेखन (जहाँ अर्थ वही रहता है लेकिन शब्द बदल जाते हैं) का परीक्षण नहीं किया है, इसलिए हालांकि कोड अनुवाद और यादृच्छिक बदलावों के खिलाफ बहुत मजबूत है, फिर भी अन्य प्रकार के हमलों पर काम करने की गुंजाइश है।
यह क्या नहीं है
लेखक स्पष्ट करते हैं कि उनकी विधि क्या नहीं करती है। वे स्वीकार करते हैं कि यदि कोई सुपर-स्मार्ट हैकर गुप्त कुंजी जानता है या पैटर्न को समझने के लिए डिटेक्टर से बार-बार सवाल पूछता है, तो वे इसे तोड़ सकते हैं। शोध पत्र एक "ब्लाइंड" हमलावर पर केंद्रित है जिसके पास कुंजी नहीं है। साथ ही, उन्होंने अभी तक हर प्रकार के संपादन (जैसे जटिल व्याकरण संबंधी पुनर्लेखन जो अर्थ को बिल्कुल वैसा ही रखते हैं) का परीक्षण नहीं किया है, इसलिए हालांकि कोड अनुवाद और यादृच्छिक बदलावों के खिलाफ बहुत मजबूत है, फिर भी अन्य प्रकार के हमलों के विरुद्ध काम करने की आवश्यकता है।
निष्कर्ष
ChainMark एक AI लेखक को एक गुप्त, कठिन-से-तोड़ने वाला नृत्य कदम देने जैसा है जो पदचिह्नों का एक निशान छोड़ता है—बशर्ते हमलावर कुंजी के प्रति अंधा हो और हमला यादृच्छिक या अनुवाद संबंधी हो। भले ही कोई कहानी का अनुवाद करके या शब्दों को बदलकर पदचिह्नों को मिटाने की कोशिश करे, पैटर्न फिर भी दिखाई देता है यदि आपके पास गुप्त कुंजी है। सबसे महत्वपूर्ण बात यह है कि यह नियामकों को इन वॉटरमार्क्स को ठीक से स्थापित करने के लिए स्पष्ट, गणितीय निर्देश पुस्तिका देता है, बिना यह अनुमान लगाए या AI कंपनी पर निर्भर हुए कि जाँच कैसे की जाए। यह एक ऐसे भविष्य की ओर एक कदम है जहाँ हम अपने डिजिटल टेक्स्ट पर भरोसा कर सकते हैं, यह जानते हुए कि इसे किसने (या किस चीज़ ने) लिखा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।