Topic-Based Watermarks for Large Language Models
यह शोध पत्र बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) के लिए एक हल्का, विषय-निर्देशित वॉटरमार्किंग (वॉटरमार्किंग) तंत्र प्रस्तावित करता है जो पाठ की गुणवत्ता को बनाए रखते हुए और बिना किसी अतिरिक्त फ्रेमवर्क ओवरहेड के, मजबूत, पता लगाने योग्य हस्ताक्षरों को एम्बेड करने के लिए शब्दावली को विषय-संरेखित उपसमूहों में विभाजित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने एक स्वादिष्ट, बेहतरीन केक बनाया है। आप इसे बेचना चाहते हैं, लेकिन आप चिंतित हैं कि कोई आपकी रेसिपी चुरा सकता है, दावा कर सकता है कि उन्होंने इसे बनाया है, या बाद में आपके केक का उपयोग करके हज़ारों खराब, जले हुए केक बना सकता है। आपको यह साबित करने के लिए एक तरीके की आवश्यकता है कि, "हे, यह मैंने बनाया है!" बिना स्वाद या बनावट बदले।
यह वह समस्या है जिसका सामना लार्ज लैंग्वेज मॉडल्स (LLMs) जैसे ChatGPT को करना पड़ता है। वे टेक्स्ट इतनी अच्छी तरह से लिखते हैं कि यह बताना असंभव हो जाता है कि इंसान ने लिखा है या रोबोट ने। यह खतरनाक है क्योंकि बुरे तत्व AI का उपयोग झूठ फैलाने के लिए कर सकते हैं, और यदि AI, AI द्वारा लिखे गए टेक्स्ट पर ही ट्रेनिंग लेने लगे, तो मॉडल अंततः मूर्ख हो जाएंगे (जैसे फोटोकॉपी की फोटोकॉपी करने वाली फोटोकॉपी मशीन)।
आपने जो पेपर साझा किया है, वह एक नया समाधान प्रस्तावित करता है जिसे टॉपिक-बेस्ड वॉटरमार्किंग (TBW) कहा जाता है। यह कैसे काम करता है, यहाँ सरल रूप में समझाया गया है:
पुराना तरीका: "रैंडम ग्रीन लाइट"
पिछले तरीकों ने टेक्स्ट में वॉटरमार्क लगाने की कोशिश की, जिसमें कुछ शब्दों को रैंडम तरीके से चुना जाता था और उन्हें अधिक बार उपयोग करने के लिए "ग्रीन लाइट" दी जाती थी।
- उपमा (Analogy): एक चौराहे पर ट्रैफिक लाइट की कल्पना करें। AI गाड़ी चला रहा है, और सिस्टम रैंडम तरीके से कहता है, "ठीक है, आज, केवल लाल रंग की कारों को ही बाएं मुड़ने की अनुमति है।"
- समस्या: यदि AI को लाल कार चुनने के लिए मजबूर किया जाता है जबकि वह वास्तव में नीली कार चाहता था, तो वाक्य अजीब या अप्राकृतिक लग सकता है। इसके अलावा, यदि कोई बुरा व्यक्ति कुछ शब्दों को बदल देता है (पैराफ्रेसिंग), तो "लाल कार" वाला नियम टूट जाता है, और वॉटरमार्क गायब हो जाता है। यह किसी वाक्य में अस्पष्ट शब्दों का उपयोग करने की शर्त रखकर गुप्त संदेश छिपाने जैसा है; यह स्पष्ट और नाजुक है।
नया तरीका: "थीमैटिक प्लेलिस्ट"
लेखकों का नया तरीका, TBW, अधिक स्मार्ट है। रैंडम शब्द चुनने के बजाय, यह बातचीत के विषय (Topic) के आधार पर शब्द चुनता है।
- उपमा: कल्पना करें कि AI एक डीजे (DJ) है जो सेट बजा रहा है।
- चरण 1 (विषय): डीजे भीड़ की मांग (प्रॉम्प्ट) को देखता है। यदि भीड़ "स्पोर्ट्स" मांगती है, तो डीजे सिर्फ रैंडम गाने नहीं चुनता; वह "स्पोर्ट्स प्लेलिस्ट" निकाल लेता है।
- चरण 2 (ग्रीन लिस्ट): इस प्लेलिस्ट में खेल से संबंधित सभी शब्द होते हैं (जैसे, गोल, कोच, स्टेडियम, बॉल)।
- चरण 3 (वॉटरमार्क): डीजे को गुप्त रूप से निर्देश दिया जाता है कि वह इस "स्पोर्ट्स प्लेलिस्ट" के गानों को सामान्य से थोड़ा अधिक बार बजाए।
- परिणाम: संगीत (टेक्स्ट) अभी भी एकदम सही लगता है क्योंकि "गोल" और "कोच" स्पोर्ट्स थीम में स्वाभाविक रूप से फिट बैठते हैं। लेकिन क्योंकि AI उस विशिष्ट प्लेलिस्ट पर बहुत अधिक झुकाव रखता है, इसलिए एक जासूस बाद में गानों की सूची देखकर कह सकता है, "आह, यह डीजे निश्चित रूप से स्पोर्ट्स प्लेलिस्ट से गाने बजा रहा था। यह हमारा वॉटरमार्क है!"
यह बेहतर क्यों है?
- यह स्वाभाविक लगता है (Fluency): क्योंकि AI उन शब्दों को चुन रहा है जो पहले से ही विषय के अनुकूल हैं, टेक्स्ट रोबोटिक या जबरदस्ती का नहीं लगता। यह ठीक वैसा ही है जैसे डीजे सही शैली का संगीत बजा रहा हो; कोई भी गुप्त नियम नोटिस नहीं करता।
- यह टूटना कठिन है (Robustness): यदि कोई टेक्स्ट को फिर से लिखने (पैराफ्रेस करने) की कोशिश करता है, तो वे आमतौर पर वही विषय बनाए रखते हैं। यदि आप सॉकर के बारे में कहानी को फिर से लिखते हैं, तो आप अभी भी गोल और टीम जैसे शब्दों का उपयोग करेंगे। चूंकि वॉटरमार्क शब्दों के थीम में छिपा है, न कि केवल रैंडम अक्षरों में, इसलिए वॉटरमार्क पुनर्गठन (Rewrite) के बाद भी जीवित रहता है।
- यह तेज़ है (Efficiency): पुराने, सुपर-रोबस्ट तरीकों के लिए आवश्यक था कि AI टेक्स्ट लिखे, उसे चेक करे, दोबारा लिखे और फिर से चेक करे (जैसे एक छात्र निबंध को पाँच बार फिर से लिखता है ताकि उसे 'A' ग्रेड मिल सके)। यह नया तरीका AI के लिखते समय ही "प्लेलिस्ट" में बदलाव कर देता है, इसलिए यह सामान्य लेखन जितना ही तेज़ है।
"डिटेक्टिव" वाला हिस्सा
हम वॉटरमार्क को कैसे ढूंढते हैं? पेपर तीन तरीके सुझाता है, लेकिन सबसे अच्छा "मैक्सिमम स्कोर" तरीका है।
- उपमा: कल्पना करें कि आपको एक रहस्यमय नोट मिलता है। आप नहीं जानते कि यह स्पोर्ट्स, एनिमल्स या मेडिसिन के बारे में है।
- पुराना तरीका: आप पहले विषय का अनुमान लगाते हैं। यदि आपका अनुमान गलत निकला, तो आप वॉटरमार्क नहीं ढूंढ पाएंगे।
- नया तरीका (TBW): आप एक साथ सभी संभावित प्लेलिस्ट के विरुद्ध उस नोट की जांच करते हैं। आप पूछते हैं: "क्या यह नोट स्पोर्ट्स प्लेलिस्ट से आया हुआ लग रहा है? या एनिमल्स प्लेलिस्ट से?" आप उस प्लेलिस्ट को चुनते हैं जो सबसे अच्छा मेल खाता है। भले ही नोट अव्यवस्थित या छोटा हो, यह तरीका पैटर्न को पहचानने में इतना सक्षम है कि यह लगभग कभी गलती नहीं करता।
निष्कर्ष
लेखकों ने एक ऐसा सिस्टम बनाया है जो AI टेक्स्ट के भीतर एक "डिजिटल फिंगरप्रिंट" छिपाता है, जो AI को बातचीत के विषय के अनुकूल शब्दों का उपयोग करने के लिए प्रेरित करता है।
- उपयोगकर्ता के लिए: टेक्स्ट पहले जैसा ही अच्छा लगता है।
- AI कंपनी के लिए: वे साबित कर सकते हैं कि यह उनके AI द्वारा लिखा गया है, भले ही कोई इसे एडिट या फिर से लिखने की कोशिश करे।
- दुनिया के लिए: यह AI-जनरेटेड झूठ के प्रसार को रोकने में मदद करता है और AI मॉडल्स को अपने ही खराब आउटपुट को खाने से रोकता है।
यह एक केक पर एक छोटे, अदृश्य, मिटाया न जा सकने वाले स्टिकर लगाने जैसा है जिस पर लिखा है "AI द्वारा बनाया गया", लेकिन स्टिकर केक के ही फ्रॉस्टिंग से बना है, इसलिए कोई भी इसे चख नहीं सकता या आसानी से खुरच नहीं सकता।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।