Can we Watermark Low-Entropy LLM Outputs?
यह शोधपत्र कम-एन्ट्रॉपी (low-entropy) वाले LLM आउटपुट के लिए प्रमाणित रूप से अप्राप्य (undetectable) और सुदृढ़ वॉटरमार्किंग की व्यवहार्यता की जांच करता है, जो नए स्कीमा प्रस्तावित करता है जो विशिष्ट क्रिप्टोग्राफिक धारणाओं के तहत रैंडम प्रतिस्थापन (random substitutions) और विलोपन (deletions) के विरुद्ध लचीले बने रहते हुए निरंतर प्रति-टोकन एन्ट्रॉपी के साथ कार्य करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक मास्टर शेफ (AI) हैं जो किसी के लिए भी स्वादिष्ट, मानवीय भोजन (टेक्स्ट) पका सकते हैं। एक नई समस्या उत्पन्न हुई है: आप यह कैसे सिद्ध करेंगे कि एक विशिष्ट व्यंजन वास्तव में आपकी रसोई द्वारा बनाया गया है और न कि केवल एक रेसिपी बुक से कॉपी किया गया है या किसी अन्य शेफ द्वारा बनाया गया है?
इस पेपर द्वारा प्रस्तावित समाधान एक गुप्त, अदृश्य सामग्री को हर व्यंजन में डालने जैसा है। इसे वॉटरमार्किंग (Watermarking) कहा जाता है।
यहाँ इस पेपर के बड़े विचार, उनके द्वारा हल की गई समस्या और उनके चतुर नए नुस्खे का सरल विवरण दिया गया है।
1. समस्या: "बोरिंग मेनू" की दुविधा
AI टेक्स्ट की वॉटरमार्किंग के पिछले प्रयास एक बड़ी खामी के साथ थे। वे तब बहुत अच्छा काम करते थे जब AI "गहराई से सोच" रहा होता और शब्दों के एक विशाल, विविध मेनू में से चुन रहा होता (उच्च एंट्रॉपी - high entropy)। लेकिन, जब AI "ऑटोपायलट" पर होता या सामान्य वाक्यांशों को दोहरा रहा होता (निम्न एंट्रॉपी - low entropy), तो वे बुरी तरह विफल हो जाते थे।
उपमा (Analogy):
कल्पना कीजिए कि आप एक वाक्य में हर शब्द का पहला अक्षर बदलकर एक गुप्त कोड छिपाने की कोशिश कर रहे हैं।
- उच्च एंट्रॉपी (अच्छा): वाक्य है "The quick brown fox jumps." आप अक्षरों को आसानी से बदल सकते हैं क्योंकि वहां बहुत सारे अलग-अलग शब्द हैं।
- निम्न एंट्रॉपी (बुरा): वाक्य है "The the the the the." यदि आप कोड छिपाने के लिए अक्षरों को बदलने की कोशिश करते हैं, तो आप वाक्य को बिगाड़ देंगे। यह अजीब लगेगा, और लोग जान जाएंगे कि आपने इसमें छेड़छाड़ की है। या, यदि आप अक्षरों को नहीं बदलते हैं, तो कोड गायब हो जाएगा।
पिछले तरीकों के लिए आवश्यक था कि AI "रचनात्मक" (उच्च एंट्रॉपी) हो ताकि वह कोड छिपा सके। लेकिन असल जिंदगी में, AI अक्सर उबाऊ, दोहराव वाला या बहुत ही अनुमानित टेक्स्ट लिखता है। पुराने तरीके उस बोरिंग टेक्स्ट को वॉटरमार्क नहीं कर सके।
2. लक्ष्य: अदृश्य और अटूट
लेखक एक ऐसा वॉटरमार्क चाहते थे जो है:
- अदृश्य (Undetectable): भले ही आप बारीकी से देखें, आप यह नहीं बता पाएंगे कि टेक्स्ट वॉटरमार्क किया गया है। इसका स्वाद बिल्कुल वैसा ही रहता है।
- मजबूत (Robust): भले ही कोई बुरा व्यक्ति शब्दों को बदलकर, वाक्य हटाकर या पर्यायवाची शब्दों को बदलकर टेक्स्ट को "ठीक" करने की कोशिश करे, फिर भी गुप्त कोड पाया जाना चाहिए।
3. समाधान: "हैशिंग" (Hashing) का तरीका
लेखकों ने "बोरिंग" टेक्स्ट में भी कोड छिपाने का एक चतुर तरीका निकाला। उन्होंने शब्दों को सीधे बदलने की कोशिश नहीं की। इसके बजाय, उन्होंने एक गुप्त फ़िल्टर का उपयोग किया।
उपमा: गुप्त रंग फिल्टर (Secret Color Filter)
कल्प_ना कीजिए कि AI रंगीन गेंदों (शब्दों) की एक धारा उत्पन्न कर रहा है।
- पुराना तरीका: संदेश लिखने के लिए गेंदों को लाल या नीला पेंट करने की कोशिश करना। यदि सभी गेंदें एक ही रंग की हैं (निम्न एंट्रॉपी), तो आप उन्हें बिना नकली दिखाए पेंट नहीं कर सकते।
- नया तरीका: आपके पास एक गुप्त रंग फिल्टर (एक हैश फंक्शन) है।
- आप उस गेंद को देखते हैं जिसे AI चुनना चाहता है।
- आप उसे अपने गुप्त फिल्टर से गुजारते हैं।
- यदि फिल्टर कहता है "लाल", तो आप एक ऐसी गेंद चुनते हैं जो लाल दिखती है। यदि यह कहता है "नीला", तो आप एक नीली गेंद चुनते हैं।
- जादू: क्योंकि फिल्टर रैंडम और गुप्त है, AI अभी भी वही सटीक गेंद चुनेगा जो वह वैसे भी चुनता। रंगों का वितरण नहीं बदलता। टेक्स्ट 100% प्राकृतिक दिखता है।
लेकिन, क्योंकि आप पूरे पैराग्राफ के लिए एक ही फिल्टर का उपयोग कर रहे हैं, इसलिए "लाल/नीले" परिणामों का क्रम एक छिपा हुआ कोड (वॉटरमार्क) बनाता है जिसे केवल आप ही पढ़ सकते हैं।
4. यह क्यों एक बड़ी बात है
यह पेपर दो मुख्य सिरदर्दों को हल करता है:
- यह बोरिंग टेक्स्ट पर काम करता है: भले ही AI सिर्फ "The the the" कह रहा हो, गुप्त फिल्टर अभी भी कोड छिपा सकता है क्योंकि यह शब्दों के बजाय उनकी संभावना (probability) को देख रहा है। इसे काम करने के लिए केवल थोड़ी सी रैंडमनेस (एंट्रॉपी) की आवश्यकता होती है, जो उबाऊ टेक्स्ट में भी होती है।
- यह संपादन (Editing) के बावजूद टिका रहता है: यदि कोई शब्द को हटा देता है या "happy" को "joyful" से बदल देता है, तो गुप्त फिल्टर अभी भी पैटर्न खोजने में सक्षम है। यह एक पहेली की तरह है जहाँ आप कुछ टुकड़े खो सकते हैं, लेकिन तस्वीर अभी भी स्पष्ट रहती है।
5. "इमोजी अटैक" की चेतावनी
पेपर यह चेतावनी भी देता है कि बुरे तत्व एक विशेष चाल चल सकते हैं। कल्पना कीजिए कि कोई AI को हर शब्द के बाद एक इमोजी डालने के लिए मजबूर करता है: "The 🍎 the 🍎 the 🍎।"
- यह एक पैटर्न बनाता है जिसमें शून्य रैंडमनेस होती है।
- लेखक दिखाते हैं कि उनका तरीका सामान्य टेक्स्ट को संभाल सकता है, लेकिन यदि कोई AI को एक कठोर, दोहराव वाले पैटर्न (जैसे इमोजी वाला हमला) में धकेल देता है, तो कोड छिपाना बहुत कठिन हो जाता है।
- समाधान: वे सुझाव देते हैं कि जब तक प्रॉम्प्ट "प्राकृतिक" है (जैसे AI से कहानी लिखने के लिए कहना, न कि रोबोट की तरह इमोजी दोहराने के लिए), तब तक सिस्टम पूरी तरह से काम करता है।
सारांश
इस पेपर को AI लेखन के लिए "घोस्ट इंक" (Ghost Ink - अदृश्य स्याही) का आविष्कार करने के रूप में देखें।
- पहले: आप केवल उस कागज पर घोस्ट इंक से लिख सकते थे जो पहले से ही रंगीन, रैंडम रेखाचित्रों से भरा हो। यदि कागज खाली या दोहराव वाला था, तो स्याही नहीं चिपकती थी।
- अब: आप किसी भी कागज पर घोस्ट इंक से लिख सकते हैं, यहाँ तक कि उबाऊ, दोहराव वाले कागज पर भी। स्याही नग्न आंखों के लिए अदृश्य है, और यदि कोई हिस्से को मिटाने या शब्दों को बदलने की कोशिश भी करता है, तो गुप्त संदेश छिपा रहता है लेकिन उस व्यक्ति द्वारा पता लगाने योग्य होता है जिसके पास "जादुई चश्मा" (गुप्त कुंजी) है।
यह हमें यह सिद्ध करने की अनुमति देता है कि टेक्स्ट AI ने लिखा है, भले ही AI केवल सरल, प्राकृतिक वाक्य लिखने का अपना काम कर रहा हो, बिना टेक्स्ट को अजीब या रोबोटिक बनाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।