PASA: A Principled Embedding-Space Watermarking Approach for LLM-Generated Text under Semantic-Invariant Attacks
यह शोध पत्र PASA को प्रस्तुत करता है, जो एक सिद्धांतपूर्ण वॉटरमार्किंग एल्गोरिदम है जो लेटेंट एम्बेडिंग स्पेस के भीतर सिमेंटिक स्तर पर वॉटरमार्क को एम्बेड और डिटेक्ट करता है, जिससे उच्च टेक्स्ट गुणवत्ता और डिटेक्शन सटीकता, मजबूती एवं डिस्टॉर्शन के बीच इष्टतम संतुलन बनाए रखते हुए पैराफ्रेसिंग जैसे सिमेंटिक-इनवेरिएंट हमलों के विरुद्ध मजबूती प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली रोबोट लेखक (एक लार्ज लैंग्वेज मॉडल, या LLM) है जो ऐसी कहानियाँ, ईमेल और लेख लिख सकता है जो लगभग बिल्कुल इंसानों द्वारा लिखे गए शब्दों जैसे लगते हैं। समस्या यह है कि आप कैसे जानेंगे कि कोई टेक्स्ट इस रोबोट से आया है या किसी असली इंसान से? और क्या होगा अगर कोई सिस्टम को धोखा देने की कोशिश करे, जैसे कि रोबोट के टेक्स्ट को लेकर उसे अलग दिखाने के लिए फिर से लिख दे?
यह पेपर PASA नामक एक नई विधि पेश करता है जो इस समस्या को हल करती है। इसे एक उच्च-तकनीकी, अदृश्य वॉटरमार्किंग सिस्टम के रूप में समझें जिसे मिटाना अविश्वसनीय रूप से कठिन है।
यह कैसे काम करता है, यहाँ कुछ सरल उपमाओं का उपयोग किया गया है:
1. समस्या: "पैराफ्रेज़" (Paraphrase) चोर
अधिकांश वर्तमान वॉटरमार्किंग सिस्टम ऐसे होते हैं जैसे वे व्यक्तिगत शब्दों पर सीधे एक गुप्त कोड की मोहर लगा रहे हों।
- पुराना तरीका: कल्पना कीजिए कि रोबोट लिखता है, "The cat sat on the mat" (बिल्ली चटाई पर बैठी थी)। वॉटरमार्क "cat," "sat," और "mat" जैसे विशिष्ट शब्दों में छिपा है।
- हमला: एक बुरा व्यक्ति (या एक चतुर संपादन टूल) आता है और वाक्य को फिर से लिख देता है: "The feline rested on the rug" (बिल्ली कालीन पर विश्राम कर रही थी)।
- विफलता: क्योंकि विशिष्ट शब्द बदल गए हैं, पुराने वॉटरमार्क डिटेक्टर भ्रमित हो जाते हैं। वे अब "cat" या "sat" को नहीं ढूंढ पाते, इसलिए वे सोचते हैं कि टेक्स्ट इंसान द्वारा लिखा गया है। शब्दावली में बदलाव के कारण वॉटरमार्क धुल गया।
2. समाधान: PASA ("थीम" ट्रैकर)
PASA खेल बदल देता है। शब्दों में गुप्त कोड छिपाने के बजाय, यह अर्थ (वाक्य के "थीम" या "वाइब") में गुप्त कोड छिपाता है।
- सिमेंटिक मैप (Semantic Map): कल्पना कीजिए कि रोबोट के मस्तिष्क में एक विशाल मानचित्र है जहाँ सभी शब्दों को उनके दिखने के बजाय उनके अर्थ के आधार पर समूह में रखा गया है।
- समूह A: "Cat," "Feline," "Kitty," "Puss."
- समूह B: "Sit," "Rest," "Lounge," "Perch."
- समूह C: "Mat," "Rug," "Carpet," "Floor."
- गुप्त कुंजी (Secret Key): रोबोट और डिटेक्टर एक गुप्त कुंजी (जैसे पासवर्ड) साझा करते हैं। यह कुंजी उन्हें बताती है कि अगले शब्द के लिए कौन सा "समूह" चुनना है।
- प्रक्रिया:
- रोबोट गुप्त कुंजी को देखता है और निर्णय लेता है, "ठीक है, इस अगले शब्द के लिए, मुझे समूह A से कुछ चुनना चाहिए।"
- वह "Feline" चुनता है (जो समूह A में है)।
- डिटेक्टर, उसी गुप्त कुंजी का उपयोग करते हुए, जानता है, "आह, अगला शब्द समूह A से होना चाहिए।"
- डिटेक्टर "Feline" को देखता है, मानचित्र की जाँच करता है, और कहता है, "हाँ! यह हमारे गुप्त प्लान से मेल खाता है!"
3. यह क्यों मजबूत है ("शेप-शिफ्टर" रक्षा)
अब, वापस चलते हैं उस चोर के पास जिसने "The cat sat on the mat" को "The feline rested on the rug" में बदल दिया।
- पुराना सिस्टम: "Cat" चला गया। "Sit" चला गया। "Mat" चला गया। वॉटरमार्क टूट गया।
- PASA सिस्टम:
- "Feline" अभी भी समूह A में है।
- "Rest" अभी भी समूह B में है।
- "Rug" अभी भी समूह C में है।
- भले ही शब्द बदल गए हों, लेकिन समूह (सिमेंटिक क्लस्टर) बिल्कुल वैसे ही रहे। गुप्त योजना का पूरी तरह से पालन किया गया। डिटेक्टर अभी भी पैटर्न देख सकता है और जानता है, "यह रोबोट द्वारा लिखा गया था।"
4. "डिस्टॉर्शन-फ्री" (विकृति-मुक्त) वादा
आमतौर पर, जब आप किसी रोबोट को एक गुप्त नियम का पालन करने के लिए मजबूर करते हैं, तो वह अजीब, अप्राकृतिक वाक्य लिखने लगता है (जैसे कि एक रोबोट जो समुद्री डाकू की तरह बोलने की कोशिश कर रहा हो)। इसे "डिस्टॉर्शन" (विकृति) कहा जाता है।
PASA विशेष है क्योंकि यह डिस्टॉर्शन-फ्री है।
- उपमा: कल्पना कीजिए कि एक शेफ को एक विशिष्ट टोकरी से ही सामग्री उपयोग करने के लिए कहा गया है। एक खराब सिस्टम शेफ को एक अजीब सामग्री का उपयोग करने के लिए मजबूर कर सकता है ताकि वह टोकरी में फिट हो सके, जिससे स्वाद खराब हो जाता है।
- PASA की ट्रिक: यह एक चतुर दो-चरणीय सैंपलिंग विधि का उपयोग करता है। यह गुप्त कुंजी के आधार पर सही टोकरी (सिमेंटिक समूह) चुनता है, लेकिन फिर यह सामग्री (विशिष्ट शब्द) को ठीक वैसे ही चुनता है जैसे शेफ आमतौर पर करेगा।
- परिणाम: टेक्स्ट 100% प्राकृतिक और उच्च गुणवत्ता वाला लगता है, ठीक रोबोट के सामान्य लेखन की तरह, लेकिन गुप्त पैटर्न फिर भी वहीं रहता है।
5. परिणाम
इस पेपर ने विभिन्न "हमलों" के विरुद्ध इसका परीक्षण किया जहाँ टेक्स्ट को फिर से लिखा गया, पर्यायवाची शब्दों को बदला गया, और वाक्य संरचनाओं को इधर-उधर किया गया।
- परिणाम: PASA मजबूत बना रहा। यहाँ तक कि जब टेक्स्ट को भारी रूप से फिर से लिखा गया था (जैसे "The movie has an interesting plot" को "The film features a fascinating tale" में बदलना), तब भी PASA इसे पहचान सका।
- तुलना: पुराने तरीके इन बदलावों के सामने बुरी तरह विफल रहे, लेकिन PASA ने अपना धैर्य बनाए रखा, जिससे साबित हुआ कि शब्दों की स्पेलिंग के बजाय अर्थ में वॉटरमार्क छिपाना बहुत अधिक सुरक्षित है।
संक्षेप में: PASA शब्दों के बजाय विचारों को टैग करके AI टेक्स्ट को वॉटरमार्क करने का एक तरीका है। इसका मतलब है कि यदि कोई स्रोत को छिपाने के लिए टेक्स्ट को फिर से लिखने की कोशिश करता है, तो भी "विचार टैग" डिटेक्टर के लिए दृश्यमान रहते हैं, और यह सब बिना टेक्स्ट को रोबोटिक या अप्राकृतिक बनाए होता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।