← नवीनतम पेपर
🤖 AI

Vaporizer: Breaking Watermarking Schemes for Large Language Model Outputs

यह शोध पत्र प्रदर्शित करता है कि विभिन्न अर्थ-संरक्षण टेक्स्ट संशोधन हमलों (semantic-preserving text modification attacks) द्वारा अत्याधुनिक लार्ज लैंग्वेज मॉडल वॉटरमार्किंग स्कीम्स को प्रभावी ढंग से तोड़ा जा सकता है, जो वर्तमान प्रणालियों में महत्वपूर्ण कमजोरियों को उजागर करता है और अधिक सुदृढ़ सुरक्षा डिजाइनों की आवश्यकता पर बल देता है।

मूल लेखक: Jonathan Hong Jin Ng, Anh Tu Ngo, Anupam Chattopadhyay

प्रकाशित 2026-05-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Jonathan Hong Jin Ng, Anh Tu Ngo, Anupam Chattopadhyay

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक जादुई स्टैम्प है जो कंप्यूटर द्वारा लिखे गए हर वाक्य पर एक अदृश्य निशान छोड़ देता है। यह "वॉटरमार्क" यह साबित करने के लिए है कि कहानी किसी इंसान ने नहीं, बल्कि एक रोबोट ने लिखी है। इन स्टैम्प्स के निर्माता दावा करते हैं कि वे अटूट हैं, एक गुप्त कोड की तरह जिसे कहानी को नष्ट किए बिना मिटाया नहीं जा सकता।

यह शोध पत्र एक समूह सुरक्षा विशेषज्ञों की तरह है जो उन स्टैम्प्स को तोड़ने की कोशिश कर रहे हैं। उन्होंने एक सरल प्रश्न पूछा: "क्या हम कागज को फटने तक रगड़े बिना अदृश्य स्याही को धो सकते हैं?"

यहाँ उन्होंने क्या पाया, जिसे रोजमर्रा के उदाहरणों के माध्यम से समझाया गया है:

"अदृश्य स्टैम्प" के तीन प्रकार

शोधकर्ताओं ने कंपनियों द्वारा एआई (AI) टेक्स्ट को वॉटरमार्क करने के तीन अलग-अलग तरीकों का परीक्षण किया:

  1. "ग्रीन लाइट" सिस्टम (प्रमाणित रूप से मजबूत): कल्पना कीजिए कि एक ट्रैफिक लाइट सूक्ष्म रूप से एआई को "लाल" शब्दों की तुलना में "हरे" शब्दों को थोड़ा अधिक चुनने के लिए प्रेरित करती है। यह एक सांख्यिकीय (statistical) चाल है। पेपर का दावा है कि यह तोड़ने में सबसे कठिन है, लेकिन यह भी अटूट नहीं है।
  2. "सीक्रेट हैंडशेक" सिस्टम (SynthID): यह एक खेल की तरह है जहाँ एआई एक गुप्त स्कोरिंग नियम के आधार पर शब्द चुनता है। यदि शब्द गुप्त पैटर्न में फिट बैठते हैं, तो वह वॉटरमार्क होता है। शोधकर्ताओं ने पाया कि यह मध्यम रूप से असुरक्षित है।
  3. "डिजिटल सिग्नेचर" सिस्टम (सार्वजनिक रूप से पता लगाने योग्य): यह टेक्स्ट में सीधे एक क्रिप्टोग्राफिक कोड छिपाने की कोशिश करता है, जैसे कि एक छिपा हुआ बारकोड। शोधकर्ताओं ने पाया कि यह पूरी तरह से टूट चुका था। उन्होंने जो भी हमला किया, उसने इस सिग्नेचर को तुरंत मिटा दिया।

"धोने" के तरीके (हमले)

टीम ने केवल स्पंज का उपयोग नहीं किया; उन्होंने वॉटरमार्क को हटाने के लिए तीन अलग-अलग "लॉन्ड्री" तकनीकों का उपयोग किया:

  • थिसॉरस स्वैप (शब्दों का बदलाव - Lexical Changes): जैसे "खुश" को "प्रसन्न" से या "बड़ा" को "विशाल" से बदलना। उन्होंने पाया कि यह सबसे कमजोर तरीका था। इसने वॉटरमार्क को लगभग छुआ तक नहीं और अक्सर टेक्स्ट को अजीब या व्याकरण की गलतियों से भरा बना दिया।
  • अनुवाद लूप (Translation Loop): कल्पना कीजिए कि एक वाक्य को अंग्रेजी से फ्रेंच में अनुवाद करना, और फिर वापस अंग्रेजी में। यह एक संदेश को "टेलीफोन गेम" के माध्यम से चलाने जैसा है। इसने कुछ वॉटरमार्क हटा दिए लेकिन अक्सर टेक्स्ट को बोझिल बना दिया या उसका अर्थ बदल दिया।
  • "एआई रीराइटर" (न्यूरल पैराफ्रेसिंग): यह "न्यूक्लियर विकल्प" था। उन्होंने एक सुपर-स्मार्ट एआई (जैसे पेगासस) का उपयोग टेक्स्ट को फिर से लिखने के लिए किया। यह आपकी कहानी को पूरी तरह से नए ढंग से लिखने के लिए एक पेशेवर संपादक को काम पर रखने जैसा है, जबकि मूल अर्थ वही रहता है।
    • परिणाम: यह सबसे प्रभावी हथियार था। इसने कई मामलों में "ग्रीन लाइट" और "सीक्रेट हैंडसेक" स्टैम्प्स को सफलतापूर्वक मिटा दिया, और "डिजिटल सिग्नेचर" को 100% समय मिटा दिया।

द कैच: "गुणवत्ता बनाम सुरक्षा" का समझौता

यहाँ सबसे महत्वपूर्ण बात है: आप दोनों चीजें एक साथ नहीं पा सकते।

पेपर ने एक स्पष्ट नियम पाया: वॉटरमार्क को तोड़ने के लिए, आपको आमतौर पर टेक्स्ट को नुकसान पहुँचाना पड़ता है।

  • यदि आपने स्टैम्प को बहुत आक्रामक तरीके से हटाने की कोशिश की, तो टेक्स्ट व्याकरण की गलतियों से भर गया, पढ़ने में कठिन हो गया, या अपना मूल अर्थ खो बैठा।
  • हालाँकि, "एआई रीराइटर" (पेगासस) एक मास्टर चोर था। वह वॉटरमार्क को हटाने में सफल रहा और साथ ही टेक्स्ट को लगभग सामान्य बनाए रखा। यह "कोड तोड़ने" और "कागज को बर्बाद न करने" के बीच का सबसे अच्छा संतुलन था।

मुख्य निष्कर्ष

शोधकर्ताओं ने निष्कर्ष निकाला कि वर्तमान "अदृश्य स्टैम्प" नाजुक हैं।

  • "डिजिटल सिग्नेचर" स्टैम्प पहले से ही बेकार है; यह मामूली स्पर्श से ही टूट जाता है।
  • "ग्रीन लाइट" और "सीक्रेट हैंडशेक" स्टैम्प मजबूत हैं, लेकिन एक स्मार्ट एआई रीराइटर अभी भी उन्हें उतार सकता है।

निचोड़ (The Bottom Line):
पेपर का तर्क है कि हम यह साबित करने के लिए इन वर्तमान वॉटरमार्क्स पर भरोसा नहीं कर सकते कि टेक्स्ट एआई-जनरेटेड है या नहीं। "ताले" चुराना बहुत आसान है। इसे ठीक करने के लिए, लेखकों का सुझाव है कि हमें निशान को शब्दों में छिपाने (जैसे स्याही का रंग) के बजाय, कहानी के गहरे अर्थ में छिपाना शुरू करना चाहिए, जिसे कहानी को नष्ट किए बिना बदलना बहुत कठिन है।

तब तक, यदि कोई टेक्स्ट को फिर से लिखकर यह छिपाने की कोशिश करता है कि वह एआई द्वारा लिखा गया है, तो वर्तमान तकनीक उन्हें विश्वसनीय रूप से रोकने में सक्षम नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →