← नवीनतम पेपर
💬 NLP

Robust LLM Watermarking with Minimal Semantic Distortion for IP Protection

यह शोध पत्र SAFESEAL को प्रस्तुत करता है, जो एक नवीन की-कंडीशन्ड वॉटरमार्किंग फ्रेमवर्क है जो संदर्भ-जागरूक पर्यायवाची प्रतिस्थापन (context-aware synonym substitution) और एक कंट्रास्टिव डिटेक्टर के माध्यम से न्यूनतम अर्थ संबंधी विरूपण और तथ्यात्मक निरंतरता बनाए रखते हुए, उच्च पहचान दर और हमलों के विरुद्ध मजबूती प्राप्त करके मालिकाना हक वाले LLMs को बौद्धिक संपदा की चोरी से सुरक्षित करता है।

मूल लेखक: Kieu Dang, Phung Lai, NhatHai Phan, Yelong Shen, Ruoming Jin

प्रकाशित 2026-05-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kieu Dang, Phung Lai, NhatHai Phan, Yelong Shen, Ruoming Jin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपकी एक बेकरी है जहाँ आप ब्रेड की एक गुप्त और स्वादिष्ट रेसिपी बेचते हैं। आप ग्राहकों को ब्रेड बेचते हैं, लेकिन आप नहीं चाहते कि वे आपकी रेसिपी बुक को चुपके से देख लें, उसे कॉपी कर लें, और अपने नाम से आपके ब्रेड का अपना संस्करण बेचना शुरू कर दें। यह वही समस्या है जिसका सामना आज लार्ज लैंग्वेज मॉडल्स (LLMs) को करना पड़ रहा है। OpenAI या Microsoft जैसी कंपनियों ने ये "डिजिटल बेकर्स" बनाए हैं, लेकिन बुरे इरादे रखने वाले लोग उन्हें इतना टेक्स्ट उगलने के लिए झांसा दे सकते हैं जिससे मॉडल को रिवर्स-इंजीनियर किया जा सके, जिससे कंपनी की बौद्धिक संपदा (intellectual property) चोरी हो सकती है।

इसे रोकने के लिए, शोधकर्ताओं ने AI द्वारा जनरेट किए गए टेक्स्ट पर अदृश्य "वॉटरमार्क" लगाने की कोशिश की है। वॉटरमार्क को एक डॉलर के नोट पर लगे एक छोटे, अदृश्य स्याही के स्टैम्प की तरह समझें। यदि आप स्टैम्प देखते हैं, तो आप जानते हैं कि वह असली है। हालाँकि, इन वॉटरमार्क्स के पिछले प्रयासों में एक बड़ी खामी थी: वे डॉलर के नोट पर एक विशाल, भारी स्टैम्प लगाने की तरह थे। इससे कागज खराब हो जाता था, स्याही फैल जाती थी, या बिल पर लिखे नंबर बदल जाते थे। AI के संदर्भ में, इसका मतलब था कि वॉटरमार्क वाला टेक्स्ट अजीब लगता था, मनगढ़ंत तथ्य बताता था, या अपना अर्थ खो देता था।

यह पेपर SAFESEAL को पेश करता है, जो AI टेक्स्ट को वॉटरमार्क करने का एक नया, स्मार्ट तरीका है। यह कैसे काम करता है, इसके लिए सरल उपमाओं (analogies) का उपयोग यहाँ दिया गया है:

1. "सेफ" स्वैप (कहानी को सुरक्षित रखना)

कल्पना कीजिए कि आप एक कहानी को एडिट कर रहे हैं। पिछले वॉटरमार्क्स एक अनाड़ी संपादक की तरह थे जो पात्रों के नाम और घटनाओं की तारीखों सहित सब कुछ बदल देते थे। इससे कहानी खराब हो जाती थी।

SAFESEAL एक बहुत ही सावधान संपादक की तरह है जो दो सख्त नियमों का पालन करता है:

  • नियम 1: "तथ्यों" को कभी न छुएं। यदि कहानी में "न्यूयॉर्क", "मंगलवार", या "डॉ. स्मिथ" का उल्लेख है, तो SAFEAL उन्हें अकेला छोड़ देता है। ये "नेम्ड एंटिटीज" (Named Entities) हैं। इन्हें बदलने से सच्चाई टूट जाएगी।
  • नियम 2: "फ्लेवर वर्ड्स" को बदलें। तथ्यों को बदलने के बजाय, SAFEAL "decided" (तय किया), "said" (कहा), या "happy" (खुश) जैसे सामान्य शब्दों को उनके पर्यायवाची शब्दों जैसे "agreed" (सहमत हुआ), "stated" (कहा), या "joyful" (हर्षित) के साथ बदल देता है।

लेकिन यहाँ जादू है: यह केवल कोई भी पर्यायवाची शब्द नहीं चुनता है। यह यह तय करने के लिए एक सीक्रेट की (Secret Key) (जैसे एक पासवर्ड जिसे केवल मालिक जानता है) का उपयोग करता है कि कौन सा पर्यायवाची शब्द चुनना है। यह एक गुप्त कोडबुक होने जैसा है जो कहता है: "यदि की (key) 'Blue' है, तो 'happy' को 'joyful' में बदलें। यदि की 'Red' है, तो 'happy' को 'cheerful' में बदलें।" यह सुनिश्चित करता है कि कहानी मानव पाठक के लिए बिल्कुल सटीक अर्थ रखती है, लेकिन शब्दों के चयन का विशिष्ट पैटर्न मालिक के लिए अद्वितीय होता है।

2. "डिटेक्टिव" (चोर को पकड़ना)

आप कैसे जानेंगे कि कोई टेक्स्ट आपकी बेकरी द्वारा बनाया गया था? आपको एक डिटेक्टिव की आवश्यकता है।

पुराने डिटेक्टर शर्ट पर लगे एक विशिष्ट दाग को देखने वाले लोगों की तरह थे। यदि चोर ने शर्ट धो दी (टेक्स्ट को फिर से लिख दिया), तो दाग गायब हो जाता था।
SAFESEAL का डिटेक्टिव अधिक स्मार्ट है। यह केवल दाग नहीं देखता; यह गुप्त कोड के पैटर्न को देखता है।

  • डिटेक्टिव एक हाथ में सीक्रेट की (Secret Key) और दूसरे हाथ में टेक्स्ट (Text) रखता है।
  • वह पूछता है: "शब्दों को बदलने का तरीका क्या मेरे की (key) द्वारा बताए गए पैटर्न से मेल खाता है?"
  • भले ही चोर टेक्स्ट को फिर से लिखने (पैराफ्रेस करने) या आपके मॉडल की नकल करने के लिए एक कॉपीकैट AI को प्रशिक्षित करने की कोशिश करे, "सेफ स्वैप्स" का विशिष्ट पैटर्न पता लगाने योग्य रहता है क्योंकि यह सीक्रेट की से जुड़ा होता है।

3. परिणाम: "गोल्डिलॉक्स" ज़ोन (Goldilocks Zone)

पेपर ने अन्य तरीकों के मुकाबले SAFESEAL का परीक्षण किया और पाया कि इसने "गोल्डिलॉक्स" ज़ोन को छू लिया है:

  • बहुत कमजोर नहीं: यह चोरों को 98% बार पकड़ लेता है, भले ही वे वॉटरमार्क को मिटाने की कोशिश करें।
  • बहुत मजबूत नहीं: यह टेक्स्ट को खराब नहीं करता है। वॉटरमार्क वाली कहानियाँ मूल कहानियों की तरह ही स्वाभाविक लगती हैं। वास्तव में, मनुष्यों ने SAFEAL के टेक्स्ट की गुणवत्ता को प्रतिस्पर्धा से बेहतर रेटिंग दी।
  • तेज़: यह बेकरी को धीमा नहीं करता है। यह टेक्स्ट जनरेट करने में बहुत कम समय जोड़ता है।

यह क्यों महत्वपूर्ण है (पेपर के अनुसार)

लेखक दावा करते हैं कि SAFESEAL AI सुरक्षा की सबसे बड़ी सिरदर्द को हल करता है: ट्रेड-ऑफ (Trade-off/समझौता)।

  • पुराना तरीका: मजबूत सुरक्षा = खराब टेक्स्ट गुणवत्ता। अच्छी टेक्स्ट गुणवत्ता = कमजोर सुरक्षा।
  • SAFESEAL: मजबूत सुरक्षा + अच्छी टेक्स्ट गुणवत्ता + तेज़ गति।

उन्होंने एक सार्वजनिक "लीडरबोर्ड" (वीडियो गेम के स्कोरबोर्ड की तरह) भी जारी किया है ताकि कोई भी अपने स्वयं के वॉटरमार्किंग विचारों को SAFESEAL के विरुद्ध टेस्ट कर सके और देख सके कि कौन सबसे अच्छा काम करता है।

संक्षेप में: SAFESEAL आपकी AI के काम पर एक गुप्त, अदृश्य पेन से हस्ताक्षर करने का एक तरीका है जो लेखन की शैली को बस इतना बदल देता है कि स्वामित्व सिद्ध किया जा सके, बिना कहानी को इतना बदलने के कि वह अपठनीय या तथ्यात्मक रूप से गलत हो जाए। यह ब्रेड को खराब किए बिना बेकर की रेसिपी की रक्षा करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →