← नवीनतम पेपर
💬 NLP

SLAM: Structural Linguistic Activation Marking for Language Models

SLAM (स्ट्रक्चरल लिंग्विस्टिक एक्टिवेशन मार्किंग) एक नवीन व्हाइट-बॉक्स वॉटरमार्किंग योजना है जो रेसिडुअल स्ट्रीम में स्पार्स ऑटोएन्कोडर-पहचाने गए स्ट्रक्चरल दिशाओं को निर्देशित करके, लेक्सिकल सैंपलिंग और सिमेंटिक्स को संरक्षित करते हुए तथा पारंपरिक टोकन-डिस्ट्रीब्यूशन विधियों के पूरक रोबस्टनेस प्रोफाइल प्रदान करते हुए, न्यूनतम गुणवत्ता हानि के साथ लगभग पूर्ण डिटेक्शन सटीकता प्राप्त करती है।

मूल लेखक: Fabrice Harel-Canada, Amit Sahai

प्रकाशित 2026-05-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fabrice Harel-Canada, Amit Sahai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ SLAM: Structural Linguistic Activation Marking for Language Models पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए हिंदी अनुवाद दिया गया है।

बड़ी समस्या: "गुणवत्ता बनाम वॉटरमार्क" का द्वंद्व

कल्पना कीजिए कि आप एक बेकर (AI मॉडल) हैं जो स्वादिष्ट ब्रेड (टेक्स्ट) बना रहे हैं। आप हर लोफ (loaf) पर एक छोटा, अदृश्य स्टैम्प लगाना चाहते हैं ताकि लोगों को पता चल सके कि यह आपकी बेकरी से आया है, न कि किसी नकली बेकरी से।

  • पुराने तरीके (टोकन-डिस्ट्रीब्यूशन वॉटरमार्क्स): ब्रेड पर स्टैम्प लगाने के लिए, बेकर बेहतरीन सामग्री को बदलना शुरू कर देता है। ताज़ा, उच्च गुणवत्ता वाले आटे के बजाय, वे जानबूझकर एक विशिष्ट, थोड़े पुराने ब्रांड के आटे का उपयोग करने के लिए मजबूर होते हैं ताकि स्टैम्प दिखाई दे सके।
    • परिणाम: ब्रेड अभी भी ब्रेड जैसी दिखती है, लेकिन उसका स्वाद थोड़ा खराब हो जाता है। यह कम फूली हुई, कम स्वादिष्ट और कभी-कभी बनावट में अजीब हो जाती है। यह वर्तमान AI वॉटरमार्क्स के साथ होता है: वे AI को एक गुप्त कोड छिपाने के लिए विशिष्ट शब्दों (टोकन्स) को चुनने के लिए मजबूर करते हैं, जिससे लेखन का स्वाभाविक प्रवाह और गुणवत्ता बिगड़ जाती है।
  • लक्ष्य: हम एक ऐसा वॉटरमार्क चाहते हैं जो स्वाद कलिकाओं (quality) के लिए अदृश्य हो लेकिन निरीक्षक (detection) के लिए दृश्यमान हो।

नया समाधान: SLAM (स्ट्रक्चरल लिंग्विस्टिक एक्टिवेशन मार्किंग)

इस पेपर के लेखक ब्रेड पर स्टैम्प लगाने का एक नया तरीका प्रस्तावित करते हैं। सामग्री (शब्दों) को बदलने के बजाय, वे आटे के आकार (वाक्य की संरचना) को बदलते हैं।

उपमा: अदृश्य वास्तुकार (The Invisible Architect)
कल्पना कीजिए कि AI एक घर बना रहा है।

  • पुराने वॉटरमार्क्स: वास्तुकार बिल्डर को मजबूर करता है कि वह नींव के लिए केवल लाल ईंटों का उपयोग करे, भले ही नीली ईंटें बेहतर दिखतीं। इससे घर थोड़ा अजीब दिखने लगता है।
  • SLAM: वास्तुकार ईंटों को नहीं बदलता। इसके बजाय, वे बिल्डर के आंतरिक ब्लूप्रिंट (खाके) को एक गुप्त निर्देश फुसफुसाते हैं: "गलियारे को सीधा रखने के बजाय उसमें हल्का सा घुमाव दें।"
    • ईंटें (शब्द) अभी भी स्वाभाविक रूप से चुनी जाती हैं। घर अभी भी एकदम सही दिखता है और महसूस होता है।
    • लेकिन, यदि आप ब्लूप्रिंट (AI के आंतरिक गणित) को देखते हैं, तो आप देख सकते हैं कि एक विशिष्ट घुमावदार गलियारा बनाया गया था। वह घुमाव ही वॉटरमार्क है।

यह कैसे काम करता है ("जादुई" चरण)

  1. "स्ट्रक्चरल स्विचेस" खोजना:
    शोधकर्ताओं ने स्पार्स ऑटोएनकोडर (SAE) नामक एक टूल का उपयोग किया। इसे AI के मस्तिष्क के अंदर देख सकने वाला एक सुपर-पावर्ड एक्स-रे समझें। उन्होंने AI के भीतर विशिष्ट "स्विच" या "नॉब्स" (knobs) का पता लगाया जो व्याकरण और संरचना को नियंत्रित करते हैं—जैसे "पैसिव वॉइस" बनाम "एक्टिव वॉइस" का नॉब, या "भूतकाल" बनाम "वर्तमान काल" का नॉब।

    • मुख्य अंतर्दृष्टि: ये स्ट्रक्चरल नॉब्स सार्वभौमिक (universal) हैं। एक बैंकर या वैज्ञानिक के बारे में वाक्य एक ही "पैसिव वॉइस" नॉब का उपयोग करते हैं। यह इस वॉटरमार्क को विषय बदलने पर भी मजबूत बनाता है।
  2. स्टीयरिंग, सैंपलिंग नहीं:
    जब AI एक वाक्य लिखता है, तो SLAM उन विशिष्ट नॉब्स को धीरे से घुमाता है। यह AI को "is" के बजाय "was" शब्द चुनने के लिए मजबूर नहीं करता है। यह बस AI को उस वाक्य संरचना को पसंद करने के लिए प्रेरित करता है जो "was" का उपयोग करती है।

    • क्योंकि AI अभी भी कोई भी शब्द चुनने के लिए स्वतंत्र है, इसलिए टेक्स्ट स्वाभाविक, विविध और उच्च गुणवत्ता वाला लगता है।
  3. चिह्न का पता लगाना (Detecting the Mark):
    यह जाँचने के लिए कि क्या कोई टेक्स्ट वॉटरमार्क किया गया है, आप यह नहीं गिनते कि एक विशिष्ट शब्द कितनी बार आता है। इसके बजाय, आप फिर से "ब्लूप्रिंट" को देखते हैं। आप देखते हैं कि क्या "पैसिव वॉइस" वाले नॉब को घुमाया गया था। यदि ब्लूप्रिंट दिखाता है कि गुप्त घुमाव बनाया गया था, तो टेक्स्ट वॉटरमार्क किया गया है।

परिणाम: एक जीत-जीत (एक पकड़ के साथ)

पेपर ने Gemma AI मॉडल के दो संस्करणों (एक छोटा 2B संस्करण और एक बड़ा 9B संस्करण) पर परीक्षण किया।

  • गुणवत्ता (Quality): वॉटरमार्क किया गया टेक्स्ट सामान्य टेक्स्ट से लगभग अभिन्न था।
    • स्कोर: पुराने तरीकों ने लगभग 7 से 11 "क्वालिटी पॉइंट्स" खो दिए। SLAM ने केवल लगभग 1 से 2 पॉइंट खोए।
    • उपमा: यदि सामान्य ब्रेड 10/10 है, तो पुराने वॉटरमार्क्स ने इसे 3/10 बना दिया। SLAM ने इसे 9/10 बनाए रखा।
  • डिटेक्शन (Detection): यह वॉटरमार्क किए गए टेक्स्ट को पहचानने में 100% सटीक था।

समझौता (The Catch):
हर सिक्के के दो पहलू होते हैं।

  • पुराने वॉटरमार्क्स: यदि कोई टेक्स्ट को बदलने के लिए शब्दों (पर्यायवाची) को बदल देता है या एक शब्द को हटा देता है, तो वॉटरमार्क आमतौर पर जीवित रहता है। लेकिन यदि कोई वाक्य की संरचना को पूरी तरह से बदल देता है (पैराफ्रेसिंग), तो वॉटरमार्क टूट जाता है।
  • SLAM: यह इसके विपरीत है!
    • शब्द-स्तर के हमले (Word-level attacks): यदि कोई "happy" को "joyful" से बदल देता है या एक शब्द को हटा देता है, तो SLAM पूरी तरह से सुरक्षित रहता है (100% डिटेक्शन)।
    • संरचना-स्तर के हमले (Structure-level attacks): यदि कोई वाक्यों को पूरी तरह से पुनर्गठित करने के लिए टूल का उपयोग करता है (उदाहरण के लिए, "The cat chased the dog" बन जाता है "The dog was chased by the cat"), तो वॉटरमार्क गायब हो जाता है।
    • क्यों? क्योंकि SLAM संरचना में रहता है। यदि आप संरचना को तोड़ देते हैं, तो चिह्न चला जाता है। पेपर नोट करता है कि यह एक गणना किया गया जोखिम है: उन्होंने मानव-लिखित टेक्स्ट जैसा महसूस कराने को प्राथमिकता दी, बजाय इसके कि इसे मानव संपादक द्वारा अटूट बनाया जाए।

एक वाक्य में सारांश

SLAM AI टेक्स्ट को वॉटरमार्क करने का एक नया तरीका है जो गुप्त कोड को शब्दों के बजाय व्याकरण और वाक्य की आकृति में छिपाता है, जिससे AI सुंदर, स्वाभाविक टेक्स्ट लिख पाता है और साथ ही निरीक्षकों के लिए एक पता लगाने योग्य फिंगरप्रिंट भी छोड़ता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →