← नवीनतम पेपर
💬 NLP

QuantileMark: A Message-Symmetric Multi-bit Watermark for LLMs

QuantileMark बड़े भाषा मॉडलों (large language models) के लिए एक व्हाइट-बॉक्स मल्टी-बिट वॉटरमार्किंग विधि है जो निरंतर संचयी वितरण (continuous cumulative distribution) में समान-द्रव्यमान वाली संभाव्यता बिनों (equal-mass probability bins) के भीतर संदेशों को एम्बेड करके संदेश समरूपता (message symmetry) और मजबूत पहचान सुनिश्चित करती है, जिससे पीढ़ी की गुणवत्ता बनाए रखते हुए सभी संदेशों में समान साक्ष्य शक्ति (uniform evidence strength) प्राप्त होती है।

मूल लेखक: Junlin Zhu, Baizhou Huang, Xiaojun Wan

प्रकाशित 2026-04-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junlin Zhu, Baizhou Huang, Xiaojun Wan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपकी एक बेकरी है जहाँ आप हर दिन हज़ारों स्वादिष्ट, कस्टम केक बेचते हैं। आप जानना चाहते हैं कि कौन सा केक किस बेकर ने बनाया है, ताकि अगर कोई नकली केक बेचने की कोशिश करे या कोई केक खराब निकले, तो आपके पास जानकारी हो। इसलिए, आप हर केक में एक छोटा, अदृश्य "गुप्त सामग्री" (secret ingredient) छिपाने का फैसला करते हैं।

पिछली विधियों के साथ समस्या कुछ ऐसी थी: कल्पना कीजिए कि आपके पास 100 अलग-अलग रंगों के स्प्रिंकल्स (sprinkles) का एक बैग है। अपने गुप्त संदेश को छिपाने के लिए, आप बेकर को बताते हैं, "यदि आप केक #1 बना रहे हैं, तो केवल लाल स्प्रिंकल्स का उपयोग करें। यदि आप केक #2 बना रहे हैं, तो केवल नीले स्प्रिंकल्स का उपयोग करें।"

लेकिन यहाँ एक पेंच है: कुछ केक स्वाभाविक रूप से अच्छे स्वाद के लिए बहुत सारे लाल स्प्रिंकल्स की मांग करते हैं, जबकि कुछ नीले रंग के।

  • पुराना तरीका (Vocabulary Partition): यदि आप एक "नीले-केवल" वाले केक को लाल स्प्रिंकल्स का उपयोग करने के लिए मजबूर करते हैं क्योंकि वह केक #1 के लिए कोड है, तो केक का स्वाद अजीब हो जाएगा (खराब गुणवत्ता)। यदि आप एक "लाल-केवल" वाले केक को नीला स्प्रिंकल्स उपयोग करने के लिए मजबूर करते हैं, तो भी वह अजीब लगेगा। इससे भी बुरा यह है कि यदि बेकर खुद से लाल स्प्रिंकल्स ही चाहता था, तो गुप्त संदेश को पहचानना आसान है। लेकिन यदि वह नीला चाहता था, तो गुप्त संदेश को ढूंढना कठिन है। "गुप्त संदेश" केक के स्वाद को बदल देता है, जो इस बात पर निर्भर करता है कि आप कौन सा गुप्त संदेश छिपा रहे हैं।

QuantileMark से मिलिए: "समान-हिस्से वाला" केक (The "Equal-Slice" Cake).

पीकिंग यूनिवर्सिटी के शोधकर्ताओं ने QuantileMark नामक एक स्मार्ट तरीका निकाला, जिसे उन्होंने पूरी रसोई के नियम बदलकर बनाया।

उपमा: संभावना का पाई (The Probability Pie)

बेकर की निर्णय लेने की प्रक्रिया को एक विशाल पाई के रूप में कल्पना करें, जो अगले निवाले के लिए वे कौन से फ्लेवर चुन सकते हैं, उसके 100% संभावनाओं का प्रतिनिधित्व करती है।

  • पाई का सबसे बड़ा हिस्सा वह फ्लेवर है जिसे बेकर वास्तव में उपयोग करना चाहता है (जैसे, "चॉकलेट")।
  • छोटे टुकड़े वे अजीब फ्लेवर हैं जिन्हें वे शायद ही कभी चुनते हैं (जैसे, "अचार/पिकल्स")।

QuantileMark कैसे काम करता है:

  1. समान हिस्से (The Equal Slices): एक विशेष केक को एक विशिष्ट रंग देने के बजाय, बेकर पूरी पाई को 4 समान हिस्सों में काटता है (क्योंकि वह 2 बिट्स की जानकारी छिपा रहा है, जो 4 संभावनाओं के बराबर है)।

    • हिस्सा 1: 0% से 25% तक।
    • हिस्सा 2: 25% से 50% तक।
    • हिस्सा 3: 50% से 75% तक।
    • हिस्सा 4: 75% से 100% तक।
  2. गुप्त कोड (The Secret Code): हर बार जब बेकर को एक फ्लेवर चुनने की आवश्यकता होती है, तो वह अपने गुप्त कोड (संदेश) को देखता है। मान लीजिए कि कोड कहता है "हिस्सा 3"।

    • बेकर को वह फ्लेवर चुनना होगा जो पाई के उस 50%–75% हिस्से के भीतर आता है।
    • यदि बेकर का पसंदीदा फ्लेवर (चॉकलेट) उस हिस्से में है, तो वह चॉकलेट चुनता है। आसान है!
    • यदि उसका पसंदीदा फ्लेवर हिस्सा 1 में है, तो उसे हिस्सा 3 में उपलब्ध सबसे अच्छा फ्लेवर चुनना होगा। शायद वह "स्ट्रॉबेरी" है।

यह गेम-चेंजर क्यों है?

  • निष्पक्षता (Message Symmetry): यह मायने नहीं रखता कि गुप्त कोड "हिस्सा 1" है या "हिस्सा 4"। प्रत्येक हिस्सा बिल्कुल एक ही आकार का है (25%)। बेकर को कभी भी किसी "अजीब" फ्लेवर को चुनने के लिए मजबूर नहीं होना पड़ता क्योंकि ऐसा कोई कोड है। केक हमेशा उतना ही स्वादिष्ट होता है, चाहे कोई भी गुप्त संदेश छिपा हो।
  • पता लगाने की क्षमता (Detectability): क्योंकि बेकर को एक विशिष्ट हिस्से से चुनने के लिए मजबूर किया जाता है, इसलिए एक जासूस (verifier) केक को देखकर कह सकता है, "आह, यह फ्लेवर 50-75% की सीमा में है। यह 'हिस्सा 3' के कोड से मेल खाता है!" भले ही बेकर को थोड़ा समझौता करना पड़ा हो, जासूस अभी भी पैटर्न को स्पष्ट रूप से देख सकता है क्योंकि हिस्से पूरी तरह से समान हैं।

"व्हाइट-बॉक्स" जासूस (The "White-Box" Detective)

पुराने दिनों में, जासूस को केक के बाहरी हिस्से के आधार पर अनुमान लगाना पड़ता था (ब्लैक-बॉक्स)। वे रेसिपी नहीं देख सकते थे।
QuantileMark के साथ, बेकरी जासूस को रसोई के अंदर झांकने की अनुमति देती है (व्हाइट-बॉक्स)। जासूस रेसिपी जानता है, पाई को कैसे काटा गया है, यह जानता है, और गणितीय रूप से सिद्ध कर सकता है, "हाँ, यह केक 'हिस्सा 3' के नियम का उपयोग करके बनाया गया था।"

वास्तविक दुनिया का परिणाम

पेपर ने AI मॉडल (बेकर्स) पर परीक्षण किया जो टेक्स्ट (केक) लिख रहे थे।

  • गुणवत्ता (Quality): QuantileMark के साथ लिखा गया टेक्स्ट उतना ही स्वाभाविक और उच्च गुणवत्ता वाला लगा जितना कि बिना किसी गुप्त कोड के लिखा गया टेक्स्ट। "स्वाद" खराब नहीं हुआ।
  • रिकवरी (Recovery): जासूस गुप्त संदेश (जैसे यूजर आईडी या टाइमस्टैम्प) को लगभग पूरी तरह से पढ़ सकता था, भले ही टेक्स्ट छोटा हो।
  • मजबूती (Robustness): भले ही कोई टेक्स्ट को बदलने (जैसे कुछ शब्द बदलना या एक वाक्य हटाना) की कोशिश करे, फिर भी पुराने "लाल बनाम नीले स्प्रिंकल्स" वाले तरीकों की तुलना में इसमें गुप्त संदेश को नष्ट करना बहुत कठिन था।

सारांश

QuantileMark AI टेक्स्ट में रहस्य छिपाने का एक नया तरीका है। AI को विशिष्ट शब्दों का उपयोग करने के लिए मजबूर करने के बजाय (जैसे एक "नीले केक" पर "लाल स्प्रिंकल" थोपना), यह AI के विकल्पों को समान, निष्पक्ष टुकड़ों में विभाजित करता है। यह सुनिश्चित करता है कि टेक्स्ट स्वादिष्ट (उच्च गुणवत्ता वाला) बना रहे जबकि गुप्त कोड को ढूंढना आसान और उसे बिगाड़ना असंभव हो, चाहे AI मूल रूप से क्या कहने की योजना बना रहा हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →