← नवीनतम पेपर
💬 NLP

Rethinking LLM Watermark Detection in Black-Box Settings: A Non-Intrusive Third-Party Framework

यह शोधपत्र TTP-Detect को प्रस्तुत करता है, जो एक अग्रणी ब्लैक-बॉक्स फ्रेमवर्क है जो प्रॉक्सी मॉडल और सापेक्ष परिकल्पना परीक्षण के माध्यम से डिटेक्शन (पता लगाने) को इंजेक्शन (प्रविष्टि) से अलग करके, मौजूदा सीक्रेट-की स्कीम्स की सीमाओं को पार करते हुए, LLM वॉटरमार्क के गैर-आक्रामक, तीसरे पक्ष के सत्यापन को सक्षम बनाता है।

मूल लेखक: Zhuoshang Wang, Yubing Ren, Yanan Cao, Fang Fang, Xiaoxue Li, Li Guo

प्रकाशित 2026-03-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhuoshang Wang, Yubing Ren, Yanan Cao, Fang Fang, Xiaoxue Li, Li Guo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक ऐसी दुनिया है जहाँ आर्टिफिशियल इंटेलिजेंस (जैसे कि वे चैटबॉट्स जिनसे आप बात करते हैं) एकदम सटीक निबंध, समाचार लेख और कहानियाँ लिख सकते हैं। यह अद्भुत है, लेकिन यह एक समस्या भी पैदा करता है: हम कैसे जानें कि क्या असली है और क्या नकली?

इसे हल करने के लिए, कंपनियाँ AI टेक्स्ट के भीतर अदृश्य "वॉटरमार्क" डालने की कोशिश कर रही हैं, ठीक वैसे ही जैसे कागजी मुद्रा में एक छिपे हुए सुरक्षा धागे (security thread) होता है। यदि आप नोट को रोशनी के सामने रखते हैं, तो आपको वह धागा दिखाई देता है। यदि नहीं, तो आप उसे पहचान नहीं पाएंगे।

समस्या: "ब्लैक बॉक्स" की दुविधा (The "Black Box" Dilemma)
वर्तमान में, ये वॉटरमार्क एक गुप्त हाथ मिलाने (secret handshake) की तरह हैं। केवल वही कंपनी जिसने AI बनाया है (प्रदाता/Provider), उस गुप्त कोड को जानता है जिससे वॉटरमार्क की जाँच की जा सकती है।

  • मुद्दा: यदि कोई अदालत या समाचार संपादक यह सत्यापित करना चाहता है कि क्या कोई लेख AI द्वारा लिखा गया था, तो उन्हें कंपनी से पूछना होगा, "हे, क्या यह नकली है?" कंपनी कहती है, "हाँ, यह है।" लेकिन अदालत को बस उन पर विश्वास करना होगा। क्या होगा अगर कंपनी झूठ बोल रही हो? क्या होगा अगर वे यह छिपाना चाहते हैं कि उन्होंने फर्जी खबरें बनाई हैं?
  • जोखिम: यदि कंपनी अदालत के साथ गुप्त कोड साझा करती है, तो हैकर्स इसे चुरा सकते हैं और वॉटरमार्क को हटा सकते हैं या नकली वॉटरमार्क बना सकते हैं। इसलिए, कोड को गुप्त रहना चाहिए, लेकिन इसका मतलब यह भी है कि कोई और इसकी जाँच नहीं कर सकता।

समाधान: TTP-Detect (द "थर्ड-पार्टी डिटेक्टिव")
यह पेपर एक नया फ्रेमवर्क पेश करता है जिसे TTP-Detect कहा जाता है। इसे एक तटस्थ रेफरी (neutral referee) के रूप में सोचें जो गुप्त रणनीति (playbook) जाने बिना खेल की जाँच कर सकता है।

यह इस प्रकार काम करता है, इस सरल उपमा (analogy) का उपयोग करते हुए:

1. "स्वाद परीक्षण" की उपमा (The "Taste Test" Analogy)

कल्पना कीजिए कि आप एक फूड क्रिटिक हैं जो बाजार के कुकीज़ (AI वॉटरमार्क वाला टेक्स्ट) और घर के बने कुकीज़ (सामान्य टेक्स्ट) के बीच अंतर करने की कोशिश कर रहे हैं।

  • पुराना तरीका: आप बेकरी से पूछते हैं, "क्या यह बाजार का कुकी है?" वे कहते हैं "हाँ।" आपको उन पर विश्वास करना पड़ता है।
  • TTP-Detect तरीका: आपको बेकरी की गुप्त रेसिपी जानने की जरूरत नहीं है। इसके बजाय, आप बेकरी से कहते हैं कि वे आपके लिए अभी दो नए कुकीज़ बनाएँ: एक बाजार वाला और एक घर का बना, और दोनों में बिल्कुल समान सामग्री का उपयोग करें जैसा कि रहस्यमय कुकी में किया गया है।
    • अब आपके पास तीन कुकीज़ हैं: रहस्यमय वाला, एक बाजार वाला, और एक घर का बना हुआ।
    • आप उन सभी का स्वाद लेते हैं। आपको रेसिपी जानने की जरूरत नहीं है; आप बस फ्लेवर प्रोफाइल (स्वाद के गुणों) की तुलना करते हैं।
    • यदि रहस्यमय कुकी का स्वाद बाजार वाले कुकी जैसा ही है (और घर के बने कुकी से अलग है), तो आप जान जाते हैं कि वह बाजार का कुकी है।

2. "डिटेक्टिव" कैसे काम करता है (3 चरण)

TTP-Detect सिस्टम एक सुपर-स्मार्ट डिटेक्टिव की तरह काम करता है जो तीन चरणों का पालन करता है:

  • चरण 1: "शैडो" मॉडल (द प्रॉक्सी)
    डिटेक्टिव एक "शैडो" AI (एक छोटा, सस्ता AI) काम पर रखता है ताकि यह सीख सके कि वॉटरमार्क वाला टेक्स्ट कैसा महसूस होता है। यह शैडो AI मूल वाला नहीं है; इसे केवल यह पहचानने के लिए प्रशिक्षित किया गया है कि "AI-लिखित" और "मानव-लिखित" शैलियों के बीच सूक्ष्म अंतर क्या हैं। यह एक कुत्ते को विशिष्ट गंध को सूंघने के लिए प्रशिक्षित करने जैसा है, बिना यह जाने कि वह गंध कैसे बनी।

  • चरण 2: "रेफरेंस" सेट (द कंट्रोल ग्रुप)
    जब कोई संदिग्ध टेक्स्ट आता है, तो डिटेक्टिव AI कंपनी से कहता है: "कृपया उसी शुरुआती वाक्य का उपयोग करके वॉटरमार्क के साथ टेक्स्ट के 16 उदाहरण और वॉटरमार्क के बिना टेक्स्ट के 16 उदाहरण तैयार करें।"
    अब डिटेक्टिव के पास एक कंट्रोल ग्रुप है। उनके पास "वॉटरमार्क वाले" नमूनों की एक टोकरी और "साफ" नमूनों की एक टोकरी है।

  • चरण 3: "रिलेटिव" चेक (द कंपैरिजन)
    डिटेक्टिव किसी एक "जादुई नंबर" की तलाश नहीं करता है। इसके बजाय, वह चार अलग-अलग परीक्षणों का उपयोग करता है यह देखने के लिए कि रहस्यमय टेक्स्ट कहाँ फिट बैठता है:

    1. लोकल कंसिस्टेंसी (Local Consistency): क्या यह टेक्स्ट समान विचारों के एक पड़ोस में "वॉटरमार्क वाले" समूह के साथ रहता है?
    2. ग्लोबल ज्योमेट्री (Global Geometry): क्या टेक्स्ट का समग्र आकार "वॉटरमार्क वाले" समूह जैसा है या "साफ" समूह जैसा?
    3. एनर्जी स्कोर (Energy Score): क्या टेक्स्ट "तनावपूर्ण" है या "रिलैक्स्ड" है, जो वॉटरमार्क वाले समूह से मेल खाता है?
    4. एडेप्टिव रैंक (Adaptive Rank): क्या टेक्स्ट उसी लय (rhythm) का पालन करता है जो वॉटरमार्क वाले उदाहरणों में है?

अंत में, डिटेक्टिव सभी सुरागों को जोड़ता है। यदि रहस्यमय टेक्स्ट "वॉटरमार्क वाले" समूह के अधिक करीब व्यवहार करता है, तो इसे फ्लैग (चिह्नित) किया जाता है।

यह एक बड़ी बात क्यों है

  • रहस्यों की आवश्यकता नहीं: डिटेक्टिव को गुप्त कुंजी (secret key) की आवश्यकता नहीं है। उन्हें बस AI से उदाहरण बनाने के लिए कहने की क्षमता चाहिए।
  • निष्पक्षता: यह AI कंपनी को झूठ बोलने से रोकता है। यदि वे दावा करते हैं कि एक टेक्स्ट "साफ" है, तो डिटेक्टिव ताज़ा उदाहरणों के साथ तुलना करके साबित कर सकता है कि वह वास्तव में "वॉटरमार्क वाला" है।
  • मजबूती (Robustness): भले ही कोई वॉटरमार्क को छिपाने के लिए टेक्स्ट को संपादित करने की कोशिश करे (जैसे शब्दों को बदलना या वाक्यों को फिर से लिखना), यह सिस्टम पैटर्न की तुलना करने में इतना अच्छा है कि वह अंतर को फिर भी पहचान सकता है।

निष्कर्ष (The Bottom Line)

TTP-Detect खेल को "हम पर विश्वास करें, हमारे पास गुप्त कुंजी है" से बदलकर "हमें सबूत दिखाएं, और हम स्वयं इसकी तुलना करेंगे" में बदल देता है। यह स्वतंत्र ऑडिटर्स, अदालतों और नियामकों को AI कंपनियों की सुरक्षा को तोड़े बिना AI कंटेंट को सत्यापित करने की अनुमति देता है, जिससे एक अधिक निष्पक्ष और पारदर्शी डिजिटल दुनिया का निर्माण होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →