← नवीनतम पेपर
🤖 AI

Asking Back: Interaction-Layer Antidistillation Watermarks

यह शोध पत्र "इंटरेक्शन-लेयर एंटीडिस्टिलेशन वॉटरमार्क्स" का प्रस्ताव करता है, जो एक नवीन रक्षा तंत्र है जो एलएलएम (LLM) के सिस्टम प्रॉम्प्ट्स में पता लगाने योग्य व्यवहार संबंधी मार्कर समाहित करता है ताकि अनधिकृत ज्ञान आसवन (नॉलेज डिस्टिलेशन) को विश्वसनीय रूप से ट्रैक किया जा सके, भले ही हमलावर पारंपरिक टोकन-स्तरीय संकेतों को पैराफ्रेस या हटा दें, जो विविध स्टूडेंट मॉडल्स में उच्च हस्तांतरणीयता और उपयोगकर्ता अनुभव पर न्यूनतम प्रभाव प्रदर्शित करता है।

मूल लेखक: Guang Yang, Amir Ghasemian, Fengchen Liu, Zhong Wang, Ninareh Mehrabi, Homa Hosseinmardi

प्रकाशित 2026-05-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Guang Yang, Amir Ghasemian, Fengchen Liu, Zhong Wang, Ninareh Mehrabi, Homa Hosseinmardi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Asking Back: Interaction-Layer Antidistillation Watermarks" शोध पत्र का सरल भाषा और रचनात्मक उपमाओं के साथ विवरण दिया गया है।

बड़ी समस्या: "द फेंटम स्टूडेंट" (छलावा छात्र)

कल्पना कीजिए कि एक प्रसिद्ध शेफ (टीचर/शिक्षक) है जो एक उच्च श्रेणी के रेस्तरां में काम करता है। उनके पास एक गुप्त रेसिपी बुक है जिसे कोई और नहीं देख सकता। एक चालाक प्रतिस्पर्धी (अटैकर/हमलावर) उस किताब को चुरा तो नहीं सकता, लेकिन वह मेनू के हर व्यंजन का ऑर्डर दे सकता है, शेफ जो कुछ भी कहता है और जिस तरह से परोसता है, उसे लिख सकता है, और फिर एक जूनियर कुक (स्टूडेंट/छात्र) को उन नोट्स को याद करने के लिए काम पर रख सकता है।

वह जूनियर कुक व्यंजनों की नकल करने में इतना माहिर हो जाता है कि वह अपना खुद का रेस्तरां खोल सकता है और वही खाना बेच सकता है, बिना कभी मूल रेसिपी बुक देखे या शेफ को भुगतान किए। इसे अनधिकृत ज्ञान आसवन (unauthorized knowledge distillation) कहा जाता है।

शेफ जानना चाहता है: "क्या वह नया रेस्तरां मेरी रेसिपी का उपयोग कर रहा है?"

पुराने समाधान: भोजन पर निशान लगाना

पहले, शेफ चोर को पकड़ने के लिए भोजन में ही अदृश्य स्याही डालने की कोशिश करते थे।

  • टोकन वॉटरमार्क (The Token Watermark): शेफ गुप्त रूप से सब्जियों को काटने के तरीके या सजावट (AI के जवाब में विशिष्ट शब्दों या "टोकन्स" को बदलना) को बदल देते थे।
  • समस्या: यदि चोर स्मार्ट है, तो वह बस डिश को दोबारा सजा (re-plate) सकता है। वह शेफ के विवरण को ले सकता है, उसे अपने शब्दों में फिर से लिख सकता है (पैराफ्रेसिंग), और फिर उसे दोबारा परोस सकता है। अदृश्य स्याही धुल जाती है, लेकिन स्वाद (ज्ञान) बना रहता है। चोर बच निकलता है।

नया विचार: "आस्किंग बैक" (वापस पूछना) वॉटरमार्क

यह शोध पत्र एक नई रणनीति प्रस्तावित करता है। भोजन (टेक्स्ट) को मार्क करने के बजाय, शेफ बातचीत (इंटरैक्शन) को मार्क करता है।

कल्पना कीजिए कि शेफ का एक नियम है: "हर व्यंजन परोसने के बाद, मुझे एक फॉलो-अप सवाल पूछना चाहिए, जैसे, 'क्या यह जन्मदिन की पार्टी के लिए है या बिजनेस लंच के लिए?'"

  • रणनीति: शेफ (AI API) को एक गुप्त निर्देश दिया जाता है कि वह कभी-कभी ऐसे फॉलो-अप सवाल पूछे।
  • चोरी: चोर शेफ के जवाबों और सवालों दोनों को रिकॉर्ड करता है। वे अपने जूनियर कुक को इस व्यवहार की नकल करने के लिए प्रशिक्षित करते हैं।
  • पकड़े जाने का डर: भले ही चोर शेफ के जवाबों को अपने शब्दों में फिर से लिख दे, लेकिन जूनियर कुक यह सीख जाता है कि "अच्छी सेवा" में एक फॉलो-अप सवाल पूछना शामिल है। इसलिए, जूनियर कुक भी वे सवाल पूछना शुरू कर देता है, भले ही उसने मूल शेफ को कभी न देखा हो।

डिफेंडर (मूल शेफ) फिर नए रेस्तरां में जा सकता है, एक सवाल पूछ सकता है, और देख सकता है कि क्या जूनियर कुक वापस एक फॉलो-अप सवाल पूछता है। यदि वह ऐसा करता है, तो यह एक मजबूत संकेत है कि उसने प्रशिक्षण डेटा चुराया है।

उन्होंने इसका परीक्षण कैसे किया

शोधकर्ताओं ने यह देखने के लिए एक बड़ा प्रयोग किया कि यह "आस्किंग बैक" वाला तरीका काम करता है या नहीं।

  1. सेटअप: उन्होंने एक विशाल, स्मार्ट AI (Llama-3.3-70B) को "शेफ" के रूप में उपयोग किया। उन्होंने तीन अलग-अलग प्रकार के छोटे AI (Gemma, OLMo, और Qwen) को शेफ की नकल करने के लिए प्रशिक्षित किया।
  2. शर्तें:
    • स्ट्रॉन्ग (Strong): शेफ ने हर बार एक फॉलो-अप सवाल पूछा।
    • सॉफ्ट (Soft): शेफ ने केवल 20% समय के बारे में एक फॉलो-अप सवाल पूछा (इसे पकड़ना कठिन बनाने के लिए)।
    • स्टाइल (Style): सवाल पूछने के बजाय, शेफ ने एक उपयोगी टिप जोड़ी जैसे, "यह तब सबसे अच्छा काम करता है जब आप जल्दी में हों।"
  3. हमला: उन्होंने एक ऐसे चोर का अनुकरण किया जो प्रशिक्षण के लिए स्टूडेंट को देने से पहले शेफ के प्रॉम्प्ट्स को फिर से लिखता है ("पैराफ्रेस अटैक")।

उन्हें क्या मिला (परिणाम)

  • यह काम करता है (H1 और H2): छोटे AI ने इस व्यवहार को पूरी तरह से सीख लिया। भले ही शेफ ने केवल 20% समय सवाल पूछे, छात्रों ने सामान्य से बहुत अधिक दर पर वे सवाल पूछना शुरू कर दिया। यह तीनों प्रकार के स्टूडेंट AI में हुआ।
  • यह रीराइटिंग (पुनर्लेखन) में भी जीवित रहता है (H3): यहाँ तक कि जब चोर ने पैटर्न को छिपाने के लिए प्रॉम्प्ट्स को फिर से लिखने की कोशिश की, तब भी छात्रों ने अपनी आदत बनाए रखी। दिलचस्प बात यह है कि एक स्टूडेंट मॉडल (OLMo) मूल शेफ की तुलना में सवाल पूछने में बेहतर भी हो गया।
  • इसे पहचानना कठिन है (H4 और H5):
    • लो डेंसिटी (Low Density): वॉटरमार्क तब भी काम कर गया जब शेफ ने इसे केवल 20% समय इस्तेमाल किया।
    • स्टील्थ (Stealth/गुप्तता): उन्होंने 20 लोगों को AI के साथ चैट करने के लिए कहा। लोगों को अंतर महसूस नहीं हुआ। उन्होंने "वॉटरमार्क वाले" AI के साथ बातचीत को सामान्य जितना ही सुखद बताया। अतिरिक्त सवाल परेशान करने वाले या अजीब नहीं लगे।

"सीक्रेट सॉस" (गुप्त नुस्खा) की उपमा

पुराने वॉटरमार्क्स को ईंट पर एक अनूठा पैटर्न पेंट करने के रूप में सोचें। यदि आप ईंट लेते हैं, उसे घिसते हैं और ऊपर से पेंट करते हैं, तो पैटर्न गायब हो जाता है।

यह नया तरीका एक राजमिस्त्री की एक विशिष्ट आदत सिखाने जैसा है। यदि आप एक राजमिस्त्री को सिखाते हैं कि ईंट रखने से पहले हमेशा अपनी करनी (trowel) को तीन बार थपथपाना है, और फिर वे किसी और के लिए दीवार बनाते हैं, तो वे अभी भी तीन बार थपथपाएंगे। आप दीवार को फिर से पेंट करके उस आदत को मिटा नहीं सकते। "थपथपाना" व्यवहार है, पेंट नहीं।

निष्कर्ष

शोध पत्र यह निष्कर्ष निकालता है कि एक AI कैसे इंटरैक्ट करता है (उसका व्यवहार) देखना, चोरों को पकड़ने का एक शक्तिशाली नया तरीका है। यह टेक्स्ट, मॉडल कोड और रीजनिंग स्टेप्स के ऊपर स्थित एक "चौथा स्तर" का बचाव है।

  • अच्छी खबर: इसे हटाना कठिन है, यह विभिन्न प्रकार के AI पर काम करता है, और उपयोगकर्ताओं को परेशान नहीं करता है।
  • चेतावनी: अध्ययन स्वीकार करता है कि यदि कोई चोर बहुत स्मार्ट है और विशेष रूप से इस विशिष्ट व्यवहार को हटाने की कोशिश करता है, तो वे अभी भी सफल हो सकते हैं। साथ ही, एक AI मॉडल (OLMo) में देखा गया "सुपर-लर्निंग" प्रभाव एक संयोग भी हो सकता है जो उस विशिष्ट मॉडल के लिए ही है और इसके और परीक्षण की आवश्यकता है।

संक्षेप में, यदि आप जानना चाहते हैं कि कोई AI नकलची है या नहीं, तो केवल यह न देखें कि वह क्या कहता है; बल्कि यह सुनें कि वह कैसे बात करता है। यदि वह मूल की तरह ही वही अजीब फॉलो-अप सवाल पूछने लगता है, तो संभावना है कि वह एक छात्र है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →