← नवीनतम पेपर
🤖 machine learning

Robust Safety Monitoring of Language Models via Activation Watermarking

यह शोध पत्र "एक्टिवेशन वॉटरमार्किंग" पेश करके अनुकूलनशील विरोधियों (adaptive adversaries) के प्रति मौजूदा लार्ज लैंग्वेज मॉडल मॉनिटर्स की संवेदनशीलता को संबोधित करता है, जो कम फॉल्स पॉजिटिव दरों को बनाए रखते हुए इन्फरेंस-टाइम अनिश्चितता को इंजेक्ट करके डिटेक्शन सटीकता में काफी सुधार करता है।

मूल लेखक: Toluwani Aremu, Daniil Ognev, Samuele Poppi, Nils Lukas

प्रकाशित 2026-03-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Toluwani Aremu, Daniil Ognev, Samuele Poppi, Nils Lukas

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, सहायक रोबोट सहायक (एक लार्ज लैंग्वेज मॉडल, या LLM) है। आपने उसे विनम्र और सुरक्षित रहना सिखाया है, लेकिन आप जानते हैं कि चतुर ठग (हैकर्स) कभी-कभी उसे "जेलब्रेक" कर सकते हैं, जिससे वह बम बनाने या वायरस लिखने जैसे खतरनाक रहस्य प्रकट करने के लिए मजबूर हो जाता है।

इसे रोकने के लिए, आप आमतौर पर दरवाजे पर एक सुरक्षा गार्ड तैनात करते हैं। यह गार्ड रोबोट द्वारा भेजे गए हर संदेश को पढ़ता है और किसी भी संदिग्ध चीज़ को ब्लॉक कर देता है।

समस्या: "नकलची" चोर
समस्या यह है कि यह सुरक्षा गार्ड अनुमानित (predictable) है। यदि चोर को पता चल जाए कि गार्ड कैसे सोचता है, तो वे एक "नकली गार्ड" पर अपने प्रयोगों का अभ्यास कर सकते हैं जब तक कि वे घुसपै隙 ढूँढ न लें। एक बार जब उन्हें वह तरीका मिल जाता है, तो वे आपके असली रोबोट पर उस ट्रिक का उपयोग कर सकते हैं, और गार्ड को पता भी नहीं चलेगा। इसे अनुकूली हमला (adaptive attack) कहा जाता है। चोर आपकी सुरक्षा प्रणाली को मात देने के लिए विशेष रूप से अपनी रणनीति को अनुकूलित करता है।

समाधान: अदृश्य स्याही वाला स्टैम्प
लेखक एक शानदार नया विचार प्रस्तावित करते हैं: एक अलग गार्ड रखने के बजाय, वे रोबोट के मस्तिष्क के भीतर सीधे एक गुप्त, अदृश्य स्याही वाला स्टैम्प रख देते हैं।

यह इस प्रकार काम करता है, एक सरल उपमा का उपयोग करते हुए:

1. गुप्त रेसिपी (वॉटरमार्क)

कल्पना कीजिए कि रोबोट के पास "बुरे व्यवहार" की एक गुप्त रेसिपी है।

  • सामान्य बातचीत: जब रोबोट केक बनाने के बारे में बात करता है, तो उसकी मस्तिष्क तरंगें (activations) एक सामान्य, शांत पैटर्न में बहती हैं।
  • बुरी बातचीत: जब रोबोट बम बनाने के बारे में बात करना शुरू करता है, तो लेखकों ने रोबोट को इस तरह प्रशिक्षित किया है कि उसकी मस्तिष्क तरंगें अचानक एक विशिष्ट, छिपे हुए पैटर्न में बदल जाती हैं।
  • पेंच (The Catch): यह छिपा हुआ पैटर्न एक बैंक नोट में मौजूद वॉटरमार्क की तरह है। यह नग्न आंखों (उपयोगकर्ता) के लिए और स्वयं रोबोट के लिए भी अदृश्य है, लेकिन इसे एक विशेष स्कैनर द्वारा पहचाना जा सकता है जिसके पास केवल मालिक के पास होता है।

2. गुप्त कुंजी (Secret Key)

"स्कैनर" को वॉटरमार्क देखने के लिए एक गुप्त कुंजी की आवश्यकता होती है।

  • रोबोट का मालिक इस कुंजी को छिपाकर रखता है।
  • चोर (हैकर) यह तो जान सकता है कि रोबोट कैसे काम करता है, लेकिन उनके पास चाबी नहीं है
  • क्योंकि चोर के पास चाबी नहीं है, इसलिए वे वॉटरमार्क को छिपाने का तरीका सीखने के लिए रोबोट के नकली संस्करण पर अभ्यास नहीं कर सकते। हर बार जब वे रोबोट को धोखा देने की कोशिश करते हैं, तो गुप्त स्टैम्प दिखाई देता है, और अलार्म बज उठता है।

3. यह गार्ड से बेहतर क्यों है?

  • गति: एक सुरक्षा गार्ड को पूरा संदेश पढ़ना होता है और फिर निर्णय लेना होता है। इसमें समय लगता है और यह काम को धीमा कर देता है। "अदृश्य स्याही" को रोबोट के सोचते समय ही तुरंत जांच लिया जाता है। यह पत्र भेजने के लिए इंतजार करने के बजाय, रोबोट के टाइप करते समय ही फिंगरप्रिंट चेक करने जैसा है।
  • गोपनीयता (Stealth): चोर वॉटरमार्क को नहीं देख सकता। वे अपने शब्द बदल सकते हैं, कोड का उपयोग कर सकते हैं, या पहेलियों में बात कर सकते हैं, लेकिन रोबोट के मस्तिष्क का आंतरिक पैटर्न अभी भी सच्चाई को उजागर कर देता है।
  • विशिष्टता (Specificity): यदि रोबोट गलती से किसी "एंटिटी A" (जैसे किसी विशिष्ट व्यक्ति का पता) के बारे में कोई गुप्त जानकारी प्रकट करता है, तो सिस्टम आपको बिल्कुल बता सकता है कि कौन सा गुप्त विवरण लीक हुआ है, न कि केवल यह कि "कुछ बुरा हुआ है।"

समझौता (The Trade-off)

क्या इसमें कोई नुकसान है? लेख स्वीकार करते हैं कि रोबोट को इस गुप्त स्टैम्प को ले जाने के लिए प्रशिक्षित करने से यह जटिल गणितीय पहेलियों (जैसे कठिन समीकरणों को हल करना) को हल करने में थोड़ा कम सक्षम हो जाता है। हालांकि, लेखक तर्क देते हैं कि यह एक उचित समझौता है: गणित में थोड़ा धीमा होना बेहतर है यदि इसका अर्थ यह है कि आपको खतरनाक रहस्य प्रकट करने के लिए ठगा नहीं जा सकता।

सारांश में

इसे इस तरह सोचें:

  • पुराना तरीका: क्लब के दरवाजे पर खड़ा एक बाउंसर जो अनुमान लगाने की कोशिश करता है कि कौन शरारती है। यदि शरारती को बाउंसर के नियम पता चल जाएं, तो वह अंदर घुस जाता है।
  • नया तरीका: हर मेहमान एक छिपा हुआ, चमकता हुआ टैटू पहनता है जिसे केवल मालिक ही एक विशेष टॉर्च से देख सकता है। भले ही मेहमान अपने कपड़े बदल ले या अपने नाम के बारे में झूठ बोले, बुरा करने की कोशिश करते ही वह टैटू चमकने लगता है। चोर टैटू को नहीं छिपा सकता क्योंकि उसे इसे बंद करने का गुप्त कोड नहीं पता है।

यह तरीका हैकर्स के लिए बिना पकड़े गए संवेदनशील जानकारी चुराना बहुत कठिन बना देता है, भले ही वे बहुत बुद्धिमान हों और उन्होंने सिस्टम का बारीकी से अध्ययन किया हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →