← नवीनतम पेपर
💬 NLP

DistillGuard: Evaluating Defenses Against LLM Knowledge Distillation

यह शोध पत्र DistillGuard को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो व्यवस्थित रूप से LLM नॉलेज डिस्टिलेशन के विरुद्ध आउटपुट-लेवल डिफेंस का मूल्यांकन करता है और यह पाता है कि अधिकांश वर्तमान दृष्टिकोण काफी हद तक अप्रभावी हैं, जिसमें प्रदर्शन में गिरावट अत्यधिक कार्य-निर्भर है और ज्ञान की चोरी को व्यापक रूप से रोकने के लिए अपर्याप्त है।

मूल लेखक: Bo Jiang

प्रकाशित 2026-03-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bo Jiang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास दुनिया के सबसे बेहतरीन चॉकलेट केक की एक गुप्त रेसिपी (secret recipe) है। आप खुद केक नहीं बेचते हैं; इसके बजाय, आप एक "केक API" चलाते हैं। लोग आपसे यह पूछने के लिए एक छोटी सी फीस देते हैं कि "मैं यह केक कैसे बनाऊं?" और आप उन्हें निर्देश भेज देते हैं।

एक चतुर (लेकिन अनैतिक) बेकर इस बात पर ध्यान देता है। उसे एहसास होता है कि उसे आपकी महंगी सामग्री खरीदने या अपने मास्टर शेफ को काम पर रखने की ज़रूरत नहीं है। इसके बजाय, वह बस आपकी API से रेसिपी को 10,000 बार मांग सकता है, जवाब लिख सकता है, और फिर अपने स्वयं के सस्ते, छोटे रोबोट को बिल्कुल आपके जैसा केक बनाना सिखा सकता है। इसे नॉलेज डिस्टिलेशन (Knowledge Distillation) कहा जाता है। वे आपकी दिमागी शक्ति को चुराकर एक सस्ता कॉपी बनाने के लिए उसका उपयोग कर रहे हैं।

जो पेपर आपने साझा किया है, DistillGuard, उस केक शॉप के मालिक द्वारा नियुक्त किए गए एक सुरक्षा सलाहकार की तरह है। मालिक पूछता है: "मैंने सुना है कि लोग मेरी रेसिपी चुरा रहे हैं। मैंने उन्हें रोकने के लिए कुछ तरकीबें आजमाई हैं—जैसे कागज पर कुछ टेढ़ा-मेढ़ा लिखना, सामग्री के बारे में झूठ बोलना, या आखिरी पन्ना फाड़ देना। क्या ये तरकीबें वास्तव में काम करती हैं?"

यहाँ सुरक्षा सलाहकार (पेपर) द्वारा पाया गया निष्कर्ष है, जिसे सरल भाषा में समझाया गया है:

वे तीन "तरकीबें" जिनका उन्होंने परीक्षण किया

शोधकर्ताओं ने चोर को रोकने के तीन मुख्य तरीकों का परीक्षण किया। इन्हें तीन अलग-अलग सुरक्षा गार्डों के रूप में सोचें:

1. "पैराफ्रेज़" गार्ड (आउटपुट परटर्बेशन - Output Perturbation)

विचार: "यदि चोर रेसिपी मांगता है, तो मैं उन्हें निर्देश तो वही दूंगा, लेकिन मैं उन्हें एक अलग शैली में फिर से लिख दूंगा। 'मैदा और चीनी मिलाएं' कहने के बजाय, मैं कहूंगा 'सफेद पाउडर को मीठे क्रिस्टल के साथ मिलाएं।' इससे चोर भ्रमित हो जाना चाहिए और असफल होना चाहिए।"
परिणाम: पूर्ण विफलता।
चोर को शैली की परवाह नहीं थी। चाहे रेसिपी शेक्सपियर की अंग्रेजी में लिखी हो या बोलचाल की भाषा में, तर्क (logic) वही रहा। चोर के रोबोट ने केक को बिल्कुल ठीक से सीख लिया।

  • उपमा: यह किसी को अलग लहजे में गाकर गाना सीखने से रोकने की कोशिश करने जैसा है। वे अभी भी धुन सीख ही जाते हैं।

2. "झूठा" गार्ड (डेटा पॉइजनिंग - Data Poisoning)

विचार: "मैं चोर से रैंडम तरीके से झूठ बोलूंगा। 30% समय, मैं उन्हें एक ऐसी रेसिपी दूंगा जिसमें लिखा होगा 'केक को 10 मिनट तक जला दें।' शायद वे भ्रमित हो जाएंगे और गलत चीज़ सीख लेंगे।"
परिणाम: मिला-जुला (और ज्यादातर बेकार)।
चोर के रोबले को बातचीत करने या कहानी सुनाने के तरीके में थोड़ी उलझन हुई (वह बातचीत में थोड़ा अनाड़ी हो गया)। हालांकि, जब बात बेकिंग या कोडिंग के गणित की आई, तो रोबोट ने झूठ को नजरअंदाज कर दिया। उसने समझ लिया कि "इसे जला दें" वाले निर्देश बेतुके थे और उसने बाकी 70% जवाबों में देखे गए सही पैटर्न पर ही ध्यान दिया।

  • उपमा: यदि आप एक बच्चे को गणित सिखाने की कोशिश करते समय बीच-बीच में उसे "2+2=5" बताते हैं, तो वह अंततः समझ जाएगा कि आप झूठ बोल रहे हैं और केवल उन्हीं समयों से सीखेगा जब आपने कहा था कि "2+2=4"।

3. "सेंसर" गार्ड (इंफॉर्मेशन थ्रॉटलिंग - Information Throttling)

विचार: "मैं उत्तर को पूरा होने से पहले ही काट दूंगा। मैं उन्हें यह नहीं दिखाऊंगा कि मैंने समस्या को कैसे हल किया, केवल अंतिम उत्तर दिखाऊंगा। 'उत्तर 42 है।' कोई चरण नहीं, कोई तर्क नहीं।"
परिणाम: यह काम कर गया... लेकिन केवल गणित (Math) के लिए।
यही एकमात्र तरीका था जिसने वास्तव में चोर को नुकसान पहुँचाया। जब चोर ने बिना "चरणों" (Chain of Thought) को देखे जटिल गणित की समस्याओं को सीखने की कोशिश की, तो उनका रोबोट गणित में बहुत खराब हो गया।
हालांकि, एक बड़ी समस्या थी: इसने ईमानदार ग्राहकों को भी नुकसान पहुँचाया।
यदि आप गणित की समस्याओं के लिए चरणों को काट देते हैं, तो आपके वास्तविक ग्राहक (जो केवल जानना चाहते हैं कि केक कैसे बनाना है) को भी बहुत खराब उत्तर मिलेंगे। आपकी अपनी केक शॉप भी विफल होने लगेगी।

  • उपमा: चोर को पहेली सुलझाने से रोकने के लिए, आप केवल तैयार तस्वीर दिखाते हैं, न कि टुकड़े। लेकिन अब, आपके ईमानदार ग्राहक भी टुकड़े नहीं देख सकते, इसलिए वे पहेली भी हल नहीं कर सकते।

मुख्य निष्कर्ष: "दोधारी तलवार" (The Double-Edged Sword)

पेपर का मुख्य संदेश केक शॉप के मालिक के लिए थोड़ा निराशाजनक है: मुफ्त में कुछ नहीं मिलता (There is no free lunch)।

  • यदि आप अपने ग्राहकों को नुकसान पहुँचाए बिना अपनी रेसिपी को सुरक्षित करने की कोशिश करते हैं, तो आप विफल हो जाते हैं। (पैराफरेज और झूठे गार्ड काम नहीं आए)।
  • यदि आप प्रभावी ढंग से अपनी रेसिपी को सुरक्षित करने की कोशिश करते हैं, तो आप अपने ग्राहकों को नुकसान पहुँचाते हैं। (सेंसर गार्ड ने गणित पर काम किया, लेकिन इसने आपके गणित के उत्तरों को भी बेकार बना दिया)।

शोधकर्ता इसे "डिस्टिलेशन डिलेमा" (Distillation Dilemma) कहते हैं।
कोई भी उत्तर जो एक भुगतान करने वाले ग्राहक के लिए अच्छा है, वह एक चोर के सीखने के लिए भी पर्याप्त अच्छा है। आप ऐसा "उपयोगी" उत्तर नहीं रख सकते जो चोर के लिए "अनुपयोगी" हो।

केक शॉप को क्या करना चाहिए?

पेपर सुझाव देता है कि वर्तमान "आउटपुट-लेवल" की तरकीबें (शब्द बदलना, झूठ बोलना या टेक्स्ट काटना) पर्याप्त नहीं हैं।

इसके बजाय, शॉप मालिक को स्ट्रक्चरल डिफेंस (Structural Defenses) की ओर देखना चाहिए:

  1. वॉटरमार्किंग (Watermarking): रेसिपी को बदलने के बजाय, कागज पर एक अदृश्य "दाग" लगा दें जो साबित करे कि यह आपसे आया है। यदि चोर इसकी कॉपी बेचने की कोशिश करता है, तो आप साबित कर सकते हैं कि यह चोरी का है।
  2. बेहतर डिटेक्शन (Better Detection): चोर को सवाल पूछने से पहले ही पकड़ लें, शायद यह देखकर कि वे बहुत तेजी से एक ही तरह के सवाल पूछ रहे हैं।

एक वाक्य में सारांश

किसी के द्वारा आपके AI के दिमाग को चुराने से रोकने के लिए केवल उसके द्वारा कहे जाने वाले शब्दों को बदलना वैसा ही है जैसे किसी को अलग लहजे में गाकर गाना सीखने से रोकने की कोशिश करना—यह काम नहीं करता; और उन्हें वास्तव में रोकने का एकमात्र तरीका (चरणों को छिपाना) आपके ईमानदार ग्राहकों के अनुभव को भी खराब कर देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →