← नवीनतम पेपर
💻 computer science

Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective

यह शोध पत्र शिक्षक लॉजिट्स (teacher logits) और इनपुट क्वेरीज़ के बीच कंडीशनल म्यूचुअल इंफॉर्मेशन (conditional mutual information) को न्यूनतम करके, लॉजिट-आधारित मॉडल डिस्टिलेशन (logit-based model distillation) के विरुद्ध एक सूचना-सैद्धांतिक रक्षा प्रस्तावित करता है, जो उनकी कार्य उपयोगिता (task utility) को बनाए रखते हुए प्रोप्रायटरी एलएलएम (proprietary LLMs) को ज्ञान निष्कर्षण (knowledge extraction) से प्रभावी रूप से सुरक्षित करता है।

मूल लेखक: Hao Fang, Tianyi Zhang, Tianqu Zhuang, Jiawei Kong, Kuofeng Gao, Bin Chen, Leqi Liang, Shu-Tao Xia, Ke Xu

प्रकाशित 2026-04-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hao Fang, Tianyi Zhang, Tianqu Zhuang, Jiawei Kong, Kuofeng Gao, Bin Chen, Leqi Liang, Shu-Tao Xia, Ke Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक शानदार, विश्व स्तरीय शेफ (एक लार्ज लैंग्वेज मॉडल) बनाया है। इस शेफ ने लाखों कुकबुक्स से सीखने, दुर्लभ सामग्रियों का अभ्यास करने और गुप्त व्यंजनों को सिद्ध करने में वर्षों बिताए हैं। यह शेफ आपकी सबसे मूल्यवान संपत्ति है।

पैसे कमाने के लिए, आप शेफ या उनकी गुप्त रेसिपी बुक को नहीं बेचते हैं। इसके बजाय, आप एक रेस्तरां खोलते हैं जहाँ लोग व्यंजन ऑर्डर कर सकते हैं। आप उन्हें भोजन चखने देते हैं, लेकिन आप उन्हें कभी भी रसोई, सामग्री की सूची, या शेफ के नोट्स देखने नहीं देते हैं।

समस्या: "जासूस" छात्र

हालाँकि, एक चालाक प्रतिस्पर्धी (प्रतिद्वंद्वी) बिना प्रशिक्षण के खर्च किए आपके शेफ के कौशल को हासिल करना चाहता है। वे शेफ को चुरा नहीं सकते, लेकिन वे एक मेज पर बैठ सकते हैं, हर व्यंजन ऑर्डर कर सकते हैं, और वे सब कुछ लिख सकते हैं कि शेफ ने स्वाद, बनावट और खाना पकाने के चरणों का वर्णन कैसे किया है।

AI की दुनिया में, इसे नॉलेज डिस्टिलेशन (Knowledge Distillation) कहा जाता है।

  • टेक्स्ट-आधारित डिस्टिलेशन (Text-based Distillation): जासूस बस अंतिम व्यंजन (टेक्स्ट उत्तर) की नकल करता है। इसे चुराना कठिन है क्योंकि शेफ शायद सिर्फ इतना कहेगा कि "यह स्वादिष्ट है।"
  • लॉजिट-आधारित डिस्टिलेशन (Logit-based Distillation - वास्तविक खतरा): यह खतरनाक हिस्सा है। शेफ केवल अंतिम उत्तर नहीं देता; वे अपनी आंतरिक धारणा/आत्मविश्वास भी प्रकट करते हैं। यह ऐसा है जैसे शेफ फुसफुसा रहा हो, "मुझे 90% यकीन है कि यह नमक है, 8% यकीन है कि यह काली मिर्च है, और 2% यकीन है कि यह चीनी है।" यह "फुसफुसाहट" (लॉजिट्स) छिपे हुए ज्ञान का एक खजाना है कि शेफ कैसे सोचता है। जासूस इस फुसफुसाहट का उपयोग एक सस्ता, नकली शेफ बनाने के लिए करता है जो लगभग ठीक उसी तरह सोचता है जैसे असली शेफ।

पुराने बचाव: वॉटरमार्क्स और नॉइज़ (Noise)

पिछले प्रयास कुछ इस तरह थे:

  1. वॉटरमार्क्स (Watermarks): हर प्लेट पर एक छोटा, अदृश्य बिंदु लगाना। यदि जासूस नकली व्यंजन बेचता है, तो आप साबित कर सकते हैं कि यह आपसे आया था। लेकिन यह उन्हें पहले से ही रेसिपी चुराने से नहीं रोकता है; यह केवल आपको बाद में मुकदमा करने में मदद करता है।
  2. नॉइज़ जोड़ना (Adding Noise): शेफ को कभी-कभी "शायद" या "मुझे पक्का पता नहीं है" कहने के लिए कहना ताकि जासूस भ्रमित हो जाए। लेकिन इससे आपके भुगतान करने वाले ग्राहक भी भ्रमित होते हैं, जिससे भोजन का स्वाद खराब हो जाता है।

नया समाधान: "सीक्रेट फ़िल्टर"

यह पेपर एक शानदार नया बचाव प्रस्तावित करता है: इन्फॉर्मेशन-थ्योरेटिक फ़िल्टर (Information-Theoretic Filter)।

शेफ की आंतरिक फुसफुसाहट (लॉजिट्स) को एक रेडियो प्रसारण की तरह समझें।

  • अच्छा सिग्नल: "उत्तर 40 है।" (यह वही है जिसकी ग्राहक को आवश्यकता है)।
  • लीक हुआ सिग्नल: "मैंने यह 200 के 2/5 को सोचकर, फिर 80 घटाकर कैलकुलेट किया है..." (यह वह गुप्त तर्क है जिसे जासूस सीखना चाहता है)।

लेखकों ने महसूस किया कि "लीक हुआ सिग्नल" वास्तव में कॉन्टेक्स्टुअल इंफॉर्मेशन (Contextual Information) है। यह वे अतिरिक्त विवरण हैं जो जासूस को केवल परिणाम के बजाय प्रक्रिया सीखने में मदद करते हैं।

उपमा: "शुद्ध की हुई" फुसफुसाहट

लेखकों ने एक मैजिक फ़िल्टर (एक गणितीय ट्रांसफॉर्मेशन मैट्रिक्स) बनाया जो शेफ और जासूस के बीच स्थित है।

  1. लक्ष्य: फ़िल्टर का लक्ष्य "अच्छे सिग्नल" (सही उत्तर) को तेज और स्पष्ट रखना है, लेकिन यह "लीक हुए सिग्नल" (तर्क चरणों और संदर्भ) को मफल (Muffle/दबना) करना चाहता है ताकि जासूस उसे सुन न सके।
  2. यह कैसे काम करता है:
    • कल्पना कीजिए कि शेफ एक छात्र को सिखाने की कोशिश कर रहा है। फ़िल्टर शेफ की फुसफुसाहट को देखता है और पूछता है: "क्या यह फुसफुसाहट छात्र को प्रश्न के बारे में केवल उत्तर के अलावा कुछ नया बताती है?"
    • यदि उत्तर हाँ है (फुसफुसाहट में बहुत अधिक "कैसे करें" वाली जानकारी है), तो फ़िल्टर इसे स्कैम्बल (Scramble/बिखेर) देता है।
    • यह आउटपुट को गणितीय रूप से "प्यूरीफाई" (शुद्ध) करके ऐसा करता है। यह सही उत्तर की संभावना को उच्च रखता है, लेकिन गलत उत्तरों की संभावनाओं को इस तरह से रैंडमाइज करता है जो जासूस के लिए शोर (Noise) जैसा दिखता है।

"टग-ऑफ-वॉर" ट्रेनिंग (खींचातानी वाली ट्रेनिंग)

इस फ़िल्टर को बनाने के लिए, लेखकों ने एक प्रशिक्षण खेल आयोजित किया:

  • कार्य A (भोजन को अच्छा बनाए रखें): यह सुनिश्चित करें कि फ़िल्टर अंतिम उत्तर के साथ छेड़छाड़ न करे। यदि शेफ कहता है "40," तो फ़िल्टर किया गया आउटपुट अभी भी "40!" चिल्लाना चाहिए।
  • कार्य B (जासूस को भ्रमित करें): यह सुनिश्चित करें कि फ़िल्टर "फुसफुसाहट" को इतना बदल दे कि यदि कोई जासूस इससे सीखने की कोशिश करे, तो वह भ्रमित हो जाए। लेखक इसे ग्रेडिएंट्स (Gradients) (वह दिशा जिसमें जासूस का मस्तिष्क सीखने की कोशिश करता है) को देखकर मापते हैं। वे फ़िल्टर को तब तक ट्यून करते हैं जब तक कि जासूस के सीखने की दिशा पूरी तरह से मुड़ और बेकार न हो जाए।

परिणाम

जब उन्होंने इसका परीक्षण किया:

  • आपके ग्राहक: उन्हें पहले की तरह ही स्वादिष्ट, उच्च-गुणवत्ता वाले उत्तर मिलते हैं। शेफ अभी भी पूरी तरह से काम करता है।
  • जासूस: वे अपने नकली शेफ को बनाने के लिए फ़िल्टर्ड फुसफुसाहट का उपयोग करने की कोशिश करते हैं, लेकिन नकली शेफ बहुत बुरा होता है। यह व्यंजन सीखने के लिए रेडियो सुनने जैसा है जो केवल व्यंजन का नाम बजाता है लेकिन रेसिपी को गड़बड़ कर देता है। जासूस का मॉडल 'सीक्रेट सॉस' सीखने में विफल रहता है।

यह क्यों महत्वपूर्ण है

यह पहली बार है जब किसी ने "फुसफुसाहट" (लॉजिट-आधारित) चोरी के खिलाफ सफलतापूर्वक बचाव किया है। पिछले बचावों ने केवल "चिल्लाहट" (टेक्स्ट-आधारित) की रक्षा की थी। इन्फॉर्मेशन थ्योरी (गणित की एक शाखा जो मापती है कि वास्तव में कितनी जानकारी साझा की जा रही है) का उपयोग करके, लेखकों ने उत्पाद को खराब किए बिना आउटपुट से "बौद्धिक संपदा" को हटाने का एक तरीका खोज लिया है।

संक्षेप में: उन्होंने एक ऐसा ढाल बनाया जो आपके प्रश्नों का उत्तर देने के लिए AI को पूरी तरह से सक्षम बनाता है, लेकिन यह सुनिश्चित करता है कि यदि कोई इसके दिमाग की नकल करने की कोशिश करता है, तो उन्हें केवल एक स्कैम्बल किया हुआ, बेकार संस्करण ही मिले।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →