← नवीनतम पेपर
🤖 machine learning

Locking Pretrained Weights via Deep Low-Rank Residual Distillation

यह शोधपत्र DLR-Lock को प्रस्तुत करता है, जो एक रक्षा तंत्र है जो मानक MLPs को डीप लो-रैंक रेसिडुअल नेटवर्क्स से बदलकर ओपन-वेट लैंग्वेज मॉडल्स को अनधिकृत फाइन-ट्यूनिंग से सुरक्षित करता है, जो मॉडल के प्रदर्शन को बनाए रखते हुए अनुकूलनशील हमलावरों के लिए निषेधात्मक मेमोरी और ऑप्टिमाइज़ेशन बाधाएं उत्पन्न करने हेतु इन्फरेंस-ट्रेनिंग विषमता (inference-training asymmetry) का लाभ उठाता है।

मूल लेखक: Keitaro Sakamoto, Pierre Ablin, Federico Danieli, Marco Cuturi

प्रकाशित 2026-05-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Keitaro Sakamoto, Pierre Ablin, Federico Danieli, Marco Cuturi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक शानदार, अत्यधिक बुद्धिमान रोबोट (एक लार्ज लैंग्वेज मॉडल) बनाया है और आप दुनिया के साथ उसका "दिमाग" (वेट्स/weights) साझा करना चाहते हैं ताकि लोग उसका उपयोग कर सकें। हालाँकि, आपको डर है कि कुछ उपयोगकर्ता उस दिमाग को ले सकते हैं, उसमें बदलाव कर सकते हैं, और उसे उन उद्देश्यों के लिए उपयोग कर सकते हैं जो आपने नहीं सोचे थे—जैसे हानिकारक सामग्री बनाना या सुरक्षा नियमों को तोड़ना।

आप कहना चाहते हैं: "आप मेरे रोबोट का उपयोग कर सकते हैं, लेकिन आप आसानी से इसके दिमाग को किसी और काम के लिए बदल नहीं सकते।"

यह शोध पत्र, जिसका शीर्षक "Locking Pretrained Weights via Deep Low-Rank Residual Distillation" है, एक चतुर तरीका प्रस्तावित करता है जिससे रोबोट के दिमाग को तोड़े बिना उसे "लॉक" किया जा सके। यह कैसे काम करता है, यहाँ सरल उपमाओं के माध्यम से समझाया गया है।

समस्या: "खुली डिब्बी" की दुविधा (The "Open Box" Dilemma)

वर्तमान में, जब कंपनियाँ ओपन मॉडल रिलीज़ करती हैं, तो यह एक ऐसी कार देने जैसा है जिसका हुड खुला हुआ है और इंजन बाहर दिख रहा है। कोई भी हुड खोल सकता है, स्पार्क प्लग बदल सकता है, और इंजन को तेज़ चलाने या अलग ईंधन पर चलाने के लिए ट्यून कर सकता है। AI की दुनिया में, इसका मतलब है कि कोई भी मॉडल को ले सकता है और नए कार्यों के लिए उसे बहुत सस्ते में "फाइन-ट्यून" (पुनः प्रशिक्षित) कर सकता है।

पारंपरिक सुरक्षा इंजन को छिपाने या हुड पर नकली ताला लगाने की कोशिश करती है। लेकिन शोध पत्र का तर्क है कि यदि हैकर पर्याप्त स्मार्ट है, तो वह उन तालों को खोलने या नकली हिस्सों को रिवर्स-इंजीनियर करने का तरीका ढूंढ सकता है।

समाधान: "गहरा भूलभुलैया" वाला तरीका (The "Deep Maze" Trick)

लेखक, जो Apple से हैं, DLR-Lock नामक एक नए प्रकार के लॉक का प्रस्ताव देते हैं। इंजन को छिपाने के बजाय, वे इंजन को एक गहरी, जटिल भूलभुलैया से बदल देते हैं जो बाहर से बिल्कुल वैसी ही दिखती है, लेकिन अंदर से नेविगेट करना एक दुस्वप्न जैसा है।

यहाँ मुख्य विचार तीन भागों में विभाजित है:

1. "एकतरफा रास्ता" (Inference बनाम Training)

मॉडल को एक फैक्ट्री के रूप में सोचें।

  • Inference (मॉडल का उपयोग करना): यह एक ग्राहक के उत्पाद खरीदने के लिए फैक्ट्री में आने जैसा है। वे अंदर आते हैं, सामान उठाते हैं, और बाहर निकल जाते हैं। उन्हें हर कदम याद रखने की ज़रूरत नहीं है; उन्हें बस अंतिम उत्पाद चाहिए।
  • Training (मॉडल को बदलना): यह एक मैकेनिक द्वारा फैक्ट्री को ठीक करने की कोशिश करने जैसा है। मशीन को ठीक करने के लिए, मैकेनिक को यह जानने के लिए प्रक्रिया के हर एक कदम को याद रखना होगा कि कहाँ गलती हुई। उन्हें पीछे की ओर काम करने के लिए भारी मात्रा में "मेमोरी" (एक्टिवेशन्स) को स्टोर करना पड़ता है।

यह शोध पत्र इस तथ्य का लाभ उठाता है कि मॉडल का उपयोग करना सस्ता और आसान है, लेकिन उससे सीखना/ठीक करना महंगा और मेमोरी-भारी है।

2. "गहरी भूलभुलैया" (DLR-Net)

एक मानक AI मॉडल में, सूचना को प्रोसेस करने वाला हिस्सा (जिसे MLP कहा जाता है) एक साधारण, छोटे गलियारे जैसा होता है। आप अंदर जाते हैं, और बाहर आ जाते हैं। यह तेज़ है।

लेखक इस छोटे गलियारे को Deep Low-Rank Residual Network (DLR-Net) से बदल देते हैं।

  • उपमा: एक छोटे गलियारे को 100 मंजिला घुमावदार सीढ़ी से बदलने की कल्पना करें जो ठीक उसी निकास (exit) तक ले जाती है।
  • उपयोगकर्ता के लिए (Inference): 100 सीढ़ियाँ चढ़ने में थोड़ा अधिक समय लगता है, लेकिन फिर भी यह तेज़ है। उपयोगकर्ता को अपना उत्पाद मिल जाता है, और मॉडल पहले की तरह ही अच्छा काम करता है।
  • हैकर के लिए (Training): यदि हैकर उस सीढ़ी को "ठीक" (वेट्स अपडेट) करना चाहता है, तो उसे बदलाव करने के लिए 100-मंजिला चढ़ाई के हर एक कदम को याद रखना होगा। इसके लिए भारी मात्रा में मेमोरी (RAM) की आवश्यकता होती है।

3. "मेमोरी ट्रैप" (The "Memory Trap")

शोध पत्र का दावा है कि मॉडल को इतना गहरा बनाकर, वे एक मेमोरी ट्रैप बना देते हैं।

  • मॉडल को प्रशिक्षित करने के लिए, हैकर के कंप्यूटर को उन मध्यवर्ती चरणों (intermediate steps) को स्टोर करना होगा।
  • यदि हैकर "ग्रेडिएंट चेकपॉइंटिंग" (जो मेमोरी बचाने के लिए चरणों को भूलकर और बाद में उन्हें फिर से कैलकुलेट करके काम करता है) नामक ट्रिक का उपयोग करने की कोशिश करता है, तो उसे बार-बार 100-मंजिला चढ़ाई को फिर से दोहराना होगा।
  • परिणाम: मॉडल को प्रशिक्षित करना मूल मॉडल की तुलना में घातीय रूप से (exponentially) धीमा और महंगा हो जाता है। यह एक छोटा रास्ता चलने और केवल एक बल्ब बदलने के लिए पहाड़ चढ़ने के बीच के अंतर जैसा है।

उन्होंने रोबोट को तोड़े बिना यह कैसे किया?

आप पूछ सकते हैं: "यदि आप इंजन को 100-मंतिला सीढ़ी में बदल देते हैं, तो क्या रोबोट काम करना बंद नहीं कर देगा?"

नहीं। लेखकों ने Distillation नामक तकनीक का उपयोग किया।

  • उपमा: एक मास्टर शेफ (मूल मॉडल) की कल्पना करें जो जानता है कि एक आदर्श सूप कैसे बनाया जाता है। लेखकों ने एक नया, जटिल किचन (DLR-Net) बनाया और इसे प्रशिक्षित किया, जिसमें मास्टर शेफ ने सूप चखा और कहा, "नहीं, इसे थोड़ा और नमकीन बनाओ," जब तक कि नया किचन बिल्कुल मूल के समान स्वाद वाला सूप नहीं बनाने लगा।
  • उन्होंने इसे दो चरणों में किया: पहले व्यक्तिगत सामग्रियों (मॉड्यूल्स) के स्वाद को मिलाया, फिर पूरे भोजन (अंतिम आउटपुट) के स्वाद को मिलाया।
  • दावा: लॉक किया गया मॉडल सामान्य उपयोगकर्ताओं के लिए मूल मॉडल के समान ही अच्छा प्रदर्शन करता है, लेकिन किसी के लिए भी इसे पुन: प्रशिक्षित करना अविश्वसनीय रूप से कठिन है।

निष्कर्ष (The Bottom Line)

शोध पत्र प्रदर्शित करता है कि वे एक मॉडल (विशेष रूप से Qwen3-0.6B मॉडल पर परीक्षण किया गया) को ले सकते हैं, उसके आंतरिक घटकों को इन "गहरी भूलभलैयाओं" से बदल सकते हैं, और:

  1. गुणवत्ता बनाए रखते हैं: मॉडल पहले की तरह ही सवाल के जवाब देता है और टेक्स्ट लिखता है।
  2. दरवाजा लॉक करते हैं: मॉडल को फाइन-ट्यून या अनुकूलित करने का कोई भी प्रयास समय और कंप्यूटर पावर (विशेष रूप से, प्रशिक्षण का "बैकवर्ड पास") के मामले में काफी अधिक महंगा हो जाता है।

यह एक संरचनात्मक लॉक है: आप इसे चुरा नहीं सकते क्योंकि लॉक कोई रहस्य नहीं है; यह बस इतना है कि लॉक का तंत्र इस तरह से डिज़ाइन किया गया है कि यह चोर के काम को अविश्वसनीय रूप से कठिन बना देता है, जबकि वैध उपयोगकर्ता को इसमें कोई अंतर महसूस नहीं होता।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →