← नवीनतम पेपर
💬 NLP

Protecting Language Models Against Unauthorized Distillation through Trace Rewriting

यह शोध पत्र गतिशील ट्रेस रीराइटिंग (dynamic trace rewriting) तकनीकों का प्रस्ताव करता है जो शिक्षक मॉडल की तर्क प्रक्रिया को संशोधित करती हैं ताकि मूल प्रतिक्रियाओं की शुद्धता और सुसंगतता को बनाए रखते हुए, अनधिकृत डिस्टिलेशन (unauthorized distillation) की उपयोगिता को कम किया जा सके और छात्र मॉडलों में सत्यापन योग्य वॉटरमार्क (verifiable watermarks) समाहित किए जा सकें।

मूल लेखक: Xinhang Ma, William Yeoh, Ning Zhang, Yevgeniy Vorobeychik

प्रकाशित 2026-04-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xinhang Ma, William Yeoh, Ning Zhang, Yevgeniy Vorobeychik

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक शानदार, विश्व स्तरीय शेफ (शिक्षक मॉडल - Teacher Model) है, जिसने दुनिया के सबसे बेहतरीन लाज़ानिया (lasagna) की गुप्त रेसिपी को सिद्ध करने में वर्षों बिताए हैं। यह शेफ इतना कुशल है कि वे विस्तार से, चरण-दर-चरण, एक विस्तृत नोटबुक (तर्क प्रक्रिया - Reasoning Trace) में समझा सकते हैं कि वे इसे कैसे बनाते हैं।

अब, कल्पना कीजिए कि एक भूखा प्रतिस्पर्धी (छात्र मॉडल - Student Model) इस रेसिपी को सीखना चाहता है। शेफ के समय के लिए भुगतान करने के बजाय, वह बस रसोई में घुस जाता है, नोटबुक की नकल करता है, और खुद लाज़ानिया बनाने की कोशिश करता है। यही 'नॉलेज डिस्टिलेशन' (Knowledge Distillation) है: एक बड़े, महंगे AI के "दिमाग" को एक छोटे, सस्ते वाले में कॉपी करना।

समस्या यह है कि बड़े AI कंपनियों ने अपने इन "शेफों" को प्रशिक्षित करने में लाखों डॉलर और वर्षों का प्रयास लगाया है। यदि कोई भी मुफ्त में इन नोटबुकों की नकल कर सकता है, तो कंपनियों के पास नवाचार (innovation) करने का कोई कारण नहीं बचेगा।

यह पेपर इन डिजिटल शेफों की रक्षा करने के लिए एक चतुर तरीका प्रस्तावित करता है। लेखक दो-चरणीय रणनीति का सुझाव देते हैं: रेसिपी को खराब करना (sabotaging the recipe) और एक गुप्त मुहर छिपाना (hiding a secret stamp)

1. "भ्रमित शेफ" की रणनीति (Anti-Distillation)

पहला लक्ष्य चोरी करने वाले के लिए नकल की गई नोटबुक को बेकार बनाना है, जबकि मूल शेफ को खुश रखना है।

  • पुराना तरीका: पहले, चोरों को रोकने के लिए, लोग शेफ को बड़बड़ाने या निरर्थक बातें लिखने के लिए कहते थे। लेकिन यह शेफ को ऐसी भाषा में रेसिपी लिखने के लिए कहने जैसा है जिसे कोई समझ ही न सके। समस्या यह है कि मूल ग्राहक (जो शेफ के लिए भुगतान करते हैं) भी इसे समझ नहीं पाएंगे। यह व्यवसाय को नुकसान पहुँचाता है।
  • नया तरीका: लेखकों ने नोटबुक को इस तरह से फिर से लिखने का एक तरीका खोजा जिससे चरण एक इंसान के लिए पूरी तरह से तार्किक और सही दिखें, लेकिन एक रोबोट लर्नर के लिए वे सूक्ष्म रूप से "जहरीले" (poisoned) हों।
    • उपमा: कल्पना कीजिए कि शेफ बहुत ही फैंसी, अस्पष्ट और अत्यधिक तकनीकी शब्दों का उपयोग करके रेसिपी लिखता है। एक इंसान के पढ़ने के लिए, इसमें अभी भी लिखा है "नमक डालें।" लेकिन एक छात्र रोबोट के लिए जो पैटर्न सीखने की कोशिश कर रहा है, जटिल शब्दावली उसके दिमाग को भ्रमित कर देती है। वह वास्तविक खाना पकाने के तर्क के बजाय "फैंसी शब्दों" को सीखने की कोशिश करता है।
    • परिणाम: चोर का रोबोट अंततः एक घटिया लाज़ानिया बनाता है (कम सटीकता), लेकिन मूल शेफ भुगतान करने वाले ग्राहकों के लिए अभी भी एक उत्तम व्यंजन बना सकता है। वास्तव में, क्योंकि पुनर्गठन (rewriting) की प्रक्रिया अक्सर शेफ द्वारा की गई छोटी गलतियों को ठीक कर देती है, इसलिए शेफ खाना पकाने में और भी बेहतर हो सकता है!

2. "गुप्त अदृश्य स्याही" की रणनीति (API Watermarking)

दूसरा लक्ष्य यह पकड़ना है कि यदि चोर रेसिपी चुराने में सफल भी हो जाए।

  • पुराना तरीका: कुछ तरीकों ने स्पेसिंग (spacing) को थोड़ा बदलकर या विशिष्ट शब्दों का उपयोग करके वॉटरमार्क छिपाने की कोशिश की। लेकिन ये किसी फोटो पर वॉटरमार्क लगाने जैसा था जिसे आसानी से क्रॉप या धुंधला किया जा सकता था। साथ ही, उन्होंने अक्सर "गलत अलार्म" दिए, निर्दोष लोगों पर चोरी का आरोप लगाया।
  • नया तरीका: लेखक तर्क प्रक्रिया (reasoning trace) के भीतर एक गुप्त "ट्रिगर" छिपाते हैं।
    • उपमा: कल्पना कीजिए कि शेफ नोटबुक में एक गुप्त कोड लिखता है: "यदि आप 'Sunset' शब्द देखते हैं, तो उत्तर हमेशा 'Blue' होगा।" यह कोड रेसिपी के बीच में छिपा हुआ है।
    • यह कैसे काम करता है: यदि कोई चोर नोटबुक चुरा लेता है और अपने रोबोट को प्रशिक्षित करता है, तो रोबोट इस गुप्त नियम को सीख लेता है। बाद में, मालिक रोबोट से पूछ सकता है, "'Sunset' का उत्तर क्या है?" यदि रोबोट कहता है "Blue," तो मालिक जानता है, "अहा! तुमने मेरी रेसिपी चुराई है!"
    • परिणाम: यह अविश्वसनीय रूप से विश्वसनीय है। इसे नकली बनाना लगभग असंभव है (शून्य गलत अलार्म), और यह तब भी काम करता है जब चोर नोटबुक को हटाने के लिए उसे फिर से लिखने की कोशिश करता है।

यह क्यों महत्वपूर्ण है

इसे एक वीडियो गेम की सुरक्षा करने जैसा समझें।

  • सुरक्षा के बिना: कोई भी गेम के कोड की नकल कर सकता है और उसे $5 में बेच सकता है, जिससे मूल डेवलपर बर्बाद हो जाएगा।
  • इस नए तरीके के साथ: यदि कोई गेम की नकल करने की कोशिश करता है, तो उन्हें जो कोड मिलता है वह "ग्लिच" (glitched) होता है ताकि उनका संस्करण क्रैश हो जाए या खराब चले। लेकिन यदि वे वास्तव में नकल करने में सफल हो जाते हैं, तो गेम में एक छिपा हुआ "बग" होता है जिसे केवल मूल डेवलपर ही सक्रिय कर सकता है, जो साबित करता है कि उन्होंने चोरी की है।

मुख्य निष्कर्ष (The Bottom Line)

लेखकों ने दिखाया कि पहले AI के उत्तरों को "पुनर्लिखित" करने के लिए दूसरे स्मार्ट AI का उपयोग करके, वे:

  1. चोर की सीखने की क्षमता को तोड़ सकते हैं: चुराया गया मॉडल कुछ भी उपयोगी नहीं सीख पाता (सटीकता 60% तक गिर जाती है)।
  2. मालिक को खुश रखते हैं: मूल मॉडल अभी भी पूरी तरह से (या बेहतर) काम करता है।
  3. चोर को पकड़ सकते हैं: वे बिना किसी गलत आरोप के, लगभग पूर्ण सटीकता के साथ स्वामित्व को सिद्ध कर सकते हैं।

यह एक स्मार्ट, अदृश्य ढाल है जो AI कंपनियों को बिना यह डर रखे अपने "दिमाग" को API के माध्यम से साझा करने की अनुमति देती है कि उनके कठिन परिश्रम को मुफ्त में चुरा लिया जाएगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →