← नवीनतम पेपर
🤖 machine learning

Verifying LLM Inference to Detect Model Weight Exfiltration

यह शोध पत्र एक प्रमाण योग्य सत्यापन ढांचे (provable verification framework) का प्रस्ताव करता है जो स्टेगनोग्राफी के माध्यम से मॉडल वेट एक्सफिल्ट्रेशन (model weight exfiltration) का पता लगाने और उसे कम करने के लिए LLM इन्फरेंस में अभिलक्षणिक अनिश्चितता (characterized non-determinism) का लाभ उठाता है, जो 30B पैरामीटर्स तक के मॉडल्स में न्यूनतम प्रदर्शन ओवरहेड के साथ महत्वपूर्ण सुरक्षा सुधार प्रदर्शित करता है।

मूल लेखक: Roy Rinberg, Adam Karvonen, Alexander Hoover, Daniel Reuter, Keri Warr

प्रकाशित 2026-03-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Roy Rinberg, Adam Karvonen, Alexander Hoover, Daniel Reuter, Keri Warr

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास दुनिया के सबसे बेहतरीन केक की एक अविश्वसनीय रूप से मूल्यवान, गुप्त रेसिपी है। आप रेसिपी बुक बेचना नहीं चाहते; आप बस चाहते हैं कि लोग आपकी बेकरी में आएं, एक स्लाइस का ऑर्डर दें और उसे खाएं। आज के लार्ज लैंग्वेज मॉडल्स (LLMs) इसी तरह काम करते हैं: कंपनियां अपने सर्वर पर "मस्तिष्क" (मॉडल वेट्स) होस्ट करती हैं, और उपयोगकर्ता उत्तर प्राप्त करने के लिए प्रॉम्प्ट भेजते हैं।

समस्या: चालाक चोर
अब, कल्पना कीजिए कि एक चोर आपकी बेकरी में घुस आता है। वह पूरी रेसिपी बुक नहीं चुरा सकता क्योंकि वह बहुत भारी है और अलार्म बज जाएगा। लेकिन, वह चतुराई से इस बात को बदल सकता है कि केक के स्लाइस कैसे परोसे जाते हैं।

सिर्फ आपको केक का स्लाइस देने के बजाय, वे केक के अंदर ही रेसिपी के छोटे, अदृश्य कण (crumbs) छिपाने लगते हैं। शायद वे स्प्रिंकल्स (sprinkles) को एक विशिष्ट पैटर्न में सजाते हैं, या स्वाद के नोट्स में एक गुप्त कोड फुसफुसाते हैं। आपके लिए, ग्राहक के लिए, केक सामान्य दिखता है और स्वाद भी सामान्य लगता है। लेकिन, चोर के साथी के लिए जो बाहर इंतजार कर रहा है, वे "सामान्य" कण पूरी गुप्त रेसिपी का पता देते हैं।

इसे स्टेग्नोग्राफी (steganography) कहा जाता है: किसी ऐसी चीज़ के अंदर गुप्त संदेश छिपाना जो पूरी तरह से निर्दोष लगे। AI की दुनिया में, एक समझौता किया गया (compromised) सर्वर पूरे मॉडल के "मस्तिष्क" को टेक्स्ट के रूप में धीरे-धीरे महीनों या वर्षों में बाहर भेज सकता है।

समाधान: "सत्य बताने वाला" निरीक्षक
यह पेपर आपकी बेकरी के लिए एक नया सुरक्षा गार्ड प्रस्तावित करता है। आइए इसे द इंस्पेक्टर (The Inspector) कहें।

यहाँ इंस्पेक्टर कैसे काम करता है, इसका एक सरल उदाहरण दिया गया है:

1. "जादुई बीज" (यादृच्छिकता/Randomness)

जब आप एक केक का ऑर्डर देते हैं, तो बेकर (AI) हर बार बिल्कुल एक जैसा केक नहीं बनाता। वे फ्रॉस्टिंग छिड़कने का निर्णय लेने के लिए एक "जादु la बीज" (magic seed) का उपयोग करते हैं। यदि आप उसी बीज का उपयोग करते हैं, तो आपको बहुत समान केक मिलना चाहिए।

  • पकड़: कभी-कभी, उसी बीज के साथ भी, बेकर गलती से एक कण को थोड़ा अलग जगह पर गिरा सकता है क्योंकि ओवन का तापमान एक डिग्री अधिक था, या आटा थोड़ा नम था। इसे "वैलिड नॉन-डिटरमिनिज्म" (valid non-determinism) कहा जाता है। यह सामान्य, हानिरहित शोर (noise) है।

2. इंस्पेक्टर का काम

इंस्पेक्टर एक अलग, बंद कमरे में बैठता है। उसके पास ठीक वही रेसिपी बुक और ठीक वही जादुई बीज है।

  • जब बेकरी एक केक भेजती है (AI प्रतिक्रिया), तो इंस्पेक्टर ऑर्डर और बीज लेता है।
  • वह अपने बंद कमरे में अपना खुद का केक बनाता है।
  • वह अपने केक की तुलना उस केक से करता है जो बेकरी ने भेजा है।

3. चोर को पकड़ना

  • सामान्य शोर (Normal Noise): यदि बेकरी के केक में एक कण इंस्पेक्टर के केक की तुलना में थोड़ी अलग जगह पर है, लेकिन वह अभी भी एक उचित स्थान पर है (जैसे कि ऊपर बताए गए "वैलिड नॉन-डिटरमिनिज्म" की तरह), तो इंस्पेक्टर कहता है, "ठीक है, यह बस ओवन का थोड़ा सा बदलाव है। जाने दो।"
  • चोरी: यदि बेकरी एक ऐसा केक भेजती है जहाँ स्प्रिंकल्स एक गुप्त कोड के रूप में व्यवस्थित हैं (एक ऐसा पैटर्न जो एक सामान्य बेकर के लिए सांख्यिकीय रूप से असंभव है), तो इंस्पेक्टर कहता है, "रुको! यह केक नकली है! बेकर एक संदेश छिपाने की कोशिश कर रहा है!"

इस पेपर की प्रतिभा यह है कि यह गणना करता है कि कितना "शोर" सामान्य है। यह एक गणितीय "बाड़" (fence) बनाता है। यदि बेकरी बहुत अधिक जानकारी छिपाने की कोशिश करती है, तो "शोर" इतना अजीब हो जाता है कि वह बाड़ को तोड़ देता है, और अलार्म बज जाता है।

यह एक बड़ी बात क्यों है

  • यह तेज़ है: इंस्पेक्टर को हर बार शून्य से पूरा केक फिर से बनाने की ज़रूरत नहीं है। उसे बस "स्प्रिंकल्स" (शब्दों के पीछे का तर्क) की बहुत तेज़ी से जांच करने की आवश्यकता है। इसका मतलब है कि बेकरी ग्राहकों के लिए धीमी नहीं होती है।
  • यह एक निवारक (Deterrent) है: भले ही चोर बहुत स्मार्ट हो, यह प्रणाली उसे इतना सावधान रहने के लिए मजबूर करती है कि पूरी रेसिपी चुराने में उसे 200 गुना अधिक समय लगेगा। रेसिपी चुराने में 1 दिन के बजाय, इसे एक साल से अधिक समय लगेगा। जब तक वह इसे पूरा करेगा, रेसिपी पुरानी हो सकती है, या कंपनी ने उसे पकड़ लिया होगा।
  • यह बग्स को भी पकड़ता है: कभी-कभी बेकरी का बुरा दिन हो सकता है (सॉफ्टवेयर बग)। इंस्पेक्टर इसे भी पकड़ लेगा, यह कहते हुए, "हे, आज आपका केक अजीब लग रहा है, चलिए ओवन को ठीक करते हैं।" इसलिए, यह सुरक्षा और गुणवत्ता नियंत्रण दोनों में मदद करता है।

निचोड़

यह पेपर AI कंपनियों को यह कहने का एक तरीका देता है: "हम जानते हैं कि आप हमें भेजे जाने वाले टेक्स्ट में छिपाकर हमारी गुप्त रेसिपी चुराने की कोशिश कर सकते हैं। लेकिन हमारे पास एक सुपर-स्मार्ट इंस्पेक्टर है जो जानता है कि हमारा टेक्स्ट वास्तव में कैसा दिखना चाहिए। यदि आप कोई गुप्त संदेश छिपाने की कोशिश करते हैं, तो हम जान जाएंगे, और आप पकड़े जाएंगे।"

यह AI की अपनी "आवाज़" को एक सुरक्षा प्रणाली में बदल देता है, जिससे चोरों के लिए सबसे मूल्यवान संपत्ति—स्वयं मॉडल को चुराना—अत्यधिक कठिन हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →