Verifying LLM Inference to Detect Model Weight Exfiltration
यह शोध पत्र एक प्रमाण योग्य सत्यापन ढांचे (provable verification framework) का प्रस्ताव करता है जो स्टेगनोग्राफी के माध्यम से मॉडल वेट एक्सफिल्ट्रेशन (model weight exfiltration) का पता लगाने और उसे कम करने के लिए LLM इन्फरेंस में अभिलक्षणिक अनिश्चितता (characterized non-determinism) का लाभ उठाता है, जो 30B पैरामीटर्स तक के मॉडल्स में न्यूनतम प्रदर्शन ओवरहेड के साथ महत्वपूर्ण सुरक्षा सुधार प्रदर्शित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास दुनिया के सबसे बेहतरीन केक की एक अविश्वसनीय रूप से मूल्यवान, गुप्त रेसिपी है। आप रेसिपी बुक बेचना नहीं चाहते; आप बस चाहते हैं कि लोग आपकी बेकरी में आएं, एक स्लाइस का ऑर्डर दें और उसे खाएं। आज के लार्ज लैंग्वेज मॉडल्स (LLMs) इसी तरह काम करते हैं: कंपनियां अपने सर्वर पर "मस्तिष्क" (मॉडल वेट्स) होस्ट करती हैं, और उपयोगकर्ता उत्तर प्राप्त करने के लिए प्रॉम्प्ट भेजते हैं।
समस्या: चालाक चोर
अब, कल्पना कीजिए कि एक चोर आपकी बेकरी में घुस आता है। वह पूरी रेसिपी बुक नहीं चुरा सकता क्योंकि वह बहुत भारी है और अलार्म बज जाएगा। लेकिन, वह चतुराई से इस बात को बदल सकता है कि केक के स्लाइस कैसे परोसे जाते हैं।
सिर्फ आपको केक का स्लाइस देने के बजाय, वे केक के अंदर ही रेसिपी के छोटे, अदृश्य कण (crumbs) छिपाने लगते हैं। शायद वे स्प्रिंकल्स (sprinkles) को एक विशिष्ट पैटर्न में सजाते हैं, या स्वाद के नोट्स में एक गुप्त कोड फुसफुसाते हैं। आपके लिए, ग्राहक के लिए, केक सामान्य दिखता है और स्वाद भी सामान्य लगता है। लेकिन, चोर के साथी के लिए जो बाहर इंतजार कर रहा है, वे "सामान्य" कण पूरी गुप्त रेसिपी का पता देते हैं।
इसे स्टेग्नोग्राफी (steganography) कहा जाता है: किसी ऐसी चीज़ के अंदर गुप्त संदेश छिपाना जो पूरी तरह से निर्दोष लगे। AI की दुनिया में, एक समझौता किया गया (compromised) सर्वर पूरे मॉडल के "मस्तिष्क" को टेक्स्ट के रूप में धीरे-धीरे महीनों या वर्षों में बाहर भेज सकता है।
समाधान: "सत्य बताने वाला" निरीक्षक
यह पेपर आपकी बेकरी के लिए एक नया सुरक्षा गार्ड प्रस्तावित करता है। आइए इसे द इंस्पेक्टर (The Inspector) कहें।
यहाँ इंस्पेक्टर कैसे काम करता है, इसका एक सरल उदाहरण दिया गया है:
1. "जादुई बीज" (यादृच्छिकता/Randomness)
जब आप एक केक का ऑर्डर देते हैं, तो बेकर (AI) हर बार बिल्कुल एक जैसा केक नहीं बनाता। वे फ्रॉस्टिंग छिड़कने का निर्णय लेने के लिए एक "जादु la बीज" (magic seed) का उपयोग करते हैं। यदि आप उसी बीज का उपयोग करते हैं, तो आपको बहुत समान केक मिलना चाहिए।
- पकड़: कभी-कभी, उसी बीज के साथ भी, बेकर गलती से एक कण को थोड़ा अलग जगह पर गिरा सकता है क्योंकि ओवन का तापमान एक डिग्री अधिक था, या आटा थोड़ा नम था। इसे "वैलिड नॉन-डिटरमिनिज्म" (valid non-determinism) कहा जाता है। यह सामान्य, हानिरहित शोर (noise) है।
2. इंस्पेक्टर का काम
इंस्पेक्टर एक अलग, बंद कमरे में बैठता है। उसके पास ठीक वही रेसिपी बुक और ठीक वही जादुई बीज है।
- जब बेकरी एक केक भेजती है (AI प्रतिक्रिया), तो इंस्पेक्टर ऑर्डर और बीज लेता है।
- वह अपने बंद कमरे में अपना खुद का केक बनाता है।
- वह अपने केक की तुलना उस केक से करता है जो बेकरी ने भेजा है।
3. चोर को पकड़ना
- सामान्य शोर (Normal Noise): यदि बेकरी के केक में एक कण इंस्पेक्टर के केक की तुलना में थोड़ी अलग जगह पर है, लेकिन वह अभी भी एक उचित स्थान पर है (जैसे कि ऊपर बताए गए "वैलिड नॉन-डिटरमिनिज्म" की तरह), तो इंस्पेक्टर कहता है, "ठीक है, यह बस ओवन का थोड़ा सा बदलाव है। जाने दो।"
- चोरी: यदि बेकरी एक ऐसा केक भेजती है जहाँ स्प्रिंकल्स एक गुप्त कोड के रूप में व्यवस्थित हैं (एक ऐसा पैटर्न जो एक सामान्य बेकर के लिए सांख्यिकीय रूप से असंभव है), तो इंस्पेक्टर कहता है, "रुको! यह केक नकली है! बेकर एक संदेश छिपाने की कोशिश कर रहा है!"
इस पेपर की प्रतिभा यह है कि यह गणना करता है कि कितना "शोर" सामान्य है। यह एक गणितीय "बाड़" (fence) बनाता है। यदि बेकरी बहुत अधिक जानकारी छिपाने की कोशिश करती है, तो "शोर" इतना अजीब हो जाता है कि वह बाड़ को तोड़ देता है, और अलार्म बज जाता है।
यह एक बड़ी बात क्यों है
- यह तेज़ है: इंस्पेक्टर को हर बार शून्य से पूरा केक फिर से बनाने की ज़रूरत नहीं है। उसे बस "स्प्रिंकल्स" (शब्दों के पीछे का तर्क) की बहुत तेज़ी से जांच करने की आवश्यकता है। इसका मतलब है कि बेकरी ग्राहकों के लिए धीमी नहीं होती है।
- यह एक निवारक (Deterrent) है: भले ही चोर बहुत स्मार्ट हो, यह प्रणाली उसे इतना सावधान रहने के लिए मजबूर करती है कि पूरी रेसिपी चुराने में उसे 200 गुना अधिक समय लगेगा। रेसिपी चुराने में 1 दिन के बजाय, इसे एक साल से अधिक समय लगेगा। जब तक वह इसे पूरा करेगा, रेसिपी पुरानी हो सकती है, या कंपनी ने उसे पकड़ लिया होगा।
- यह बग्स को भी पकड़ता है: कभी-कभी बेकरी का बुरा दिन हो सकता है (सॉफ्टवेयर बग)। इंस्पेक्टर इसे भी पकड़ लेगा, यह कहते हुए, "हे, आज आपका केक अजीब लग रहा है, चलिए ओवन को ठीक करते हैं।" इसलिए, यह सुरक्षा और गुणवत्ता नियंत्रण दोनों में मदद करता है।
निचोड़
यह पेपर AI कंपनियों को यह कहने का एक तरीका देता है: "हम जानते हैं कि आप हमें भेजे जाने वाले टेक्स्ट में छिपाकर हमारी गुप्त रेसिपी चुराने की कोशिश कर सकते हैं। लेकिन हमारे पास एक सुपर-स्मार्ट इंस्पेक्टर है जो जानता है कि हमारा टेक्स्ट वास्तव में कैसा दिखना चाहिए। यदि आप कोई गुप्त संदेश छिपाने की कोशिश करते हैं, तो हम जान जाएंगे, और आप पकड़े जाएंगे।"
यह AI की अपनी "आवाज़" को एक सुरक्षा प्रणाली में बदल देता है, जिससे चोरों के लिए सबसे मूल्यवान संपत्ति—स्वयं मॉडल को चुराना—अत्यधिक कठिन हो जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।