On the (In-)Security of the Shuffling Defense in the Transformer Secure Inference
यह शोध पत्र प्रदर्शित करता है कि शफलिंग डिफेंस (shuffling defense), जिसे सुरक्षित ट्रांसफॉर्मर इन्फरेंस में मॉडल वेट एक्सट्रैक्शन के लिए एक सुदृढ़ शमन माना जाता था, एक नए हमले के प्रति संवेदनशील है जो परमिटेड एक्टिवेशन्स (permuted activations) को संरेखित करके कम क्वेरी लागत पर उच्च सटीकता के साथ मॉडल वेट्स को रिकवर कर लेता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ एक सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करके पेपर की व्याख्या दी गई है।
बड़ी तस्वीर: "ब्लैक बॉक्स" की समस्या
कल्प dáng कि आप अपने लिए भोजन पकाने के लिए एक सुपर-स्मार्ट AI (जैसे एक रोबोट शेफ) का उपयोग करना चाहते हैं। आप शेफ को अपनी गुप्त रेसिपी (आपका इनपुट) नहीं बताना चाहते, और शेफ आपको अपना गुप्त मसाला मिश्रण (उनके मॉडल वेट्स) नहीं दिखाना चाहता।
इसे हल करने के लिए, वैज्ञानिकों ने एक "सुरक्षित रसोई" (Secure Kitchen) बनाई। इस रसोई में, शेफ और ग्राहक एक विशेष ताले और चाबी वाली प्रणाली (क्रिप्टोग्राफी) का उपयोग करके मिलकर काम करते हैं। शेफ खाना पकाता है, लेकिन ग्राहक केवल अंतिम प्लेट देख पाता है। शेफ कभी भी कच्चे ингредиents (सामग्री) नहीं देखता, और ग्राहक कभी भी गुप्त मसालों को नहीं देख पाता।
बाधा: "स्लो कुकर" (धीमी गति से पकाने वाला बर्तन)
समस्या यह है कि यह सुरक्षित रसोई अविश्वसनीय रूप से धीमी है। साधारण चीजें पकाना (जैसे सब्जियां काटना, या लीनियर लेयर्स) तेज़ है। लेकिन जटिल चीजें पकाना (जैसे सूफ़ले बनाना, या नॉन-लीनियर लेयर्स) ग्राहक और शेफ के बीच इतनी अधिक बार जाँच-परख की मांग करता है कि इसमें बहुत समय लग जाता है।
इसे तेज़ करने के लिए, कुछ शोधकर्ताओं ने एक शॉर्टकट सुझाया: "चलिए ग्राहक को बीच के चरण दिखा देते हैं!"
बनाने के चरण के दौरान गुप्त मसाला मिश्रण को छिपाए रखने के बजाय, वे ग्राहक को मिश्रण (batter) देखने देते हैं—मिश्रण तैयार होने के बाद लेकिन पकने से पहले। इससे प्रक्रिया 10 से 50 गुना तेज़ हो जाती है।
"शफलिंग" (क्रम बदलना) रक्षा: बिखरा हुआ पहेली का खेल
शोधकर्ता जानते थे कि यदि ग्राहक मिश्रण को देखता है, तो वह गुप्त मसाला मिश्रण को रिवर्स-इंजीनियर कर सकता है। इसलिए, उन्होंने "शफलिंग" (Shuffling) नामक एक रक्षा प्रणाली जोड़ी।
कल्पना कीजिए कि मिश्रण एक पहेली है जिसमें 1,000 टुकड़े हैं। ग्राहक को दिखाने से पहले, शेफ उन टुकड़ों को एक ब्लेंडर में डाल देता है, उन्हें पूरी तरह से मिला देता है (scramble), और ग्राहक को मिले-जुले टुकड़ों का एक बैग थमा देता है।
- तर्क: चूंकि उन टुकड़ों को व्यवस्थित करने के (एक ऐसी संख्या जिसमें सैकड़ों शून्य हैं) तरीके हैं, शोधकर्ताओं को लगा कि ग्राहक के लिए मूल क्रम का अनुमान लगाना असंभव होगा। उनका मानना था कि "बिखरा हुआ पहेली का खेल" सुरक्षित है।
हमला: अराजकता में पैटर्न खोजना
यह पेपर तर्क देता है कि "शफलिंग रक्षा" सुरक्षित नहीं है। लेखकों ने बिना मूल क्रम जाने उस पहेली को सुलझाने का एक तरीका खोज निकाला है।
उन्होंने इसे कैसे किया, इसके लिए एक सरल उपमा का उपयोग करें:
- "लगभग समान" वाला तरीका:
कल्पना कीजिए कि आप शेफ से दो केक बनाने के लिए कहते हैं जो लगभग बिल्कुल एक जैसे हैं। आप उन्हें ऐसी सामग्री देते हैं जो बहुत ही मामूली अंतर रखती है (जैसे कि एक अतिरिक्त नमक का दाना डालना)।
- क्योंकि केक बहुत समान हैं, दोनों केक का मिश्रण (batter) लगभग एक जैसा ही दिखेगा, बस उनमें बहुत मामूली अंतर होगा।
- "बिखरा हुआ" वितरण:
शेफ दोनों केक बनाता है, दोनों के मिश्रण को बिखेरता (scramble) देता है, और आपको भेज देता है।
- केक A का मिश्रण क्रम #1 में बिखरा हुआ है।
- केक B का मिश्रण क्रम #2 में बिखरा हुआ है।
- "मैचमेकर" समाधान:
भले ही टुकड़े बिखरे हुए हों, लेकिन उनके मान (स्वाद/आकार) अभी भी मौजूद हैं। क्योंकि दोनों केक बहुत समान थे, इसलिए केक A के मिश्रण के टुकड़े केक B के संगत टुकड़ों के लगभग समान आकार के हैं।
- हमलावर बिखरे हुए टुकड़ों के दो बैगों को देखता है।
- वह बैग A के उस टुकड़े को ढूँढता है जो आकार में बैग B के किसी टुकड़े के सबसे करीब है।
- वह उन्हें आपस में मिला देता है।
- हर एक टुकड़े के लिए ऐसा करने से, वे पता लगा सकते हैं कि दोनों बिखराव (scrambles) एक-दूसरे से कैसे संबंधित हैं। वे अनिवार्य रूप से दो बिखरी हुई पहेलियों को एक सामान्य क्रम में "पुनः संरेखित" (re-align) कर देते हैं।
- परिणाम:
एक बार जब हमलावर टुकड़ों को संरेखित कर लेता है, तो वे गणित का उपयोग करके गुप्त मसाला मिश्रण (मॉडल वेट्स) के लिए समाधान निकाल सकते हैं।
- महत्वपूर्ण बिंदु: हमलावर को वेट्स बिल्कुल मूल क्रम में नहीं मिलते। यह ऐसा है जैसे आपको मसाला मिश्रण मिल गया हो जहाँ "नमक" के जार पर "मिर्च" लिखा है और "मिर्च" के जार पर "नमक" लिखा है।
- यह फिर भी क्यों काम करता है: लेबल बदले जाने के बावजूद, शेफ अभी भी बिल्कुल वही भोजन बना सकता है। गणित पूरी तरह से काम करता है; यह बस उन्हीं सामग्रियों का एक अलग अरेंजमेंट है।
वास्तविक दुनिया का परीक्षण
लेखकों ने दो लोकप्रिय AI मॉडलों (Pythia-70म और GPT-2) पर इसका परीक्षण किया।
- लागत: इस हमले को चलाने में उन्हें लगभग $1 खर्च हुआ।
- सफलता: वे लगभग पूर्ण सटीकता के साथ बिखरे हुए टुकड़ों को संरेखित करने में सफल रहे (त्रुटियाँ रेत के एक कण से भी छोटी थीं)।
- परिणाम: उन्होंने मॉडल के "मसाला मिश्रण" को इतनी उच्च सटीकता के साथ रिकवर किया कि वे इसका उपयोग मूल मॉडल की तरह व्यवहार करने वाले एक नकल (copycat) AI को बनाने के लिए कर सके।
वह "ग्लिच" (खराबी) जिसने हमले में मदद की
आप सोच सकते हैं: "उन्होंने दो केक को इतना समान कैसे बनाया यदि कंप्यूटर केवल पूर्णांक (whole numbers) स्वीकार करता है?"
लेखकों ने सुरक्षित रसोई के गणित में एक छोटी सी "खराबी" (glitch) पाई। जब कंप्यूटर सुरक्षित गणित करता है, तो वह कभी-कभी थोड़ी सी सटीकता (precision) खो देता है (जैसे दशमलव को राउंड ऑफ करना)। यह रैंडम तरीके से होता है। लेखक समझ गए कि वे इन छोटे, रैंडम राउंडिंग एरर्स का उपयोग उस "नमक के दाने" के अंतर के रूप में कर सकते हैं जिसकी उन्हें दो केक को थोड़ा अलग बनाने के लिए आवश्यकता थी, जिससे हमला काम कर सका।
निष्कर्ष
पेपर यह निष्कर्ष निकालता है कि "शफलिंग डिफेंस" (डेटा के क्रम को छिपाना) मजबूत नहीं है। भले ही आप डेटा को बिखेर दें, यदि आप AI को दो बहुत समान इनपुट प्रोसेस करने के लिए मजबूर कर सकते हैं, तो एक हमलावर उन सूक्ष्म अंतरों का उपयोग करके मूल क्रम का पता लगा सकता है और मॉडल के रहस्यों को चुरा सकता है।
संक्षेप में: आप ताश की गड्डी को शफल करके किसी रहस्य को नहीं छिपा सकते यदि कोई व्यक्ति दो लगभग समान डेक को शफल होते हुए देख सकता है और परिणामों की तुलना कर सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।