When Speculation Spills Secrets: Side Channels via Speculative Decoding In LLMs
यह शोध पत्र प्रकट करता है कि लार्ज लैंग्वेज मॉडल्स में स्पेक्युलेटिव डिकोडिंग एक नई साइड-चैनल भेद्यता (vulnerability) उत्पन्न करती है जहाँ हमलावर टोकन गणना या पैकेट आकार की निगरानी करके उपयोगकर्ता के प्रश्नों का अनुमान लगा सकते हैं और गोपनीय डेटा लीक कर सकते हैं, साथ ही यह पैकेट पैडिंग और टोकन एग्रीगेशन जैसे प्रभावी प्रति उपायों का प्रस्ताव और मूल्यांकन भी करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक व्यस्त रेस्टोरेंट में हैं। आप एक जटिल भोजन ऑर्डर करते हैं, और शेफ (AI) खाना बनाना शुरू करता है। समय बचाने के लिए, शेफ के पास एक सहायक शेफ (sous-chef) है जो पहले से ही अनुमान लगा लेता है कि आपको अगले कुछ सामग्रियों की आवश्यकता होगी और उन्हें पहले से तैयार रखता है।
- यदि सहायक शेफ का अनुमान सही निकलता है, तो शेफ एक साथ तैयार सामग्रियों की पूरी ट्रे उठा लेता है।
- यदि सहायक शेफ का अनुमान गलत निकलता है, तो शेफ को रुकना पड़ता है, उस ट्रे को फेंकना पड़ता है, और एक-एक करके एक-एक सामग्री को फिर से काटना शुरू करना पड़ता है।
यह "अनुमान लगाने" की तकनीक स्पेक्युलेटिव डिकोडिंग (Speculative Decoding) कहलाती है। यह AI चैटबॉट्स को बहुत तेज़ बनाती है।
समस्या:
"When Speculation Spills Secrets" नामक शोध पत्र बताता है कि हैकर्स इन AI चैटबॉट्स के साथ आपकी निजी बातचीत को सुनने के लिए एक चालाकी भरा तरीका ढूंढ चुके हैं, यह आपके एन्क्रिप्शन को तोड़ने के माध्यम से नहीं, बल्कि आपके द्वारा भेजे जा रहे डिलीवरी पैकेज के आकार को देखकर किया जाता है।
"पैकेज का आकार" लीक होना
AI की प्रतिक्रिया को आपके फोन पर भेजे जा रहे डिजिटल पैकेजों के प्रवाह के रूप में सोचें।
- बड़ा पैकेज: AI ने सही अनुमान लगाया! उसने एक साथ 5 शब्द भेजे। पैकेज बड़ा है।
- छोटा पैकेज: AI ने गलत अनुमान लगाया! उसने केवल 1 शब्द भेजा। पैकेज बहुत छोटा है।
भले ही संदेश की सामग्री एक सुरक्षित तिजोरी में लॉक हो (एन्क्रिप्टेड हो), लेकिन डिलीवरी ट्रक (आपके वाई-फाई या इंटरनेट प्रदाता पर मौजूद हैकर) द्वारा देखा जाने वाला बॉक्स का आकार दिखाई देता है।
हमला: "आकारों का गुप्त कोड"
शोधकर्ताओं ने पाया कि हर सवाल के लिए पैकेज के आकार का पैटर्न अद्वितीय होता है। यह बॉक्स के आकारों से बना एक फिंगरप्रिंट की तरह है।
- सेटअप: एक हैकर एक ग्राहक होने का नाटक करता है। वे AI से 50 अलग-अलग सवाल पूछते हैं (जैसे, "फ्लू के लक्षण क्या हैं?" बनाम "टूटी हुई हड्डी के लक्षण क्या हैं?")।
- फिंगरप्रिंटिंग: वे प्रत्येक प्रश्न के लिए पैकेज के आकार के पैटर्न को रिकॉर्ड करते हैं।
- सवाल A कुछ ऐसा दिख सकता है: बड़ा, बड़ा, छोटा, बड़ा, बड़ा।
- सवाल B कुछ ऐसा दिख सकता है: छोटा, छोटा, बड़ा, छोटा।
- जासूसी (Eavesdrop): बाद में, वे एक वास्तविक उपयोगकर्ता को AI से बात करते हुए देखते हैं। वे उपयोगकर्ता के पैकेज के आकार देखते हैं: बड़ा, बड़ा, छोटा, बड़ा, बड़ा।
- परिणाम: हैकर पैटर्न का मिलान करता है और तुरंत जान जाता है, "आह! यह उपयोगकर्ता फ्लू के बारे में पूछ रहा है!"
उनके परीक्षणों में, यह अविश्वसनीय रूप से प्रभावी रहा। कुछ AI सिस्टम के लिए, वे 90% से अधिक सटीकता के साथ उपयोगकर्ता के सवाल का अनुमान लगा सके, भले ही उपयोगकर्ता संवेदनशील चिकित्सा मुद्दों या निजी बीमा विवरणों के बारे में पूछ रहा हो।
"डेटा चोरी"
यह और भी बुरा है। कुछ AI सिस्टम बेहतर अनुमान लगाने के लिए पिछली बातचीत की एक "लाइब्रेरी" का उपयोग करते हैं। शोधकर्ताओं ने दिखाया कि एक हैकर AI को उसकी गुप्त लाइब्रेरी की सामग्री प्रकट करने के लिए मजबूर कर सकता है। विशिष्ट प्रश्न पूछकर और यह देखकर कि कौन से अनुमान "सही" (बड़े पैकेज) और कौन से "गलत" (छोटे पैकेज) थे, वे धीरे-धीरे उस निजी डेटा की पूरी लाइब्रेरी चुरा सकते हैं जिसका उपयोग AI कर रहा था, जिससे लगभग 25 शब्द प्रति सेकंड की दर से डेटा लीक हो रहा है।
समाधान: "बक्सों में पैडिंग करना"
हम इसे कैसे रोक सकते हैं? यह पेपर रेस्टोरेंट के उदाहरण का उपयोग करते हुए दो मुख्य समाधान सुझाता है:
"समान बॉक्स" रणनीति (Padding):
कल्पना कीजिए कि रेस्टोरेंट यह निर्णय लेता है कि हर डिलीवरी, चाहे वह 1 शब्द हो या 10 शब्द, एक विशाल, समान बॉक्स में जानी चाहिए। यदि AI के पास केवल 1 शब्द है, तो वे बॉक्स को नकली, खाली कागज से भर देते हैं ताकि यह सबसे बड़े बॉक्स के समान आकार का हो जाए।- फायदे: हैकर अब यह नहीं बता सकता कि कितने शब्द भेजे गए थे। रहस्य सुरक्षित है।
- नुकसान: यह बर्बादी है। आप बहुत सारा खाली कागज भेज रहे हैं, जो डिलीवरी को धीमा कर देता है और अधिक पैसा खर्च कराता है।
"बैच डिलीवरी" रणनीति (Aggregation):
हर बार जब AI एक शब्द सोचता है, तो पैकेज भेजने के बजाय, रेस्टोरेंट तब तक इंतजार करता है जब तक कि AI 10 शब्दों जैसे कुछ शब्द न सोच ले, और फिर उन सभी को एक बड़े बैच में भेज देता है।- फायदे: यह "सही अनुमान लगाने" बनाम "गलत अनुमान लगाने" के पैटर्न को छिपा देता है।
- नुकसान: उपयोगकर्ता को उत्तर का पहला शब्द देखने के लिए अधिक इंतजार करना पड़ता है, जिससे चैट धीमी महसूस होती है।
निष्कर्ष
यह शोध पत्र एक चेतावनी है। हम अक्सर सोचते हैं कि यदि हमारा डेटा एन्क्रिप्टेड है, तो हम सुरक्षित हैं। लेकिन यह शोध दिखाता है कि डेटा कितनी तेजी से और किन टुकड़ों में भेजा जाता है, वह डेटा के अपने से भी अधिक जानकारी लीक कर सकता है।
जैसे-जैसे AI तेज़ और स्मार्ट होता जा रहा है, हमें यह सुनिश्चित करने की आवश्यकता है कि हम अनजाने में "पीछे का दरवाजा" खुला न छोड़ दें, जिससे हमारे डिजिटल पैकेजों का आकार हमारे रहस्यों को उजागर कर दे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।