← नवीनतम पेपर
💬 NLP

When Speculation Spills Secrets: Side Channels via Speculative Decoding In LLMs

यह शोध पत्र प्रकट करता है कि लार्ज लैंग्वेज मॉडल्स में स्पेक्युलेटिव डिकोडिंग एक नई साइड-चैनल भेद्यता (vulnerability) उत्पन्न करती है जहाँ हमलावर टोकन गणना या पैकेट आकार की निगरानी करके उपयोगकर्ता के प्रश्नों का अनुमान लगा सकते हैं और गोपनीय डेटा लीक कर सकते हैं, साथ ही यह पैकेट पैडिंग और टोकन एग्रीगेशन जैसे प्रभावी प्रति उपायों का प्रस्ताव और मूल्यांकन भी करता है।

मूल लेखक: Jiankun Wei, Abdulrahman Abdulrazzag, Tianchen Zhang, Adel Muursepp, Gururaj Saileshwar

प्रकाशित 2026-02-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiankun Wei, Abdulrahman Abdulrazzag, Tianchen Zhang, Adel Muursepp, Gururaj Saileshwar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त रेस्टोरेंट में हैं। आप एक जटिल भोजन ऑर्डर करते हैं, और शेफ (AI) खाना बनाना शुरू करता है। समय बचाने के लिए, शेफ के पास एक सहायक शेफ (sous-chef) है जो पहले से ही अनुमान लगा लेता है कि आपको अगले कुछ सामग्रियों की आवश्यकता होगी और उन्हें पहले से तैयार रखता है।

  • यदि सहायक शेफ का अनुमान सही निकलता है, तो शेफ एक साथ तैयार सामग्रियों की पूरी ट्रे उठा लेता है।
  • यदि सहायक शेफ का अनुमान गलत निकलता है, तो शेफ को रुकना पड़ता है, उस ट्रे को फेंकना पड़ता है, और एक-एक करके एक-एक सामग्री को फिर से काटना शुरू करना पड़ता है।

यह "अनुमान लगाने" की तकनीक स्पेक्युलेटिव डिकोडिंग (Speculative Decoding) कहलाती है। यह AI चैटबॉट्स को बहुत तेज़ बनाती है।

समस्या:
"When Speculation Spills Secrets" नामक शोध पत्र बताता है कि हैकर्स इन AI चैटबॉट्स के साथ आपकी निजी बातचीत को सुनने के लिए एक चालाकी भरा तरीका ढूंढ चुके हैं, यह आपके एन्क्रिप्शन को तोड़ने के माध्यम से नहीं, बल्कि आपके द्वारा भेजे जा रहे डिलीवरी पैकेज के आकार को देखकर किया जाता है।

"पैकेज का आकार" लीक होना

AI की प्रतिक्रिया को आपके फोन पर भेजे जा रहे डिजिटल पैकेजों के प्रवाह के रूप में सोचें।

  • बड़ा पैकेज: AI ने सही अनुमान लगाया! उसने एक साथ 5 शब्द भेजे। पैकेज बड़ा है।
  • छोटा पैकेज: AI ने गलत अनुमान लगाया! उसने केवल 1 शब्द भेजा। पैकेज बहुत छोटा है।

भले ही संदेश की सामग्री एक सुरक्षित तिजोरी में लॉक हो (एन्क्रिप्टेड हो), लेकिन डिलीवरी ट्रक (आपके वाई-फाई या इंटरनेट प्रदाता पर मौजूद हैकर) द्वारा देखा जाने वाला बॉक्स का आकार दिखाई देता है।

हमला: "आकारों का गुप्त कोड"

शोधकर्ताओं ने पाया कि हर सवाल के लिए पैकेज के आकार का पैटर्न अद्वितीय होता है। यह बॉक्स के आकारों से बना एक फिंगरप्रिंट की तरह है।

  1. सेटअप: एक हैकर एक ग्राहक होने का नाटक करता है। वे AI से 50 अलग-अलग सवाल पूछते हैं (जैसे, "फ्लू के लक्षण क्या हैं?" बनाम "टूटी हुई हड्डी के लक्षण क्या हैं?")।
  2. फिंगरप्रिंटिंग: वे प्रत्येक प्रश्न के लिए पैकेज के आकार के पैटर्न को रिकॉर्ड करते हैं।
    • सवाल A कुछ ऐसा दिख सकता है: बड़ा, बड़ा, छोटा, बड़ा, बड़ा।
    • सवाल B कुछ ऐसा दिख सकता है: छोटा, छोटा, बड़ा, छोटा।
  3. जासूसी (Eavesdrop): बाद में, वे एक वास्तविक उपयोगकर्ता को AI से बात करते हुए देखते हैं। वे उपयोगकर्ता के पैकेज के आकार देखते हैं: बड़ा, बड़ा, छोटा, बड़ा, बड़ा
  4. परिणाम: हैकर पैटर्न का मिलान करता है और तुरंत जान जाता है, "आह! यह उपयोगकर्ता फ्लू के बारे में पूछ रहा है!"

उनके परीक्षणों में, यह अविश्वसनीय रूप से प्रभावी रहा। कुछ AI सिस्टम के लिए, वे 90% से अधिक सटीकता के साथ उपयोगकर्ता के सवाल का अनुमान लगा सके, भले ही उपयोगकर्ता संवेदनशील चिकित्सा मुद्दों या निजी बीमा विवरणों के बारे में पूछ रहा हो।

"डेटा चोरी"

यह और भी बुरा है। कुछ AI सिस्टम बेहतर अनुमान लगाने के लिए पिछली बातचीत की एक "लाइब्रेरी" का उपयोग करते हैं। शोधकर्ताओं ने दिखाया कि एक हैकर AI को उसकी गुप्त लाइब्रेरी की सामग्री प्रकट करने के लिए मजबूर कर सकता है। विशिष्ट प्रश्न पूछकर और यह देखकर कि कौन से अनुमान "सही" (बड़े पैकेज) और कौन से "गलत" (छोटे पैकेज) थे, वे धीरे-धीरे उस निजी डेटा की पूरी लाइब्रेरी चुरा सकते हैं जिसका उपयोग AI कर रहा था, जिससे लगभग 25 शब्द प्रति सेकंड की दर से डेटा लीक हो रहा है।

समाधान: "बक्सों में पैडिंग करना"

हम इसे कैसे रोक सकते हैं? यह पेपर रेस्टोरेंट के उदाहरण का उपयोग करते हुए दो मुख्य समाधान सुझाता है:

  1. "समान बॉक्स" रणनीति (Padding):
    कल्पना कीजिए कि रेस्टोरेंट यह निर्णय लेता है कि हर डिलीवरी, चाहे वह 1 शब्द हो या 10 शब्द, एक विशाल, समान बॉक्स में जानी चाहिए। यदि AI के पास केवल 1 शब्द है, तो वे बॉक्स को नकली, खाली कागज से भर देते हैं ताकि यह सबसे बड़े बॉक्स के समान आकार का हो जाए।

    • फायदे: हैकर अब यह नहीं बता सकता कि कितने शब्द भेजे गए थे। रहस्य सुरक्षित है।
    • नुकसान: यह बर्बादी है। आप बहुत सारा खाली कागज भेज रहे हैं, जो डिलीवरी को धीमा कर देता है और अधिक पैसा खर्च कराता है।
  2. "बैच डिलीवरी" रणनीति (Aggregation):
    हर बार जब AI एक शब्द सोचता है, तो पैकेज भेजने के बजाय, रेस्टोरेंट तब तक इंतजार करता है जब तक कि AI 10 शब्दों जैसे कुछ शब्द न सोच ले, और फिर उन सभी को एक बड़े बैच में भेज देता है।

    • फायदे: यह "सही अनुमान लगाने" बनाम "गलत अनुमान लगाने" के पैटर्न को छिपा देता है।
    • नुकसान: उपयोगकर्ता को उत्तर का पहला शब्द देखने के लिए अधिक इंतजार करना पड़ता है, जिससे चैट धीमी महसूस होती है।

निष्कर्ष

यह शोध पत्र एक चेतावनी है। हम अक्सर सोचते हैं कि यदि हमारा डेटा एन्क्रिप्टेड है, तो हम सुरक्षित हैं। लेकिन यह शोध दिखाता है कि डेटा कितनी तेजी से और किन टुकड़ों में भेजा जाता है, वह डेटा के अपने से भी अधिक जानकारी लीक कर सकता है।

जैसे-जैसे AI तेज़ और स्मार्ट होता जा रहा है, हमें यह सुनिश्चित करने की आवश्यकता है कि हम अनजाने में "पीछे का दरवाजा" खुला न छोड़ दें, जिससे हमारे डिजिटल पैकेजों का आकार हमारे रहस्यों को उजागर कर दे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →