Can Transformer Memory Be Corrupted? Investigating Cache-Side Vulnerabilities in Large Language Models
यह शोध पत्र मैलिशियस टोकन इंजेक्शन (MTI) प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो यह प्रदर्शित करता है कि इन्फरेंस के दौरान की-वैल्यू कैश (key-value cache) में व्यवधान उत्पन्न करना ट्रांसफॉर्मर लैंग्वेज मॉडल्स को व्यवस्थित रूप से दूषित कर सकता है, जो कैश अखंडता (cache integrity) को एलएलएम (LLM) सुरक्षा में एक महत्वपूर्ण और पहले अनदेखी की गई भेद्यता के रूप में उजागर करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि एक लार्ज लैंग्वेज मॉडल (LLM) एक मेधावी, तेज़ दिमाग वाले छात्र की तरह है जो एक लंबी परीक्षा दे रहा है। किसी प्रश्न का उत्तर देने के लिए, उसे केवल वर्तमान प्रश्न को ही नहीं देखना है; उसे यह भी याद रखना होगा कि उसने अब तक क्या लिखा है ताकि उसका उत्तर सुसंगत बना रहे। AI की दुनिया में, इस "याददाश्त" को KV Cache कहा जाता है। यह एक डिजिटल रफ नोटबुक (scratchpad) की तरह है जहाँ मॉडल बातचीत के सबसे महत्वपूर्ण हिस्सों को संग्रहीत करता है ताकि उसे हर बार अगला शब्द लिखने के लिए पूरी किताब दोबारा न पढ़नी पड़े।
यह शोध पत्र, जिसका शीर्षक है "Can Transformer Memory Be Corrupted?" (क्या ट्रांसफॉर्मर की मेमोरी को भ्रष्ट किया जा सकता है?), एक डरावना लेकिन सरल प्रश्न पूछता है: क्या होगा यदि कोई उस छात्र द्वारा परीक्षा देते समय चुपके से उस रफ नोटबुक पर कुछ लिख दे या छेड़छाड़ कर दे?
यहाँ उनके निष्कर्षों का रोजमर्रा के उदाहरणों के साथ विवरण दिया गया है:
1. छिपी हुई कमजोरी: "अदृश्य" रफ नोटबुक (The Invisible Scratchpad)
आमतौर पर, हमें इस बात की चिंता होती है कि हैकर्स छात्र की पाठ्यपुस्तकों (मॉडल के ट्रेनिंग डेटा) को बदल सकते हैं या उन्हें किसी अजीब सवाल (प्रॉम्प्ट इंजेक्शन) से धोखा दे सकते हैं। लेकिन इस शोध पत्र ने एक अलग, अधिक चालाक तरीका खोजा जिससे सिस्टम को तोड़ा जा सकता है।
शोधकर्ताओं ने महसूस किया कि "रफ नोटबुक" (KV Cache) को अक्सर असुरक्षित छोड़ दिया जाता है। भले ही पाठ्यपुस्तकें और परीक्षा के प्रश्न सुरक्षित हों, लेकिन एक हमलावर जो मॉडल चलाने वाले कंप्यूटर के अंदर घुसने में सक्षम है, वह उस रफ नोटबुक के नंबरों में सूक्ष्म बदलाव कर सकता है।
- उदाहरण: कल्पना कीजिए कि एक शेफ एक जटिल स्टू (stew) बना रहा है। रेसिपी सुरक्षित है, और सामग्री ताजी है। लेकिन अगर कोई तोड़-फोड़ करने वाला व्यक्ति शेफ द्वारा बर्तन चखने के दौरान चुपके से नमक की जगह थोड़ी सी चीनी डाल दे, तो पूरा व्यंजन बिगड़ सकता है, भले ही शेफ ने रेसिपी या सामग्री में कोई बदलाव न किया हो।
2. हमला: "मैलिसियस टोकन इंजेक्शन" (Malicious Token Injection - MTI)
लेखकों ने इस परीक्षण के लिए MTI V.1 नामक एक टूल बनाया। उन्होंने मॉडल को तोड़ा नहीं; उन्होंने बस उसकी मेमोरी को "हल्का सा प्रभावित" किया। उन्होंने रफ नोटबुक के साथ छेड़छाड़ करने के तीन मुख्य तरीके आजमाए:
- "स्टैटिक" धक्का (Gaussian Noise): मेमोरी में थोड़ा सा रैंडम शोर या 'स्टैटिक' जोड़ना, जैसे रेडियो की आवाज़ को थोड़ा बढ़ाने तक, जिससे शब्द अस्पष्ट हो जाते हैं।
- "इरेज़र" (Zeroing): मेमोरी के विशिष्ट हिस्सों को पूरी तरह से मिटा देना, जैसे नोट्स के पन्ने पर लाल मार्कर चलाना।
- "ट्विस्ट" (Rotation): मेमोरी को तिरछा कर देना। जानकारी वहीं है, लेकिन वह गलत दिशा में इशारा कर रही है, जिससे मॉडल का समझ विकसित होना भ्रमित हो जाता है।
3. परिणाम: छोटे बदलाव, बड़ी गड़बड़ी
शोधकर्ताओं ने लोकप्रिय AI मॉडल्स (जैसे GPT-2 और LLaMA-2) पर इसका परीक्षण किया। उन्होंने पाया कि मेमोरी में बहुत छोटे, लगभग अदृश्य बदलावों के कारण बड़ी समस्याएं पैदा हुईं:
- भ्रम (Confusion): मॉडल उन शब्दों का अनुमान लगाने लगा जो उसे नहीं बोलने चाहिए थे। वह कम आत्मविश्वासी हो गया और तथ्य गढ़ने (hallucinate) लगा।
- कार्य की विफलता (Task Failure):
- सरल कार्य: जब पूछा गया कि कोई वाक्य खुश या दुखी है या नहीं, तो मॉडल भ्रमित हो गया और गलत उत्तर देने लगा।
- जटिल कार्य: जब किसी लंबे दस्तावेज़ में से किसी विशिष्ट तथ्य को खोजने के लिए कहा गया (जैसे कि कोई ट्रिविया प्रश्न), तो मॉडल पूरी तरह विफल रहा। ऐसा लगा जैसे छात्र प्रश्न पढ़ना ही भूल गया हो।
- "एजेंट" टेस्ट: जब AI एक रोबोट की तरह काम कर रहा था जो चरणों की एक श्रृंखला की योजना बना रहा था (जैसे फ्लाइट बुक करना), तो मेमोरी के भ्रष्टाचार ने उसे रास्ता भटका दिया और गलत क्रियाएं चुनने पर मजबूर कर दिया।
4. "क्यों": यह कैसे फैलता है?
शोध पत्र इसके पीछे के गणित को सरल रूप में समझाता है: AI अगला शब्द क्या कहेगा, यह तय करने के लिए अपनी मेमोरी को देखता है। यदि मेमोरी थोड़ी सी भी गलत है, तो AI का ध्यान (attention) भटक जाता है।
- उदाहरण: कल्पना कीजिए कि आप भीड़ भरे कमरे में अपने दोस्त को ढूंढने की कोशिश कर रहे हैं। आप एक मानचित्र (मेमोरी) देखते हैं। यदि कोई मानचित्र पर एक छोटी सी, गलत रेखा खींच देता है, तो आप गलत कोने में देख सकते हैं। एक बार जब आप गलत कोने में देखते हैं, तो आपकी बाकी रात की पूरी योजना बिगड़ जाती है। यह शोध पत्र साबित करता है कि मानचित्र पर ये "छोटी रेखाएं" गणितीय रूप से यह सुनिश्चित कर सकती हैं कि AI का ध्यान भटक जाए।
5. क्या हम इसे ठीक कर सकते हैं? (बचाव के उपाय)
शोधकर्ताओं ने यह देखने के लिए कि क्या वे इसे रोक सकते हैं, कुछ त्वरित समाधान आजमाए:
- रफ नोटबुक को साफ करना: समय-समय पर मेमोरी को साफ करना।
- नोट्स को रैंडमाइज करना: मेमोरी के कुछ हिस्सों को रैंडमली छिपाना यह देखने के लिए कि क्या मॉडल अभी भी अनुमान लगा सकता है।
- शोर को स्मूथ करना: "स्टैटिक" को हटाने के लिए नंबरों का औसत निकालना।
निर्णय: इन सुधारों ने थोड़ा मदद की, लेकिन वे कोई जादुई इलाज नहीं थे। उन्होंने सबसे खराब नुकसान को रोका, लेकिन यदि हमला मजबूत था या लगातार होता रहा, तो मॉडल फिर भी विफल हो गया। यह एक कट पर पट्टी लगाने जैसा है; यह मदद करता है, लेकिन यदि हमलावर बार-बार कोशिश करता रहता है, तो यह कट को गहरा होने से नहीं रोकता।
मुख्य निष्कर्ष (The Bottom Line)
यह शोध पत्र यह नहीं कहता कि AI टूटा हुआ है या आपको इसका उपयोग बंद कर देना चाहिए। इसके बजाय, यह उन लोगों के लिए एक अलार्म बेल बजा रहा है जो AI सिस्टम बनाते हैं और उनकी सुरक्षा करते हैं।
मुख्य बात: हमने AI के "दिमाग" (ट्रेनिंग डेटा) और उसके "मुंह" (इनपुट प्रॉम्प्ट्स) को सुरक्षित करने में बहुत अच्छा काम किया है, लेकिन हमने उसकी "अल्पकालिक स्मृति" (KV Cache) को काफी हद तक अनदेखा किया है। यदि कोई हमलावर AI चलाने वाले कंप्यूटर के अंदर घुस जाता है, तो वे उस मेमोरी को भ्रष्ट कर सकते हैं और AI को अविश्वसनीय, भ्रमित या खतरनाक बना सकते हैं, बिना कोड की एक भी लाइन बदले।
लेखक एक नए प्रकार की सुरक्षा की मांग कर रहे हैं जो इस "रफ नोटबुक" को एक महत्वपूर्ण सुरक्षा क्षेत्र (safety zone) के रूप में देखती है, जिसकी रक्षा उतनी ही सख्ती से की जानी चाहिए जितनी कि पूरे सिस्टम की की जाती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।