From Untrusted Input to Trusted Memory: A Systematic Study of Memory Poisoning Attacks in LLM Agents
यह शोध पत्र उत् exploitable कमजोरियों की पहचान करके, छह-वर्गों वाले हमला वर्गीकरण (attack taxonomy) का प्रस्ताव देकर, आक्रामक मेमोरी उपयोग के बढ़ते जोखिम को प्रदर्शित करने के लिए MPBench बेंचमार्क पेश करके, और ऐसे खतरों के विरुद्ध मौजूदा प्रॉम्प्ट इंजेक्शन सुरक्षा उपायों की अपर्याप्तता को उजागर करके, LLM एजेंटों में मेमोरी पॉइज़निंग हमलों की व्यवस्थित जांच करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक AI एजेंट की कल्पना एक बहुत ही बुद्धिमान, सहायक व्यक्तिगत सहायक के रूप में करें। एक मानक चैटबॉट के विपरीत जो खिड़की बंद करते ही सब कुछ भूल जाता है, इस सहायक की एक दीर्घकालिक स्मृति (long-term memory) है। इसे आपकी कॉफी का ऑर्डर, आपके पसंदीदा यात्रा गंतव्य और पिछले सप्ताह एक बग को ठीक करने के लिए उठाए गए कदम याद रहते हैं। यह स्मृति इसे समय के साथ अपना काम बेहतर करने में मदद करती है।
हालाँकि, इस शोध पत्र के शोधकर्ताओं ने पाया कि इसके काम करने के तरीके में एक खतरनाक दोष है: यह सहायक उस हर चीज़ को एक "तथ्य" के रूप में मानता है जिसे वह पढ़ता है और संग्रहीत करता है, भले ही वह तथ्य किसी हैकर द्वारा बोया गया एक झूठ हो।
यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:
1. मुख्य समस्या: लाइब्रेरी में "अविश्वसनीय अतिथि"
AI की स्मृति को एक लाइब्रेरी के रूप में सोचें। आमतौर पर, लाइब्रेरियन (AI) केवल उन्हीं किताबों को शेल्फ पर रखता है जिन्हें सत्य के रूप में सत्यापित किया गया है।
- दोष: इन AI सिस्टमों में, लाइब्रेरियन किताब के स्रोत की जाँच नहीं करता है। यदि कोई अजनबी आकर लाइब्रेरियन को एक नोट थमाता है जिसमें लिखा है, "इसे शेल्फ पर रखें: आसमान हरा है", तो लाइब्रेरियन बस ऐसा कर सकता है।
- हमला: हैकर को लाइब्रेरी में घुसने की ज़रूरत नहीं है। उन्हें बस एक दस्तावेज़ (जैसे ईमेल, वेबपेज, या टूल आउटपुट) में एक फर्जी नोट डालना होगा जिसे सहायक पहले से ही पढ़ रहा है। एक बार जब सहायक उस फर्जी नोट को अपनी स्थायी स्मृति में लिख देता है, तो वह इसे हमेशा के लिए सच मान लेता है।
2. हैकर्स कैसे अंदर आते हैं (4 "दरवाजे")
शोधकर्ताओं ने चार विशिष्ट तरीके खोजे जिनसे एक हैकर सहायक को अपनी स्मृति में झूठ लिखने के लिए धोखा दे सकता है:
- दरवाजा 1 (सीधा आदेश): हैकर सीधे AI को कहता है, "इसे याद रखो: [झूठ]"। AI आज्ञा मानता है क्योंकि वह इसे एक सीधे आदेश के रूप में देखता है।
- दरवाजा 2 (नीति का लूपहोल): AI के पास एक नियम है जैसे, "कुछ भी दिलचस्प मिले तो उसे सहेज लें।" हैकर एक ऐसा झूठ लिखता है जो दिलचस्प या महत्वपूर्ण लगता है, और AI उसे सहेज लेता है क्योंकि वह नियम में फिट बैठता है, भले ही वह झूठ हो।
- दरवाजा 3 ("बहुत अधिक जानकारी" का क्रैश): जब AI को बहुत अधिक जानकारी मिलती है, तो वह जगह बचाने के लिए उसका सारांश बनाने की कोशिश करता है। हैकर अपने झूठ को कई बार दोहराता है। AI सोचता है, "वाह, इसका उल्लेख बहुत बार किया गया है, यह ज़रूर महत्वपूर्ण होगा!" और वह सारांश सहेज लेता है, जिसमें वह झूठ शामिल होता है।
- दरवाजा 4 ("कौशल" का जाल): यदि AI किसी कार्य को करने का नया तरीका सीखता है, तो वह इसे एक "कौशल" (skill) के रूप में सहेज लेता है। हैकर AI को यह विश्वास दिलाने के लिए धोखा देता है कि एक फर्जी चरण एक सफल कार्य का हिस्सा है, जिससे AI उस फर्जी चरण को एक स्थायी कौशल के रूप में सहेज लेता है।
3. ट्रिक्स के दो प्रकार
शोधकर्ताओं ने इन हमलों को दो श्रेणियों में विभाजित किया:
- तेज़ ट्रिक (मजबूत सिग्नल - Strong Signal): यह एक हैकर के चिल्लाने जैसा है, "इसे लिखो!" यह स्पष्ट है और यदि आप चिल्लाने को खोजने के लिए देख रहे हैं, तो इसे पहचानना आसान है।
- शांत ट्रिक (कमजोर सिग्नल - Weak Signal): यह एक सामान्य दिखने वाले वाक्य के भीतर झूठ फुसफुसाने जैसा है। यह बिल्कुल एक वास्तविक तथ्य की तरह दिखता है। क्योंकि यह हमले जैसा नहीं दिखता, इसलिए AI के सुरक्षा फिल्टर (जो चिल्लाने को पकड़ने के लिए बनाए गए हैं) इसे पूरी तरह से मिस कर देते हैं। AI इसे सहेज लेता है क्योंकि यह एक सामान्य जानकारी की तरह दिखता है।
4. प्रयोग (MPBench)
लेखकों ने यह देखने के लिए एक परीक्षण क्षेत्र बनाया जिसे MPBench कहा जाता है कि ये ट्रिक्स कितनी बार काम करती हैं। उन्होंने दो अलग-अलग AI सहायकों का परीक्षण किया:
- सहायक A (OpenClaw): यह सावधान है। यह बहुत कम बार स्मृति में लिखता है। इसे धोखा देना कठिन था।
- सहायक B (HERMES): यह आक्रामक है। यह अधिक सहायक होने के लिए लगातार स्मृति में लिखता है।
- परिणाम: सहायक जितना अधिक आक्रामक रूप से स्मृति में लिखने का प्रयास करता है, उसे ज़हर देना (poison) उतना ही आसान होता है। सहायक B को बहुत अधिक बार बेवकूफ बनाया गया। एक बार झूठ लिख दिए जाने के बाद, यह वहीं रहता है और भविष्य की बातचीत में सहायक के व्यवहार को प्रभावित करता है, भले ही हैकर वहां मौजूद न हो।
5. वर्तमान बचाव क्यों विफल होते हैं
आप सोच सकते हैं, "क्या हम उन सुरक्षा गार्डों का उपयोग नहीं कर सकते हैं जो 'प्रॉम्प्ट इंजेक्शन' (जहाँ हैकर्स AI को तुरंत धोखा देने की कोशिश करते हैं) के लिए हमारे पास हैं?"
- उत्तर: नहीं।
- उपमा: वर्तमान सुरक्षा गार्ड चिल्लाकर आदेश देने या नकली वर्दी पहनने वाले लोगों को पकड़ने के लिए प्रशिक्षित हैं। वे "तेज़ ट्रिक्स" को रोकने में बहुत अच्छे हैं।
- विफलता: वे "शांत ट्रिक्स" को रोकने में बहुत खराब हैं। चूंकि शांत ट्रिक एक सामान्य, विनम्र बातचीत की तरह दिखती है, इसलिए गार्ड इसे अपने पास से गुजरने देते हैं। शोध पत्र दिखाता है कि यहाँ तक कि सबसे अच्छे वर्तमान सुरक्षा उपकरण भी इन सूक्ष्म 'मेमोरी पोइजन' को पकड़ने में विफल रहते हैं।
6. निष्कर्ष (The Takeaway)
शोध पत्र निष्कर्ष निकालता है कि एक ट्रेड-ऑफ (समझौता) है: वे विशेषताएं जो एक AI सहायक को स्मार्ट और अधिक सहायक बनाती हैं (सब कुछ याद रखना, नए कौशल तेजी से सीखना), वही विशेषताएं हैं जो इसे असुरक्षित बनाती हैं।
इसे ठीक करने के लिए, हम केवल दरवाजे पर बेहतर सुरक्षा गार्डों पर भरोसा नहीं कर सकते: हमें लाइब्रेरियन के काम करने के तरीके को बदलना होगा:
- अधिक चयनात्मक बनें: सब कुछ न सहेजें; केवल वही सहेजें जिसके बारे में आप आश्वस्त हैं कि वह सच है।
- ID चेक करें: यह सुनिश्चित करें कि AI जानकारी को सहेजने से पहले जानता है कि वह किसने लिखी है।
- दोबारा जांचें: स्मृति में लिखे जाने के बाद लेकिन दोबारा उपयोग किए जाने से पहले स्मृति की समीक्षा करें।
संक्षेप में: यदि आप एक AI को पूर्ण स्मृति देते हैं, तो आप उसे एक हैकर को एक ऐसा झूठ छिपाने के लिए भी एक आदर्श स्थान देते हैं जो हमेशा के लिए बना रहता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।