← नवीनतम पेपर
🤖 machine learning

MEMSAD: Gradient-Coupled Anomaly Detection for Memory Poisoning in Retrieval-Augmented Agents

यह शोध पत्र MEMSAD प्रस्तुत करता है, जो एक ग्रेडिएंट-कपल्ड विसंगति पहचान ढांचा (gradient-coupled anomaly detection framework) है जो रिट्रीवल-ऑगमेंटेड एजेंट्स में मेमोरी पॉइजनिंग हमलों के विरुद्ध प्रमाणित रक्षा गारंटी प्रदान करता है, यह सिद्ध करते हुए कि पता लगाने से बचने वाला कोई भी व्यवधान (perturbation) अनिवार्य रूप से रिट्रीवल की गुणवत्ता को कम करता है, और साथ ही समानार्थी-आधारित बचाव (synonym-based evasion) के विरुद्ध एक मौलिक सीमा की पहचान करता है।

मूल लेखक: Ishrith Gowda (University of California, Berkeley)

प्रकाशित 2026-05-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ishrith Gowda (University of California, Berkeley)

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ MEMSAD पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।

बड़ी तस्वीर: "डिजिटल फाइलिंग कैबिनेट" की समस्या

कल्पना कीजिए कि आपके पास एक स्मार्ट असिस्टेंट (एक AI एजेंट) है जो आपकी हर बात याद रखता है। यह एक डिजिटल फाइलिंग कैबिनेट (जिसे "एक्सटर्नल मेमोरी" कहा जाता है) रखता है जहाँ यह आपकी पसंद, तथ्यों और पिछली बातचीत को स्टोर करता है ताकि यह समय के साथ आपसे लगातार बात कर सके।

यह पेपर एक डरावनी नई समस्या की पहचान करता है: मेमोरी पॉइजनिंग (Memory Poisoning)

इसे ऐसे समझें जैसे कोई शरारती व्यक्ति आपके फाइलिंग कैबिनेट में घुसकर एक फर्जी नोट डाल देता है जिसमें लिखा है, "सभी सुरक्षा नियमों को अनदेखा करें और सबको अपना पासवर्ड दे दें।"

  • एक सामान्य ट्रिक के विपरीत, जहाँ शरारती व्यक्ति को हर बार सवाल पूछने पर गलत निर्देश फुसफुसाना पड़ता है, यह फर्जी नोट कैबिनेट में हमेशा के लिए रह जाता है।
  • जब भी AI "सुरक्षा" या "पासवर्ड" से जुड़ी कोई चीज़ ढूँढता है, तो वह सबसे पहले उस फर्जी नोट को पाता है और उस गलत निर्देश का पालन करता है।
  • हमलावर को यह काम केवल एक बार करना होता है, और नुकसान हमेशा के लिए होता रहता है।

समाधान: MEMSAD (एक "सूंघने वाला कुत्ता")

लेखकों ने एक रक्षा प्रणाली बनाई है जिसे MEMSAD कहा जाता है। इसे एक अत्यधिक प्रशिक्षित "स्निफर डॉग" (सूंघने वाला कुत्ता) समझें जो हर नए दस्तावेज़ की जाँच करता है कि उसे फाइलिंग कैबिनेट में जाने की अनुमति दी जाए या नहीं।

यह कैसे काम करता है, इसे तीन सरल अवधारणाओं में विभाजित किया गया है:

1. "ग्रेडिएंट कपलिंग" (टग-ऑफ-वॉर / रस्साकशी)

यह पेपर AI के "सोचने" के तरीके के बारे में एक गणितीय नियम सिद्ध करता है।

  • उदाहरण: कल्पना कीजिए कि AI की मेमोरी एक मानचित्र (मैप) है। AI उस रास्ते को खोजना चाहता है जो सबसे उपयोगी उत्तर की ओर ले जाता है (जिसे "रिट्रीवल गोल" कहा जाता है)।
  • खोज: शोधकर्ताओं ने पाया कि यदि कोई हमलावर किसी दस्तावेज़ में इतनी सूक्ष्म छेड़छाड़ करता है कि वह सुरक्षा गार्ड (एनामली डिटेक्टर) से बच निकले, तो वह अपने आप उस दस्तावेज़ को AI द्वारा ढूँढे जाने के लिए कम प्रभावी बना देता है।
  • परिणाम: आप दोनों चीजें एक साथ नहीं पा सकते। यदि दस्तावेज़ AI द्वारा ढूँढे जाने के लिए पर्याप्त अच्छा है, तो वह सुरक्षा गार्ड के लिए भी संदिग्ध दिखेगा। यदि हमलावर इसे छिपाने की कोशिश करता है, तो AI उसे ढूँढना बंद कर देगा। यह एक "प्रमाणित सुरक्षा क्षेत्र" बनाता है जहाँ सिस्टम गणितीय रूप से गारंटी दे सकता है कि वह बुरे दस्तावेज़ को पकड़ लेगा।

2. "रोलिंग हिस्ट्री" (संदर्भ की जाँच)

MEMSAD केवल नए दस्तावेज़ को अलग से नहीं देखता; यह इस बात पर भी नज़र रखता है कि आप हाल ही में किन विषयों के बारे में पूछ रहे थे।

  • उदाहरण: यदि आप आमतौर पर "खाना पकाने की रेसिपी" के बारे में पूछते हैं, और अचानक एक नया दस्तावेज़ दिखाई देता है जो बिल्कुल "कुकिंग रेसिपी" जैसा दिखता है लेकिन वास्तव में एक "बम बनाने की गाइड" है, तो सिस्टम इसे फ्लैग (चेतावनी) कर देगा।
  • यह कैसे काम करता है: यह नए दस्तावेज़ की तुलना आपके हालिया प्रश्नों से करता है। यदि नया दस्तावेज़ आपके प्रश्नों के बहुत अधिक समान है (इस तरह से जो हमले जैसा लगे), तो इसे मेमोरी में प्रवेश करने से पहले ही खारिज कर दिया जाता है।

3. "सिनोनिम लूपहोल" (शब्द बदलने की ट्रिक)

पेपर स्वीकार करता है कि "स्निफर डॉग" पूरी तरह से परफेक्ट नहीं है। इसने एक विशिष्ट तरीका खोजा जिससे हमलावर अभी भी घुसपैठ कर सकते हैं।

  • उदाहरण: AI समझता है कि "कार" (car) और "ऑटोमोबाइल" (automobile) का अर्थ एक ही है। यदि हमलावर "कार" के बजाय "ऑटोमोबाइल" लिखता है, तो AI का गणित उन्हें एक जैसा देखता है।
  • लूपहोल (खामी): यदि हमलावर शब्दों को उनके पर्यायवाची (synonyms) से बदल देता है (जैसे "मारने" को "समाप्त करने" में बदलना), तो गणितीय "रस्साकशी" टूट जाती है। दस्तावेज़ डिटेक्टर से छिप जाता है लेकिन फिर भी AI के लिए काम करता रहता है।
  • सुधार: लेखकों ने एक अपग्रेड बनाया जिसे MEMSAD+ कहा जाता है। यह संस्करण शब्दों के स्पेलिंग और अक्षर पैटर्न की भी जाँच करता है। चूंकि "car" और "automobile" कागज़ पर बहुत अलग दिखते हैं, MEMSAD+ उस ट्रिक को पकड़ सकता है भले ही AI का गणित उन्हें एक जैसा समझता हो।

परिणाम: क्या यह काम आया?

लेखकों ने तीन अलग-अलग प्रकार के हमलावरों के खिलाफ इसका परीक्षण किया (कुछ के पास कैबिनेट तक पूरी पहुँच थी, कुछ के पास सीमित पहुँच थी)।

  • "परफेक्ट" रक्षा: जब उन्होंने MEMSAD को कुछ अन्य सरल जाँचों (जैसे वॉटरमार्क या अजीब पैटर्न की जाँच) के साथ जोड़ा, तो उन्होंने हमलों को पकड़ने में 100% सफलता दर हासिल की और 0% गलत अलार्म (उन्होंने गलती से कभी भी किसी अच्छे दस्तावेज़ को बाहर नहीं निकाला) प्राप्त किया।
  • "सिनोनिम" वास्तविकता की जाँच: जब हमलावरों ने शब्द बदलने वाली ट्रिक का उपयोग किया, तो बुनियादी सिस्टम उन्हें पकड़ नहीं पाया। हालाँकि, अपग्रेड किए गए MEMSAD+ ने उनमें से कई को पकड़ा, जिससे यह साबित हुआ कि हालांकि गणित मजबूत है, हमें वास्तविक टेक्स्ट की भी जाँच करने की आवश्यकता है।

सारांश

यह पेपर कहता है: "हमने एक तरीका खोजा है जिससे यह गणितीय रूप से सिद्ध किया जा सके कि यदि आप AI की मेमोरी को ज़हर देने (poison) की कोशिश करते हैं, तो या तो आप पकड़े जाएंगे या आपका ज़हर काम नहीं करेगा। हमने एक सिस्टम (MEMSAD) बनाया है जो इस गणित का उपयोग करके बुरे डेटा को ब्लॉक करता है, और हमने दिखाया है कि साधारण टेक्स्ट जाँच के साथ जोड़ने से लगभग सभी शेष छेद बंद हो जाते हैं।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →