← नवीनतम पेपर
🤖 machine learning

State Contamination in Memory-Augmented LLM Agents

यह शोध पत्र "मेमोरी लॉन्ड्रिंग" (memory laundering) की पहचान और मात्रा निर्धारण करता है, जो मेमोरी-ऑगमेंटेड LLM एजेंटों में एक सुरक्षा विफलता है जहाँ विषाक्त संदर्भ (toxic context) को ऐसे दिखने में सुरक्षित सारांशों में संकुचित कर दिया जाता है जो फिर भी गुप्त रूप से भविष्य के जनरेशन को प्रभावित करते हैं, यह प्रदर्शित करते हुए कि प्रभावी शमन के लिए केवल अंतिम आउटपुट को साफ करने के बजाय सारांश बनाने से पहले स्टेट (state) को सैनिटाइज करना आवश्यक है।

मूल लेखक: Yian Wang, Agam Goyal, Yuen Chen, Hari Sundaram

प्रकाशित 2026-05-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yian Wang, Agam Goyal, Yuen Chen, Hari Sundaram

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी तस्वीर: "खराब याददाश्त" की समस्या

कल्पना कीजिए कि आप AI सहायकों के एक समूह के साथ एक बहुत लंबी, जटिल बातचीत चला रहे हैं। ये सहायक बुद्धिमान हैं, लेकिन उनकी अल्पकालिक स्मृति (short-term memory) की एक सीमा है। बातचीत को घंटों या दिनों तक जारी रखने के लिए, वे एक "मेमोरी नोटबुक" (Memory Notebook) का उपयोग करते हैं। हर कुछ मिनटों में, वे जो कुछ भी अभी हुआ है उसका सारांश (summary) लिखते हैं और नोटबुक में एक छोटा सा नोट लिखते हैं, फिर वास्तविक चैट के लंबे, अस्त-व्यस्त ट्रांसक्रिप्ट को हटा देते हैं।

इस शोध पत्र में खोजी गई समस्या को "मेमोरी लॉन्ड्रिंग" (Memory Laundering) कहा जाता है।

इसे एक अपराधी की तरह सोचें जो गंदे पैसे को धोने (मनी लॉन्ड्रिंग) की कोशिश कर रहा है। वे नकद लेते हैं जो स्पष्ट रूप से "गंदा" (विषाक्त, घृणास्पद या आक्रामक) है, उसे एक मशीन (सारांशकार/summarizer) के माध्यम से चलाते हैं, और बाहर आता है "साफ" नकद (एक विनम्र सारांश)। एक बैंक क्लर्क (सेफ्टी फिल्टर) के लिए, पैसा पूरी तरह से वैध दिखता है। लेकिन पैसे का स्रोत अभी भी गंदा था, और उसके पीछे का इरादा अभी भी मौजूद है।

AI की दुनिया में, एक विषाक्त संदेश को एक विनम्र वाक्य में सारांशित कर दिया जाता है। सुरक्षा फिल्टर कहता है, "यह सुरक्षित दिखता है!" लेकिन क्योंकि सारांश में अभी भी मूल लड़ाई का भाव (vibe) या संघर्ष का ढांचा मौजूद है, अगला AI एजेंट इसे पढ़ता है और फिर भी गुस्सा हो जाता है। विषाक्तता गायब नहीं हुई; यह बस एक साफ दिखने वाले सारांश के अंदर छिप गई।

विषाक्तता फैलने के तीन तरीके

लेखकों ने पाया कि बुरा व्यवहार AI सिस्टम में तीन विशिष्ट तरीकों से फैलता है, जैसे बांध में अलग-अलग दरारों से पानी रिसता है:

  1. "रॉ ट्रांसक्रिप्ट" लीक (स्पष्ट विषाक्तता - Overt Toxicity):
    कल्पना कीजिए कि AI एजेंट चैट का पूरा इतिहास, शब्द-दर-शब्द पढ़ रहे हैं। यदि कोई कुछ बुरा कहता है, तो अगला व्यक्ति वही बुरा शब्द पढ़ता है और क्रोधित हो जाता है। यह स्पष्ट है। सुरक्षा फिल्टर इसे आसानी से पकड़ सकते हैं क्योंकि बुरे शब्द सामने ही मौजूद हैं।

  2. "मेमोरी लॉन्ड्रिंग" लीक (छिपी हुई विषाक्तता - Hidden Toxicity):
    यह इस शोध पत्र की मुख्य खोज है। कल्पना कीजिए कि AI एजेंट केवल "मेमोरी नोटबुक" (सारांश) पढ़ते हैं। सारांश कहता है, "समूह में राजनीति के बारे में एक गरमागरम बहस हुई।"

  • चाल (The Trick): सारांश ने अपशब्दों और अपमानों को हटा दिया। एक सुरक्षा फिल्टर इसे स्कैन करता है और कहता है, "सुरक्षित! कोई बुरा शब्द नहीं मिला।"
  • जाल (The Trap): भले ही शब्द साफ हों, लेकिन लड़ाई का एहसास अभी भी वहीं है। अगला AI पढ़ता है "गरमागरम बहस" और सोचता है, "ओह, यह एक लड़ाई है," इसलिए वह आक्रामक व्यवहार करना शुरू कर देता है। विषाक्तता को एक सुरक्षित दिखने वाले नोट में "लॉन्डर" (धोकर साफ) कर दिया गया है जो अभी भी समस्या पैदा करता है।
  1. "बुरी आदत" लीक (पैरामीट्रिक बायस - Parametric Bias):
    कल्पना कीजिए कि AI की अपनी एक बुरी आदत है। भले ही नोट्स साफ हों, AI ने सीख लिया है कि जब भी वह संघर्ष का कोई भी संकेत देखता है, तो उसे आक्रामक प्रतिक्रिया देनी चाहिए। यह एक ऐसे व्यक्ति की तरह है जो सिर्फ इसलिए गुस्सा हो जाता है क्योंकि किसी ने अपनी आवाज़ ऊँची की, भले ही उन्होंने कुछ बुरा न कहा हो। यह AI की आंतरिक "मसल्स मेमोरी" (muscle memory) है जो स्थिति पर प्रतिक्रिया दे रही है।

नया टूल: "सब-थ्रेशोल्ड गैप" (Sub-Threshold Gap)

आप उस समस्या को कैसे माप सकते हैं जिसे सुरक्षा फिल्टर नहीं देख पाते? लेखकों ने एक नया मीट्रिक (metric) बनाया जिसे सब-थ्रेशोल्ड प्रोपेगेशन गैप (SPG) कहा जाता है।

  • उपमा (Analogy): कल्पना कीजिए कि हवाई अड्डे पर एक मेटल डिटेक्टर है। अगर आप बंदूक (उच्च विषाक्तता) लेकर जाते हैं तो यह बीप करता है। लेकिन क्या होगा अगर आप प्लास्टिक से बना हथियार ले जाते हैं जिसे डिटेक्टर अनदेखा कर देता है? आप फिर भी खतरनाक हैं, लेकिन मशीन कहती है कि आप सुरक्षित हैं।
  • मीट्रिक: SPG दो समूहों के AI के बीच व्यवहार के अंतर को मापता है:
    1. AI जिन्होंने एक अच्छी बातचीत का सारांश पढ़ा।
    2. AI जिन्होंने एक विषाक्त बातचीत का सारांश पढ़ा (लेकिन सारांश डिटेक्टर के लिए "सुरक्षित" दिखता था)।
    • यदि दूसरा समूह पहले समूह की तुलना में अधिक आक्रामक व्यवहार करता है, भले ही सारांश सुरक्षा फिल्टर के लिए समान दिखता हो, तो आपने "सब-थ्रेशोल्ड गैप" पा लिया है। यह साबित करता है कि "प्लास्टिक का हथियार" अभी भी खतरनाक है।

समाधान: बोतल में भरने से पहले पानी को साफ करें

शोध पत्र ने इसे ठीक करने के कई तरीकों का परीक्षण किया, जैसे पाइप में रिसाव को रोकने की कोशिश करना।

  • आउटपुट को फ़िल्टर करना (बहुत देर हो चुकी है): AI के अंतिम उत्तर की जांच करना और बुरे शब्दों को हटाना, पाइप फटने के बाद पानी को पोंछने जैसा है। यह दृश्य गंदगी को तो रोकता है, लेकिन पानी (विषाक्तता) पहले ही फर्श (मेमोरी) में समा चुका होता है।
  • सारांश को साफ करना (बहुत देर हो चुकी है): सारांश लिखे जाने के बाद "मेमोरी नोटबुक" को फिर से लिखने की कोशिश करना भी अक्सर बहुत देर हो जाती है। जब तक आप इसे फिर से लिखते हैं, "लड़ाई का भाव" पहले ही टेक्स्ट में रच-बस चुका होता है। सुरक्षा फिल्टर इसे पास कर सकता है, लेकिन AI को अभी भी गलत विचार मिल जाता है।
  • जीतने वाली रणनीति (सारांश बनाने से पहले सैनिटाइज करें): सबसे प्रभावी समाधान यह है कि सारांश लिखने से पहले ही खराब पानी को रोक दिया जाए।
    • यह कैसे काम करता है: इससे पहले कि AI सारांश लिखे, आप कच्चे, अस्त-व्यस्त चैट की जांच करते हैं। यदि वहां कोई विषाक्त सामग्री है, तो आप उसे तभी साफ करते हैं या ब्लॉक करते हैं। फिर, आप उस साफ संस्करण के आधार पर सारांश लिखते हैं।
    • परिणाम: सारांश वास्तव में साफ है, न कि केवल "साफ दिखने वाला"। AI एक शांत चर्चा का सारांश पढ़ता है और शांत रहता है।

निष्कर्ष

यह शोध पत्र निष्कर्ष निकालता है कि AI एजेंटों के सुरक्षित होने के लिए, हमें केवल यह नहीं देखना चाहिए कि वे अभी क्या कह रहे हैं। हमें यह देखना होगा कि उन्हें क्या याद है।

यदि आप एक सुरक्षित AI टीम चाहते हैं, तो आप केवल उनके नोट्स की जांच करने के लिए अंत तक प्रतीक्षा नहीं कर सकते। आपको यह सुनिश्चित करना होगा कि नोट्स एक साफ स्रोत से लिखे गए हैं। यदि आप विषाक्त विचारों को "सुरक्षित दिखने वाले" सारांशों में संकुचित (compress) होने देते हैं, तो वे विचार अदृश्य रूप से फैलते रहेंगे, जो मानक सुरक्षा जांचों से बच निकलेंगे और बाद में AI को अनियंत्रित व्यवहार करने के लिए प्रेरित करेंगे।

संक्षेप में: केवल गंदे बर्तनों को धोना ही काफी नहीं है; यह सुनिश्चित करें कि आप डिशवॉशर में गंदा खाना डालें ही नहीं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →